Was Sie brauchen
Windows 10 oder 11
64-Bit. ARM64-Geräte (Snapdragon) laufen mit den Apps; der Python-Weg erwartet x64.
Arbeitsspeicher
8 GB Minimum. 16 GB sind angenehm für das große Modell.
GPU, optional, aber entscheidend
NVIDIA RTX ab der 20er-Serie: eine Stunde Audio in 4–12 Minuten. Nur CPU: etwa eine Stunde pro Stunde.
Festplatte
1–3 GB pro Modell, einmalig geladen. Audiodateien und Transkripte bleiben, wo Sie sie ablegen.
Die fünf Wege, der einfachste zuerst
| Einrichtung | Sprecherzuordnung | GPU | Preis | |
|---|---|---|---|---|
| 1. Scrieb (App) | Installer | ✓ | NVIDIA, AMD, Intel | Abo, kostenlos testen |
| 2. Buzz (App) | Installer | ✗ | NVIDIA | Kostenlos |
| 3. WhisperDesktop (GUI) | Entpacken + Modelldatei | ✗ | Alle (DirectCompute) | Kostenlos |
| 4. whisper.cpp (Binaries) | Entpacken + Terminal | ✗ | NVIDIA, CPU-optimiert | Kostenlos |
| 5. Offizielle CLI (Python) | Python + pip + ffmpeg | ✗ (WhisperX ergänzt sie) | NVIDIA über CUDA | Kostenlos |
1. Scrieb: Whisper ohne Einrichtung, mit Sprecherzuordnung
Scrieb ist eine Desktop-App für Windows und Mac, die Whisper, ein lokales Modell für die Sprecherzuordnung und ein kleines lokales Modell für Zusammenfassungen mitbringt. Installieren, Audio- oder Videodatei hineinziehen, Transkript als Dialog erhalten, als DOCX, PDF oder TXT exportieren. Internet braucht es einmalig für den Modell-Download, danach arbeitet es offline. So sieht das aus:
Es ist die kostenpflichtige Option auf dieser Seite. Wer nur Aufnahmen mit einer Stimme transkribiert und ein Terminal nicht scheut, ist mit den kostenlosen Wegen weiter unten gut bedient. Wer Interviews, Meetings oder Gespräche transkribiert und wissen will, wer was gesagt hat, ohne Python anzufassen, ist hier richtig. Kostenlos testen.
2. Buzz: kostenlose App, keine Sprecherzuordnung
Open-Source-Desktop-App für Windows, Mac und Linux. Installer von den GitHub-Releases des Projekts laden, öffnen, Datei hineinziehen, Modellgröße wählen, Text erhalten. Nutzt NVIDIA-GPUs. Der Export ist einfach, Sprecher werden nicht unterschieden – für Diktate, Vorlesungen und Memos reicht das.
3. WhisperDesktop: kostenlose Oberfläche für jede GPU
Eine Windows-Oberfläche um whisper.cpp, bemerkenswert, weil sie DirectCompute nutzt: Auch AMD- und Intel-GPUs beschleunigen, nicht nur NVIDIA. Zip von den GitHub-Releases (Const-me/Whisper) laden, eine ggml-Modelldatei laden, in der App auswählen. Updates kommen selten, Sprecher werden nicht erkannt, aber auf einem PC ohne NVIDIA-Karte ist es die schnellste kostenlose Option.
4. whisper.cpp: fertige Binaries, gut auf CPU
Die C++-Portierung von Whisper, mit Windows-Binaries auf der GitHub-Releases-Seite. Entpacken, Modell laden, im Terminal ausführen. Erwartet 16-kHz-Mono-WAV, also zuerst konvertieren:
ffmpeg -i interview.mp3 -ar 16000 -ac 1 interview.wav whisper-cli.exe -m ggml-medium.bin -f interview.wav -l de -otxt
Der CUDA-Build auf der Releases-Seite nutzt NVIDIA-GPUs; der Standard-Build ist auf CPUs optimiert und die beste Wahl für ältere Laptops.
5. Die offizielle Kommandozeile: Schritt für Schritt
Die Referenzimplementierung von OpenAI. Beim ersten Mal etwa fünfzehn Minuten.
- Python 3.10 oder 3.11 installieren von python.org. Im Installer „Add Python to PATH" ankreuzen.
- ffmpeg installieren, womit Whisper Audio liest. Im Terminal:
winget install Gyan.FFmpeg
Danach das Terminal schließen und neu öffnen, damit PATH aktualisiert wird. - Whisper installieren:
pip install -U openai-whisper
- Mit NVIDIA-GPU: die CUDA-Version von PyTorch installieren. pip installiert standardmäßig die CPU-Version, der häufigste Grund für langsames Whisper. Den Befehl aus dem Auswahlwerkzeug auf pytorch.org für Ihre CUDA-Version nehmen; er sieht so aus:
pip install torch --index-url https://download.pytorch.org/whl/cu121
Dann prüfen:python -c "import torch; print(torch.cuda.is_available())"muss True ausgeben. - Ausführen:
whisper interview.mp3 --model medium --language de --output_format txt
Der erste Lauf lädt das Modell, 1,5 GB für medium, 3 GB für large. Die Ausgabe landet neben der Eingabedatei als .txt, mit anderen Ausgabeformaten auch als .srt und .vtt. - Sprecherzuordnung gewünscht? Stattdessen WhisperX installieren (
pip install whisperx); es ergänzt die Diarisierung, braucht aber ein Hugging-Face-Token für das Sprechermodell und dieselbe CUDA-Einrichtung.
Ein schnellerer Ersatz für denselben Ablauf ist faster-whisper: weniger Speicher, das große Modell läuft auch auf kleineren GPUs.
Fehler, die jeder einmal hat
„ffmpeg not found" / FileNotFoundError
ffmpeg ist nicht im PATH. Mit winget installieren und dann ein neues Terminalfenster öffnen; das alte behält den alten PATH.
Es läuft, aber sehr langsam
torch.cuda.is_available() liefert False: Die CPU-Version von PyTorch ist installiert. torch deinstallieren und die CUDA-Version von pytorch.org installieren.
„FP16 is not supported on CPU; using FP32 instead"
Harmlos. Bedeutet nur, dass keine GPU gefunden wurde. --fp16 False anhängen oder die GPU-Einrichtung reparieren.
Der erste Lauf hängt minutenlang
Das Modell wird nach %USERPROFILE%\.cache\whisper geladen. Abwarten oder bei schneller Verbindung vorab laden.
Erfundene Sätze bei Stille oder Musik
Whisper halluziniert bei Nicht-Sprache. Stille vorher wegschneiden oder eine App mit Sprachaktivitätserkennung vor dem Modell nutzen.
Speicher voll bei large
medium nehmen, oder large-v3-turbo, oder faster-whisper mit int8. Das große Modell braucht im offiziellen Build rund 10 GB VRAM.
Welches Modell auf welcher Hardware
| Modell | Genauigkeit | Nur CPU | NVIDIA-GPU |
|---|---|---|---|
| tiny / base | Niedrig | Schnell, nur Entwürfe | Sofort |
| small | Gut (Englisch) | Brauchbar, ~2× Echtzeit | Sehr schnell |
| medium | Sehr gut | Etwa Echtzeit; der CPU-Standard für Deutsch | Schnell |
| large-v3 | Am besten | Zu langsam für den Alltag | Der Standard mit GPU |
| large-v3-turbo | Fast large-v3 | Langsam | Schnellste genaue Option |
Preise
Whisper mit Sprecherzuordnung und ohne Einrichtung. Eine Lizenz für Windows und Mac, keine Minutenlimits. Kostenlos testen.
Monatlich
- Unbegrenzte Transkriptionen
- Alle Exportformate
- Sprechererkennung
- Intelligente Zusammenfassungen
- Prioritäts-Support
6 Monate
- Unbegrenzte Transkriptionen
- Alle Exportformate
- Sprechererkennung
- Intelligente Zusammenfassungen
- Prioritäts-Support
Jährlich
- Unbegrenzte Transkriptionen
- Alle Exportformate
- Sprechererkennung
- Intelligente Zusammenfassungen
- Prioritäts-Support
Häufige Fragen
- Läuft Whisper unter Windows?
- Ja. OpenAIs Whisper läuft unter Windows 10 und 11 über Python, über die whisper.cpp-Binaries oder in Desktop-Apps, die es mitbringen. Alles auf dieser Seite läuft lokal; das Audio verlässt den PC nicht.
- Braucht Whisper unter Windows eine Grafikkarte?
- Nein, aber sie hilft enorm. Nur mit CPU läuft das Modell 'medium' etwa in Echtzeit: Eine Stunde Audio dauert rund eine Stunde. Mit einer NVIDIA RTX ab der 20er-Serie ist es 5- bis 15-mal schneller. AMD- und Intel-GPUs funktionieren mit whisper.cpp und einigen Apps; die offizielle Python-Version beschleunigt nur mit NVIDIA.
- Gibt es eine Whisper-Oberfläche für Windows?
- Mehrere. Scrieb ist eine vollständige Desktop-App mit Sprechererkennung und DOCX-Export; Buzz ist eine kostenlose Open-Source-App; WhisperDesktop ist eine kostenlose Oberfläche um whisper.cpp, die auch AMD- und Intel-GPUs nutzt. Keine der kostenlosen Oberflächen erkennt Sprecher.
- Ist Whisper kostenlos?
- Das Modell ist Open Source und kostenlos. Es auszuführen kostet nichts außer Hardware. Bezahlte Apps wie Scrieb berechnen Oberfläche, Sprechererkennung, Zusammenfassungen und Support, nicht Whisper selbst.
- Welches Whisper-Modell für Deutsch?
- Mindestens 'medium'; 'large-v3' bei Fachbegriffen, Dialekt oder schlechter Aufnahme. Die kleinen Modelle sind bei Deutsch deutlich schwächer als bei Englisch. Mit GPU ist 'large-v3-turbo' der beste Kompromiss aus Tempo und Genauigkeit.
- Erkennt Whisper Sprecher?
- Nicht von sich aus. Whisper liefert nur Text. Sprecherzuordnung braucht ein zweites Modell. Unter Windows führt Scrieb diesen Schritt lokal aus; WhisperX kann es per Kommandozeile; Buzz, WhisperDesktop und die offizielle CLI nicht.
- Warum ist Whisper auf meinem PC so langsam?
- Fast immer einer von drei Gründen: Es läuft auf der CPU, weil die CPU-Version von PyTorch installiert wurde; das Modell ist zu groß für den Rechner; oder eine lange Datei wird mit großem Modell bei wenig RAM verarbeitet. Prüfen Sie zuerst torch.cuda.is_available().