Scrieb
Windows 10/11 · Anleitung · Stand: Sept. 2026

Whisper für Windows: alle Wege, es auszuführen

OpenAIs Whisper läuft gut auf einem Windows-PC. Die Frage ist nur, wie viel Einrichtung Sie wollen. Diese Anleitung zeigt alle fünf Wege, von Apps ohne Einrichtung bis zu den genauen Befehlen für die Kommandozeile, mit GPU-Einrichtung und den Fehlern, die jeder einmal hat.

Alles hier läuft lokal. Bei jeder dieser Optionen bleibt Ihr Audio auf dem PC.

Einrichtung überspringen: Scrieb laden

Was Sie brauchen

Windows 10 oder 11

64-Bit. ARM64-Geräte (Snapdragon) laufen mit den Apps; der Python-Weg erwartet x64.

Arbeitsspeicher

8 GB Minimum. 16 GB sind angenehm für das große Modell.

GPU, optional, aber entscheidend

NVIDIA RTX ab der 20er-Serie: eine Stunde Audio in 4–12 Minuten. Nur CPU: etwa eine Stunde pro Stunde.

Festplatte

1–3 GB pro Modell, einmalig geladen. Audiodateien und Transkripte bleiben, wo Sie sie ablegen.

Die fünf Wege, der einfachste zuerst

EinrichtungSprecherzuordnungGPUPreis
1. Scrieb (App)Installer✓NVIDIA, AMD, IntelAbo, kostenlos testen
2. Buzz (App)Installer✗NVIDIAKostenlos
3. WhisperDesktop (GUI)Entpacken + Modelldatei✗Alle (DirectCompute)Kostenlos
4. whisper.cpp (Binaries)Entpacken + Terminal✗NVIDIA, CPU-optimiertKostenlos
5. Offizielle CLI (Python)Python + pip + ffmpeg✗ (WhisperX ergänzt sie)NVIDIA über CUDAKostenlos

1. Scrieb: Whisper ohne Einrichtung, mit Sprecherzuordnung

Scrieb ist eine Desktop-App für Windows und Mac, die Whisper, ein lokales Modell für die Sprecherzuordnung und ein kleines lokales Modell für Zusammenfassungen mitbringt. Installieren, Audio- oder Videodatei hineinziehen, Transkript als Dialog erhalten, als DOCX, PDF oder TXT exportieren. Internet braucht es einmalig für den Modell-Download, danach arbeitet es offline. So sieht das aus:

Es ist die kostenpflichtige Option auf dieser Seite. Wer nur Aufnahmen mit einer Stimme transkribiert und ein Terminal nicht scheut, ist mit den kostenlosen Wegen weiter unten gut bedient. Wer Interviews, Meetings oder Gespräche transkribiert und wissen will, wer was gesagt hat, ohne Python anzufassen, ist hier richtig. Kostenlos testen.

2. Buzz: kostenlose App, keine Sprecherzuordnung

Open-Source-Desktop-App für Windows, Mac und Linux. Installer von den GitHub-Releases des Projekts laden, öffnen, Datei hineinziehen, Modellgröße wählen, Text erhalten. Nutzt NVIDIA-GPUs. Der Export ist einfach, Sprecher werden nicht unterschieden – für Diktate, Vorlesungen und Memos reicht das.

3. WhisperDesktop: kostenlose Oberfläche für jede GPU

Eine Windows-Oberfläche um whisper.cpp, bemerkenswert, weil sie DirectCompute nutzt: Auch AMD- und Intel-GPUs beschleunigen, nicht nur NVIDIA. Zip von den GitHub-Releases (Const-me/Whisper) laden, eine ggml-Modelldatei laden, in der App auswählen. Updates kommen selten, Sprecher werden nicht erkannt, aber auf einem PC ohne NVIDIA-Karte ist es die schnellste kostenlose Option.

4. whisper.cpp: fertige Binaries, gut auf CPU

Die C++-Portierung von Whisper, mit Windows-Binaries auf der GitHub-Releases-Seite. Entpacken, Modell laden, im Terminal ausführen. Erwartet 16-kHz-Mono-WAV, also zuerst konvertieren:

ffmpeg -i interview.mp3 -ar 16000 -ac 1 interview.wav
whisper-cli.exe -m ggml-medium.bin -f interview.wav -l de -otxt

Der CUDA-Build auf der Releases-Seite nutzt NVIDIA-GPUs; der Standard-Build ist auf CPUs optimiert und die beste Wahl für ältere Laptops.

5. Die offizielle Kommandozeile: Schritt für Schritt

Die Referenzimplementierung von OpenAI. Beim ersten Mal etwa fünfzehn Minuten.

  1. Python 3.10 oder 3.11 installieren von python.org. Im Installer „Add Python to PATH" ankreuzen.
  2. ffmpeg installieren, womit Whisper Audio liest. Im Terminal:
    winget install Gyan.FFmpeg
    Danach das Terminal schließen und neu öffnen, damit PATH aktualisiert wird.
  3. Whisper installieren:
    pip install -U openai-whisper
  4. Mit NVIDIA-GPU: die CUDA-Version von PyTorch installieren. pip installiert standardmäßig die CPU-Version, der häufigste Grund für langsames Whisper. Den Befehl aus dem Auswahlwerkzeug auf pytorch.org für Ihre CUDA-Version nehmen; er sieht so aus:
    pip install torch --index-url https://download.pytorch.org/whl/cu121
    Dann prüfen: python -c "import torch; print(torch.cuda.is_available())" muss True ausgeben.
  5. Ausführen:
    whisper interview.mp3 --model medium --language de --output_format txt
    Der erste Lauf lädt das Modell, 1,5 GB für medium, 3 GB für large. Die Ausgabe landet neben der Eingabedatei als .txt, mit anderen Ausgabeformaten auch als .srt und .vtt.
  6. Sprecherzuordnung gewünscht? Stattdessen WhisperX installieren (pip install whisperx); es ergänzt die Diarisierung, braucht aber ein Hugging-Face-Token für das Sprechermodell und dieselbe CUDA-Einrichtung.

Ein schnellerer Ersatz für denselben Ablauf ist faster-whisper: weniger Speicher, das große Modell läuft auch auf kleineren GPUs.

Fehler, die jeder einmal hat

„ffmpeg not found" / FileNotFoundError

ffmpeg ist nicht im PATH. Mit winget installieren und dann ein neues Terminalfenster öffnen; das alte behält den alten PATH.

Es läuft, aber sehr langsam

torch.cuda.is_available() liefert False: Die CPU-Version von PyTorch ist installiert. torch deinstallieren und die CUDA-Version von pytorch.org installieren.

„FP16 is not supported on CPU; using FP32 instead"

Harmlos. Bedeutet nur, dass keine GPU gefunden wurde. --fp16 False anhängen oder die GPU-Einrichtung reparieren.

Der erste Lauf hängt minutenlang

Das Modell wird nach %USERPROFILE%\.cache\whisper geladen. Abwarten oder bei schneller Verbindung vorab laden.

Erfundene Sätze bei Stille oder Musik

Whisper halluziniert bei Nicht-Sprache. Stille vorher wegschneiden oder eine App mit Sprachaktivitätserkennung vor dem Modell nutzen.

Speicher voll bei large

medium nehmen, oder large-v3-turbo, oder faster-whisper mit int8. Das große Modell braucht im offiziellen Build rund 10 GB VRAM.

Welches Modell auf welcher Hardware

ModellGenauigkeitNur CPUNVIDIA-GPU
tiny / baseNiedrigSchnell, nur EntwürfeSofort
smallGut (Englisch)Brauchbar, ~2× EchtzeitSehr schnell
mediumSehr gutEtwa Echtzeit; der CPU-Standard für DeutschSchnell
large-v3Am bestenZu langsam für den AlltagDer Standard mit GPU
large-v3-turboFast large-v3LangsamSchnellste genaue Option

Preise

Whisper mit Sprecherzuordnung und ohne Einrichtung. Eine Lizenz für Windows und Mac, keine Minutenlimits. Kostenlos testen.

Monatlich

$24.99/Monat
  • Unbegrenzte Transkriptionen
  • Alle Exportformate
  • Sprechererkennung
  • Intelligente Zusammenfassungen
  • Prioritäts-Support

6 Monate

$99.99/6 Mo.
$50 sparen
  • Unbegrenzte Transkriptionen
  • Alle Exportformate
  • Sprechererkennung
  • Intelligente Zusammenfassungen
  • Prioritäts-Support

Häufige Fragen

Läuft Whisper unter Windows?
Ja. OpenAIs Whisper läuft unter Windows 10 und 11 über Python, über die whisper.cpp-Binaries oder in Desktop-Apps, die es mitbringen. Alles auf dieser Seite läuft lokal; das Audio verlässt den PC nicht.
Braucht Whisper unter Windows eine Grafikkarte?
Nein, aber sie hilft enorm. Nur mit CPU läuft das Modell 'medium' etwa in Echtzeit: Eine Stunde Audio dauert rund eine Stunde. Mit einer NVIDIA RTX ab der 20er-Serie ist es 5- bis 15-mal schneller. AMD- und Intel-GPUs funktionieren mit whisper.cpp und einigen Apps; die offizielle Python-Version beschleunigt nur mit NVIDIA.
Gibt es eine Whisper-Oberfläche für Windows?
Mehrere. Scrieb ist eine vollständige Desktop-App mit Sprechererkennung und DOCX-Export; Buzz ist eine kostenlose Open-Source-App; WhisperDesktop ist eine kostenlose Oberfläche um whisper.cpp, die auch AMD- und Intel-GPUs nutzt. Keine der kostenlosen Oberflächen erkennt Sprecher.
Ist Whisper kostenlos?
Das Modell ist Open Source und kostenlos. Es auszuführen kostet nichts außer Hardware. Bezahlte Apps wie Scrieb berechnen Oberfläche, Sprechererkennung, Zusammenfassungen und Support, nicht Whisper selbst.
Welches Whisper-Modell für Deutsch?
Mindestens 'medium'; 'large-v3' bei Fachbegriffen, Dialekt oder schlechter Aufnahme. Die kleinen Modelle sind bei Deutsch deutlich schwächer als bei Englisch. Mit GPU ist 'large-v3-turbo' der beste Kompromiss aus Tempo und Genauigkeit.
Erkennt Whisper Sprecher?
Nicht von sich aus. Whisper liefert nur Text. Sprecherzuordnung braucht ein zweites Modell. Unter Windows führt Scrieb diesen Schritt lokal aus; WhisperX kann es per Kommandozeile; Buzz, WhisperDesktop und die offizielle CLI nicht.
Warum ist Whisper auf meinem PC so langsam?
Fast immer einer von drei Gründen: Es läuft auf der CPU, weil die CPU-Version von PyTorch installiert wurde; das Modell ist zu groß für den Rechner; oder eine lange Datei wird mit großem Modell bei wenig RAM verarbeitet. Prüfen Sie zuerst torch.cuda.is_available().

Weitere Seiten

→ MacWhisper für Windows→ Offline-Transkription→ Beste lokale Transkriptionssoftware→ Sprechererkennung→ Transkription ohne Cloud