Scrieb
Spracherkennung · Lokal · Mac und Windows · Stand: Sept. 2026

Spracherkennung offline: Sprache zu Text, ohne dass Audio den Rechner verlässt

Offline-Spracherkennung heißt: Das Modell, das Sprache in Text verwandelt, liegt auf Ihrer Festplatte und rechnet auf Ihrem Prozessor. Kein Upload, kein Konto, kein Auftragsverarbeiter. Das war lange eine Nischenlösung mit schlechter Qualität; seit Whisper ist es der Normalfall für alle, die vertrauliche Gespräche verschriftlichen.

Was lokal möglich ist, was die eingebauten Funktionen von Windows und macOS können, und welche Programme Aufnahmen offline transkribieren.

Scrieb herunterladen

Wie Offline-Spracherkennung funktioniert

Ein Spracherkennungsmodell ist eine Datei von einigen hundert Megabyte bis wenigen Gigabyte. Cloud-Dienste halten diese Datei auf ihren Servern und lassen Sie Audio hochladen. Offline-Spracherkennung lädt dieselbe Art Datei einmal auf Ihren Rechner. Danach verarbeitet Ihr Prozessor oder Ihre Grafikkarte die Aufnahme, und nichts verlässt das Gerät. Sie können das Netzwerkkabel ziehen und es funktioniert weiter.

Der Durchbruch kam 2022 mit Whisper von OpenAI: ein frei verfügbares Modell, das rund hundert Sprachen erkennt, darunter Deutsch auf hohem Niveau. Fast jedes Offline-Programm, das heute Aufnahmen transkribiert, baut darauf auf.

Diktat oder Transkription: zwei verschiedene Aufgaben

Diktat (live)

Sie sprechen ins Mikrofon, der Text erscheint sofort. Dafür sind die eingebauten Funktionen von Windows und macOS gedacht. Eine Person, ein Mikrofon, kurze Texte.

Transkription (Aufnahme)

Eine vorhandene Datei oder ein aufgezeichnetes Gespräch wird nachträglich in Text verwandelt, mit mehreren Sprechern. Dafür braucht es ein eigenes Programm; die Betriebssysteme bieten es nicht.

Wer nach "Spracherkennung offline" sucht, meint meistens das Zweite: ein Interview, eine Besprechung, ein Mandantengespräch oder eine Sprachmemo verschriftlichen, ohne die Aufnahme irgendwohin zu schicken.

Was die Betriebssysteme eingebaut haben

Läuft offlineTranskribiert DateienSprecherExport
Windows Spracheingabe (Win + H)Nein, braucht InternetNeinNeinText im Cursorfeld
Windows 11 SprachzugriffJaNein, nur Steuerung und DiktatNeinText im Cursorfeld
macOS Diktat (Apple Silicon)Ja, für DeutschNeinNeinText im Cursorfeld
Word Transkribieren (Microsoft 365)Nein, Upload zu MicrosoftJaJaWord, mit Monatslimit
ScriebJaJa, Audio und VideoJaDOCX, PDF, TXT

Kurz: Für Diktat reicht das Betriebssystem. Für Aufnahmen mit mehreren Personen brauchen Sie Software, die Whisper lokal ausführt. Die Optionen auf dem PC: Whisper für Windows.

Programme für Offline-Spracherkennung

Scrieb (Mac und Windows)

Aufnahme oder Datei hineinziehen, Modellgröße wählen, Text mit Sprecherzuordnung bekommen. Zusammenfassung und Chat laufen ebenfalls lokal. Export als DOCX, PDF, TXT. Kostenlos testbar.

Buzz (Mac und Windows)

Open Source, kostenlos. Transkribiert Dateien lokal mit Whisper. Keine Sprechererkennung, einfacher Export.

MacWhisper (nur Mac)

Beliebte Mac-App rund um Whisper. Keine Windows-Version; Sprechererkennung nur in der Pro-Version.

whisper.cpp und WhisperX (Kommandozeile)

Kostenlos und schnell, aber Terminal, Python und bei WhisperX ein Hugging-Face-Konto für das Sprechermodell. Für Technikaffine.

Ausführlicher Vergleich: Beste lokale Transkriptionssoftware.

Hardware und Geschwindigkeit

  • Ohne Grafikkarte: etwa Echtzeit. Eine Stunde Audio dauert eine Stunde, im Hintergrund.
  • Mit NVIDIA-, AMD- oder Intel-GPU: 5- bis 15-mal schneller, eine Stunde in 4 bis 12 Minuten.
  • Apple Silicon (M1 bis M4): wenige Minuten pro Stunde Audio, ohne Einrichtung.
  • Modellgröße: Für Deutsch mindestens "medium". "large" bei Fachbegriffen, Dialekt oder schlechter Aufnahme.

Warum offline für vertrauliche Gespräche

Bei Cloud-Spracherkennung ist der Anbieter Auftragsverarbeiter nach Art. 28 DSGVO: Vertrag, Prüfung, Verzeichnis, Drittlandfrage. Bei Offline-Spracherkennung gibt es für den Inhalt keinen Auftragsverarbeiter, weil niemand außer Ihnen die Aufnahme sieht. Für Kanzleien, Praxen, Forschung und Personalgespräche ist das der eigentliche Grund, lokal zu arbeiten. Details: Datenschutz und Sicherheit und Transkription ohne Cloud.

Preise

Keine Minutenlimits, Sprechererkennung inklusive, eine Lizenz für Mac und Windows. Kostenlos testen.

Monatlich

$24.99/Monat
  • Unbegrenzte Transkriptionen
  • Alle Exportformate
  • Sprechererkennung
  • Intelligente Zusammenfassungen
  • Prioritäts-Support

6 Monate

$99.99/6 Mo.
$50 sparen
  • Unbegrenzte Transkriptionen
  • Alle Exportformate
  • Sprechererkennung
  • Intelligente Zusammenfassungen
  • Prioritäts-Support

Häufige Fragen

Was ist Offline-Spracherkennung?
Spracherkennung, bei der das KI-Modell auf Ihrem eigenen Rechner läuft. Die Aufnahme wird nicht an einen Server geschickt; Mikrofon oder Datei gehen direkt in das lokale Modell, der Text kommt direkt zurück. Nach dem einmaligen Laden des Modells ist keine Internetverbindung mehr nötig.
Ist Offline-Spracherkennung schlechter als die Cloud?
Nicht mehr. Seit OpenAI das Whisper-Modell 2022 veröffentlicht hat, läuft dieselbe Erkennungsqualität, die Cloud-Dienste verwenden, auf einem normalen Laptop. Bei klaren Aufnahmen ist das große Modell für Deutsch nahe an menschlicher Genauigkeit.
Funktioniert die Windows-Spracherkennung offline?
Teilweise. Die Windows-Spracheingabe (Win + H) braucht eine Internetverbindung. Der Sprachzugriff in Windows 11 arbeitet lokal, ist aber zur Steuerung des PCs gedacht und transkribiert keine Audiodateien. Für Aufnahmen brauchen Sie ein eigenes Programm.
Und das Diktat auf dem Mac?
Auf Macs mit Apple Silicon läuft das Diktat für Deutsch auf dem Gerät. Es transkribiert aber nur, was Sie live ins Mikrofon sprechen, keine vorhandenen Aufnahmen, und kennt keine Sprecher.
Welche Hardware brauche ich?
8 GB RAM reichen. Ohne Grafikkarte dauert eine Stunde Audio etwa eine Stunde; mit einer aktuellen NVIDIA-, AMD- oder Intel-GPU oder einem Apple-M-Chip wenige Minuten. Das Modell belegt zwischen 500 MB und 3 GB auf der Festplatte.
Erkennt Offline-Spracherkennung auch Sprecher?
Whisper selbst nicht. Dafür braucht es ein zweites Modell zur Sprechertrennung, das ebenfalls lokal laufen kann. Scrieb bringt es mit; Kommandozeilen-Tools wie WhisperX auch, mit mehr Einrichtung.
Gibt es kostenlose Offline-Spracherkennung?
Ja. Buzz (Open Source, Mac und Windows) und whisper.cpp transkribieren Dateien kostenlos lokal, ohne Sprechererkennung und ohne Word-Export. Scrieb ist kostenlos testbar und ergänzt Sprechererkennung, Zusammenfassungen und DOCX-Export.

Weitere Seiten

→ Offline-Transkription→ Whisper für Windows→ Transkription ohne Cloud→ Sprechererkennung→ Datenschutz und Sicherheit→ Beste lokale Transkriptionssoftware