Was Sprechererkennung leistet
Sprechererkennung – auch Sprecherzuordnung oder Diarisierung genannt – ermittelt, wie viele Personen in einer Aufnahme sprechen und welche Passagen zu wem gehören. Das Transkript kommt als Gespräch zurück statt als ein einziger Block:
Für alle, die Menschen zitieren – Forschende, Journalisten, Juristen, UX-Teams – ist das der Unterschied zwischen einem brauchbaren Transkript und einem, das man noch einmal anhören muss.
Whisper allein erkennt keine Sprecher
Das überrascht viele. Whisper von OpenAI ist hervorragend darin, Sprache in Text zu verwandeln – aber es hat keine Vorstellung davon, wer spricht. Für die Sprecherzuordnung braucht es ein zweites Modell, einen Diarisierungsschritt, der obendrauf gesetzt wird.
Die meisten Apps lösen das, indem sie Ihr Audio an einen Server schicken, auf dem dieser Schritt läuft. Genau das geht bei einem vertraulichen Interview, einem Mandantengespräch oder einem Patientengespräch nicht. Scrieb führt beide Schritte – Transkription und Sprechererkennung – lokal auf Ihrem Mac oder Windows-PC aus. Nichts verlässt das Gerät.
Wo es am meisten zählt
Forschungsinterviews
Interviewende und Befragte werden getrennt, in Fokusgruppen auch die Teilnehmenden untereinander. Zitate sind zuordenbar, ohne die Aufnahme erneut abzuspielen.
Meetings und Telefonate
Wer hat was zugesagt? Entscheidungen und Aufgaben bleiben mit der Person verbunden, die sie ausgesprochen hat.
Recht und Compliance
Mandantengespräche, Anhörungen und Zeugenaussagen brauchen eine Zuordnung – und dürfen nicht an Dritte hochgeladen werden.
Journalismus und Podcasts
Aufnahmen mit mehreren Gästen werden zu zitierfähigem Dialog, bereit zum Schneiden oder Veröffentlichen.
So funktioniert es in Scrieb
- Aufnahme hineinziehen. MP3, WAV, M4A, MP4 und weitere gängige Formate, in über 90 Sprachen.
- Scrieb transkribiert und ordnet Sprecher automatisch zu. Auf CPU oder GPU, offline. Nichts zu konfigurieren.
- Mit Sprecherangaben exportieren. DOCX, PDF oder TXT, als Dialog formatiert.
So erzielen Sie die besten Ergebnisse
Sprechererkennung ist nur so gut wie die Aufnahme. Ein paar Gewohnheiten machen einen großen Unterschied – bei jedem Tool:
- Nah an den Sprechern aufnehmen. Ein Smartphone in der Tischmitte ist besser als ein Laptop-Mikrofon am anderen Ende des Raums.
- Überlappungen vermeiden. Gleichzeitiges Sprechen ist für jedes Diarisierungsmodell der schwierigste Fall.
- Originaldatei behalten. Transkribieren Sie die unkomprimierte Aufnahme statt eines erneut exportierten Sprachmemos oder eines Videos mit Musik.
- Zwei bis sechs Sprecher sind ideal. Große Runden mit vielen ähnlichen Stimmen lassen sich schwerer trennen.
Sprechererkennung: lokale Tools im Vergleich
| Tool | Sprecherangaben | Läuft offline | Mac + Windows |
|---|---|---|---|
| Scrieb | ✓ alle Tarife | ✓ | ✓ |
| MacWhisper | nur Pro | ✓ | nur Mac |
| Buzz | ✗ | ✓ | ✓ |
| Whisper CLI | ✗ | ✓ | Terminal |
| Cloud-Dienste (Otter, Turboscribe …) | ✓ | ✗ Upload nötig | Web |
Ausführlicher Vergleich: Beste lokale Transkriptionssoftware.
Preise
Sprechererkennung in jedem Tarif. Keine Minutenlimits, Mac und Windows.
Monatlich
- Unbegrenzte Transkriptionen
- Alle Exportformate
- Sprechererkennung
- Intelligente Zusammenfassungen
- Prioritäts-Support
6 Monate
- Unbegrenzte Transkriptionen
- Alle Exportformate
- Sprechererkennung
- Intelligente Zusammenfassungen
- Prioritäts-Support
Jährlich
- Unbegrenzte Transkriptionen
- Alle Exportformate
- Sprechererkennung
- Intelligente Zusammenfassungen
- Prioritäts-Support
Häufige Fragen
- Was ist Sprechererkennung bei der Transkription?
- Sprechererkennung (auch Sprecherzuordnung oder Diarisierung) teilt eine Aufnahme danach auf, wer gerade spricht, und kennzeichnet jeden Abschnitt des Transkripts mit dem Sprecher. Statt eines Textblocks erhalten Sie einen Dialog: Sprecher 1 sagt dies, Sprecher 2 antwortet das.
- Erkennt Whisper Sprecher?
- Nein. Das Whisper-Modell von OpenAI wandelt nur Sprache in Text um und weiß nicht, wie viele Personen sprechen. Die Sprecherzuordnung kommt aus einem zusätzlichen Schritt. Die meisten Tools führen ihn in der Cloud aus. Scrieb führt Transkription und Sprechererkennung lokal auf Ihrem Rechner aus.
- Funktioniert die Sprechererkennung offline?
- Ja. In Scrieb läuft der gesamte Ablauf auf Ihrem Mac oder Windows-PC. Es wird nichts hochgeladen, und nach dem einmaligen Laden des Modells ist keine Internetverbindung nötig.
- Wie viele Sprecher kann Scrieb unterscheiden?
- Scrieb erkennt die Sprecher einer Aufnahme automatisch. Am besten funktioniert es bei zwei bis sechs Personen, die sich nicht ständig ins Wort fallen – das deckt die meisten Interviews, Meetings und Fokusgruppen ab.
- Wie genau ist die Sprechererkennung?
- Das hängt vor allem von der Aufnahme ab. Klare Aufnahmen mit unterschiedlichen Stimmen und wenig Überlappung liefern sehr gute Ergebnisse. Telefonqualität, starke Hintergrundgeräusche oder mehrere gleichzeitig sprechende Personen verschlechtern das Ergebnis bei jedem Tool – ob Cloud oder lokal.
- Ist die Sprechererkennung in jedem Tarif enthalten?
- Ja. Die Sprechererkennung ist in allen Scrieb-Tarifen enthalten, ohne Minutenlimit. Manche Wettbewerber bieten sie nur in einer Pro-Version an oder rechnen pro Minute ab.
- Bleiben die Sprecherangaben beim Export erhalten?
- Ja. Die Sprecherzuordnung bleibt beim Export als DOCX, PDF oder TXT erhalten. Das Dokument liest sich wie ein Dialog und ist direkt zitierfähig.