Blog · 16. September 2026 · 16 Min. Lesezeit

Transkriptionssoftware im Vergleich

Grafische Titelkarte zum Beitrag „Transkriptionssoftware im Vergleich“ mit einem stilisierten Motiv: Tonspur mit Transkript.
Grafik: HumanITy

Transkriptionssoftware für deutschsprachige Aufnahmen zerfällt in zwei Gruppen, und die Trennlinie verläuft nicht zwischen teuer und billig, sondern zwischen lokaler Verarbeitung und Cloud. Lokal arbeiten Whisper im Eigenbetrieb, noScribe und MacWhisper: Die Audiodatei verlässt deinen Rechner nicht, laufende Kosten entstehen keine, dafür brauchst du Rechenzeit und etwas Einrichtung. In der Cloud arbeiten f4x mit Servern nur in Deutschland, Amberscript mit Speicherung in Frankfurt, Happy Scribe in der EU, Descript ohne genannte Region und die Speech-to-Text-API von OpenAI ab 0,003 Dollar je Audiominute. Darunter steckt oft dieselbe Modellfamilie, nämlich Whisper, was aber noch kein gleiches Ergebnis bedeutet. Sprechertrennung bringen noScribe, f4x, Amberscript und Happy Scribe mit, Whisper pur nicht, MacWhisper erst in Pro. Für Fachbegriffe hat Amberscript ein eigenes Wörterbuch, die OpenAI-API prompt und keywords, Descript ein Glossar nur auf Englisch. Die Preisspanne reicht von null bis rund zwölf Euro je Stunde Audio. Wer Gespräche mit Kunden, Patienten oder Mitarbeitern transkribiert, entscheidet zuerst über den Verarbeitungsort, dann über Genauigkeit.

Ich transkribiere meine eigenen Calls mit Whisper lokal. Wie ich Aufgaben an feste Rollen übergebe statt an immer neue Abos, steht auf der Seite KI-Mitarbeiter, welche Daten bei mir in Richtung KI gehen in KI und Datenschutz: was die KI sehen darf.

Warum lokal oder Cloud die eigentliche Trennlinie ist

Bei den meisten Werkzeugen wählst du eine Funktionsausstattung, hier ein Rechtsverhältnis.

Läuft die Erkennung lokal, sinkt die Zahl der externen Empfänger auf null, solange wirklich kein Dritter mitverarbeitet: kein Auftragsverarbeitungsvertrag, kein Drittlandtransfer, keine Löschfrist beim Anbieter. Diese Bedingung ist die eigentliche Arbeit. Cloud-Sicherung, synchronisierter Ordner, Telemetrie, verwaltetes Gerät, Supportzugriff oder ein zugeschaltetes Cloud-Modell holen den Dritten zurück; MacWhisper etwa kann die Transkription an OpenAI, ElevenLabs, Deepgram, Groq oder Gladia auslagern. Auch rein lokal bleiben Rechtsgrundlage, Zweck, Zugriffsschutz, Verschlüsselung, Löschfristen und Betroffenenrechte deine Aufgabe: Lokal reduziert die Zahl der Beteiligten, es ersetzt kein Datenschutzkonzept.

Geht die Datei in die Cloud, ist das eine Verarbeitung personenbezogener Daten durch einen Dienstleister. Auftragsverarbeitungsvertrag, Verarbeitungsort und Aufbewahrungsfrist stehen damit auf dem Tisch, bevor über Wortfehlerraten geredet wird: Ein Erstgespräch im Coaching enthält regelmäßig Gesundheitsangaben, ein Personalgespräch Leistungsbewertungen, ein Verkaufsgespräch die Zahlen des Kunden.

Das Modell darunter stammt oft aus derselben Familie: Whisper steckt in noScribe, in MacWhisper, in der OpenAI-API und laut Descripts Sicherheitsseite auch dort unter den Unterauftragsverarbeitern. Gleiche Familie heißt aber nicht gleiche Erkennung: Modellgröße, Implementierung, Vor- und Nachverarbeitung, Prompts und eine zusätzliche Diarisierung verändern das Ergebnis, und welche Version ein Anbieter fährt, steht nirgends. Vergleichbar wird es erst mit derselben Audiodatei auf beiden Wegen.

Vergleich von Transkriptionssoftware: Bei Whisper lokal bleibt die Audiodatei auf dem eigenen Rechner und der Aufwand liegt bei Einrichtung und Rechenzeit. Beim Cloud-Dienst wird die Datei zum Anbieter übertragen und der Betrieb arbeitet mit Konto, Kontingent und dessen Regeln.
Lokale Verarbeitung und Cloud-Dienst unterscheiden sich vor allem beim Datenweg. Grafik: HumanITy

Acht Werkzeuge: Verarbeitung, Datenort, Preis

Sieben Fragen entscheiden: lokal oder Cloud, wo die Daten liegen und bei wem, Deutsch und Dialekt, Sprechertrennung, Fachbegriffe, Formate, Preis. Die ersten drei beantwortet diese Tabelle, die übrigen die nächste. Für Interviews in Abschlussarbeiten taugen die Werkzeuge genauso; gemeint ist hier der Geschäftsalltag. Alle Angaben von den Herstellerseiten, abgerufen am 20. September 2026; Standort, Zertifikat und Löschfrist sind Anbieterangaben; ein ISO-Zertifikat oder EU-Standort macht deine Verarbeitung für sich noch nicht DSGVO-konform.

Werkzeug Verarbeitung Wo die Daten liegen Preis
Whisper im Eigenbetrieb lokal, Kommandozeile oder whisper.cpp nur dein Rechner 0 Euro, MIT-Lizenz
noScribe lokal, App für Windows, macOS, Linux nur dein Rechner 0 Euro, GPL-3.0
MacWhisper lokal auf dem Mac, Cloud zuschaltbar dein Mac, solange kein Cloud-Dienst an ist Free 0 Euro, Pro 65 Euro einmalig, ab 5 Lizenzen 54 Euro je Stück
f4x Cloud eigene Server in Deutschland, ISO 27001, Aufnahme sofort gelöscht, Transkript max. 28 Tage 25,00 bis 1.599,00 Euro für 2 bis 200 Stunden inkl. MwSt., 15 Minuten gratis
Amberscript Cloud Google Cloud Frankfurt laut Preisseite, ISO 27001 und 9001 ab 0,17 Euro je Minute, Abos 19/29/49 Euro im Monat für 5/10/25 Stunden, ohne Abo 10 Euro je Stunde
Happy Scribe Cloud Rechenzentrum in der EU, ISO 27001, AES-256 bei Jahreszahlung 8,50 Euro für 120 Minuten, 19 für 600, 59 für 6.000, monatlich kündbar 17, 29 und 89 Euro, Zusatzminute 0,20 Euro
Descript Cloud Amazon S3 oder Google Cloud, keine Region genannt, Unterauftragsverarbeiter Rev und Whisper Free 60 Minuten im Monat, dann 16 Dollar jährlich oder 24 monatlich für 10 Medienstunden, 24/35 für 30, 50/65 für 40
OpenAI Speech-to-Text API Cloud beim Anbieter gpt-4o-mini-transcribe 0,003 Dollar je Minute, gpt-transcribe 0,0045, gpt-4o-transcribe, whisper-1 und Diarisierung je 0,006; Minutenpreise sind Schätzwerte, 4o-Modelle rechnen nach Token

Eine Stunde Audio kostet über das günstigste API-Modell rund 18 Cent, über gpt-transcribe rund 27 Cent, bei f4x zwischen 8,00 und 12,50 Euro, lokal nichts außer Strom und Wartezeit. Das ist keine Qualitätsspanne, sondern zeigt, wofür du zahlst: Infrastruktur, deutsche Server, einen Editor oder nichts davon.

Deutsch, Dialekt, Sprechertrennung, Fachbegriffe, Formate

Werkzeug Deutsch und Dialekt Sprechertrennung Fachbegriffe Formate
Whisper im Eigenbetrieb 98 Sprachen; laut Modellkarte unterschiedliche Leistung bei Akzenten und Dialekten nicht enthalten über den Prompt steuerbar txt, vtt, srt, tsv, json, jsonl
noScribe rund 60 Sprachen; laut Entwickler auch mit Dialekten recht gut ja, über pyannote kein Glossar, Korrektur im Editor HTML für Word, Text, WebVTT
MacWhisper 100 Sprachen, Oberfläche auch auf Deutsch Pro, lokal nur auf M-Macs, sonst ElevenLabs oder Deepgram eigene Modelle einbindbar srt, vtt, csv, docx, pdf, Markdown, HTML
f4x 48 Sprachen (Fassung 2026); laut Anbieter 60 Prozent schneller bei deutschen Interviews ja, automatisch kein Glossar dokumentiert docx, rtf, srt
Amberscript über 90 Sprachen ja, im Editor umbenennbar eigenes Wörterbuch, laut Preisseite in allen Tarifen Word, TXT, JSON, VTT, SRT, EBU-STL
Happy Scribe über 150 Sprachen ja, automatisch Korrektur im Editor, menschliche Nachbearbeitung ab 1,75 Euro je Minute Untertitel- und Textformate
Descript 25 Sprachen inklusive Deutsch laut Preisseite, eine je Datei ja Glossar nur auf Englisch, ebenso Füllwort-Erkennung Export aus dem Editor, Untertitelformate
OpenAI Speech-to-Text API whisper-1 deckt 98 Sprachen ab über gpt-4o-transcribe-diarize prompt mit bis zu 224 Token, keywords bei gpt-transcribe json, verbose json, text, vtt, srt, diarisiertes JSON

Zwei Dinge fallen auf: Die Sprechertrennung fehlt dort, wo es sonst am günstigsten ist, und Fachvokabular ist dünn besetzt. Ein Wörterbuch für deutsche Fachbegriffe gibt es hier nur bei Amberscript, Descripts Glossar arbeitet auf Englisch, bei der API steuerst du über prompt und keywords gegen.

Was die Prozentzahlen der Hersteller wert sind

Zwei Anbieter nennen Zahlen: Amberscript über 90 Prozent Genauigkeit automatisch und über 99 Prozent mit menschlicher Nachbearbeitung, f4x unter ein Prozent misslungene Sprechertrennungen, vor allem bei schwieriger Aufnahmequalität. Beides sind Herstellerangaben, ohne Messmethode, ohne Testmaterial und ohne Angabe, ob deutschsprachiges Material gemeint war. Eine unabhängige Vergleichsmessung dieser acht Produkte für Deutsch habe ich nicht gefunden.

Brauchbarer ist ein eigener Zehn-Minuten-Test, und wie weit du ohne Kaufentscheidung kommst, ist je Werkzeug verschieden: Whisper und noScribe sind kostenlos, MacWhisper hat eine kostenlose Fassung, die transkribiert, f4x gibt 15 Freiminuten ausdrücklich ohne Abo und ohne Zahlungsdaten, Happy Scribe zehn Testminuten, Descript 60 Minuten im Monat. Amberscript weist auf der Preisseite kein Gratiskontingent aus, dort beginnt der Test mit dem Kauf, und die OpenAI-API rechnet ab der ersten Minute ab. Sechs der acht kannst du frei ausprobieren, zwei nur gegen Geld.

Nimm eine typische Aufnahme statt einer Studioaufnahme: dein Raum, dein Mikrofon, dein Gesprächspartner, dein Fachvokabular. Zähl danach aus: Fehler bei Eigennamen, falsch zugeordnete Sprecherwechsel, Minuten fürs Korrigieren. Der dritte Wert zählt am Monatsende. Wer die Runde nicht allein fahren will, bringt sie in die Community, wo Leute mit ähnlichem Material sitzen.

Eine Eigenschaft betrifft alle Whisper-basierten Werkzeuge: Die Modellkarte von OpenAI weist ausdrücklich darauf hin, dass das Modell Text erzeugen kann, der gar nicht gesprochen wurde, und dass es zu Wiederholungen neigt. An leisen Stellen wirkt ein Transkript deshalb nicht lückenhaft, sondern plausibel falsch. Gegenlesen ist Teil der Arbeit, kein Qualitätsanspruch.

Ein Absatz zum Recht, bevor du ein Werkzeug auswählst

In Deutschland ist das unbefugte Aufnehmen des nichtöffentlich gesprochenen Wortes nach § 201 StGB eine Straftat, nicht eine Ordnungswidrigkeit. Die sichere Regel für den Geschäftsalltag lautet deshalb: vorher die ausdrückliche Zustimmung aller Beteiligten einholen. Sonderlagen gehören in die rechtliche Einzelfallprüfung. Die spätere Verarbeitung durch eine Software ist davon getrennt und braucht ihre eigene Grundlage nach der DSGVO. Selbst die Modellkarte von Whisper rät davon ab, das Modell für Aufnahmen ohne Einwilligung der Betroffenen zu verwenden. Ich bin Entwickler und kein Anwalt, das hier ist keine Rechtsberatung. Die ausführliche Fassung mit Normen, Einwilligungswegen und dem Sonderfall Beschäftigte steht in Gespräche transkribieren: was rechtlich gilt.

Welches Werkzeug zu welchem Fall passt

  • Vertrauliche Gespräche: erster Kandidat ist noScribe, kostenlos, lokal, mit Sprechertrennung und Editor. Der Preis steht woanders: ein bis drei Stunden Rechenzeit je Interviewstunde, rund 3 Gigabyte Installation und der Schutz des Geräts, auf dem dann alles liegt.
  • Mac, täglich, Tempo wichtig: MacWhisper, einmalig 65 Euro für Pro, mit Stapelverarbeitung und überwachtem Ordner. Lokale Sprechererkennung braucht einen M-Mac, die Cloud-Dienste bleiben aus.
  • Nichts installieren, deutsche Server: f4x, acht Minuten je Stunde Audio, Word und SRT, Kontingente statt Abo, Aufnahme danach gelöscht.
  • Regelmäßiges Volumen mit Editor im Browser: Amberscript oder Happy Scribe; Amberscript mit Wörterbuch und mehr Formaten, Happy Scribe mit günstigerem Einstieg.
  • Schnitt und Transkript zusammen: Descript, wenn du im Transkript schneidest statt in der Timeline; Glossar nur auf Englisch, keine Speicherregion genannt.
  • Automatisierung und eigene Skripte: die OpenAI-API, günstigster Minutenpreis, JSON als Ausgabe, prompt und keywords für Fachbegriffe, maximal 25 Megabyte je Datei.
  • Maximale Kontrolle, kein Budget: Whisper direkt, sechs Modellgrößen von tiny (39 Millionen Parameter) bis large (1,55 Milliarden), dazu turbo. Die Sprechertrennung baust du dazu, etwa über pyannote; wer das nicht allein aufsetzen will, bringt die Frage in die Community, dort ist denselben Weg schon jemand gegangen.

Geht es nicht um einzelne Dateien, sondern um das Protokoll nach jedem Termin, ist der Weg über das Konferenzwerkzeug oft kürzer. Wie das bei Teams, Zoom und Meet aussieht, steht in Meeting-Protokoll automatisch erstellen.

Wer die Software bedient, wenn das Transkript da ist

Jeder Werkzeugvergleich endet an derselben Stelle: Du hast jetzt Text, ob aus eigener Software oder weil du das Transkript hast erstellen lassen. Nach dreißig Gesprächen liegen dreißig Dateien da, die niemand mehr liest, und die Frage ist nicht, welches Programm sie erzeugt hat, sondern wer sie durcharbeitet.

Diese Rolle füllt bei mir Gustav, mein KI-Mitarbeiter für Call-Auswertung. Seine Spracherkennung läuft über lokales Whisper. Danach kommt der feste Ersetzungs-Pass: Namen zu Rollen, Firmen zu Branchen, Beträge zu Größenordnungen, Orte zu Regionen. Damit ist der Text zunächst pseudonym und nicht anonym (Art. 4 Nr. 5 DSGVO). Als Mindestprüfung folgt die Gegenprobe, ob Rolle, Branche, Zeitpunkt und ein Zitat zusammen doch auf eine Person führen. Für echte Anonymität zählt nach Erwägungsgrund 26 der gesamte Kontext und ob eine Identifizierung mit vernünftigerweise wahrscheinlichen Mitteln möglich bleibt. Im Zweifel bleibt der Eintrag pseudonymisiert und bekommt Zweck, Frist und Zugriffsschutz.

Sein Ergebnis ist nicht das Transkript, sondern ein Muster-Register: die wiederkehrenden Fragen aus vielen Gesprächen, jeweils mit der besten eigenen Antwort, woraus Playbook, FAQ, Content-Rohstoff und Einwand-Bibliothek werden. Wie so eine Rolle entsteht, steht in KI-Mitarbeiter einstellen: der Ablauf, und welche Rollen im Coaching-Alltag tragen, in KI für Coaches.

Häufige Fragen

Welche Transkriptionssoftware ist für Deutsch am besten?

Für vertrauliche Gespräche ist noScribe der erste Kandidat: lokal, mit Sprechertrennung, kostenlos, dafür rechenzeitintensiv. Wer nichts installieren will und deutsche Server braucht, sieht sich f4x an, nach Herstellerangabe in der Fassung 2026 60 Prozent schneller bei deutschsprachigen Interviews. Die Erkennung geht fast überall auf die Whisper-Familie zurück, was noch kein gleiches Ergebnis bedeutet.

Gibt es Transkriptionssoftware kostenlos?

Ja, ohne Kontingentgrenze. Whisper steht unter MIT-Lizenz, noScribe unter GPL-3.0, beide laufen kostenlos auf dem eigenen Rechner. Du bezahlst mit Rechenzeit: noScribe braucht je Stunde Interview etwa ein bis drei Stunden. Die Gratisstufen der Cloud-Dienste sind gedeckelt: Descript 60 Minuten im Monat, Happy Scribe zehn. Alle kostenlosen Wege mit ihren Kontingenten stehen in Audio in Text umwandeln: kostenlose Tools.

Welche Transkriptionssoftware ist DSGVO-konform?

Nicht am Produkt zu beantworten, sondern am Aufbau. Lokale Werkzeuge brauchen keinen Auftragsverarbeitungsvertrag, solange wirklich kein Dritter mitverarbeitet: keine Cloud-Sicherung, kein zugeschaltetes Cloud-Modell, kein fremder Supportzugriff. Rechtsgrundlage, Zugriffsschutz und Löschfristen bleiben trotzdem deine Aufgabe. Bei Cloud-Diensten prüfst du Verarbeitungsort, Auftragsverarbeitung und Löschfrist: f4x verarbeitet in Deutschland, Amberscript speichert in Frankfurt, Happy Scribe in der EU, Descript nennt keine Region. EU-Standort und ISO-Zertifikat sind dabei Bausteine, keine Konformitätsbescheinigung.

Was taugt noScribe?

Ein starker Kandidat für sensibles Material: kostenlos, quelloffen unter GPL-3.0, lokal, mit Sprechertrennung über pyannote, rund 60 Sprachen und einem Editor zum Gegenlesen. Ausgabe als HTML für Word, Text oder WebVTT. Achte auf die richtige Adresse, der Entwickler warnt vor einem fremden Anbieter unter ähnlicher Domain.

Wie du weitermachst

Jag zehn Minuten einer typischen eigenen Aufnahme durch zwei Werkzeuge, eines lokal, eines aus der Cloud, und miss die Zeit, bis du den Text jemandem zeigen würdest.

Ist nicht die Software der Engpass, sondern das Durcharbeiten danach, liegt Gustav als fertiges Paket in meiner Community, mit Ersetzungs-Pass samt Gegenprobe, Einwilligungs-Vorlagen und einem erfundenen Demo-Transkript zum Üben. Die Vorlagen sind Muster ohne Gewähr. Alles dazu unter Community.

Kevin Welter

Kevin Welter

Entwickler, IT-Architekt, Fachbuchautor (Kubernetes, Cloud-Infrastrukturen) und Speaker. Betreibt sein Business mit einer KI-Belegschaft aus vierzehn KI-Mitarbeitern und zeigt Selbstständigen in seiner Community, wie sie ihren ersten KI-Mitarbeiter einstellen.

Mehr über KI-Mitarbeiter

In einer Stunde läuft dein erster KI-Mitarbeiter

Zur Community