Audio kostenlos in Text umwandeln geht auf drei Wegen. Sie unterscheiden sich in Kontingent, Datenschutz, Bedienung und je nach Material auch in der Qualität. Erstens die Gratisstufen der Online-Dienste: Descript verarbeitet 60 Minuten Medien im Monat, exportiert in der Free-Stufe aber mit Wasserzeichen, Notta gibt 120 Transkriptionsminuten im Monat und deckelt das einzelne Gespräch auf drei Minuten, Happy Scribe stellt zehn Minuten KI-Transkription zum Ausprobieren bereit, f4x mit Servern in Deutschland 15 Minuten ohne Abo und ohne Zahlungsdaten. Zweitens die Bordmittel, die du vielleicht schon bezahlst: Word transkribiert hochgeladene Audiodateien bis zu 300 Minuten im Monat, setzt dafür aber ein Microsoft-365-Abo voraus, und die Spracheingabe in Google Docs ist gratis, nimmt allerdings keine Datei an, sondern nur ein laufendes Mikrofon. Drittens der eigene Rechner: Whisper steht unter MIT-Lizenz, noScribe unter GPL-3.0, beide kosten nichts, haben kein Minutenkontingent und brauchen keine Anmeldung. Dieser dritte Weg ist der einzige, bei dem die Aufnahme dein Gerät nicht verlässt. Bezahlt wird er trotzdem, nämlich mit Einrichtungszeit und Rechenzeit: noScribe veranschlagt für eine Stunde Interview etwa ein bis drei Stunden Verarbeitung.
Ich transkribiere meine eigenen Calls lokal, und der Grund ist keine Sparsamkeit, sondern die Frage, wer die Aufnahme zu sehen bekommt. Bei einem Erstgespräch lautet die Antwort: niemand außer mir. Was auf meinem eigenen Gerät läuft und was ich bewusst in die Cloud gebe, steht auf der Seite KI und ausführlicher in Lokale KI: was 2026 wirklich geht sowie in KI und Datenschutz: was die KI sehen darf.
Drei Wege, drei Grenzen
Kostenlos heißt bei jedem der drei Wege etwas anderes. Diese Übersicht sagt, woran du jeweils zuerst anstößt.
Die Spalte, die den Ausschlag gibt, ist meist die letzte. Bei einer Sprachnotiz an dich selbst ist sie egal, bei einem aufgezeichneten Kundengespräch entscheidet sie darüber, ob ein Auftragsverarbeitungsvertrag fällig wird.
Die Gratisstufen der Dienste und ihre Kontingente
Alle Angaben von den Anbieterseiten, abgerufen am 20. September 2026.
Die Deckelung ist selten nur eine Minutenzahl, wie die rechte Spalte zeigt. Als Probelauf reichen diese Stufen trotzdem: Zehn Minuten genügen, um zu sehen, wie ein Dienst mit deinem Mikrofon, deinem Raum und deinem Fachvokabular zurechtkommt.
Wer regelmäßig mehr braucht, findet acht Werkzeuge mit Verarbeitungsort, Sprechertrennung, Formaten und Preisen nebeneinander in Transkriptionssoftware im Vergleich.
Bordmittel: was Office und Browser schon können
Word transkribiert hochgeladene Dateien. Die Funktion heißt „Transkribieren", sitzt in Word für das Web und in Word für Windows, nimmt WAV, MP4, M4A und MP3 entgegen und kann Deutsch (Deutschland). Microsoft nennt für Nutzer mit Microsoft-365-Abo 300 Minuten hochgeladener Audiodateien im Monat, mit Copilot-Lizenz bis zu 30.000 Minuten. Zwei Einschränkungen gehören dazu: Ohne Abo oder Copilot-Lizenz gibt es die Funktion nicht, und sie braucht eine Internetverbindung, die Verarbeitung läuft also nicht auf deinem Rechner. Wer Microsoft 365 ohnehin bezahlt, hat hier den kürzesten Weg von der Datei zum Text im Dokument.
Die Spracheingabe in Google Docs kostet nichts, nimmt aber keine Datei. Sie läuft in Chrome, Edge und Safari, braucht ein Mikrofon und deckt über 120 Sprachen und Dialekte ab, Deutsch inbegriffen. Was sie nicht kann, steht so in Googles eigener Hilfe: Sie diktiert live mit, einen Upload einer bestehenden Aufnahme sieht sie nicht vor. Für ein gesprochenes Protokoll direkt nach dem Termin ist das brauchbar, für die Aufnahme von gestern nicht; die liegt eher auf deinem Handy, und was dessen Bordmittel aus Sprachaufnahmen machen, ist ein eigenes Thema.
Dein Konferenzwerkzeug schreibt vermutlich schon mit. Teams, Zoom und Meet bringen eine eigene Transkription mit, die je nach Lizenz freigeschaltet ist, und ersparen dir damit den Umweg über eine Datei. Wo diese Schalter sitzen und was die Automatik danach an Protokoll liefert, steht in Telefonate in Teams transkribieren und in Meeting-Protokoll automatisch erstellen.
Der Weg über den eigenen Rechner
Dieser Weg hat als einziger zwei Eigenschaften gleichzeitig: dauerhaft gratis ohne Kontingent, und die Aufnahme verlässt das Haus nicht.
Whisper direkt. Das Modell von OpenAI steht samt Code unter MIT-Lizenz. Installiert wird es mit pip install -U openai-whisper, ein Lauf sieht aus wie whisper aufnahme.wav --language German. Es gibt sechs Größen, und die Wahl entscheidet über Tempo und Speicherbedarf.
noScribe, wenn du keine Kommandozeile willst. Die Anwendung ist quelloffen unter GPL-3.0, kostet nichts, läuft auf Windows, macOS und Linux und bringt Sprechererkennung mit, was Whisper allein nicht tut. Rund 60 Sprachen sind abgedeckt, die Ausgabe kommt als HTML zum Öffnen in Word, als reiner Text oder als WebVTT. Der Entwickler nennt zwei Zahlen offen: etwa drei Gigabyte Installationsgröße, weil die Modelle mitkommen, und etwa ein bis drei Stunden Rechenzeit je Stunde Interview, auf älteren Geräten länger, mit einer NVIDIA-Karte deutlich schneller.
Im Browser, ganz ohne Installation. Das Projekt Whisper Web setzt Whisper über Transformers.js um und beschreibt sich als Spracherkennung direkt im Browser, mit experimenteller WebGPU-Beschleunigung in einem eigenen Branch, ebenfalls unter MIT-Lizenz. Das ist der kürzeste Weg, um die lokale Variante einmal auszuprobieren, bevor du etwas installierst. Gleichsetzen mit einer installierten Offline-Anwendung solltest du das aber nicht: Die Seite selbst und die Modelldateien kommen aus dem Netz, und welche weiteren Verbindungen eine konkrete Instanz aufbaut, siehst du erst, wenn du im Browser einmal in den Netzwerkverkehr schaust.
Bei diesen drei Varianten ist kein Konto im Spiel. Wer „ohne Anmeldung" sucht, landet deshalb hier: Es ist kein Anbieter beteiligt, bei dem man sich anmelden könnte.
Die Einrichtung ist der eigentliche Aufwand an diesem Weg, und zwar einmalig. Wer sie nicht allein durchziehen will, bringt die Frage in die Community: Dort sitzen Leute, die denselben Aufbau schon auf ihrem Rechner haben, und in den Calls ist so etwas am geteilten Bildschirm schnell geklärt.
Was „gratis" in der Rechnung wirklich heißt
Der lokale Weg ist nicht der bessere, er ist der andere. Er tauscht Geld gegen Zeit, und ob dieser Tausch aufgeht, hängt an deinem Material; die Gegenrechnung, ab wann sich das Erstellenlassen eines Transkripts lohnt, steht im eigenen Beitrag.
Dazu kommt ein Punkt, der für alle Whisper-basierten Werkzeuge gilt, also auch für die Dienste, die Whisper im Hintergrund einsetzen: Die Modellkarte des Projekts weist ausdrücklich darauf hin, dass die Ausgabe Text enthalten kann, der gar nicht gesprochen wurde, dass das Modell zu Wiederholungen neigt und dass es bei verschiedenen Akzenten und Dialekten unterschiedlich gut arbeitet. Für die Praxis heißt das: Ein Transkript wirkt an undeutlichen Stellen nicht lückenhaft, sondern plausibel falsch. Gegenlesen gehört deshalb zum Arbeitsschritt, und diese Minuten gehören in die Kostenrechnung, egal auf welchem der drei Wege der Text entstanden ist.
Ein Absatz zum Recht, bevor du irgendetwas hochlädst
§ 201 StGB stellt das unbefugte Aufnehmen des nichtöffentlich gesprochenen Wortes eines anderen unter Strafe. Heimlich aufnehmen ist damit raus, und der sichere Regelfall im Geschäftsalltag ist die vorherige ausdrückliche Zustimmung aller anderen Beteiligten. Die spätere Verarbeitung durch einen Dienst ist davon getrennt zu betrachten und braucht ihre eigene Grundlage nach der DSGVO. Selbst die Modellkarte von Whisper rät ausdrücklich davon ab, das Modell für Aufnahmen zu verwenden, die ohne Einwilligung der Betroffenen entstanden sind. Ich bin Entwickler und kein Anwalt, das hier ist keine Rechtsberatung. Die ausführliche Fassung mit den Normen und den Einwilligungswegen steht in Gespräche transkribieren: was rechtlich gilt.
Wenn der Text da ist, fängt die Arbeit an
Die Suche nach einem kostenlosen Werkzeug endet meist an derselben Stelle: Du hast jetzt Text. Nach dreißig Gesprächen hast du dreißig Dateien, und die eigentliche Frage ist nicht mehr, was die Umwandlung gekostet hat, sondern wer sie durcharbeitet.
Diese Rolle füllt bei mir Gustav, mein KI-Mitarbeiter für Call-Auswertung. Seine Reihenfolge deckt sich mit dem dritten Weg oben, und das ist kein Zufall: Die Spracherkennung läuft über lokales Whisper, das Roh-Transkript verlässt den Rechner nicht. Danach kommt der feste Anonymisierungs-Pass, der Namen zu Rollen, Firmen zu Branchen, Beträge zu Größenordnungen und Orte zu Regionen macht und heikle Passagen entfernt. Erst die anonymisierten Extrakte gehen weiter.
Sein Ergebnis ist deshalb nicht das Transkript, sondern ein Muster-Register: die wiederkehrenden Fragen aus vielen Gesprächen, jeweils mit deiner bislang klarsten eigenen Antwort darauf, woraus Playbook, FAQ, Content-Rohstoff und eine Einwand-Bibliothek werden. Er arbeitet in Etappen von zehn bis zwanzig Calls mit Stichproben-Review, und er destilliert, was du selbst gesagt hast, statt Ratschläge zu erfinden. Welche Rollen im Coaching-Alltag sonst noch tragen, steht in KI für Coaches.
Häufige Fragen
Wie wandle ich Audio kostenlos in Text um?
Am schnellsten über die Gratisstufe eines Dienstes: f4x gibt 15 Minuten ohne Zahlungsdaten, Notta 120 Minuten im Monat. Dauerhaft und ohne Kontingent geht es mit Whisper oder noScribe auf dem eigenen Rechner. Beide sind quelloffen, kosten nichts und brauchen kein Konto.
Geht das auch ohne Anmeldung?
Ja, auf dem lokalen Weg. Whisper und noScribe sind Programme auf deinem Rechner, es gibt keinen Anbieter, bei dem du dich anmelden könntest. Whisper Web bringt dieselbe Modellfamilie in den Browser, lädt Anwendung und Modell dafür allerdings aus dem Netz. Die Gratisstufen der Online-Dienste setzen dagegen in der Regel ein Konto voraus, f4x verzichtet immerhin auf Zahlungsdaten für die ersten 15 Minuten.
Kann Word Audio in Text umwandeln?
Ja, über die Funktion „Transkribieren" in Word für das Web und in Word für Windows. Sie nimmt WAV, MP4, M4A und MP3 und kann Deutsch. Voraussetzung ist ein Microsoft-365-Abo oder eine Copilot-Lizenz, kostenlos ist sie also nur, wenn du das Abo ohnehin hast.
Wie lange dauert die kostenlose Umwandlung auf dem eigenen Rechner?
Das hängt an Hardware und Modellgröße. noScribe nennt für eine Stunde Interview etwa ein bis drei Stunden Verarbeitung, auf älteren Geräten länger, mit einer NVIDIA-Karte deutlich schneller. Bei Whisper direkt steuerst du das über die Modellgröße: tiny läuft laut Projektangabe rund zehnmal so schnell wie large, turbo rund achtmal.
Sind kostenlose Werkzeuge ungenauer als bezahlte?
Nicht zwingend, denn unter vielen Diensten steckt eine verwandte Modellfamilie, oft Whisper, das du auch lokal betreiben kannst. Modellgröße, Vor- und Nachverarbeitung und Sprechertrennung unterscheiden sich trotzdem, und damit je nach Material auch das Ergebnis. Eine unabhängige Vergleichsmessung dieser Dienste für Deutsch habe ich bei der Recherche nicht gefunden, deshalb ist ein eigener Zehn-Minuten-Test mit typischem Material aussagekräftiger als jede fremde Prozentzahl.
Ist die kostenlose Variante auch die datenschutzfreundlichere?
Lokal sinkt die Zahl der Empfänger: Verarbeitet wirklich kein Dritter mit, entfällt der Auftragsverarbeitungsvertrag. Prüf dafür Cloud-Backup, synchronisierte Ordner und optionale Cloud-Funktionen deines Werkzeugs. Zugriffsschutz, Rechtsgrundlage und Löschfrist bleiben auch lokal deine Aufgabe. Bei den Gratisstufen der Dienste gilt dasselbe wie bei den bezahlten: Die Datei geht an einen Anbieter. Der Preis sagt darüber nichts aus, der Verarbeitungsort schon.
Wie du weitermachst
Nimm zehn Minuten einer typischen eigenen Aufnahme, keine saubere Studioaufnahme, und lass sie durch genau zwei Wege laufen: eine Gratisstufe deiner Wahl und einmal lokal, am einfachsten über noScribe. Miss dabei nicht die Trefferquote, sondern die Zeit, die du zum Korrigieren brauchst, bis du den Text jemandem zeigen würdest. Danach weißt du, ob in deinem Fall der Preis die interessante Größe ist oder die Korrekturzeit.
Wenn dabei herauskommt, dass nicht die Umwandlung der Engpass ist, sondern das Durcharbeiten danach, liegt Gustav als fertiges Paket in meiner Community: mit Anonymisierungs-Pass, Einwilligungs-Vorlagen und einem erfundenen Demo-Transkript zum Üben, in der Premium-Stufe für 45 Dollar im Monat, Stand September 2026. Die Vorlagen sind Muster ohne Gewähr und ersetzen keine anwaltliche Prüfung deines Falls. Alles dazu unter Community.