
Sprache zu Text: So wandeln Sie Sprache auf jedem Gerät in Text um
Summarize this article with:
Die Sprache-zu-Text-Technologie ist inzwischen so zuverlässig, dass Millionen Menschen sie täglich nutzen, ohne weiter darüber nachzudenken. Sie diktieren eine Textnachricht beim Autofahren, sprechen unterwegs eine Notiz ins Handy oder durchsuchen das Web per Sprachbefehl. Doch über diese schnellen Aufgaben hinaus kann Sprache zu Text ein ernstzunehmendes Produktivitätswerkzeug sein — zum Schreiben von E-Mails, Entwerfen von Dokumenten, Transkribieren von Aufnahmen, Erstellen von Inhalten und mehr.
Jedes größere Gerät und Betriebssystem bringt heute integrierte Sprache-zu-Text-Funktionen mit, und browserbasierte KI-Tools haben die Genauigkeit auf ein Niveau gehoben, das mit professioneller menschlicher Transkription mithalten kann. Dieser Leitfaden zeigt, wie Sie Sprache auf jeder Plattform in Text umwandeln, die Sie nutzen könnten: iPhone, Android, Windows, Mac und Browser.
So funktioniert Sprache zu Text
Bevor wir zu den gerätespezifischen Anleitungen kommen, hilft es, die zwei grundlegend unterschiedlichen Arten von Sprache zu Text zu verstehen.
Echtzeit-Diktat
Das passiert, wenn Sie auf das Mikrofonsymbol Ihrer Tastatur tippen und zu sprechen beginnen. Das Gerät wandelt Ihre Sprache in Echtzeit in Text um, während Sie sprechen. Ideal ist das für:
- Das Schreiben von Nachrichten, E-Mails und Notizen
- Das Ausfüllen von Formularen und Suchfeldern
- Freihändige Texteingabe, wenn Sie nicht tippen können
Echtzeit-Diktat ist in jedem modernen Gerät integriert und funktioniert auf neueren Betriebssystemen auch offline.
Transkription von Audiodateien
Hierbei haben Sie eine aufgenommene Audiodatei (ein Sprachmemo, einen Podcast, ein Interview, eine Meeting-Aufzeichnung) und möchten sie nachträglich in Text umwandeln. Dafür braucht es andere Werkzeuge als beim Diktieren, in der Regel KI-gestützte Transkriptionsdienste, die die Audiodatei verarbeiten und ein Texttranskript zurückliefern.
Beide Arten werden in diesem Leitfaden behandelt.
Sprache zu Text auf dem iPhone
Das iPhone verfügt über ausgereifte Sprache-zu-Text-Funktionen, die mit jeder iOS-Version deutlich besser geworden sind.
Diktieren (Spracheingabe in Echtzeit)
So aktivieren Sie es:
- Gehen Sie zu Einstellungen, dann Allgemein, dann Tastatur.
- Aktivieren Sie Diktieren aktivieren.
- Wählen Sie Ihre Diktiersprache.
So nutzen Sie es:
- Öffnen Sie eine beliebige App, in der Sie tippen können (Nachrichten, Notizen, Mail usw.).
- Tippen Sie auf das Mikrofonsymbol auf der Tastatur.
- Beginnen Sie zu sprechen. Ihre Worte erscheinen in Echtzeit als Text.
- Tippen Sie erneut auf das Mikrofonsymbol, um das Diktieren zu beenden.
Tipps für das Diktieren auf dem iPhone:
- Sprechen Sie Satzzeichen laut aus: "Hallo Komma wie geht es dir Fragezeichen" ergibt "Hallo, wie geht es dir?"
- Sagen Sie "neue Zeile" oder "neuer Absatz", um Zeilenumbrüche einzufügen.
- Ab iOS 17 können Sie gleichzeitig diktieren und tippen — die Tastatur bleibt während des Diktierens sichtbar, sodass Sie Korrekturen vornehmen können, ohne zu unterbrechen.
- Das Diktieren funktioniert für die primäre Gerätesprache offline (ab iOS 16), das heißt, es funktioniert im Flugmodus und Ihr Audio wird nicht an Apples Server gesendet.
Einschränkungen:
- Das Diktieren hat ein Zeitlimit (in den meisten Apps etwa 60 Sekunden pro Sitzung, das in neueren iOS-Versionen allerdings verlängert wurde).
- Die Genauigkeit nimmt bei starken Akzenten, Hintergrundgeräuschen oder Fachvokabular ab.
- Nicht geeignet für die Langform-Transkription aufgenommener Audiodateien.
Audiodateien auf dem iPhone transkribieren
Zum Umwandeln aufgenommener Audiodateien in Text (Sprachmemos, Interviews, Vorlesungen):
- Integriert (ab iOS 18): Die Notizen-App und die Sprachmemos-App enthalten jetzt Transkriptionsfunktionen. Nehmen Sie in Sprachmemos auf, und ein Transkript wird automatisch erstellt.
- Browserbasiert: Öffnen Sie Safari und rufen Sie Sprache zu Text auf. Laden Sie Ihre Audiodatei hoch und erhalten Sie in wenigen Minuten ein Transkript. Das funktioniert mit jeder Audiodatei auf Ihrem Telefon.
Sprache zu Text unter Android
Android bietet seit seinen Anfängen Spracherkennung, und Googles Sprachtechnologie gehört zu den besten der Welt.
Diktieren (Google-Spracheingabe)
So aktivieren Sie es:
- Öffnen Sie Einstellungen, dann System, dann Sprachen & Eingabe, dann Bildschirmtastatur.
- Stellen Sie sicher, dass Gboard (Google-Tastatur) als Standardtastatur ausgewählt ist.
- Die Spracheingabe ist in Gboard standardmäßig aktiviert.
So nutzen Sie es:
- Öffnen Sie ein beliebiges Texteingabefeld.
- Tippen Sie auf das Mikrofonsymbol auf der Gboard-Tastatur.
- Beginnen Sie zu sprechen. Der Text erscheint in Echtzeit.
- Tippen Sie erneut auf das Mikrofon oder warten Sie, bis es automatisch stoppt.
Tipps für das Diktieren unter Android:
- Googles Spracherkennung ist für Englisch außergewöhnlich genau und unterstützt über 100 Sprachen.
- Sprechen Sie Satzzeichen ganz natürlich aus: "Punkt", "Komma", "Ausrufezeichen", "Fragezeichen".
- "Neue Zeile" und "neuer Absatz" funktionieren zur Formatierung.
- Auf Pixel-Telefonen (und einigen Samsung-Geräten) kann das Diktieren nach dem Herunterladen des Sprachpakets vollständig offline funktionieren.
Die Google Recorder App
Die Google Recorder App (auf Pixel-Telefonen vorinstalliert, für andere Android-Geräte verfügbar) ist eines der besten kostenlosen Transkriptionstools überhaupt — auf jeder Plattform.
Funktionen:
- Nimmt Audio auf und erstellt gleichzeitig ein Echtzeit-Transkript.
- Hebt Wörter im Transkript hervor, während das Audio abgespielt wird.
- Ermöglicht die Suche innerhalb des Transkripts.
- Funktioniert offline.
- Unterstützt den Import von Audiodateien zur Transkription.
So nutzen Sie sie für die Transkription von Vorlesungen oder Meetings:
- Öffnen Sie Google Recorder.
- Tippen Sie auf die Aufnahmetaste und starten Sie Ihre Aufnahme.
- Sehen Sie zu, wie das Transkript in Echtzeit erscheint.
- Speichern Sie die Aufnahme, wenn Sie fertig sind. Sowohl Audio als auch Transkript werden gespeichert.
- Teilen oder exportieren Sie das Transkript als Text.
Audiodateien unter Android transkribieren
Für Dateien, die nicht mit Google Recorder aufgenommen wurden, öffnen Sie Chrome und nutzen Sie Audio zu Text, um beliebige Audiodateien direkt im Browser hochzuladen und zu transkribieren.
Sprache zu Text unter Windows
Windows bietet mehrere Sprache-zu-Text-Optionen, von der integrierten Diktierfunktion bis zur leistungsstarken KI-Transkription.
Spracheingabe (Windows 11)
Windows 11 enthält eine integrierte Spracheingabefunktion, die systemweit funktioniert.
So aktivieren Sie sie:
- Drücken Sie Windows-Taste + H, um die Spracheingabe zu öffnen.
- Ein kleines Mikrofon-Overlay erscheint am oberen Bildschirmrand.
- Beginnen Sie zu sprechen. Der Text erscheint dort, wo sich Ihr Cursor befindet.
- Drücken Sie erneut Windows-Taste + H oder klicken Sie auf das Mikrofon, um zu stoppen.
Einstellungen und Anpassung:
- Klicken Sie auf das Zahnradsymbol in der Spracheingabe-Symbolleiste, um die Einstellungen aufzurufen.
- Aktivieren Sie die automatische Interpunktion, damit Windows automatisch Punkte, Kommas und Fragezeichen einfügt.
- Die Spracheingabe funktioniert in jeder Anwendung — Word, Editor, E-Mail, Textfelder im Browser und mehr.
Tipps:
- Verwenden Sie für beste Ergebnisse ein Headset oder ein dediziertes Mikrofon statt des eingebauten Mikrofons Ihres Laptops.
- Die Spracheingabe unterstützt mehrere Sprachen. Ändern Sie die Eingabesprache in den Windows-Einstellungen unter Zeit & Sprache.
- Sprachbefehle wie "lösche das", "alles auswählen" und "gehe zum Ende" funktionieren zum Bearbeiten, ohne die Tastatur zu berühren.
Windows-Spracherkennung (Legacy)
Die ältere Windows-Spracherkennung (Einstellungen > Barrierefreiheit > Sprache) bietet eine umfassendere Sprachsteuerung des gesamten Betriebssystems, nicht nur der Texteingabe. Sie kann Apps öffnen, Schaltflächen anklicken und Menüs per Sprache bedienen. Für reines Diktieren ist die neuere Spracheingabe (Win+H) jedoch schneller und genauer.
Audiodateien unter Windows transkribieren
Zum Transkribieren aufgenommener Audiodateien unter Windows:
- Microsoft Word (Microsoft 365): Words Transkriptionsfunktion (zu finden unter Start > Diktieren > Transkribieren) kann hochgeladene Audiodateien verarbeiten und ein Transkript mit Sprecherkennzeichnungen erstellen. Dies erfordert ein Microsoft-365-Abonnement.
- Browserbasierte Tools: Öffnen Sie einen beliebigen Browser und gehen Sie zu Sprache zu Text, um Audiodateien ohne Softwareinstallation zu transkribieren.
Sprache zu Text auf dem Mac
macOS bringt eine integrierte Diktierfunktion mit, die in allen Anwendungen funktioniert, plus die Möglichkeit, browserbasierte Tools für die Transkription von Audiodateien zu nutzen.
Diktieren (macOS)
So aktivieren Sie es:
- Öffnen Sie die Systemeinstellungen (bzw. die Systemeinstellungen in älteren macOS-Versionen).
- Gehen Sie zu Tastatur.
- Scrollen Sie nach unten zu Diktat und aktivieren Sie es.
- Wählen Sie Ihre Sprache und die Tastenkombination (Standard ist zweimaliges Drücken der Fn-Taste).
So nutzen Sie es:
- Platzieren Sie den Cursor in ein beliebiges Textfeld.
- Drücken Sie zweimal die Fn-Taste (oder Ihre konfigurierte Tastenkombination).
- Eine Mikrofonanzeige erscheint. Beginnen Sie zu sprechen.
- Drücken Sie erneut Fn oder klicken Sie auf "Fertig", um das Diktieren zu beenden.
Tipps für das Diktieren auf dem Mac:
- Auf Macs mit Apple Silicon (M1 und neuer) wird das Diktat für unterstützte Sprachen direkt auf dem Gerät verarbeitet, das heißt, es funktioniert offline und Ihr Audio wird nicht an Apples Server gesendet.
- Auf neueren macOS-Versionen kann das Diktieren über längere Zeiträume laufen (das alte 60-Sekunden-Limit wurde entfernt).
- Die üblichen Interpunktionsbefehle funktionieren: "Punkt", "Komma", "neuer Absatz", "Ausrufezeichen".
- Sie können gleichzeitig diktieren und Tastatur sowie Trackpad benutzen — das Diktieren sperrt andere Eingabemethoden nicht.
Audiodateien auf dem Mac transkribieren
- Integriert: macOS hat keine native Funktion zur Transkription von Audiodateien (das Diktat funktioniert nur in Echtzeit).
- Browserbasiert: Nutzen Sie Safari oder Chrome, um Audio zu Text aufzurufen und aufgenommene Dateien zur Transkription hochzuladen.
- Lokale Tools: Das Open-Source-Modell Whisper kann lokal auf dem Mac ausgeführt werden. MacWhisper ist eine beliebte native Mac-App, die eine benutzerfreundliche Oberfläche für das Whisper-Modell bietet.
Sprache zu Text im Browser
Browserbasierte Sprache-zu-Text-Tools funktionieren auf jedem Gerät mit Webbrowser und Internetverbindung. Sie sind plattformunabhängig, erfordern keine Installation und sind oft die vielseitigste Option.
Für Echtzeit-Aufnahme und -Transkription
Mit dem Online-Sprachrekorder können Sie Audio direkt im Browser aufnehmen und anschließend transkribieren — ganz ohne App-Installation. Das ist nützlich, wenn:
- Sie an einem geteilten oder dienstlichen Computer arbeiten, auf dem Sie keine Software installieren dürfen.
- Sie einen einfachen Aufnehmen-und-Transkribieren-Workflow möchten.
- Sie ein Chromebook oder ein anderes Gerät mit eingeschränkter nativer App-Unterstützung nutzen.
Für die Transkription vorhandener Audiodateien
Sprache zu Text und Audio zu Text akzeptieren hochgeladene Audiodateien in jedem Format und liefern präzise Transkripte. Diese Tools nutzen fortschrittliche KI-Modelle und erreichen in der Regel eine höhere Genauigkeit als die integrierte Diktierfunktion der Geräte, insbesondere bei:
- Langen Aufnahmen (Vorlesungen, Interviews, Meetings)
- Audio mit Hintergrundgeräuschen
- Mehreren Sprechern
- Fachvokabular
Google Docs Spracheingabe
Google Docs enthält eine integrierte Spracheingabefunktion:
- Öffnen Sie ein Google-Dokument.
- Gehen Sie zu Tools, dann Spracheingabe (oder drücken Sie Ctrl+Shift+S / Cmd+Shift+S).
- Klicken Sie auf das Mikrofonsymbol und beginnen Sie zu sprechen.
Das ist eine solide kostenlose Option, um direkt in ein Dokument zu diktieren, erfordert aber den Chrome-Browser und eine Internetverbindung.
Den richtigen Ansatz wählen
Hier eine schnelle Entscheidungshilfe:
Nutzen Sie die integrierte Diktierfunktion, wenn:
- Sie eine Nachricht, E-Mail oder kurze Notiz schreiben
- Sie Text in Echtzeit beim Sprechen möchten
- Sie keine Aufnahme des Audios benötigen
- Der Inhalt umgangssprachlich und nicht hochtechnisch ist
Nutzen Sie die Transkription von Audiodateien, wenn:
- Sie eine bereits aufgenommene Datei haben (Vorlesung, Meeting, Interview, Podcast)
- Die Aufnahme länger als ein paar Minuten ist
- Sie hohe Genauigkeit mit Sprecherkennzeichnungen benötigen
- Sie das Transkript bearbeiten, durchsuchen und teilen möchten
Nutzen Sie eine dedizierte Aufnahme-App, wenn:
- Sie sowohl die Audioaufnahme als auch das Transkript möchten
- Sie in Umgebungen aufnehmen müssen, in denen Sie nicht auf den Bildschirm schauen können
- Sie Echtzeit-Transkription während der Aufnahme zur direkten Durchsicht möchten
Die Genauigkeit von Sprache zu Text verbessern
Unabhängig vom Gerät oder Tool, das Sie nutzen, verbessern diese Praktiken die Genauigkeit:
Sprechen Sie deutlich
Das bedeutet nicht, unnatürlich langsam oder laut zu sprechen. Es bedeutet:
- Wörter vollständig artikulieren statt zu nuscheln
- Am Satzende nicht leiser werden oder verschleifen
- Kurz zwischen den Sätzen pausieren, damit der Algorithmus korrekt segmentieren kann
Reduzieren Sie Hintergrundgeräusche
Die Genauigkeit der Spracherkennung sinkt in lauten Umgebungen deutlich. Selbst moderne Geräuschunterdrückungsalgorithmen können ein lautes Café oder Baulärm nicht vollständig ausgleichen. Nutzen Sie nach Möglichkeit einen ruhigen Raum oder ein Nahbesprechungsmikrofon (etwa Ohrhörer mit eingebautem Mikrofon), das Ihre Stimme aufnimmt und Umgebungsgeräusche ausblendet.
Verwenden Sie ein gutes Mikrofon
Bei regelmäßiger Sprache-zu-Text-Nutzung zahlt sich selbst die Investition in ein einfaches externes Mikrofon in puncto Genauigkeit aus. Ein USB-Mikrofon für $20 übertrifft beim Diktieren jedes eingebaute Laptop-Mikrofon.
Trainieren Sie Ihr Vokabular
Manche Plattformen erlauben das Hinzufügen eigener Wörter oder Phrasen. Wenn Sie regelmäßig Fachbegriffe verwenden (medizinische Terminologie, juristisches Fachvokabular, Produktnamen), verbessert das Hinzufügen zum Wörterbuch Ihres Geräts oder zum benutzerdefinierten Vokabular des Transkriptionstools die Erkennung.
Datenschutzaspekte
Achten Sie bei der Nutzung von Sprache zu Text darauf, wohin Ihre Audiodaten gelangen:
- Verarbeitung auf dem Gerät (verfügbar auf neueren iPhones, Macs mit Apple Silicon, Pixel-Telefonen und Windows 11) behält Ihr Audio auf Ihrem Gerät. Nichts wird in die Cloud gesendet.
- Cloudbasierte Verarbeitung sendet Ihr Audio zur Transkription an entfernte Server. Das gilt für die meisten browserbasierten Tools und ältere Diktierfunktionen von Geräten.
- Prüfen Sie die Datenschutzerklärung jedes Drittanbieter-Transkriptionstools, bevor Sie sensible Audiodaten hochladen (medizinische Unterlagen, Gerichtsverfahren, vertrauliche Geschäftsgespräche).
Häufig gestellte Fragen
Was ist die genaueste Sprache-zu-Text-Methode?
Für das Echtzeit-Diktat sind sowohl Apples geräteinternes Diktat (iPhone und Mac mit Apple Silicon) als auch Googles Spracheingabe hervorragend, mit einer Genauigkeit von über 95 % bei deutlicher englischer Sprache. Für die Transkription aufgenommener Audiodateien liefern KI-gestützte Tools wie Sprache zu Text in der Regel die höchste Genauigkeit, weil sie das Audio mehrfach verarbeiten und größere Modelle nutzen können als das, was auf einem Telefon läuft.
Kann ich Sprache zu Text offline nutzen?
Ja, auf den meisten modernen Geräten. iPhones (ab iOS 16), Macs mit Apple Silicon, Pixel-Telefone und Windows 11 unterstützen alle das Offline-Diktat für die primären Sprachen. Der Offline-Modus nutzt kleinere Modelle, daher kann die Genauigkeit etwas geringer ausfallen als bei cloudbasierter Verarbeitung. Tools zur Transkription von Audiodateien benötigen in der Regel eine Internetverbindung.
Wie füge ich mit Sprache zu Text Satzzeichen ein?
Sprechen Sie die Satzzeichen laut aus. Alle großen Diktiersysteme erkennen: "Punkt" (.), "Komma" (,), "Fragezeichen" (?), "Ausrufezeichen" (!), "Doppelpunkt" (:), "Semikolon" (;), "Anführungszeichen Anfang" / "Anführungszeichen Ende" (" "), "neue Zeile" und "neuer Absatz". Viele Systeme unterstützen auch "Gedankenstrich", "Bindestrich" und "Auslassungspunkte".
Ist Sprache zu Text gut genug für professionelles Schreiben?
Sprache zu Text ist ein hervorragendes Werkzeug für die erste Fassung. Viele professionelle Autoren, Journalisten und Content-Ersteller diktieren ihre Rohfassungen und bearbeiten sie anschließend am Bildschirm. Der Schlüssel liegt darin, das Diktieren als Entwurfswerkzeug zu betrachten, nicht als Werkzeug für das fertige Produkt. Diktieren Sie frei und überarbeiten Sie dann auf Klarheit, Struktur und Präzision. Für die Transkription professioneller Aufnahmen (Interviews, Meetings, diktierte Notizen) liefern KI-Transkriptionstools Ergebnisse, die mit minimalem Nachbearbeitungsaufwand bereit für die Bearbeitung sind.
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Speechmatics Alternative for Non-Developers: Web Transcription Without Code
Speechmatics is genuinely excellent for developers: 50 hours free per month, 56 languages, on-prem deployment. If you need a drag-and-drop web app with flat $9.99/mo pricing instead of an API, here is an honest comparison of the two.

Best Free Transcription Tools With No Watermark (2026)
The best free transcription tools that produce clean, unwatermarked output. Compare CATT, TurboScribe, MacWhisper, and self-hosted options for unrestricted use.