Alle Artikel

Engineering

Text in Sprache umwandeln: Praxisleitfaden für deutsche Sprachsynthese

Wie Unternehmen Text in natürliche deutsche Sprache umwandeln: Wege von Systemstimmen über Webtools bis zur TTS-API mit Streaming, Textvorbereitung für Zahlen und Namen, Qualitätsprüfung, Stimmrechte und Barrierefreiheit.

Viktor Presber13 Min. Lesezeit
Feine Partikelreihen in gleichmäßigem Raster gehen fließend in eine weiche Schallwelle mit konzentrischen Wellenringen über.
Auf dieser Seite

Wer in einem Unternehmen Text in Sprache umwandeln muss, hat selten ein Problem mit dem Knopf, der Audio erzeugt. Das Problem beginnt danach: Die Stimme liest „3.10.“ als Zahlenkette, spricht einen Produktnamen englisch aus, wo er deutsch klingen soll, oder eine Kollegin fragt, ob die Stimme aus dem kostenlosen Webtool überhaupt im Kundenportal verwendet werden darf. Ob es um Produktaudio, E-Learning, Barrierefreiheit, Durchsagen, eine App oder einen Voice Agent geht: Die Wahl des Wegs entscheidet darüber, wie viel Kontrolle Sie über Aussprache, Rechte und Datenfluss haben.

Dieser Leitfaden erklärt, wie moderne Sprachsynthese praktisch funktioniert, warum Deutsch besondere Sorgfalt verlangt, wie Sie Text vorbereiten und wie Sie zwischen Systemstimmen, Webtools und einer TTS-API wählen. Offenlegung: KugelAudio veröffentlicht diesen Artikel und bietet selbst eine TTS-API an. Die Auswahl eines deutschen TTS-Anbieters behandelt der Artikel Deutsches und regionales Text-to-Speech 2026 richtig auswählen ausführlich; hier geht es um den Weg vom Text zum fertigen Audio.

Das Wichtigste in Kürze

  • Für einzelne Texte reichen oft die Vorlesefunktionen von Betriebssystem und Browser. Für wiederkehrende, veröffentlichte oder dynamische Sprachausgabe brauchen Sie einen Weg mit festgelegter Stimme, geklärten Nutzungsrechten und reproduzierbarer Aussprache.
  • Die meisten hörbaren Fehler im Deutschen entstehen vor der eigentlichen Synthese: bei Zahlen, Daten, Abkürzungen, Namen und englischen Begriffen. Textvorbereitung und Normalisierung sind deshalb genauso wichtig wie die Stimme.
  • Prüfen Sie Qualität mit echten Texten, einem verdeckten Hörtest durch Muttersprachler und einer ASR-Rückprüfung, die falsch gelesene Zahlen und Namen findet.
  • Eine geklonte oder nachgeahmte Stimme braucht die Einwilligung der Person. Seit dem 2. August 2026 gelten außerdem die Transparenzpflichten aus Artikel 50 der KI-Verordnung.
  • Eine Vorlesefunktion ersetzt keine barrierefreie Textstruktur. Das Barrierefreiheitsstärkungsgesetz verlangt Sprachausgabe nur für bestimmte Produkte ausdrücklich.

Wie funktioniert moderne Sprachsynthese?

Moderne Sprachsynthese erzeugt Sprache mit einem neuronalen Modell, das aus großen Mengen gesprochener Aufnahmen gelernt hat, wie Text klingt. Sie setzt nicht mehr einzelne aufgenommene Lautbausteine zusammen, sondern berechnet das Audiosignal neu. Deshalb klingen aktuelle Stimmen flüssiger als die Systeme früherer Navigationsgeräte.

Praktisch läuft die Umwandlung in drei Schritten ab. Zuerst wird der Text normalisiert: Ziffern, Datumsangaben, Währungen und Abkürzungen werden in die Wörter übersetzt, die tatsächlich gesprochen werden sollen. Danach sagt das Modell voraus, wie diese Wörter mit Betonung, Pausen und Satzmelodie klingen. Zuletzt entsteht daraus das hörbare Audiosignal, entweder als fertige Datei oder in kleinen Stücken, die schon abgespielt werden, während der Rest noch berechnet wird.

Dieses Streaming ist der Unterschied zwischen einer Hörbuchproduktion und einem Voice Agent. Für eine E-Learning-Datei spielt es keine Rolle, ob die Erzeugung einige Sekunden dauert. In einem Telefongespräch oder einer App, die auf eine Frage antwortet, muss das erste Audio dagegen beginnen, bevor der ganze Satz fertig ist.

Wichtig für die Praxis: Das Modell hört nur, was nach der Normalisierung ankommt. Liest die Stimme eine Kontonummer falsch, liegt der Fehler oft nicht an der Stimme, sondern an der Aufbereitung davor.

Warum klingt deutscher Text so oft falsch?

Deutscher Text klingt oft falsch, weil dieselbe Zeichenfolge je nach Kontext unterschiedlich gesprochen wird und viele Werkzeuge ihre Regeln für Zahlen und Abkürzungen aus dem Englischen übernommen haben. Eine Stimme kann dabei vollkommen natürlich klingen und trotzdem den Inhalt verändern.

Zahlen sind das deutlichste Beispiel. „1.250,00 €“ nutzt Punkt und Komma genau umgekehrt wie im Englischen, und „24“ wird mit der Einerstelle vor der Zehnerstelle gesprochen. Datumsangaben verlangen zusätzlich die richtige Beugung: „am 3. Oktober“ wird zu „am dritten Oktober“, „bis zum 3. Oktober“ ebenso, „der 3. Oktober“ zu „der dritte Oktober“. Telefonnummern, Postleitzahlen und Kundennummern werden dagegen gar nicht als Zahlwort gelesen, sondern in Ziffern oder Gruppen.

Abkürzungen sind mehrdeutig. „St.“ kann „Sankt“ oder „Straße“ bedeuten, „Nr.“ und „z. B.“ werden ausgeschrieben, „GmbH“ und „ABC“ werden buchstabiert, „DSGVO“ in der Regel ebenfalls, „NATO“ dagegen als Wort gesprochen. Kein Normalisierer kennt alle Abkürzungen Ihrer Branche.

Zusammengesetzte Wörter wie „Datenschutzfolgenabschätzung“ brauchen die richtige Betonung, sonst zerfallen sie hörbar in Einzelteile. Englische Begriffe wie „Update“, „Dashboard“ oder „Meeting“ gehören im deutschen Geschäftsalltag dazu und sollen meist englisch klingen, eingebettet in deutsche Satzmelodie. Eigennamen, Produktnamen und Nachnamen aus anderen Sprachen sind der häufigste Grund für Beschwerden, weil sie für die Hörer am wichtigsten sind.

Wie bereite ich Text vor, damit er richtig gesprochen wird?

Sie bereiten Text vor, indem Sie die Sprache ausdrücklich angeben, eindeutige Fälle der automatischen Normalisierung überlassen, mehrdeutige Fälle ausschreiben und für wiederkehrende Namen eine feste Ausspracheregel hinterlegen. Das ist wenig Aufwand, wenn Sie es einmal systematisch tun.

Setzen Sie zuerst die Sprache fest, statt sie erkennen zu lassen. Kurze Texte oder Texte mit vielen englischen Begriffen werden sonst leicht nach falschen Regeln normalisiert. Schreiben Sie danach um, was die Maschine nicht wissen kann: „St.“ als „Sankt“ oder „Straße“, eine Uhrzeit wie „14.30“ als „14:30 Uhr“, einen Betrag mit Währungszeichen statt als nackte Zahl.

Formatierung gehört nicht in den Sprachtext. Sternchen, Rauten, Aufzählungszeichen und Emojis werden je nach System vorgelesen oder verschluckt. Das ist besonders wichtig, wenn ein Sprachmodell den Text erzeugt, denn solche Modelle schreiben gern Markdown. Kurze Sätze mit klarer Zeichensetzung helfen doppelt: Komma, Punkt und Fragezeichen steuern Pausen und Satzmelodie, und beim Streaming kann die Erzeugung früher beginnen.

Für Aussprache gibt es einen offenen Standard: SSML, die Speech Synthesis Markup Language des W3C. Sie definiert unter anderem Elemente für Pausen (break), Ersatztexte (sub), Lautschrift (phoneme) und die Interpretation von Zahlen oder Daten (say-as). Die zulässigen Werte für say-as legt die Spezifikation allerdings nicht selbst fest, und Anbieter unterstützen jeweils nur einen Teil des Standards. Prüfen Sie deshalb in der Dokumentation Ihres Anbieters, welche Tags tatsächlich wirken, bevor Sie Inhalte mit SSML auszeichnen.

Für Namen und Fachbegriffe, die immer wieder vorkommen, ist ein Aussprachewörterbuch der robusteste Weg. Ein Eintrag ordnet einem Wort eine lautgetreue Schreibweise oder eine Umschrift im Internationalen Phonetischen Alphabet (IPA) zu und gilt dann für jede Anfrage. Codes, Seriennummern, E-Mail-Adressen und IBANs sollten dagegen Zeichen für Zeichen gesprochen werden, am besten in Vierergruppen, so wie Menschen sie am Telefon vorlesen.

Wie kann ich Text in Sprache umwandeln?

Sie können Text in Sprache umwandeln, indem Sie die Vorlesefunktion Ihres Betriebssystems oder Browsers nutzen, einen Text in ein Webtool einfügen und die Audiodatei herunterladen oder eine TTS-API aus Ihrer Anwendung aufrufen. Welcher Weg passt, hängt davon ab, ob das Audio einmalig, veröffentlicht oder dynamisch entsteht.

Die eingebauten Stimmen sind der schnellste Einstieg. Auf dem Mac liest die Einstellung „Gesprochene Inhalte“ markierten Text mit der gewählten Systemstimme vor, Windows bringt die Sprachausgabe mit, und Webseiten können über die Web Speech API des Browsers sprechen. Die Stimmen hängen dabei vom Gerät ab: Die Web Speech API liefert die auf dem jeweiligen Gerät verfügbaren Stimmen, und manche davon können von einem entfernten Dienst statt lokal bereitgestellt werden. Für das persönliche Vorlesen oder einen Prototyp ist das ideal. Für ein Produkt, bei dem alle Nutzer dieselbe Stimme hören sollen, ist es ungeeignet.

Webtools für Endnutzer sind der nächste Schritt: Text einfügen, Stimme wählen, Datei herunterladen. Das funktioniert für ein einzelnes Erklärvideo oder eine Ansage. Klären Sie vorher drei Dinge in den Nutzungsbedingungen: ob die kommerzielle Nutzung und Veröffentlichung des Audios erlaubt ist, wo der eingegebene Text verarbeitet und gespeichert wird und ob Sie dieselbe Stimme später für Korrekturen wieder erzeugen können.

Eine TTS-API lohnt sich, sobald Audio regelmäßig, in großer Menge oder aus wechselnden Daten entsteht. Für Kursmodule, Produktansagen oder Hilfetexte erzeugen Sie Dateien per Stapelverarbeitung und legen Stimme, Sprache und Ausspracheregeln im Code fest. Für Apps und Voice Agents nutzen Sie Streaming über eine WebSocket-Verbindung, sodass die Wiedergabe beginnt, während das Sprachmodell noch Text liefert. Wenn Texte das eigene Netz nicht verlassen dürfen, kommt ein selbst betriebenes Deployment infrage; der Leitfaden zu Voice AI On-Premise beschreibt die Abwägung.

WegAufwandKontrolle über Aussprache und StimmeGeeignet für
Systemstimme im BetriebssystemKeiner, sofort nutzbarGering, Stimme hängt vom Gerät abPersönliches Vorlesen, Korrekturlesen, erste Hörproben
Web Speech API im BrowserWenige Zeilen JavaScriptGering, Stimmen unterscheiden sich je nach Browser und GerätPrototypen und optionale Vorlesefunktionen in Webanwendungen
Webtool mit DownloadGering, ohne ProgrammierungMittel, je nach Tool mit Stimmenwahl und KorrekturenEinzelne Erklärvideos, Präsentationen, kurze Ansagen
TTS-API mit DateiausgabeMittel, einmalige IntegrationHoch, Stimme, Sprache und Wörterbuch im Code festgelegtE-Learning, Produktaudio, Hilfetexte und Durchsagen in großer Zahl
TTS-API mit StreamingHöher, EchtzeitintegrationHoch, zusätzlich zeitkritische SteuerungVoice Agents, Telefonassistenten, Apps mit dynamischen Antworten
Selbst betriebene TTSHoch, eigener BetriebHoch, Datenhaltung in eigener InfrastrukturSensible Texte, strenge interne Vorgaben zur Datenverarbeitung

Wo passt KugelAudio als API-Option?

KugelAudio ist eine der TTS-APIs, die Sie für den API-Weg prüfen können. Die Plattform wird in Europa entwickelt, bietet einen direkten EU-Endpunkt, den Sie ausdrücklich auswählen, und eine Installation per Kubernetes in der eigenen Infrastruktur. Für Deutsch gibt es native Stimmen mit Hörproben auf der Seite Text to Speech auf Deutsch und in der Stimmenübersicht.

Für die Textvorbereitung dokumentiert KugelAudio eine Normalisierung von Zahlen, Daten und Währungen, die mit ausdrücklich gesetzter Sprache am zuverlässigsten arbeitet, einen spell-Tag für Codes und E-Mail-Adressen mit automatischer Vierergruppierung, break-Tags für bewusste Pausen, Lautschrift im Text sowie Aussprachewörterbücher pro Projekt. Von SSML werden nur break, spell und prosody rate ausgewertet; phoneme wird durch Lautschrift zwischen Schrägstrichen ersetzt. Für Voice Agents gibt es Streaming über WebSocket mit Texteingabe Token für Token sowie dokumentierte Integrationen für LiveKit, Pipecat, Vapi und Cognigy.

Preise stehen auf der Preisseite. Ein unabhängiger Qualitätsvergleich ist dieser Abschnitt nicht; testen Sie KugelAudio mit derselben Methode wie jeden anderen Anbieter.

Wie prüfe ich, ob die Sprachausgabe gut genug ist?

Sie prüfen die Qualität mit Ihren eigenen Texten, einem verdeckten Hörtest durch Muttersprachler und einer automatischen Rückprüfung per Spracherkennung. Eine einzelne Demo auf der Webseite eines Anbieters sagt über Ihre Inhalte wenig aus.

Stellen Sie zuerst einen Testsatz aus echten Texten zusammen: Beträge, Datumsangaben, Telefonnummern, Abkürzungen Ihrer Branche, Produktnamen, lange Komposita und englische Begriffe. Notieren Sie für jeden Satz vorab, wie er gesprochen werden soll. Nur so lässt sich später unterscheiden, ob die Stimme falsch spricht oder ob die Erwartung unklar war.

Für den Hörtest spielen Sie die Proben ohne Anbieternamen in zufälliger Reihenfolge ab und lassen Verständlichkeit und Natürlichkeit getrennt bewerten. Die ITU-T-Empfehlung P.800 beschreibt mit der absoluten Kategorienbewertung die klassische Methode, aus der der bekannte Mean Opinion Score stammt. Für ein internes Projekt genügt eine vereinfachte Form, solange alle Proben unter denselben Bedingungen bewertet werden.

Die ASR-Rückprüfung ergänzt den Hörtest. Dabei transkribiert ein Spracherkennungssystem das erzeugte Audio, und Sie vergleichen das Ergebnis mit der erwarteten gesprochenen Form. So finden Sie falsch gelesene Zahlen, verschluckte Wörter und vertauschte Namen in großen Mengen schnell. Weil die Spracherkennung selbst Fehler macht, markiert sie nur Verdachtsfälle, die ein Mensch anhören sollte. Die ausführliche Testmethode für den Anbietervergleich steht im Leitfaden zur Auswahl von deutschem TTS.

Welche Rechte brauche ich an Stimme und Audio?

Sie brauchen das Recht, die gewählte Stimme für Ihren Zweck zu nutzen, und bei einer geklonten oder nachgeahmten Stimme die Einwilligung der Person, deren Stimme es ist. Zusätzlich gelten seit August 2026 Transparenzpflichten für KI-erzeugte Inhalte.

Bei Katalogstimmen eines Anbieters regeln die Nutzungsbedingungen, ob Sie das Audio kommerziell, in Werbung oder im Rundfunk verwenden dürfen. Das gilt auch für Systemstimmen und kostenlose Webtools, deren Bedingungen oft für persönliche Nutzung formuliert sind.

Wer eine eigene Stimme klonen lässt, etwa die einer Sprecherin oder eines Geschäftsführers, sollte Zweck, Dauer, Einsatzgebiete und Widerruf schriftlich vereinbaren. Dass die Stimme rechtlich geschützt ist, zeigt ein Urteil des Landgerichts Berlin II vom 20. August 2025 (Az. 2 O 202/24): Ein YouTuber hatte eine per KI erzeugte Nachahmung der Stimme eines bekannten Synchronsprechers verwendet, das Gericht sah darin eine Verletzung des allgemeinen Persönlichkeitsrechts und sprach eine fiktive Lizenzgebühr zu. Entscheidend war, dass Zuhörer die Stimme dem Sprecher zuordneten.

Die KI-Verordnung der EU verpflichtet Anbieter von Systemen, die synthetisches Audio erzeugen, nach Artikel 50 Absatz 2 dazu, die Ausgabe maschinenlesbar als KI-generiert zu kennzeichnen. Nach Angaben der EU-Kommission gilt Artikel 50 seit dem 2. August 2026; für Systeme, die vorher auf den Markt kamen, gilt die Kennzeichnungspflicht erst ab dem 2. Dezember 2026. Unternehmen, die KI-Systeme einsetzen, müssen Deepfakes offenlegen, also Audio, das existierenden Personen ähnelt und fälschlich als echt erscheinen würde. KugelAudio versieht nach eigener Dokumentation jede Ausgabe mit einem Wasserzeichen im Signal und einem Hinweis im HTTP-Header. Datenschutzfragen rund um Sprachdaten und Aufzeichnungen behandelt der Artikel Voice AI in Deutschland und der DACH-Region.

Was verlangt das Barrierefreiheitsstärkungsgesetz von Sprachausgabe?

Das Barrierefreiheitsstärkungsgesetz verlangt keine Vorlesefunktion auf jeder Webseite. Es verlangt, dass bestimmte Produkte und Dienstleistungen barrierefrei sind, und schreibt Sprachausgabe nur für einzelne Produktgruppen ausdrücklich vor.

Das Gesetz setzt den European Accessibility Act, die Richtlinie (EU) 2019/882, in deutsches Recht um. Es gilt für bestimmte Produkte, die nach dem 28. Juni 2025 in Verkehr gebracht werden, und für bestimmte Dienstleistungen, die nach diesem Datum für Verbraucher erbracht werden. Dazu gehören unter anderem Dienstleistungen im elektronischen Geschäftsverkehr, Bankdienstleistungen für Verbraucher, E-Books und Telekommunikationsdienste. Kleinstunternehmen, die Dienstleistungen anbieten, sind von den Barrierefreiheitsanforderungen ausgenommen.

Die zugehörige Verordnung verlangt unter anderem, dass Informationen über mehr als einen sensorischen Kanal bereitgestellt werden und in Textformaten vorliegen, aus denen assistive Technologien alternative Formate erzeugen können. Ausdrücklich mit Sprachausgabe ausgestattet sein müssen Selbstbedienungsterminals und E-Book-Lesegeräte.

Für Webseiten und Apps folgt daraus: Blinde und sehbehinderte Menschen nutzen meist einen eigenen Screenreader mit eigener Sprachausgabe. Dieser funktioniert nur, wenn Ihr Text sauber strukturiert ist. Eine zusätzliche Vorlesefunktion kann Menschen mit Leseschwierigkeiten helfen, ersetzt aber keine barrierefreie Struktur. Für Terminals, Durchsagen und Audioinhalte ist eine gut vorbereitete Sprachsynthese dagegen direkt Teil der Lösung.

FAQ

Kann ich Text kostenlos in Sprache umwandeln?

Ja, mit den Vorlesefunktionen von Betriebssystem und Browser und mit kostenlosen Stufen vieler Webtools. Für veröffentlichte oder kommerzielle Inhalte sollten Sie die Nutzungsbedingungen prüfen, weil kostenlose Angebote häufig auf persönliche Nutzung ausgerichtet sind.

Was ist der Unterschied zwischen Text to Speech und Sprachsynthese?

Es gibt keinen. Text to Speech, TTS, Text zu Sprache und Sprachsynthese bezeichnen dieselbe Technik: die maschinelle Erzeugung gesprochener Sprache aus geschriebenem Text.

Wie bringe ich einer TTS-Stimme einen Firmennamen bei?

Für einen einzelnen Text schreiben Sie den Namen so, wie er klingen soll. Für den dauerhaften Einsatz legen Sie einen Eintrag in einem Aussprachewörterbuch an, entweder mit lautgetreuer Schreibweise oder mit IPA-Lautschrift, und prüfen das Ergebnis mit der verwendeten Stimme.

Brauche ich SSML?

Nicht unbedingt. Gute Zeichensetzung, ausdrücklich gesetzte Sprache und ein Aussprachewörterbuch lösen die meisten Probleme. SSML hilft bei gezielten Pausen oder buchstabierten Codes, wird aber von jedem Anbieter nur teilweise unterstützt.

Wie lese ich IBANs und Telefonnummern korrekt vor?

Lassen Sie sie Zeichen für Zeichen in Gruppen sprechen statt als große Zahl. Viele APIs bieten dafür ein Buchstabier-Tag oder eine eigene Einstellung; prüfen Sie das Ergebnis mit einer ASR-Rückprüfung, weil hier ein falsches Zeichen den Inhalt unbrauchbar macht.

Reicht eine Vorlesefunktion für das Barrierefreiheitsstärkungsgesetz?

Nein. Das Gesetz stellt Anforderungen an Wahrnehmbarkeit, Bedienbarkeit und Textformate, die mit assistiven Technologien funktionieren. Eine Vorlesefunktion kann ergänzen, ersetzt aber keine barrierefreie Gestaltung.

Muss ich KI-generierte Sprache kennzeichnen?

Anbieter von Systemen, die synthetisches Audio erzeugen, müssen die Ausgabe nach Artikel 50 der KI-Verordnung maschinenlesbar kennzeichnen. Wer KI einsetzt, muss zusätzlich Deepfakes offenlegen, etwa eine täuschend echte Nachahmung einer realen Person.

Welcher Weg eignet sich für einen Voicebot oder Telefonassistenten?

Eine TTS-API mit Streaming, weil die Antwort hörbar beginnen muss, während der Rest noch erzeugt wird. Worauf es beim Weg vom Prototyp zum Produktivbetrieb ankommt, beschreibt der Leitfaden für den Produktivstart.

Quellen

Mit KugelAudio entwickeln

Europäische Voice-Infrastruktur produktiv einsetzen.

Nutzen Sie den EU-Endpunkt oder besprechen Sie ein selbst betriebenes Kubernetes-Deployment.