Alle Artikel

Engineering

Die besten Text-to-Speech-APIs für Entwickler 2026

Ein praxisnaher TTS-API-Vergleich für Entwickler mit Schwerpunkt auf Streaming, Zeitstempeln, Textnormalisierung, Bereitstellung und aussagekräftigen Latenzmessungen.

Viktor Presber11 Min. Lesezeit
Eine synthetische Wellenform zwischen miteinander verbundenen API-Knoten
Auf dieser Seite

Wichtige Erkenntnisse

  • Ohne einheitlichen Testkorpus, dieselbe Clientregion, dasselbe Audioformat, ein festgelegtes Lastprofil und ein verblindetes Hörtestprotokoll lässt sich kein belastbarer Gesamtsieger bestimmen.
  • Behandeln Sie Modell-ID, Transport, Stimme und Region als Bestandteile des Produkts. Der Name eines Anbieters allein beschreibt keine reproduzierbare Konfiguration.
  • Die fünf APIs rechnen in drei unterschiedlichen Einheiten ab: erzeugte Audiozeit, Zeichen beziehungsweise Credits sowie Ein- und Ausgabetokens. Die beworbenen Preise lassen sich deshalb nicht direkt vergleichen.
  • Streaming kann eine in Blöcken übertragene HTTP-Antwort, Server-Sent Events (SSE) oder eine bidirektionale WebSocket-Verbindung mit schrittweiser Texteingabe bedeuten. Prüfen Sie genau, welches Verhalten Ihre Anwendung benötigt.
  • Ein gehosteter EU-Endpunkt, Zero Data Retention, eine Private Cloud und Self-Hosting sind unterschiedliche Kontrollen. Nehmen Sie jede erforderliche Kontrolle in den Vertrag auf und testen Sie deren Umsetzung.

Zuletzt aktualisiert am 10. August 2026. Die Dokumentation zu Modellen, Preisen, Transport, Sprachen, Voice Cloning, Bereitstellung, Datenspeicherung und Kontingenten wurde an diesem Datum erneut geprüft.

Welche TTS-APIs eignen sich 2026 am besten für Entwickler?

Sinnvoll ist eine Auswahlliste, keine Rangfolge. Beginnen Sie mit zwingenden Anforderungen wie kommerziellem Self-Hosting, einer bestimmten Sprache, schrittweiser Texteingabe, Voice Cloning oder einer Vorgabe zur Datenspeicherung. Vergleichen Sie anschließend nur die Anbieter, die diese Mindestanforderungen erfüllen.

API und aktuelles AngebotTransport und offizielle SDKsSprachen und Voice CloningÖffentliche PreiseinheitBereitstellung und DatenspeicherungGeeignet für
KugelAudio kugel-3HTTP-Audioantwort; WebSocket-Ausgabe, schrittweise Texteingabe und Sitzungen mit mehreren Kontexten; Dokumentation für SDKs in Python, TypeScript/JavaScript und Java26 Sprachen in einem Modell; benutzerdefiniertes Voice Cloning0,07 € pro erzeugter MinuteGeografisch gerouteter oder direkter EU-Endpunkt; kommerzielles Self-Hosting mit Kubernetes und Helm. Die Speicherbedingungen der gehosteten Lösung müssen gesondert geprüft werden; beim Self-Hosting verbleibt die Speicherung der Nutzdaten in der KundenumgebungTeams, die einen einheitlichen API-Vertrag für eine in der EU gehostete und eine On-Premise-Bereitstellung benötigen
Mistral Voxtral TTS, API-Alias voxtral-mini-tts-latestPOST /v1/audio/speech, auch mit Ausgabe als Event Stream; offizielle SDKs für Python und TypeScript9 Sprachen; voreingestellte Stimmen, gespeicherte benutzerdefinierte Stimmen oder Referenzaudio pro Anfrage$0.016 pro 1.000 Zeichen für die APIAPI-Daten werden standardmäßig in der EU gehostet; je nach Funktion und Unterauftragsverarbeiter sind vorübergehende Übermittlungen möglich. Im Scale-Tarif kann für das zustandslose /v1/audio/speech ZDR beantragt werden. Die separaten Modellgewichte von Voxtral-4B-TTS-2603 lassen sich unter CC BY-NC 4.0 selbst hosten; diese Lizenz erlaubt keine kommerzielle NutzungPrototypen mit benutzerdefinierten Stimmen oder die Evaluierung einsehbarer, nichtkommerzieller Modellgewichte
ElevenLabs eleven_v3, eleven_flash_v2_5 und eleven_multilingual_v2HTTP und HTTP-Streaming; WebSocket mit schrittweiser Texteingabe für unterstützte Modelle, jedoch nicht für eleven_v3; offizielle Bibliotheken für Python und Node.jsMehr als 70 Sprachen für v3, 32 für Flash v2.5 und 29 für Multilingual v2; Instant und Professional Voice CloningAbonnement-Credits: In Self-Service-Tarifen verbraucht Flash v2.5 0,5 Credits und Multilingual v2 einen Credit pro Zeichen; die Preise für v3 unterscheiden sich zwischen Website und APIDokumentiert sind EU-Datenresidenz für Unternehmenskunden und ZRM für ausgewählte Enterprise-Tarife; eine private Bereitstellung wird über AWS Marketplace und SageMaker angebotenGroßer Stimmenkatalog, ausdrucksstarke Ausgabe mit v3 oder ausgereifte Kreativwerkzeuge
Cartesia sonic-3.5Streaming per HTTP-Bytes, SSE und Multiplex-WebSocket; offizielle SDKs für Python und TypeScript/JavaScript42 Sprachen; Instant Voice Cloning ab Pro und Professional Voice Cloning ab StartupMonatliche Credits auf Grundlage der erzeugten Audiozeit; laut Pro-Tarif entsprechen 100.000 Credits etwa 133 Minuten mit Sonic 3.5Gehostete API; eine Zusage zur Datenresidenz wird hier nicht angeführt. Enterprise ZDR umfasst TTS-Ein- und -Ausgaben, schließt Workflows für Voice Cloning jedoch ausBidirektionales Streaming mit expliziten Kontexten, Abbruch und Zeitstempeln
Gemini gemini-3.1-flash-tts-previewInteractions API mit gestreamter Ausgabe; offizielle Google-GenAI-SDKs für Python und JavaScript sowie REST78 aufgeführte Sprachen und 30 voreingestellte Stimmen; für diese API ist kein Workflow für benutzerdefiniertes Voice Cloning dokumentiert$1 pro Million Texteingabetoken plus $20 pro Million Audioausgabetoken; Audio beträgt 25 Token pro SekundeVon Google gehostete Preview-API; eine Zusage zur EU-Datenresidenz wird hier nicht angeführt. Inhalte kostenpflichtiger Dienste werden nicht zur Produktverbesserung verwendet. Die Speicherung in Interactions ist standardmäßig aktiviert und muss mit store=false abgeschaltet werden. ZDR auf Projektebene erfordert eine Genehmigung und zusätzliche KonfigurationPer Prompt gesteuerte Sprachausgabe, Skripte mit zwei Sprechern und Teams, die bereits die Gemini API verwenden

Die Zeilen beschreiben bewusst konkrete, derzeit verfügbare Angebote und nicht die gesamte Plattform eines Anbieters. Primärquellen sind das Sprachangebot von KugelAudio, die Modellkarte von Kugel 3, die Dokumentation zu Voxtral TTS, die Modellübersicht von ElevenLabs, die Modellseite zu Cartesia Sonic 3.5 und der Leitfaden zu Gemini TTS.

Die Angaben zu Bereitstellung und Datenschutz in der Tabelle stammen aus den Dokumentationen zu den jeweiligen Kontrollen und nicht aus allgemeinen Sicherheitsseiten der Anbieter:

Wie lässt sich KugelAudio TTS integrieren?

Speichern Sie die Zugangsdaten in einer Umgebungsvariable und geben Sie die Region ausdrücklich an, wenn der Datenverkehr über den direkten EU-Endpunkt laufen muss:

import os

from kugelaudio import KugelAudio

client = KugelAudio(
    api_key=os.environ["KUGELAUDIO_API_KEY"],
    region="eu",
)

audio = client.tts.generate(
    text="Guten Tag. Wie kann ich Ihnen helfen?",
    model_id="kugel-3",
)
audio.save("greeting.wav")

Wenn Teiltexte schrittweise von einem LLM eintreffen, verwenden Sie eine Streaming-Sitzung, statt generate wiederholt aufzurufen. Nutzen Sie einen bereits verbundenen Client weiter, schließen Sie jeden Turn sauber ab und brechen Sie den aktiven Turn ab, sobald die anrufende Person unterbricht. Der Python-Schnellstart erläutert die Wiederverwendung von Verbindungen, der Streaming-Leitfaden den Lebenszyklus eines Turns und die Zeitstempel. Der Self-Hosting-Leitfaden zeigt, wie dasselbe SDK mit einer Kundenbereitstellung verbunden wird.

Welche TTS-API hat die niedrigste Latenz?

Die veröffentlichten Zahlen sind nicht vergleichbar. Mistral unterscheidet zwischen der Modellverarbeitungszeit und der Zeit bis zum ersten Audio der API und weist für PCM und MP3 ein unterschiedliches API-Verhalten aus. ElevenLabs gibt bei seiner Flash-Zahl ausdrücklich an, dass Anwendungs- und Netzwerklatenz nicht enthalten sind. Cartesia stellt für jeden Block die serverseitige step_time bereit, während KugelAudio die TTFA der serverseitigen Inferenz von der clientseitig gemessenen Latenz trennt. Google beschreibt seine TTS-Modelle als latenzarm, veröffentlicht jedoch keine anbieterübergreifende Messung mit derselben Messgrenze.

Messen Sie vom Anwendungsprozess bis zum ersten abspielbaren Frame und nicht nur bis zum ersten Byte. Bei einer MP3-Antwort können bereits Bytes eintreffen, bevor dem Decoder genügend Daten zur Wiedergabe vorliegen; Roh-PCM lässt sich dagegen meist sofort abspielen. Erfassen Sie folgende Ereignisse getrennt:

  1. DNS-Auflösung und TLS-Verbindungsaufbau abgeschlossen;
  2. Anfrage oder Textblock gesendet;
  3. erstes Antwortbyte empfangen;
  4. erster decodierbarer Audio-Frame verfügbar;
  5. Wiedergabe gestartet;
  6. letztes Audiostück eingetroffen; und
  7. Abbruch bestätigt und veraltete Audiowiedergabe beendet.

Testen Sie neue und wiederverwendete Verbindungen als getrennte Szenarien. Berichten Sie p50, p90, p99, Zeitüberschreitungen und Wiederholungsversuche für kurze, mittlere und lange Eingaben. Verwenden Sie für ein reproduzierbares Protokoll den internen Leitfaden für einen deutschen TTS-Benchmark, statt lediglich die einzelne Latenzangabe eines Anbieters zu übernehmen.

Welche TTS-API ist am günstigsten?

Kein Anbieter ist bei jeder Arbeitslast am günstigsten. Zum Stichtag rechnet KugelAudio nach erzeugten Minuten ab, Mistral nach eingegebenen Zeichen, ElevenLabs nach modellabhängigen Credits pro Zeichen, Cartesia nach Credits auf Grundlage der erzeugten Audiozeit und Gemini nach Ein- und Ausgabetokens. Lange Pausen, Sprechgeschwindigkeit, Markup, Wiederholungsversuche und neu erzeugtes Audio wirken sich auf diese Einheiten unterschiedlich aus.

Gemini 3.1 Flash TTS rechnet Audio beispielsweise mit 25 Tokens pro Sekunde ab. Die ausgewiesenen $20 pro Million Ausgabetokens entsprechen damit vor Berücksichtigung der Eingabetokens $0.03 pro erzeugter Minute. Diese Rechnung ist hilfreich, bildet aber nicht die monatlichen Gesamtkosten ab: Auch Kontingente für Preview-Modelle, fehlgeschlagene Anfragen, Mindestumsätze, Speicherung, ausgehender Datenverkehr und Entwicklungsaufwand spielen eine Rolle. Verwenden Sie die offiziellen Preise von KugelAudio, den Einführungspreis von Mistral, die Credit-Regeln von ElevenLabs, die Preise von Cartesia und die Preise von Gemini als Eingabewerte für ein gemeinsames Arbeitslastmodell.

Welche TTS-API eignet sich am besten für Deutsch?

Für diesen Artikel liegen keine gemeinsamen Ergebnisse eines verblindeten Hörtests auf Deutsch vor; deshalb wird kein Sieger genannt. Alle fünf Angebote dokumentieren die Unterstützung von Deutsch. Ein Eintrag in einer Sprachliste belegt jedoch nicht, dass die von Ihrer Anwendung erzeugten Texte korrekt ausgesprochen werden.

Erstellen Sie einen deutschen Abnahmetestsatz mit Beispielen aus dem Produktivbetrieb: Datumsangaben, Währungen, Dezimalzahlen, Telefonnummern, IBANs, Abkürzungen, Straßennamen, zusammengesetzte Wörter, Wechsel zwischen Deutsch und Englisch sowie alle benötigten regionalen Varietäten. Halten Sie Modell-ID und Stimme konstant. Lassen Sie deutschsprachige Muttersprachler Verständlichkeit, Natürlichkeit, regionale Passung und bedeutungsverändernde Fehler bewerten, ohne den Anbieter zu kennen. Vergleichen Sie außerdem Aussprachekontrollen und Normalisierung, denn die zuverlässige korrekte Aussprache von 1.234,56 € kann wichtiger sein als ein höherer durchschnittlicher Präferenzwert.

Was sollten Entwickler vor der Auswahl einer API testen?

Verwenden Sie eine Abnahmematrix mit Kriterien für „bestanden“ und „nicht bestanden“, die bereits vor dem Hörtest festgelegt werden:

TestZu erfassende DatenBeispiel für ein Freigabekriterium
TranskripttreueErsetzungen, Auslassungen sowie Fehler bei Zahlen und NamenKeine bedeutungsverändernden Fehler in kritischen Skripten
Wahrgenommene SprachqualitätVerblindete Hörerbewertungen nach Sprachvarietät und AnwendungsfallZielwert für den Median und keine schwerwiegenden Ausreißer
Streamingerster abspielbarer Frame, Lücken, Reihenfolge, AbschlussmarkierungKeine falsch angeordneten oder duplizierten Audiostücke
UnterbrechungAbbruch während des ersten, mittleren und letzten BlocksKeine veraltete Sprachausgabe nach Ablauf der Abbruchfrist
Tail-Latenz und Fehlerverhaltenp50/p90/p99, Zeitüberschreitungen, 429- und 5xx-Fehler, Wiederholungsversuchep99 und Ausfallrate bleiben innerhalb des Interaktionsbudgets
AusgabevertragCodec, Abtastrate, Zeitstempel, LautstärkeDekodiert direkt im Produktionswiedergabepfad
Voice-LebenszyklusEinwilligung, Erstellen, Auflisten, Widerrufen, LöschenGelöschte Stimmen und Samples sind nicht mehr verwendbar
DatenschutzEndpunktregion, Logs, Verlauf der Nutzdaten, LöschungDas beobachtete Verhalten entspricht dem Auftragsverarbeitungsvertrag und der Konfiguration

Ratenbegrenzungen müssen durch einen Lasttest geprüft werden. ElevenLabs und Cartesia veröffentlichen tarifabhängige Parallelitätsgrenzen und Kontextgrenzen. Mistral verwendet organisations- und modellspezifische Stufen für RPS und Tokens, während Gemini Grenzwerte an die Nutzungsstufe des Projekts bindet und darauf hinweist, dass Preview-Modelle stärker eingeschränkt sind. KugelAudio dokumentiert 429-Antworten und gegebenenfalls Retry-After in seiner API-Referenz. Lesen Sie die Grenzwerte des für den Produktivbetrieb vorgesehenen Kontos oder Vertrags aus und prüfen Sie anschließend das Warteschlangen- und Überlastungsverhalten. Wiederholen Sie eine Anfrage nach einem 429 niemals sofort in einer engen Schleife.

Welche Aufgaben sollte ein TTS-Adapter für den Produktivbetrieb übernehmen?

Kapseln Sie anbieterspezifische Felder hinter einer kleinen Schnittstelle, reduzieren Sie aber nicht jeden Anbieter auf einen synthesize(text)-Aufruf mit dem kleinsten gemeinsamen Funktionsumfang. Der Adapter sollte die Funktionen abbilden, von denen die Anwendung tatsächlich abhängt:

  • eine festgeschriebene Modellversion und Stimmkennung des Anbieters;
  • Volltext- und Teiltextgenerierung als unterschiedliche Methoden;
  • die benötigten Steuerelemente für Codec, Abtastrate, Sprache und Aussprache;
  • strukturierte Ereignisse für Audio, Zeitstempel, Abschluss und Anbieteranforderungs-ID;
  • ausdrückliche Stornierung mit Bestätigung;
  • klar definierte Fehlertypen für Authentifizierung, ungültige Eingaben, nicht verfügbare Modelle, Kontingentüberschreitungen, Zeitüberschreitungen, Anbieterfehler und Abbrüche; und
  • gemessene Client-Zeitstempel für gesendete Anfrage, erstes Byte, erster abspielbarer Frame und Abschluss.

Weichen Sie bei einem Synthesefehler nicht auf eine andere Stimme aus und geben Sie nicht einfach Stille zurück. Wiederholen Sie nur Anfragen, die aufgrund eines vorübergehenden Fehlers gescheitert sind, beachten Sie Retry-After und brechen Sie ab, wenn die verbleibende Interaktionsfrist keinen weiteren Versuch zulässt. Protokollieren Sie Modell, Stimme, Region, Format, Status und Anfrage-ID des Anbieters. Nutzertexte und Audiodaten gehören jedoch nicht in reguläre Logs, sofern die Aufbewahrungsrichtlinie dies nicht ausdrücklich erlaubt.

Wie können Entwickler die Kosten von APIs fair vergleichen?

Spielen Sie für jeden Kandidaten einen repräsentativen Monat mit anonymisierten und normalisierten Texten nach oder verwenden Sie gemessene Ausgabedauern aus demselben Korpus. Berechnen Sie sowohl die nutzungsabhängigen Grenzkosten als auch die monatlichen Gesamtkosten. Eine nützliche gemeinsame Kennzahl ist:

all-in cost per generated hour =
  (plan + usage + regional/private deployment + egress + operations) /
  successful generated seconds * 3600

Erfassen Sie fehlgeschlagene, abgebrochene und erneut erzeugte Anfragen getrennt, damit deren Kosten nicht im Durchschnitt verschwinden. Berücksichtigen Sie beim Self-Hosting reservierte GPU-Kapazität, Leerlaufreserve, die für das p99-Ziel benötigten Replikate, Upgrades, Monitoring und personelle Rufbereitschaft. Der Leitfaden zu Self-Hosted TTS erläutert die Lizenz- und Betriebskostenkriterien; der Leitfaden zu On-Premise-Infrastruktur grenzt EU-Hosting, ZDR und On-Premise-Kontrollen voneinander ab.

Welche Einschränkungen gibt es bei diesem Vergleich?

Der Autor arbeitet für KugelAudio. Dieser Artikel vergleicht dokumentierte Funktionen und ist kein Benchmark für Qualität, Verfügbarkeit oder Latenz. Er behandelt fünf für Entwickler relevante Optionen und nicht den gesamten Markt; Preise und Bereitstellungsbedingungen für Unternehmen werden zudem häufig individuell ausgehandelt. Preview-Modelle, veränderliche Aliase, Kontingente und öffentliche Preise können sich ändern. Schreiben Sie deshalb möglichst datierte Modellversionen fest und prüfen Sie die Quellen vor der Beschaffung erneut.

FAQ

Welche TTS-API ist am günstigsten?

Darauf gibt es keine von der Arbeitslast unabhängige Antwort, weil die APIs nach Audiozeit, Zeichen, Credits oder Tokens abrechnen. Rechnen Sie einen repräsentativen Korpus in Kosten pro erfolgreich erzeugter Audiostunde um und berücksichtigen Sie Mindestumsätze, Wiederholungsversuche und Bereitstellungskosten.

Welche TTS-API hat die niedrigste Latenz?

Für diese fünf APIs liegt kein vergleichbares öffentliches Ergebnis vor. Messen Sie die Zeit vom Senden des Texts durch Ihren Client bis zum ersten abspielbaren Frame und weisen Sie p50, p90 und p99 für neue und wiederverwendete Verbindungen getrennt aus.

Welche TTS-API eignet sich am besten für Deutsch?

Alle fünf verglichenen Angebote führen Deutsch auf. Dieser Artikel enthält jedoch keinen verblindeten deutschen Benchmark, der einen Sieger belegen würde. Testen Sie die Stimmen mit Namen, Zahlen, Abkürzungen, zusammengesetzten Wörtern, Sprachwechseln und den benötigten regionalen Varietäten und lassen Sie sie von deutschsprachigen Muttersprachlern bewerten.

Welche TTS-APIs unterstützen die On-Premise-Bereitstellung?

KugelAudio dokumentiert eine kommerzielle Bereitstellung mit Kubernetes und Helm. ElevenLabs dokumentiert eine private Enterprise-Bereitstellung in der AWS-Infrastruktur des Kunden. Mistral veröffentlicht die Modellgewichte von Voxtral 4B TTS unter der nichtkommerziellen Lizenz CC BY-NC 4.0 für das Self-Hosting. Die zitierten Unterlagen zu den APIs von Cartesia und Gemini dokumentieren keine vom Kunden betriebene TTS-Bereitstellung.

Welche TTS-API bietet Zero Retention?

ElevenLabs, Cartesia, Mistral und Gemini dokumentieren bedingte Wege zu ZRM beziehungsweise ZDR; Voraussetzungen und Ausnahmen unterscheiden sich jedoch. Cartesia schließt beispielsweise Voice Cloning aus, Mistral beschränkt ZDR auf bestimmte zustandslose Endpunkte und bei Gemini Interactions muss zusätzlich store=false gesetzt werden. Prüfen Sie das konkrete Produkt und den Vertrag, statt sich auf eine pauschale Aussage zur gesamten Plattform zu verlassen.

Unterstützt KugelAudio deutsche Dialekte?

KugelAudio unterstützt Deutsch, dieser Vergleich enthält jedoch keine öffentliche Qualitätsmatrix für einzelne Dialekte. Testen Sie die benötigte regionale Varietät mit Personen, die sie selbst sprechen, und bewerten Sie die Dialektpassung getrennt von der allgemeinen Unterstützung der deutschen Sprache.

Mit KugelAudio entwickeln

Europäische Voice-Infrastruktur produktiv einsetzen.

Nutzen Sie den EU-Endpunkt oder besprechen Sie ein selbst betriebenes Kubernetes-Deployment.