Alle Artikel

Engineering

Open Source, Open Weight und Self-Hosted TTS: Leitfaden 2026

Ein Praxisvergleich von Open-Source- und Open-Weight-Modellen sowie kommerziellem Self-Hosted TTS mit klaren Lizenz- und Bereitstellungskriterien.

Viktor Presber9 Min. Lesezeit
Eine aufgefächerte modulare Sprachsphäre mit lokalen Rechenschichten
Auf dieser Seite

Wichtige Erkenntnisse

  • Herunterladbare Modellgewichte sind nicht automatisch Open Source oder kommerziell nutzbar.
  • KugelAudio 0 Open ist ein Modell-Checkpoint unter MIT-Lizenz; der kommerzielle On-Premise-Dienst Kugel 3 ist ein separates Angebot.
  • Kokoro-82M und Fun-CosyVoice3-0.5B-2512 veröffentlichen Apache 2.0-Checkpoints. Voxtral-4B-TTS-2603 ist CC BY-NC 4.0 und Fish Audio S2 Pro erfordert für jede kommerzielle Nutzung eine separate Lizenz.
  • Deutsch wird für KugelAudio 0 Open, Voxtral, CosyVoice 3, Fish Audio S2 Pro, Piper und Kugel 3 ausdrücklich genannt. Die offizielle Pipeline von Kokoro führt Deutsch nicht auf.
  • Veröffentlichte Speicherwerte gelten jeweils für eine bestimmte Laufzeitumgebung. Aus der Parameterzahl lassen sich Speicherbedarf, Latenz und Kapazität nicht verlässlich ableiten.
  • Streaming hängt sowohl vom Modell als auch vom Serving-Stack ab. Testen Sie Abbruch, Backpressure und die Zeit bis zum ersten abspielbaren Audiostück in Ihrer Zielumgebung.
  • Self-Hosting gibt dem Kunden Kontrolle über den Datenpfad, überträgt ihm aber auch Verantwortung für Patches, Kapazität, Monitoring und Vorfälle.

Zuletzt aktualisiert am 10. August 2026. Modellkarten, Repositories und Lizenzen wurden an diesem Datum überprüft.

Was ist das beste selbsthostbare TTS-Modell im Jahr 2026?

Einen belastbaren Gesamtsieger gibt es nicht. Klären Sie zuerst, welche harten Anforderungen gelten: kommerzielle Nutzungsrechte, Deutsch, echtes Streaming für Textinput und Audiooutput, eine kleine lokale Laufzeit oder ein unterstützter On-Premise-Dienst. So scheiden ungeeignete Optionen schon vor dem Hörtest aus.

Modell/AngebotWas ist verfügbarSprachnachweisNachweise zu Serving und HardwareLizenzkriteriumGeeignet für
KugelAudio 0 OpenModell-Checkpoint und Python-Code unter MIT-Lizenz23 europäische Sprachen, einschließlich DeutschDie Modellkarte nennt rund 19 GB VRAM, lokale Batch-Generierung und vorkodierte Stimmen; Voice Cloning aus rohem Referenzaudio wird nicht unterstützt.MITOffen lizenzierte Grundlage für europäische Sprachen, sofern die vorkodierten Stimmen zum Anwendungsfall passen
KugelAudio Kugel 3 On-PremiseKommerzieller Dienst; getrennt von KugelAudio 0 Open26-sprachiges mehrsprachiges Modell, einschließlich DeutschBereitstellung mit Kubernetes und Helm; die öffentliche Dokumentation nennt keine Hardwareanforderungen.Kommerzieller VertragTeams, die einen unterstützten Self-Hosted-Dienst benötigen, statt den Modellserver vollständig selbst zu verantworten
Voxtral-4B-TTS-26034B BF16-Gewichte und vLLM-Omni-IntegrationNeun Sprachen, darunter DeutschDie offizielle Modellkarte dokumentiert Streaming und Batch-Inferenz auf einer GPU mit mindestens 16 GB Speicher.CC BY-NC 4.0; kein Checkpoint für reguläre kommerzielle NutzungNichtkommerzielle mehrsprachige Forschung mit dokumentiertem Bereitstellungspfad
Kokoro-82M v1.0Checkpoint mit 82 Millionen Parametern und Python-Bibliothek für die InferenzAcht Sprachen; Deutsch ist nicht aufgeführtKleinste Parameterzahl in dieser Tabelle; das offizielle Repository nennt kein Kapazitätsziel für den Produktivbetrieb.Checkpoint und Code unter Apache 2.0Kleine, freizügig lizenzierte Grundlage, sofern eine der aufgeführten Sprachen ausreicht
Fish Audio S2 Pro4B-Modellgewichte für ein Slow-AR-Modell, Fine-Tuning-Code und Streaming-EngineMehr als 80 Sprachen, Deutsch in Tier 2Die offizielle Modellkarte enthält Ergebnisse auf einer H200. Ein Referenzrezept für vLLM-Omni nutzt eine A800 mit 80 GB und meldet rund 49 GiB Spitzenauslastung, jedoch keine Mindestanforderung.Fish Audio Research-Lizenz; die kommerzielle Nutzung, einschließlich der internen Geschäftsnutzung, erfordert eine separate schriftliche LizenzForschungsevaluierung oder separat lizenzierte Bereitstellung mit Bedarf an ausdrucksstarker Steuerung
Fun-CosyVoice3-0.5B-2512Checkpoint mit 0,5 Milliarden Parametern sowie Code für Inferenz und TrainingNeun Sprachen, darunter DeutschDas offizielle Repository dokumentiert bidirektionales Streaming für Textinput und Audiooutput, nennt aber keinen minimalen GPU-Speicher.Apache 2.0-Repository und ModellkartePermissives mehrsprachiges Prototyping mit einer dokumentierten Streaming-Implementierung
Piper (OHF-Voice/piper1-gpl)Lokale Laufzeit plus separat verpackte VITS-StimmenDeutsch und zahlreiche weitere Sprach- und RegionsvariantenCLI, Webserver, Python- und C/C++-APIs; Platzbedarf und Ausgabequalität hängen von der ausgewählten Stimme abLaufzeit unter GPL 3.0; für jede Stimme gilt die Lizenz ihrer eigenen MODEL_CARD.Offline-Sprachanwendungen auf Festnetz-Hardware nach Prüfung der GPL-Pflichten bei Weitergabe und der Lizenz der gewählten Stimme

Die Tabelle ordnet den Kandidaten mögliche Rollen in einer Auswahlliste zu und ist kein Qualitätsranking. Für diesen Artikel wurden weder ein gemeinsamer deutscher Testsatz noch identische Stimm-, Hardware- oder Bereitstellungskonfigurationen ausgeführt. Eine reproduzierbare Auswertungsstruktur beschreibt der offene Benchmark für deutsches TTS.

Was unterscheidet Open Source von Open Weight?

Open-Source-Software stellt Quellcode unter einer Open-Source-Lizenz bereit. Open Weight bedeutet zunächst nur, dass Modellparameter heruntergeladen werden können. Die Lizenz der Modellgewichte kann kommerzielle Nutzung weiterhin untersagen, Weitergabe einschränken, Namensnennung verlangen oder eine Acceptable Use Policy vorschreiben.

Prüfen Sie vier Artefakte getrennt: Inferenzcode, Modell-Checkpoint, mitgelieferte Stimmen oder Referenzaudio und jedes feinabgestimmte Derivat. Die aktuelle Piper-Laufzeit steht beispielsweise unter GPL 3.0; laut eigener Stimmdokumentation enthält die MODEL_CARD jeder Stimme deren separate Lizenz. GPL-Software intern auszuführen ist nicht dasselbe wie sie als Teil eines Produkts weiterzugeben. Änderungen und Weitergabe können Pflichten zur Bereitstellung von Quellcode auslösen. Lassen Sie die konkrete Paketierung rechtlich prüfen, statt GPL pauschal als „kommerziell“ oder „nichtkommerziell“ einzuordnen.

Bei nichtkommerziellen Lizenzen ist die Grenze eindeutiger. Die Modellkarte von Voxtral stellt den Checkpoint aufgrund der mitgelieferten Stimmreferenzen unter CC BY-NC 4.0. Die Fish Audio Research License wertet interne geschäftliche Nutzung, gehostete Dienste und umsatzgenerierende Produkte als kommerziell und verlangt dafür eine gesonderte schriftliche Vereinbarung. Keiner der beiden Checkpoints ist für reguläre kommerzielle Open-Source-Nutzung freigegeben.

Apache 2.0 ist eine freizügige Lizenz, gewährt aber keine Rechte an der Identität einer sprechenden Person, an Referenzaufnahmen von Kunden oder an sämtlichen Abhängigkeiten Dritter. Bewahren Sie für jede produktiv eingesetzte Stimme Nachweise zu Einwilligung und Herkunft auf.

Welche Self-Hosted-TTS-Modelle unterstützen Deutsch?

Dokumentierte Sprachunterstützung grenzt die Liste ein, belegt aber keine Qualität im Produktivbetrieb. KugelAudio 0 Open, Voxtral, Fun-CosyVoice 3, Fish Audio S2 Pro, Piper und Kugel 3 führen Deutsch ausdrücklich auf. Die offiziellen Sprachcodes von Kokoro nennen amerikanisches und britisches Englisch, Spanisch, Französisch, Hindi, Italienisch, Japanisch, brasilianisches Portugiesisch und Mandarin, aber kein Deutsch.

Testen Sie für Deutsch zusammengesetzte Wörter, Abkürzungen, Daten, Währungen, Namen und den Wechsel zwischen Deutsch und Englisch. Prüfen Sie österreichische und schweizerische Varianten getrennt von Standarddeutsch und behandeln Sie Dialektunterstützung als eigene Anforderung. Ein allgemeines Sprachkürzel de sagt nichts über Bairisch, Schwäbisch oder Niederdeutsch aus. Unser Leitfaden zur Auswahl von deutschem TTS und Dialekten erklärt den Aufbau eines passenden Hörtests.

Welche Hardware benötigen selbstgehostete TTS-Modelle?

Leiten Sie keine vermeintliche GPU-Anforderung allein aus der Parameterzahl ab. Der Speicherbedarf hängt auch von Präzision, Vocoder, KV-Cache, Länge des Referenzaudios, Batch-Größe, CUDA Graphs und Serving-Laufzeit ab. Voxtral nennt für seine BF16-Modellgewichte mit dem dokumentierten vLLM-Omni-Pfad mindestens 16 GB GPU-Speicher. Die Modellkarte von KugelAudio 0 Open nennt für die Referenzimplementierung rund 19 GB VRAM und weist darauf hin, dass sich dieser Wert durch Entfernen nicht benötigter Encodergewichte reduzieren lässt.

Das aktuelle vLLM-Omni-Rezept für Fish Audio ist als Referenzkonfiguration nützlich, nicht als Mindestanforderung: Es misst rund 49 GiB Spitzenauslastung auf einer A800 mit 80 GB. CosyVoice und Kokoro veröffentlichen Modellgrößen, aber keine vergleichbare Mindestangabe zum Speicher. Piper-Stimmen reichen von kleinen lokalen Modellen bis zu größeren Sprachpaketen. Messen Sie deshalb die konkrete .onnx-Datei mit der vorgesehenen Laufzeit.

Messen Sie für den Produktivbetrieb Spitzenspeicher und Zeit bis zum ersten abspielbaren Audiostück bei der benötigten Parallelität. Testen Sie anschließend lange Eingaben, geklonte Stimmreferenzen, Abbrüche und die Wiederherstellung nach Speichermangel. Halten Sie Kapazität für ein warmes Replikat vor oder akzeptieren Sie die Wiederherstellungszeit nach einem Geräteausfall.

Garantiert die dokumentierte Streaming-Unterstützung eine geringe Latenz?

Nein. Voxtral dokumentiert Streaming und Batch-Inferenz über vLLM-Omni. CosyVoice 3 dokumentiert bidirektionales Streaming für Textinput und Audiooutput. Fish Audio S2 Pro bietet einen Streaming-Pfad über SGLang; der kommerzielle Dienst Kugel 3 dokumentiert Streaming für Ein- und Ausgabe. Die aktuelle Modellkarte von KugelAudio 0 Open zeigt dagegen Batch-Generierung. Diese Angaben belegen jeweils einen unterstützten Mechanismus und sind keine Latenzgarantie für Ihre Hardware.

Die Python-API von Kokoro liefert erzeugte Segmente, die von Piper Audioblöcke. Das allein belegt jedoch weder inkrementellen Textinput noch Backpressure, schnelle Abbrüche oder stabile Latenz unter Parallelität. Testen Sie die vollständige Transport- und Wiedergabekette. Benchmarkwerte der Anbieter sind nicht direkt vergleichbar, wenn sich Hardware, Eingabelänge, Referenzaudio oder Latenzdefinition unterscheiden.

Was kostet selbst gehostetes TTS wirklich?

Rechnen Sie mit einer Arbeitslast über ein ganzes Jahr und nicht nur mit einem GPU-Stundenpreis. Berücksichtigen Sie ungenutzte Replikate, Modellspeicher, Image-Scans, Upgrades, Monitoring, Alarmierung, Lasttests, Sicherheitsmaßnahmen und die personelle Bereitschaft für Vorfälle. Hinzu kommen Beschaffung von Stimmen, Aussprachearbeit und Lizenzprüfung.

Vergleichen Sie Alternativen bei identischem Audiovolumen, derselben Spitzenparallelität, demselben Verfügbarkeitsziel und demselben Supportniveau. Ein freizügig lizenzierter Checkpoint kann die niedrigsten Lizenz- und höchsten Engineeringkosten verursachen. Ein kommerzielles Self-Hosted-Angebot kann teurer lizenziert sein, dafür aber den Bereitstellungsaufwand senken und die Netzwerkgrenzen des Kunden wahren.

Wie sollten Teams ein Modell in die engere Auswahl nehmen und bereitstellen?

  1. Notieren Sie den genauen Repository-Commit, die Checkpoint-ID und das Sprach-Asset.
  2. Genehmigen Sie Lizenzen und Bedingungen für Code, Modellgewichte, Stimmen und erzeugte Ausgaben im vorgesehenen Anwendungsfall.
  3. Lehnen Sie Kandidaten ab, die nicht über die erforderliche Sprache oder Bereitstellungsschnittstelle verfügen.
  4. Führen Sie mit allen Kandidaten denselben Aussprachetest durch und lassen Sie ihn von muttersprachlichen Testpersonen bewerten.
  5. Messen Sie Zeit bis zum ersten abspielbaren Audiostück, Durchsatz, Spitzenspeicher und Fehlerrate auf der Zielhardware.
  6. Testen Sie Abbruch, Überlastung, Neustart, Rolling Upgrade und Rollback.
  7. Dokumentieren Sie Logs, Traces, Caches, Backups, Telemetrie und Supportzugriffe.
  8. Benennen Sie Verantwortliche für Sicherheitspatches, Modellupdates und Vorfälle.

Schreiben Sie jedes genehmigte Artefakt per Version oder Digest fest. Der Umzug eines Repositorys zu einer anderen Organisation oder ein Lizenzwechsel darf einen Produktiv-Build nicht unbemerkt verändern. Das aktuelle Fish-Speech-Repository verwendet in seinem Quickstart inzwischen S2 Pro; der ältere S1-mini wird deshalb in diesem Leitfaden nicht berücksichtigt. Das CosyVoice-Projekt liegt heute unter der Organisation QwenAudio, auch wenn die frühere FunAudioLLM-URL dorthin weiterleitet. Piper zeigt das Lizenzrisiko besonders deutlich: Das frühere MIT-lizenzierte Repository rhasspy/piper wurde im Oktober 2025 archiviert. Die Entwicklung wechselte in das GPL-3.0-Repository OHF-Voice/piper1-gpl, für das aktuell Betreuer gesucht werden.

Prüfen Sie bei datenschutzrelevanten Bereitstellungen auch den vollständigen Datenfluss. Durch Self-Hosting können Text, Audio und Referenzstimmen in der Infrastruktur des Kunden bleiben; externe Telemetrie oder Logs können diese Grenze jedoch wieder öffnen. Weitere Hinweise enthalten der On-Premise-Leitfaden zu Infrastruktur und Datenkontrolle und die Checkliste für den Produktivstart.

KugelAudio dokumentiert einen Self-Hosted-Bereitstellungsweg mit Helm-Chart, Lizenzschlüssel und Unterstützung beim Rollout auf Kubernetes. Dabei handelt es sich um ein kommerzielles Angebot und nicht um ein Open-Source-Modell. Lesen Sie die Bereitstellungsdokumentation oder kontaktieren Sie das Team.

FAQ

Welches ist das beste Open-Source-TTS-Modell?

Dieser Leitfaden nennt keinen Qualitätssieger. Kokoro ist die kleinste aufgeführte, freizügig lizenzierte Grundlage; KugelAudio 0 Open konzentriert sich auf europäische Sprachen; CosyVoice 3 führt Deutsch und bidirektionales Streaming ausdrücklich auf. Entscheiden Sie erst nach einem gemeinsamen Hörtest und Messungen in der vorgesehenen Bereitstellung.

Kann ich TTS kommerziell selbst hosten?

Ja, sofern sämtliche relevanten Lizenzen die geplante Nutzung erlauben. Checkpoints wie Kokoro und CosyVoice stehen unter Apache 2.0 und lassen kommerzielle Nutzung gemäß ihren Bedingungen zu. Der veröffentlichte Voxtral-Checkpoint ist nichtkommerziell; für Fish Audio ist eine gesonderte kommerzielle Vereinbarung erforderlich.

Welcher TTS läuft auf CPU?

Piper ist eine lokale ONNX-Laufzeit; die offizielle Demo von Kokoro enthält einen CPU-Pfad. Das belegt Ausführbarkeit, aber keinen Durchsatz im Produktivbetrieb. Vergleichen Sie konkrete Laufzeit, Sprache, Textlänge und Parallelität, bevor Sie Hardware festlegen.

Was ist das beste selbsthostbare deutsche TTS?

Dieser Leitfaden enthält kein eigenes Qualitätsergebnis für Deutsch. Beginnen Sie mit Kandidaten, die Deutsch offiziell aufführen, und testen Sie anschließend Normalisierung, Namen, zusammengesetzte Wörter, Code-Switching und die benötigten regionalen Varietäten mit deutschsprachigen Muttersprachlern.

Bedeutet Self-Hosting automatisch Zero Retention?

Nein. Self-Hosting ermöglicht kundenseitig kontrollierte Speicherfristen, belegt aber nicht von selbst Zero Retention. Prüfen Sie Anwendungslogs, Traces, Caches, Backups, Crash-Dumps, Telemetrie, Lizenzprüfungen und Supportzugriffe.

Ist Voxtral TTS kommerziell als Open Source nutzbar?

Nein. Laut offizieller Modellkarte steht der Checkpoint Voxtral-4B-TTS-2603 unter CC BY-NC 4.0. Behandeln Sie ihn als nichtkommerzielle Open-Weight-Veröffentlichung, sofern Sie keine gesonderten Rechte für Ihre geplante Nutzung erwerben.

Mit KugelAudio entwickeln

Europäische Voice-Infrastruktur produktiv einsetzen.

Nutzen Sie den EU-Endpunkt oder besprechen Sie ein selbst betriebenes Kubernetes-Deployment.