Punti chiave
- Pesi scaricabili non significano automaticamente open source o utilizzabili commercialmente.
- KugelAudio 0 Open è un checkpoint con licenza MIT; il servizio commerciale on-premise Kugel 3 è un'offerta separata.
- Kokoro-82M e Fun-CosyVoice3-0.5B-2512 pubblicano checkpoint con licenza Apache 2.0. Voxtral-4B-TTS-2603 è CC BY-NC 4.0, e Fish Audio S2 Pro richiede una licenza separata per qualsiasi uso commerciale.
- Il tedesco è elencato esplicitamente per KugelAudio 0 Open, Voxtral, CosyVoice 3, Fish Audio S2 Pro, Piper e Kugel 3. La pipeline ufficiale di Kokoro non elenca il tedesco.
- I valori di memoria pubblicati dipendono dal runtime. Il numero di parametri non è un sostituto affidabile di memoria, latenza o capacità misurate.
- Il supporto dello streaming è una proprietà dello stack di serving oltre che del modello. Verificate annullamento, backpressure e tempo al primo audio riproducibile sul runtime di destinazione.
- Il self-hosting dà al cliente il controllo del percorso dei dati, ma gli trasferisce anche patching, capacità, monitoraggio e responsabilità sugli incidenti.
Ultimo aggiornamento: 10 agosto 2026. Model card, repository e licenze sono stati verificati a quella data.
Qual è il miglior modello TTS self-hostable nel 2026?
Non esiste un vincitore universale difendibile. La prima decisione utile è se il deployment richieda diritti commerciali permissivi, il tedesco, un vero streaming testo-in e audio-out, un runtime locale leggero o un servizio on-premise supportato. Quei filtri eliminano le opzioni inadatte prima di qualsiasi test di ascolto.
Questa tabella assegna ruoli in una shortlist, non punteggi di qualità. Per questo articolo non è stato eseguito alcun set di test comune in tedesco, né una voce, un hardware o una configurazione di serving condivisi. Per una struttura di valutazione riproducibile, usate il benchmark aperto sul TTS tedesco.
Qual è la differenza tra open source e open weight?
Il software open source fornisce il codice sorgente con una licenza open source. Open weight significa soltanto che i parametri del modello possono essere scaricati. La licenza dei pesi può comunque vietare l'uso commerciale, limitare la ridistribuzione, richiedere l'attribuzione o imporre una politica di uso accettabile.
Verificate quattro artefatti separatamente: codice di inferenza, checkpoint del modello, voci o audio di riferimento inclusi, e qualsiasi derivato ottenuto con fine-tuning. Per esempio, l'attuale runtime di Piper è GPL-3.0, mentre la sua documentazione sulle voci indica che la licenza pertinente si trova nel MODEL_CARD di ciascuna voce. Eseguire software GPL all'interno di un'azienda non è la stessa cosa che distribuirlo in un prodotto; distribuzione e modifica possono far sorgere obblighi sul codice sorgente. Fate esaminare da un legale il pacchetto reale, invece di etichettare la GPL come "commerciale" o "non commerciale".
I vincoli non commerciali sono più netti. La model card di Voxtral assegna al checkpoint la licenza CC BY-NC 4.0 a causa delle voci di riferimento fornite. La Fish Audio Research License definisce commerciali l'uso interno aziendale, i servizi ospitati e i prodotti che generano ricavi, e richiede un accordo scritto separato. Nessuno dei due è un checkpoint open source per uso commerciale.
Apache 2.0 è permissiva, ma non concede diritti sull'identità di un doppiatore, sulle registrazioni di riferimento di un cliente o su ogni dipendenza di terze parti. Conservate i registri di consenso e provenienza per ogni voce in produzione.
Quale TTS self-hostable è adatto al tedesco?
Le evidenze linguistiche restringono l'elenco ma non dimostrano la qualità in produzione. KugelAudio 0 Open, Voxtral, Fun-CosyVoice 3, Fish Audio S2 Pro, Piper e Kugel 3 elencano esplicitamente il tedesco. I codici di lingua ufficiali di Kokoro coprono inglese americano e britannico, spagnolo, francese, hindi, italiano, giapponese, portoghese brasiliano e cinese mandarino, ma non il tedesco.
Per il tedesco, testate composti, abbreviazioni, date, valute, nomi e code-switching. Testate l'uso austriaco e svizzero separatamente dal tedesco standard, e trattate il supporto dialettale come un requisito a sé. Un'etichetta generica de non dice nulla su bavarese, svevo o basso tedesco. La nostra guida alla scelta di tedesco e dialetti spiega come costruire quel set di ascolto.
Che hardware richiedono i modelli TTS self-hosted?
Non trasformate il numero di parametri in un requisito GPU inventato. La memoria dipende anche da precisione, vocoder, KV cache, durata dell'audio di riferimento, dimensione del batch, CUDA graph e runtime di serving. Voxtral pubblica un minimo chiaro di 16 GB di memoria GPU per i suoi pesi BF16 con il percorso vLLM-Omni documentato. La card di KugelAudio 0 Open documenta circa 19 GB di VRAM per la sua implementazione di riferimento e osserva che rimuovere i pesi dell'encoder inutilizzati può ridurre quel valore.
L'attuale ricetta vLLM-Omni di Fish Audio è utile come configurazione di riferimento, non come minimo: registra circa 49 GiB di uso di picco su una A800 da 80 GB. CosyVoice e Kokoro pubblicano le dimensioni dei modelli ma nessuna dichiarazione comparabile sulla memoria minima. Le voci di Piper vanno da piccoli modelli locali a pacchetti vocali più grandi, quindi misurate il file .onnx e il runtime esatti.
Per la produzione, rilevate memoria di picco e primo audio riproducibile alla concorrenza richiesta. Testate poi input lunghi, riferimenti di voci clonate, annullamenti e ripristino dopo un out-of-memory. Riservate capacità per una replica calda oppure accettate il tempo di ripristino dopo il guasto di un dispositivo.
Il supporto documentato dello streaming garantisce una bassa latenza?
No. Voxtral documenta inferenza in streaming e batch tramite vLLM-Omni. CosyVoice 3 documenta il bi-streaming testo-in e audio-out. Fish Audio S2 Pro include un percorso di streaming SGLang, e il servizio commerciale Kugel 3 documenta streaming sia in ingresso sia in uscita. L'attuale model card di KugelAudio 0 Open mostra invece la generazione batch. Queste indicazioni stabiliscono un meccanismo supportato, non una garanzia di latenza sul vostro hardware.
L'API Python di Kokoro restituisce segmenti generati e quella di Piper restituisce blocchi audio, ma questo da solo non dimostra input di testo incrementale, backpressure, annullamento rapido o latenza stabile sotto concorrenza. Testate l'intero trasporto e il player audio. I numeri dei benchmark dei fornitori non sono direttamente confrontabili quando hardware, lunghezza dell'input, audio di riferimento e definizione di latenza differiscono.
Quanto costa davvero un TTS self-hosted?
Usate un carico di lavoro annuale, non un singolo prezzo per GPU-ora. Includete repliche inattive, archiviazione dei modelli, scansione delle immagini, aggiornamenti, monitoraggio, alerting, test di carico, risposta agli incidenti di sicurezza e l'ingegnere che se ne fa carico. Aggiungete acquisizione delle voci, lavoro sulla pronuncia e revisione delle licenze.
Confrontate le alternative a parità di volume audio, concorrenza di picco, obiettivo di disponibilità e livello di supporto. Un checkpoint permissivo può avere il costo di licenza più basso e il costo di ingegneria più alto. Un'offerta commerciale self-hosted può costare di più in canoni ma eliminare il lavoro di serving preservando il perimetro di rete del cliente.
Come selezionare e distribuire un modello?
- Registrate il commit esatto del repository, l'ID del checkpoint e l'asset vocale.
- Fate approvare le condizioni su codice, pesi, voci e output per l'uso previsto.
- Escludete i candidati privi della lingua o dell'interfaccia di deployment richieste.
- Eseguite un unico set condiviso di pronuncia e di ascolto madrelingua.
- Misurate primo audio riproducibile, throughput, memoria di picco e tasso di errore sull'hardware di destinazione.
- Testate annullamento, sovraccarico, riavvio, rolling upgrade e rollback.
- Documentate log, tracce, cache, backup, telemetria e accessi del supporto.
- Assegnate un responsabile per patch di sicurezza, aggiornamenti dei modelli e incidenti.
Fissate ogni artefatto approvato per versione o digest. Un repository che passa a una nuova organizzazione o a una nuova licenza non deve cambiare in silenzio una build di produzione. L'attuale repository Fish Speech usa ora S2 Pro nella sua guida rapida, quindi il vecchio S1-mini non è considerato in questa guida. Il progetto CosyVoice si trova ora sotto l'organizzazione QwenAudio, anche se il vecchio URL FunAudioLLM vi reindirizza. Piper è l'esempio di licenza più chiaro: il precedente repository rhasspy/piper con licenza MIT è stato archiviato nell'ottobre 2025, lo sviluppo si è spostato sul repository GPL-3.0 OHF-Voice/piper1-gpl, e il progetto attuale è alla ricerca di manutentori.
Per i deployment sensibili alla privacy, verificate anche l'intero percorso dei dati. Il self-hosting può mantenere testo, audio e voci di riferimento dentro l'infrastruttura del cliente, ma log o telemetria esterna possono vanificare quel progetto. Si vedano la guida all'infrastruttura on-premise e al controllo dei dati e la checklist di prontezza per la produzione.
Il percorso self-hosted documentato di KugelAudio prevede la distribuzione su Kubernetes con un Helm chart, una chiave di licenza e supporto al rollout. È un'opzione commerciale, non un modello open source. Consultate la documentazione sul deployment oppure contattate il team.
FAQ
Qual è il miglior TTS open source?
In questa guida non c'è un vincitore di qualità. Kokoro è la baseline permissiva più leggera tra quelle elencate, KugelAudio 0 Open si concentra sulle lingue europee e CosyVoice 3 elenca esplicitamente il tedesco e il bi-streaming. Scegliete solo dopo un test di ascolto condiviso e misurazioni di deployment.
Posso ospitare in proprio un text-to-speech per uso commerciale?
Sì, quando tutte le licenze pertinenti consentono l'uso previsto. I checkpoint Apache 2.0 come Kokoro e CosyVoice consentono l'uso commerciale alle loro condizioni. Il checkpoint pubblicato di Voxtral è non commerciale, e Fish Audio richiede un accordo commerciale separato.
Quale TTS gira su CPU?
Piper è un runtime ONNX locale, e la demo ufficiale di Kokoro include un percorso su CPU. Questo dimostra l'esecuzione, non il throughput di produzione. Eseguite il benchmark su runtime, voce, lunghezza del testo e concorrenza esatti prima di scegliere l'hardware.
Qual è il miglior TTS tedesco self-hostable?
Qui non viene riportato alcun risultato di qualità sul tedesco. Partite dai candidati che elencano ufficialmente il tedesco, poi testate normalizzazione, nomi, composti, code-switching e la varietà regionale richiesta con ascoltatori madrelingua.
Il TTS self-hosted garantisce l'azzeramento della conservazione?
Abilita una conservazione controllata dal cliente; non dimostra di per sé l'azzeramento. Verificate log applicativi, tracce, cache, backup, crash dump, telemetria, verifiche di licenza e accessi del supporto.
Voxtral TTS è open source per uso commerciale?
No. La model card ufficiale di Voxtral-4B-TTS-2603 assegna al checkpoint la licenza CC BY-NC 4.0. Consideratelo un rilascio open weight non commerciale, salvo che otteniate diritti separati che coprano l'uso previsto.
Build with KugelAudio
Put European voice infrastructure into production.
Use the EU endpoint or discuss a customer-operated Kubernetes deployment.