All articles

Engineering

Modèles TTS open source, à poids ouverts et auto-hébergés : guide 2026

Une comparaison pratique des modèles de synthèse vocale open source, à poids ouverts et auto-hébergés commerciaux, avec des filtres de licence explicites et des preuves de déploiement.

Viktor Presber12 min read
Une sphère vocale modulaire éclatée, avec des couches de calcul local
On this page

À retenir

  • Des poids téléchargeables ne sont pas automatiquement open source ni utilisables commercialement.
  • KugelAudio 0 Open est un point de contrôle sous licence MIT ; le service commercial Kugel 3 sur site constitue une offre distincte.
  • Kokoro-82M et Fun-CosyVoice3-0.5B-2512 publient des points de contrôle sous Apache 2.0. Voxtral-4B-TTS-2603 est sous CC BY-NC 4.0, et Fish Audio S2 Pro exige une licence distincte pour tout usage commercial.
  • L’allemand est explicitement annoncé pour KugelAudio 0 Open, Voxtral, CosyVoice 3, Fish Audio S2 Pro, Piper et Kugel 3. La chaîne officielle de Kokoro ne mentionne pas l’allemand.
  • Les chiffres de mémoire publiés dépendent de l’environnement d’exécution. Le nombre de paramètres ne remplace pas une mesure de mémoire, de latence ou de capacité.
  • La prise en charge de la diffusion en continu est une propriété de la pile de service autant que du modèle. Vérifiez l’annulation, la régulation de flux et le délai avant premier audio lisible sur votre propre environnement d’exécution.
  • L’auto-hébergement donne au client la maîtrise du chemin des données, mais lui transfère aussi les correctifs, la capacité, la supervision et la responsabilité des incidents.

Dernière mise à jour : 10 août 2026. Les fiches de modèles, les dépôts et les licences ont été vérifiés à cette date.

Quel est le meilleur modèle TTS auto-hébergeable en 2026 ?

Aucun gagnant universel n’est défendable. La première décision utile consiste à déterminer si le déploiement exige des droits commerciaux permissifs, l’allemand, une véritable diffusion en continu texte en entrée et audio en sortie, un petit environnement d’exécution local, ou un service sur site accompagné. Ces filtres écartent les options inadaptées avant tout test d’écoute.

Modèle ou offreCe qui est disponibleLangues documentéesÉléments sur le service et le matérielFiltre de licenceUtilité principale
KugelAudio 0 OpenPoint de contrôle sous licence MIT et code Python23 langues européennes, dont l’allemandLa fiche du modèle mentionne environ 19 Go de VRAM, la génération locale par lots et des voix préencodées ; elle ne prend pas en charge le clonage à partir d’un audio de référence brutMITUne référence ouverte pour les langues européennes, lorsque ses voix préencodées conviennent
KugelAudio Kugel 3 sur siteService commercial, distinct de KugelAudio 0 OpenModèle multilingue de 26 langues, dont l’allemandLivraison Kubernetes et Helm ; la documentation publique ne précise pas le matérielContrat commercialLes équipes qui veulent un service auto-hébergé accompagné plutôt que d’exploiter elles-mêmes le serveur de modèle
Voxtral-4B-TTS-2603Poids 4B en BF16 et intégration vLLM-OmniNeuf langues, dont l’allemandLa fiche officielle documente l’inférence en continu et par lots sur un seul GPU d’au moins 16 Go de mémoireCC BY-NC 4.0 ; ce point de contrôle n’autorise pas l’usage commercialDe la recherche multilingue non commerciale avec une voie de service documentée
Kokoro-82M v1.0Point de contrôle de 82M et bibliothèque d’inférence PythonHuit langues ; l’allemand n’y figure pasLe plus petit nombre de paramètres de cette liste ; le dépôt officiel ne publie pas d’objectif de capacité en productionPoint de contrôle et code sous Apache 2.0Une petite base permissive lorsqu’une des langues annoncées suffit
Fish Audio S2 ProPoids 4B en autorégressif lent, code de réglage fin et moteur de diffusion en continuPlus de 80 langues, avec l’allemand en niveau 2La fiche officielle publie des résultats sur H200 ; une recette de référence vLLM-Omni utilise un A800 80 Go et relève environ 49 Gio de pic, ce qui n’est pas une exigence minimaleFish Audio Research License ; tout usage commercial, y compris interne à l’entreprise, exige une licence écrite distincteUne évaluation de recherche, ou un déploiement sous licence distincte exigeant des contrôles expressifs
Fun-CosyVoice3-0.5B-2512Point de contrôle de 0,5B, code d’inférence et d’entraînementNeuf langues, dont l’allemandLe dépôt officiel documente une diffusion bidirectionnelle texte en entrée et audio en sortie, mais aucune mémoire GPU minimaleDépôt et fiche de modèle sous Apache 2.0Un prototypage multilingue permissif avec une implémentation documentée de la diffusion en continu
Piper (OHF-Voice/piper1-gpl)Environnement d’exécution local et voix VITS empaquetées séparémentL’allemand et de nombreuses autres locales de voixCLI, serveur web, API Python et C/C++ ; l’empreinte et la qualité de sortie dépendent de la voix retenueEnvironnement d’exécution sous GPL-3.0 ; chaque voix possède sa propre licence dans son MODEL_CARDDes applications hors ligne à voix fixe, après examen des obligations de distribution GPL et de la voix choisie

Ce tableau attribue des rôles dans une présélection, non des rangs de qualité. Aucun jeu de test allemand, aucune voix, aucun matériel ni aucune configuration de service communs n’ont été utilisés pour cet article. Pour une structure d’évaluation reproductible, utilisez le benchmark ouvert de synthèse vocale allemande.

Quelle différence entre open source et poids ouverts ?

Un logiciel open source fournit son code source sous une licence open source. Des poids ouverts signifient seulement que les paramètres du modèle peuvent être téléchargés. La licence des poids peut néanmoins interdire l’usage commercial, restreindre la redistribution, imposer une attribution ou une politique d’usage acceptable.

Vérifiez quatre éléments séparément : le code d’inférence, le point de contrôle du modèle, les voix ou audios de référence fournis, et toute dérivée issue d’un réglage fin. L’environnement d’exécution actuel de Piper est par exemple sous GPL-3.0, tandis que sa propre documentation indique que le MODEL_CARD de chaque voix contient la licence applicable. Exécuter un logiciel GPL en interne n’équivaut pas à le distribuer dans un produit : la distribution et la modification peuvent créer des obligations de mise à disposition du code source. Faites examiner juridiquement l’empaquetage réel plutôt que d’étiqueter la GPL comme « commerciale » ou « non commerciale ».

Les filtres non commerciaux sont plus nets. La fiche du modèle Voxtral applique la licence CC BY-NC 4.0 au point de contrôle en raison des voix de référence fournies. La Fish Audio Research License qualifie de commerciaux l’usage interne en entreprise, les services hébergés et les produits générant des revenus, et exige un accord écrit distinct. Ni l’un ni l’autre n’est un point de contrôle open source utilisable commercialement.

Apache 2.0 est une licence permissive, mais elle n’accorde de droits ni sur l’identité d’un comédien voix, ni sur les enregistrements de référence d’un client, ni sur toutes les dépendances tierces. Conservez les traces de consentement et de provenance de chaque voix de production.

Quelle synthèse vocale auto-hébergeable convient à l’allemand ?

Les langues documentées réduisent la liste sans prouver la qualité en production. KugelAudio 0 Open, Voxtral, Fun-CosyVoice 3, Fish Audio S2 Pro, Piper et Kugel 3 annoncent explicitement l’allemand. Les codes de langue officiels de Kokoro couvrent l’anglais américain et britannique, l’espagnol, le français, le hindi, l’italien, le japonais, le portugais brésilien et le chinois mandarin, mais pas l’allemand.

Pour l’allemand, testez les mots composés, les abréviations, les dates, les devises, les noms et les alternances de langues. Testez les usages autrichiens et suisses séparément de l’allemand standard, et traitez la prise en charge dialectale comme une exigence distincte. Une étiquette générique de ne dit rien du bavarois, du souabe ou du bas allemand. Notre guide de choix pour l’allemand et ses dialectes explique comment construire ce jeu d’écoute.

Quel matériel exigent les modèles TTS auto-hébergés ?

Ne transformez pas un nombre de paramètres en exigence GPU inventée. La mémoire dépend aussi de la précision, du vocodeur, du cache KV, de la longueur de l’audio de référence, de la taille de lot, des graphes CUDA et de l’environnement d’exécution. Voxtral publie un minimum clair de 16 Go de mémoire GPU pour ses poids BF16 avec la voie vLLM-Omni documentée. La fiche de KugelAudio 0 Open indique environ 19 Go de VRAM pour son implémentation de référence et note que retirer les poids d’encodeur inutilisés peut réduire ce chiffre.

La recette vLLM-Omni actuelle de Fish Audio sert de configuration de référence, non de minimum : elle relève environ 49 Gio d’utilisation de pointe sur un A800 80 Go. CosyVoice et Kokoro publient des tailles de modèle, mais aucune indication de mémoire minimale comparable. Les voix Piper vont de petits modèles locaux à des paquets vocaux plus volumineux : mesurez le fichier .onnx et l’environnement d’exécution exacts.

Pour la production, relevez la mémoire de pointe et le premier audio lisible à la simultanéité requise. Testez ensuite les entrées longues, les références de voix clonées, l’annulation et la reprise après un dépassement de mémoire. Réservez de la capacité pour une réplique déjà chaude, ou acceptez le délai de reprise après une panne matérielle.

Une prise en charge documentée de la diffusion en continu garantit-elle une faible latence ?

Non. Voxtral documente l’inférence en continu et par lots via vLLM-Omni. CosyVoice 3 documente une diffusion bidirectionnelle texte en entrée et audio en sortie. Fish Audio S2 Pro fournit une voie de diffusion SGLang, et le service commercial Kugel 3 documente la diffusion en entrée comme en sortie. La fiche actuelle de KugelAudio 0 Open décrit en revanche une génération par lots. Ces mentions établissent un mécanisme pris en charge, non une garantie de latence sur votre matériel.

L’API Python de Kokoro renvoie des segments générés et celle de Piper des fragments audio, mais cela ne prouve à soi seul ni l’entrée de texte incrémentale, ni la régulation de flux, ni une annulation rapide, ni une latence stable à forte simultanéité. Testez l’ensemble du transport et le lecteur audio. Les chiffres de banc d’essai des fournisseurs ne sont pas directement comparables lorsque le matériel, la longueur des entrées, l’audio de référence et la définition de la latence diffèrent.

Combien coûte réellement une synthèse vocale auto-hébergée ?

Raisonnez sur une charge d’un an, non sur un prix à l’heure de GPU. Incluez les répliques inactives, le stockage des modèles, l’analyse des images, les mises à niveau, la supervision, les alertes, les tests de charge, la réponse aux incidents de sécurité et l’ingénieur qui prend en charge les incidents. Ajoutez l’acquisition des voix, le travail sur la prononciation et l’examen des licences.

Comparez les options à volume audio, simultanéité de pointe, objectif de disponibilité et niveau de support identiques. Un point de contrôle permissif peut afficher le coût de licence le plus bas et le coût d’ingénierie le plus élevé. Une offre commerciale auto-hébergée peut coûter davantage en redevances tout en supprimant le travail de service, sans sortir de la frontière réseau du client.

Comment présélectionner et déployer un modèle ?

  1. Notez le commit exact du dépôt, l’identifiant du point de contrôle et l’actif vocal.
  2. Faites approuver les conditions du code, des poids, des voix et des sorties pour l’usage prévu.
  3. Écartez les candidats sans la langue ou l’interface de déploiement requises.
  4. Exécutez un même jeu de prononciation et d’écoute par des auditeurs natifs.
  5. Mesurez le premier audio lisible, le débit, la mémoire de pointe et le taux d’erreur sur le matériel cible.
  6. Testez l’annulation, la saturation, le redémarrage, la mise à niveau progressive et le retour arrière.
  7. Documentez les journaux, les traces, les caches, les sauvegardes, la télémétrie et les accès du support.
  8. Désignez un responsable des correctifs de sécurité, des montées de version du modèle et des incidents.

Épinglez chaque artefact approuvé par version ou par empreinte. Le passage d’un dépôt à une nouvelle organisation ou à une nouvelle licence ne doit pas modifier silencieusement une version de production. Le dépôt Fish Speech actuel utilise désormais S2 Pro dans son démarrage rapide : l’ancien S1-mini n’est donc pas retenu dans ce guide. Le projet CosyVoice est désormais hébergé par l’organisation QwenAudio, même si son ancienne URL FunAudioLLM y redirige. Piper est l’exemple de licence le plus net : l’ancien dépôt rhasspy/piper sous MIT a été archivé en octobre 2025, le développement s’est déplacé vers le dépôt OHF-Voice/piper1-gpl sous GPL-3.0, et ce projet actuel recherche des mainteneurs.

Pour les déploiements sensibles à la confidentialité, auditez aussi l’ensemble du chemin des données. L’auto-hébergement peut maintenir le texte, l’audio et les voix de référence dans l’infrastructure du client, mais des journaux ou une télémétrie externe peuvent ruiner cette conception. Voir le guide sur l’infrastructure sur site et la maîtrise des données et la checklist de maturité de production.

La voie auto-hébergée documentée par KugelAudio est livrée pour Kubernetes avec un chart Helm, une clé de licence et un accompagnement au déploiement. C’est une option commerciale, non un modèle open source. Consultez la documentation de déploiement ou contactez l’équipe.

FAQ

Quelle est la meilleure synthèse vocale open source ?

Ce guide ne désigne aucun gagnant en qualité. Kokoro est la plus petite base permissive citée, KugelAudio 0 Open se concentre sur les langues européennes, et CosyVoice 3 annonce explicitement l’allemand et la diffusion bidirectionnelle. Ne choisissez qu’après un test d’écoute commun et une mesure en conditions de déploiement.

Puis-je auto-héberger une synthèse vocale à des fins commerciales ?

Oui, lorsque toutes les licences applicables autorisent l’usage prévu. Les points de contrôle sous Apache 2.0 comme Kokoro et CosyVoice permettent un usage commercial dans les conditions de leur licence. Le point de contrôle publié de Voxtral est non commercial, et Fish Audio exige un accord commercial distinct.

Quelle synthèse vocale fonctionne sur CPU ?

Piper est un environnement d’exécution ONNX local, et la démonstration officielle de Kokoro comporte une voie CPU. Cela prouve l’exécution, non le débit en production. Mesurez l’environnement d’exécution, la voix, la longueur des textes et la simultanéité exacts avant de choisir votre matériel.

Quelle est la meilleure synthèse vocale allemande auto-hébergeable ?

Aucun résultat de qualité en allemand n’est publié ici. Commencez par les candidats qui annoncent officiellement l’allemand, puis testez la normalisation, les noms, les mots composés, les alternances de langues et la variété régionale requise avec des auditeurs natifs.

Une synthèse vocale auto-hébergée garantit-elle l’absence de conservation ?

Elle permet une conservation maîtrisée par le client ; elle ne prouve pas à elle seule une absence de conservation. Vérifiez les journaux applicatifs, les traces, les caches, les sauvegardes, les vidages sur incident, la télémétrie, les vérifications de licence et les accès du support.

Voxtral TTS est-il open source à usage commercial ?

Non. La fiche officielle du modèle Voxtral-4B-TTS-2603 place le point de contrôle sous CC BY-NC 4.0. Considérez-le comme une publication à poids ouverts non commerciale, sauf à obtenir des droits distincts couvrant l’usage envisagé.

Build with KugelAudio

Put European voice infrastructure into production.

Use the EU endpoint or discuss a customer-operated Kubernetes deployment.