Ideas clave
- Que los pesos sean descargables no significa automáticamente que sean de código abierto ni de uso comercial.
- KugelAudio 0 Open es un checkpoint con licencia MIT; el servicio comercial on-premise de Kugel 3 es una oferta aparte.
- Kokoro-82M y Fun-CosyVoice3-0.5B-2512 publican checkpoints bajo Apache 2.0. Voxtral-4B-TTS-2603 está bajo CC BY-NC 4.0, y Fish Audio S2 Pro exige una licencia aparte para cualquier uso comercial.
- El alemán figura explícitamente en KugelAudio 0 Open, Voxtral, CosyVoice 3, Fish Audio S2 Pro, Piper y Kugel 3. La canalización oficial de Kokoro no incluye el alemán.
- Las cifras de memoria publicadas dependen del runtime. El número de parámetros no sustituye con garantías a una medición real de memoria, latencia o capacidad.
- El soporte de streaming es tanto una propiedad de la pila de servicio como del modelo. Confirme la cancelación, la contrapresión y el tiempo hasta el primer audio reproducible en su runtime de destino.
- El autoalojamiento da al cliente el control de la ruta de datos, pero también le traspasa la responsabilidad sobre parches, capacidad, monitorización e incidencias.
Última actualización: 10 de agosto de 2026. Las fichas de modelo, los repositorios y las licencias se consultaron en esa fecha.
¿Cuál es el mejor modelo de TTS autoalojable en 2026?
No existe un ganador universal defendible. La primera decisión útil es si el despliegue necesita derechos comerciales permisivos, alemán, streaming real de entrada de texto y salida de audio, un runtime local pequeño o un servicio on-premise con soporte. Esos filtros descartan opciones inadecuadas antes de una prueba de escucha.
Esta tabla asigna papeles dentro de una lista corta, no puestos de calidad. Para este artículo no se ejecutó ningún conjunto de prueba, voz, hardware ni configuración de servicio comunes en alemán. Para una estructura de evaluación reproducible, use el benchmark abierto de TTS en alemán.
¿Cuál es la diferencia entre código abierto y pesos abiertos?
El software de código abierto ofrece el código fuente bajo una licencia de código abierto. Los pesos abiertos solo significan que los parámetros del modelo pueden descargarse. La licencia de los pesos aún puede prohibir el uso comercial, restringir la redistribución, exigir atribución o imponer una política de uso aceptable.
Compruebe cuatro artefactos por separado: el código de inferencia, el checkpoint del modelo, las voces o el audio de referencia incluidos y cualquier derivado ajustado. Por ejemplo, el runtime actual de Piper es GPL-3.0, mientras que su propia documentación de voces indica que el archivo MODEL_CARD de cada voz contiene la licencia correspondiente. Ejecutar software GPL dentro de una empresa no es lo mismo que distribuirlo en un producto; la distribución y la modificación pueden generar obligaciones sobre el código fuente. Obtenga una revisión jurídica del empaquetado real en vez de etiquetar la GPL como «comercial» o «no comercial».
Los límites no comerciales son más claros. La ficha del modelo Voxtral asigna CC BY-NC 4.0 al checkpoint por las voces de referencia que incluye. La Fish Audio Research License define como comerciales el uso interno en la empresa, los servicios alojados y los productos que generan ingresos, y exige un acuerdo escrito aparte. Ninguno de los dos es un checkpoint comercial de código abierto.
Apache 2.0 es permisiva, pero no concede derechos sobre la identidad de un actor de voz, sobre las grabaciones de referencia de un cliente ni sobre todas las dependencias de terceros. Conserve registros de consentimiento y de procedencia de cada voz en producción.
¿Qué TTS autoalojable es adecuado para el alemán?
La evidencia de idiomas acota la lista, pero no acredita la calidad en producción. KugelAudio 0 Open, Voxtral, Fun-CosyVoice 3, Fish Audio S2 Pro, Piper y Kugel 3 enumeran explícitamente el alemán. Los códigos de idioma oficiales de Kokoro cubren inglés estadounidense y británico, español, francés, hindi, italiano, japonés, portugués de Brasil y chino mandarín, pero no el alemán.
Para el alemán, pruebe compuestos, abreviaturas, fechas, importes, nombres y alternancia de idioma. Pruebe el uso austriaco y el suizo por separado del alemán estándar, y trate el soporte dialectal como un requisito aparte. Una etiqueta genérica de no dice nada sobre el bávaro, el suabo o el bajo alemán. Nuestra guía de selección de alemán y dialectos explica cómo construir ese conjunto de escucha.
¿Qué hardware necesitan los modelos de TTS autoalojados?
No convierta el número de parámetros en un requisito de GPU inventado. La memoria depende también de la precisión, el vocoder, la caché KV, la duración del audio de referencia, el tamaño de lote, los grafos CUDA y el runtime de servicio. Voxtral publica un mínimo claro de 16 GB de memoria de GPU para sus pesos en BF16 por la vía documentada de vLLM-Omni. La ficha de KugelAudio 0 Open documenta unos 19 GB de VRAM para su implementación de referencia y señala que eliminar los pesos del codificador no utilizados puede reducir esa cifra.
La receta actual de Fish Audio para vLLM-Omni sirve como configuración de referencia, no como mínimo: registra un uso máximo de unos 49 GiB en una A800 de 80 GB. CosyVoice y Kokoro publican los tamaños de los modelos, pero ninguna indicación comparable de memoria mínima. Las voces de Piper van de modelos locales pequeños a paquetes de voz mayores, así que mida el archivo .onnx y el runtime exactos.
Para producción, registre la memoria máxima y el primer audio reproducible con la concurrencia requerida. Pruebe después entradas largas, referencias de voz clonada, cancelaciones y recuperación tras quedarse sin memoria. Reserve capacidad para una réplica caliente o asuma el tiempo de recuperación tras el fallo de un dispositivo.
¿Garantiza baja latencia un soporte de streaming documentado?
No. Voxtral documenta inferencia por streaming y por lotes mediante vLLM-Omni. CosyVoice 3 documenta bi-streaming de entrada de texto y salida de audio. Fish Audio S2 Pro incluye una vía de streaming con SGLang, y el servicio comercial Kugel 3 documenta streaming tanto de entrada como de salida. La ficha actual de KugelAudio 0 Open muestra, en cambio, generación por lotes. Estas afirmaciones acreditan un mecanismo admitido, no una garantía de latencia en su hardware.
La API de Python de Kokoro devuelve segmentos generados y la de Piper devuelve fragmentos de audio, pero eso por sí solo no demuestra entrada de texto incremental, contrapresión, cancelación rápida ni latencia estable bajo concurrencia. Pruebe el transporte completo y el reproductor de audio. Las cifras de benchmark de los proveedores no son directamente comparables cuando difieren el hardware, la longitud de la entrada, el audio de referencia y la definición de latencia.
¿Cuánto cuesta realmente un TTS autoalojado?
Use una carga de trabajo de un año, no un precio suelto por hora de GPU. Incluya las réplicas ociosas, el almacenamiento de los modelos, el escaneo de imágenes, las actualizaciones, la monitorización, las alertas, las pruebas de carga, la respuesta de seguridad y el ingeniero que se ocupa de las incidencias. Añada la adquisición de voces, el trabajo de pronunciación y la revisión de licencias.
Compare las alternativas con el mismo volumen de audio, la misma concurrencia máxima, el mismo objetivo de disponibilidad y el mismo nivel de soporte. Un checkpoint permisivo puede tener el coste de licencia más bajo y el coste de ingeniería más alto. Una oferta comercial autoalojada puede costar más en cuotas, pero elimina el trabajo de servicio y conserva el límite de red del cliente.
¿Cómo deberían los equipos preseleccionar y desplegar un modelo?
- Registre el commit exacto del repositorio, el identificador del checkpoint y el recurso de voz.
- Apruebe las condiciones del código, los pesos, las voces y la salida para el uso previsto.
- Descarte los candidatos que no tengan el idioma o la interfaz de despliegue requeridos.
- Ejecute un único conjunto compartido de pronunciación y de escucha con nativos.
- Mida el primer audio reproducible, el rendimiento, la memoria máxima y la tasa de errores en el hardware de destino.
- Pruebe la cancelación, la sobrecarga, el reinicio, la actualización progresiva y la reversión.
- Documente los logs, las trazas, las cachés, las copias de seguridad, la telemetría y el acceso de soporte.
- Asigne un responsable de los parches de seguridad, las actualizaciones del modelo y las incidencias.
Fije cada artefacto aprobado por versión o por digest. Que un repositorio cambie de organización o de licencia no debería alterar en silencio una compilación de producción. El repositorio actual de Fish Speech usa ahora S2 Pro en su guía rápida, así que en esta guía no se emplea el antiguo S1-mini. El proyecto CosyVoice reside ahora en la organización QwenAudio, aunque su antigua URL de FunAudioLLM redirige allí. Piper es el ejemplo de licencia más claro: el antiguo repositorio rhasspy/piper con licencia MIT fue archivado en octubre de 2025, el desarrollo se trasladó al repositorio OHF-Voice/piper1-gpl bajo GPL-3.0, y ese proyecto actual busca mantenedores.
En despliegues sensibles a la privacidad, audite además la ruta completa de los datos. El autoalojamiento puede mantener el texto, el audio y las voces de referencia dentro de la infraestructura del cliente, pero los logs o la telemetría externa pueden echar por tierra ese diseño. Consulte la guía de infraestructura on-premise y control de datos y la lista de comprobación de preparación para producción.
La vía autoalojada documentada de KugelAudio se entrega en Kubernetes con un chart de Helm, una clave de licencia y soporte durante el despliegue. Es una opción comercial, no un modelo de código abierto. Consulte la documentación de despliegue o contacte con el equipo.
Preguntas frecuentes
¿Cuál es el mejor TTS de código abierto?
Esta guía no designa un ganador de calidad. Kokoro es la base permisiva más pequeña de las enumeradas, KugelAudio 0 Open se centra en idiomas europeos y CosyVoice 3 declara explícitamente el alemán y el bi-streaming. Elija solo después de una prueba de escucha común y de mediciones de despliegue.
¿Puedo autoalojar síntesis de voz con fines comerciales?
Sí, cuando todas las licencias implicadas permitan el uso previsto. Los checkpoints bajo Apache 2.0, como Kokoro y CosyVoice, permiten el uso comercial con sujeción a sus condiciones. El checkpoint publicado de Voxtral no es comercial, y Fish Audio exige un acuerdo comercial aparte.
¿Qué TTS funciona en CPU?
Piper es un runtime local de ONNX, y la demo oficial de Kokoro incluye una vía en CPU. Eso demuestra que se ejecuta, no el rendimiento en producción. Mida el runtime, la voz, la longitud del texto y la concurrencia exactos antes de elegir el hardware.
¿Cuál es el mejor TTS autoalojable en alemán?
Aquí no se publica ningún resultado de calidad en alemán. Empiece por los candidatos que declaran oficialmente el alemán y pruebe después la normalización, los nombres, los compuestos, la alternancia de idioma y la variedad regional requerida con oyentes nativos.
¿Ofrece retención cero un TTS autoalojado?
Permite una retención controlada por el cliente; por sí solo no demuestra retención cero. Revise los logs de la aplicación, las trazas, las cachés, las copias de seguridad, los volcados de fallos, la telemetría, las comprobaciones de licencia y el acceso de soporte.
¿Es Voxtral TTS código abierto comercial?
No. La ficha oficial del modelo Voxtral-4B-TTS-2603 etiqueta el checkpoint como CC BY-NC 4.0. Trátelo como una publicación de pesos abiertos no comercial salvo que obtenga derechos aparte que cubran el uso previsto.
Build with KugelAudio
Put European voice infrastructure into production.
Use the EU endpoint or discuss a customer-operated Kubernetes deployment.