Ideas clave
- No hay un ganador global defendible sin un único corpus de prueba, región de cliente, formato de audio, perfil de carga y protocolo de escucha ciega.
- Trate el identificador del modelo, el transporte, la voz y la región como parte del producto. El nombre de un proveedor por sí solo no es una configuración reproducible.
- Las cinco APIs usan tres unidades de facturación distintas: tiempo de audio generado, caracteres o créditos, y tokens de entrada/salida. Los precios de portada no son directamente comparables.
- «Streaming» puede significar una respuesta HTTP entregada por fragmentos, eventos enviados por el servidor o un WebSocket bidireccional que acepta texto parcial. Verifique el comportamiento exacto que necesita su aplicación.
- Un endpoint alojado en la UE, la retención cero de datos, la nube privada y el autoalojamiento son controles distintos. Incluya cada control necesario en el contrato y pruébelo.
Última actualización: 10 de agosto de 2026. La documentación sobre modelos, precios, transporte, idiomas, clonación, despliegue, retención y cuotas se volvió a comprobar en esa fecha.
¿Cuáles son las mejores APIs de TTS para desarrolladores en 2026?
La respuesta útil es una lista corta, no una clasificación. Empiece por los requisitos innegociables, como el autoalojamiento comercial, un idioma concreto, la entrada de texto parcial, la clonación de voz o un modo de retención. Después evalúe solo a los proveedores que superen esos filtros.
Estas filas describen deliberadamente ofertas concretas y actuales, no la plataforma completa de cada proveedor. Las referencias principales son la oferta de idiomas de KugelAudio, la ficha del modelo Kugel 3, la documentación de Voxtral TTS, la lista de modelos de ElevenLabs, la página del modelo Sonic 3.5 de Cartesia y la guía de TTS de Gemini.
Los detalles de despliegue y privacidad de la tabla proceden de los propios controles de los proveedores, no de páginas genéricas de seguridad:
- KugelAudio: regiones, autoalojamiento y clonación de voz.
- Mistral: endpoint de habla, SDKs oficiales, ubicación de datos por defecto, requisitos del ZDR y la ficha del modelo de pesos abiertos.
- ElevenLabs: bibliotecas REST, residencia empresarial en la UE, alcance del ZRM y despliegue privado.
- Cartesia: comparación de endpoints, bibliotecas cliente y alcance del ZDR.
- Google: almacenamiento de Interactions, ZDR de la API para desarrolladores de Gemini y condiciones de datos del servicio de pago.
¿Cómo se integra el TTS de KugelAudio?
Use una variable de entorno para la credencial y fije la región explícitamente cuando el tráfico deba ir al endpoint directo de la UE:
import os
from kugelaudio import KugelAudio
client = KugelAudio(
api_key=os.environ["KUGELAUDIO_API_KEY"],
region="eu",
)
audio = client.tts.generate(
text="Guten Tag. Wie kann ich Ihnen helfen?",
model_id="kugel-3",
)
audio.save("greeting.wav")
Para el texto parcial que llega de un LLM, use una sesión de streaming en lugar de llamar a generate repetidamente. Reutilice un cliente ya conectado, haga flush al final de cada turno y cancele el turno activo cuando el interlocutor interrumpa. La guía rápida de Python cubre la reutilización de la conexión, la guía de streaming cubre el ciclo de vida del turno y las marcas de tiempo, y la guía de autoalojamiento muestra cómo apuntar el mismo SDK a un despliegue del cliente.
¿Qué API de TTS tiene la menor latencia?
Las cifras públicas no son comparables. Mistral distingue el tiempo de procesamiento del modelo del tiempo de la API hasta el primer audio, y reporta comportamientos distintos para PCM y MP3. ElevenLabs indica que su cifra de Flash excluye la latencia de la aplicación y de la red. Cartesia expone el step_time del servidor por fragmento, mientras que KugelAudio distingue el TTFA de inferencia en el servidor de la latencia observada por el cliente. Google describe sus modelos de TTS como de baja latencia sin publicar una medición entre proveedores bajo el mismo límite.
Mida desde el proceso de su aplicación hasta el primer fotograma reproducible, no hasta el primer byte. Una respuesta en MP3 puede entregar bytes antes de que el decodificador tenga datos suficientes para reproducir, mientras que el PCM sin comprimir suele poder reproducirse de inmediato. Registre estos eventos por separado:
- DNS y TLS completados;
- petición o fragmento de texto enviado;
- primer byte de respuesta recibido;
- primer fotograma de audio decodificable disponible;
- comienza la reproducción;
- llega el audio final; y
- se confirma la cancelación y se detiene el audio obsoleto.
Ejecute las conexiones en frío y las reutilizadas como escenarios separados. Publique p50, p90, p99, tiempos de espera agotados y reintentos para entradas cortas, medias y largas. Para un protocolo reproducible, use la guía interna de benchmark de TTS en alemán en lugar de copiar la cifra de latencia aislada de un proveedor.
¿Qué API de TTS es la más barata?
Ningún proveedor es el más barato para todas las cargas de trabajo. En la fecha de esta revisión, KugelAudio cobra por minuto generado, Mistral por carácter de entrada, ElevenLabs por créditos por carácter según el modelo, Cartesia por créditos vinculados al tiempo de audio generado y Gemini por tokens de entrada y de salida. Esas unidades reaccionan de forma distinta a las pausas largas, la velocidad de habla, el marcado, los reintentos y el audio regenerado.
Por ejemplo, Gemini 3.1 Flash TTS factura el audio a 25 tokens por segundo, así que sus $20 por millón de tokens de salida equivalen a $0.03 por minuto generado, sin contar los tokens de entrada. Ese cálculo es útil, pero no es un coste mensual total: las cuotas de la vista previa, las peticiones fallidas, los mínimos del plan, el almacenamiento, la salida de datos y el tiempo de ingeniería siguen contando. Use los precios oficiales de KugelAudio, el precio de lanzamiento de Mistral, las reglas de créditos de ElevenLabs, los precios de Cartesia y los precios de Gemini como entradas de un único modelo de carga de trabajo.
¿Qué API de TTS es mejor para el alemán?
Este artículo no dispone de resultados ciegos comunes en alemán, así que no designa un ganador. Las cinco filas documentan soporte de alemán, pero una entrada en una lista de idiomas no demuestra que la pronunciación del texto que produce su aplicación sea correcta.
Construya un conjunto de aceptación en alemán a partir de ejemplos con forma de producción: fechas, importes, decimales, números de teléfono, IBAN, abreviaturas, nombres de calles, compuestos, alternancia con el inglés y cualquier variedad regional necesaria. Mantenga fijos el identificador exacto del modelo y la voz. Pida a oyentes nativos que puntúen la inteligibilidad, la naturalidad, la adecuación del acento y los errores que cambian el significado sin ver el nombre del proveedor. Compare también los controles de pronunciación y la normalización, porque leer sistemáticamente bien 1.234,56 € puede importar más que una puntuación media de preferencia más alta.
¿Qué deberían probar los desarrolladores antes de elegir una API?
Use una única matriz de aceptación con umbrales de apto/no apto acordados antes de escuchar:
Los límites de velocidad exigen una prueba de carga, no una suposición. ElevenLabs y Cartesia publican la concurrencia por plan y los límites de contexto. Mistral aplica niveles de RPS y de tokens por organización y por modelo, mientras que Gemini vincula los límites al nivel de uso del proyecto y advierte de que los modelos en vista previa están más restringidos. KugelAudio documenta las respuestas 429 y la cabecera Retry-After cuando está disponible en su referencia de API. Consulte los límites de la cuenta o del contrato que use en producción y verifique después el comportamiento en colas y en sobrecarga. No reintente nunca un 429 de inmediato en un bucle cerrado.
¿De qué debe encargarse un adaptador de TTS en producción?
Mantenga los campos propios de cada proveedor detrás de una interfaz pequeña, pero no reduzca todos los proveedores a una llamada de mínimo común denominador del tipo synthesize(text). El adaptador debería exponer las capacidades de las que realmente depende la aplicación:
- un identificador fijado de modelo y de voz del proveedor;
- la generación con texto completo y con texto parcial como métodos distintos;
- el códec solicitado, la frecuencia de muestreo, el idioma y los controles de pronunciación;
- eventos estructurados para el audio, las marcas de tiempo, la finalización y el identificador de petición del proveedor;
- una cancelación explícita con confirmación;
- errores tipados para autenticación, entrada no válida, modelo no disponible, cuota, tiempo de espera agotado, fallo del proveedor y cancelación; y
- marcas de tiempo medidas en el cliente para la petición enviada, el primer byte, el primer fotograma reproducible y la finalización.
No sustituya la voz por otra ni devuelva silencio cuando falle la síntesis. Reintente solo los fallos transitorios, respete Retry-After y deténgase cuando el plazo restante de la interacción no permita otro intento. Registre el modelo, la voz, la región, el formato, el estado y el identificador de petición del proveedor, pero mantenga el texto del usuario y el audio fuera de los logs rutinarios salvo que la política de retención los permita explícitamente.
¿Cómo pueden los desarrolladores comparar costes de forma justa?
Reproduzca un mes representativo de texto anonimizado en cada candidato o use duraciones de salida medidas sobre el mismo corpus. Calcule tanto la factura marginal de uso como la factura mensual total. Una métrica común útil es:
all-in cost per generated hour =
(plan + usage + regional/private deployment + egress + operations) /
successful generated seconds * 3600
Lleve la cuenta por separado de las peticiones fallidas, canceladas y regeneradas para que su coste no desaparezca dentro de la media. En el autoalojamiento, incluya la capacidad de GPU reservada, el margen ocioso, las réplicas necesarias para el objetivo de p99, las actualizaciones, la monitorización y la guardia de incidencias. La guía de TTS autoalojado explica los requisitos de licencia y de coste operativo; la guía de infraestructura on-premise distingue el alojamiento en la UE, el ZDR y los controles on-premise.
¿Qué limitaciones tiene esta comparación?
El autor trabaja para KugelAudio. Es una comparación de capacidades documentadas, no un benchmark de calidad, disponibilidad o latencia. Cubre cinco opciones orientadas a desarrolladores en lugar de todo el mercado, y los precios y condiciones de despliegue empresariales suelen negociarse. Los modelos en vista previa, los alias mutables, las cuotas y los precios públicos pueden cambiar, así que fije versiones de modelo fechadas cuando estén disponibles y repita la comprobación de las fuentes antes de la compra.
Preguntas frecuentes
¿Cuál es la API de TTS más barata?
No hay una respuesta independiente de la carga de trabajo, porque estas APIs facturan por tiempo de audio, caracteres, créditos o tokens. Convierta un corpus representativo a coste por hora generada con éxito e incluya los mínimos del plan, los reintentos y los costes de despliegue.
¿Qué API de TTS tiene la menor latencia?
No existe un resultado público comparable entre estas cinco APIs. Mida el tiempo desde que su cliente envía el texto hasta su primer fotograma reproducible y publique p50, p90 y p99 por separado para conexiones nuevas y reutilizadas.
¿Cuál es la mejor API de TTS para el alemán?
Las cinco ofertas comparadas incluyen alemán, pero este artículo no dispone de un benchmark ciego en alemán que respalde a un ganador. Pruebe sus voces con nombres, números, abreviaturas, compuestos, alternancia de idioma y las variedades regionales necesarias con oyentes nativos.
¿Qué APIs de TTS admiten despliegue on-premise?
KugelAudio documenta un despliegue comercial con Kubernetes/Helm. ElevenLabs documenta un despliegue privado empresarial en la infraestructura de AWS del cliente, mientras que Mistral publica los pesos de Voxtral 4B TTS para autoalojamiento bajo la licencia no comercial CC BY-NC 4.0. El material citado de las APIs de Cartesia y de Gemini no documenta un despliegue de TTS operado por el cliente.
¿Qué API de TTS ofrece retención cero?
ElevenLabs, Cartesia, Mistral y Gemini documentan vías condicionales de ZRM o ZDR, pero los requisitos y las exclusiones difieren. Por ejemplo, Cartesia excluye la clonación, Mistral limita el ZDR a endpoints sin estado concretos y Gemini Interactions exige además store=false; verifique el producto y el contrato exactos en vez de aceptar una etiqueta que abarque toda la plataforma.
¿Admite KugelAudio los dialectos alemanes?
KugelAudio admite el alemán, pero esta comparación no ofrece una matriz pública de calidad por dialecto. Pruebe la variedad regional exacta con oyentes nativos y mantenga la adecuación dialectal separada del soporte genérico del alemán.
Build with KugelAudio
Put European voice infrastructure into production.
Use the EU endpoint or discuss a customer-operated Kubernetes deployment.