All articles

Engineering

Las mejores APIs de síntesis de voz para desarrolladores en 2026

Una comparación de APIs de TTS pensada para desarrolladores, centrada en el comportamiento del streaming, las marcas de tiempo, la normalización, el despliegue y una medición honesta de la latencia.

Viktor Presber13 min read
Una forma de onda sintética que fluye a través de nodos de API conectados
On this page

Ideas clave

  • No hay un ganador global defendible sin un único corpus de prueba, región de cliente, formato de audio, perfil de carga y protocolo de escucha ciega.
  • Trate el identificador del modelo, el transporte, la voz y la región como parte del producto. El nombre de un proveedor por sí solo no es una configuración reproducible.
  • Las cinco APIs usan tres unidades de facturación distintas: tiempo de audio generado, caracteres o créditos, y tokens de entrada/salida. Los precios de portada no son directamente comparables.
  • «Streaming» puede significar una respuesta HTTP entregada por fragmentos, eventos enviados por el servidor o un WebSocket bidireccional que acepta texto parcial. Verifique el comportamiento exacto que necesita su aplicación.
  • Un endpoint alojado en la UE, la retención cero de datos, la nube privada y el autoalojamiento son controles distintos. Incluya cada control necesario en el contrato y pruébelo.

Última actualización: 10 de agosto de 2026. La documentación sobre modelos, precios, transporte, idiomas, clonación, despliegue, retención y cuotas se volvió a comprobar en esa fecha.

¿Cuáles son las mejores APIs de TTS para desarrolladores en 2026?

La respuesta útil es una lista corta, no una clasificación. Empiece por los requisitos innegociables, como el autoalojamiento comercial, un idioma concreto, la entrada de texto parcial, la clonación de voz o un modo de retención. Después evalúe solo a los proveedores que superen esos filtros.

API y oferta actualTransporte y SDKs oficialesIdiomas y clonaciónUnidad de precio públicaDespliegue y retenciónIdóneo para
KugelAudio kugel-3Respuesta de audio por HTTP; salida por WebSocket, entrada de texto parcial y sesiones multicontexto; documentación de SDK para Python, TypeScript/JavaScript y Java26 idiomas en un solo modelo; clonación de voz personalizada€0.07 por minuto generadoEndpoint con enrutamiento geográfico o directo en la UE; autoalojamiento comercial con Kubernetes/Helm. Verifique las condiciones de retención del servicio alojado; el autoalojamiento sitúa el almacenamiento de las cargas útiles en el entorno del clienteEquipos que necesitan un mismo contrato de API para despliegues alojados en la UE y on-premise
Alias de la API de Mistral Voxtral TTS voxtral-mini-tts-latestPOST /v1/audio/speech, con salida por flujo de eventos; SDKs oficiales de Python y TypeScript9 idiomas; voces predefinidas, voces personalizadas guardadas o audio de referencia por petición$0.016 por cada 1.000 caracteres en la APILos datos de la API se alojan en la UE por defecto, con posibles transferencias temporales según la función y el subencargado; el plan Scale admite ZDR previa solicitud para el endpoint sin estado /v1/audio/speech. Los pesos aparte de Voxtral-4B-TTS-2603 pueden autoalojarse bajo CC BY-NC 4.0, que no permite el uso comercialPrototipar una voz personalizada o evaluar pesos inspeccionables no comerciales
ElevenLabs eleven_v3, eleven_flash_v2_5 y eleven_multilingual_v2HTTP y streaming por HTTP; WebSocket con texto parcial en los modelos compatibles, pero no en eleven_v3; bibliotecas oficiales de Python y Node.jsMás de 70 idiomas en v3, 32 en Flash v2.5 y 29 en Multilingual v2; clonación instantánea y profesionalCréditos de suscripción: Flash v2.5 consume 0,5 créditos por carácter en los planes de autoservicio y Multilingual v2 consume 1; las tarifas de v3 en la web y en la API difierenSe documentan la residencia empresarial en la UE y el ZRM para determinados clientes empresariales; el despliegue privado se ofrece a través de AWS Marketplace y SageMakerUn catálogo amplio de voces, la salida expresiva de v3 o herramientas creativas maduras
Cartesia sonic-3.5Bytes por HTTP en streaming, SSE y WebSocket multiplexado; SDKs oficiales de Python y TypeScript/JavaScript42 idiomas; clonación instantánea en Pro y clonación profesional en Startup o superiorCréditos mensuales vinculados al tiempo de audio generado; Pro indica 100.000 créditos como unos 133 minutos de Sonic 3.5API alojada; aquí no se afirma ningún compromiso de residencia. El ZDR empresarial cubre la entrada y la salida de TTS, pero excluye los flujos de clonación de vozStreaming bidireccional con contextos explícitos, cancelación y marcas de tiempo
Gemini gemini-3.1-flash-tts-previewAPI de Interactions con salida en streaming; SDKs oficiales de Google GenAI para Python y JavaScript, más REST78 idiomas listados y 30 voces predefinidas; no se documenta ningún flujo de clonación de voz personalizada para esta API$1 por millón de tokens de texto de entrada más $20 por millón de tokens de audio de salida; el audio son 25 tokens por segundoAPI en vista previa alojada por Google; aquí no se afirma ningún compromiso de residencia en la UE. El contenido del servicio de pago no se usa para mejorar productos; el almacenamiento de Interactions está activado por defecto y debe desactivarse con store=false. El ZDR del proyecto requiere aprobación y configuración adicionalInterpretación dirigida por prompts, guiones a dos voces y equipos que ya usan la API de Gemini

Estas filas describen deliberadamente ofertas concretas y actuales, no la plataforma completa de cada proveedor. Las referencias principales son la oferta de idiomas de KugelAudio, la ficha del modelo Kugel 3, la documentación de Voxtral TTS, la lista de modelos de ElevenLabs, la página del modelo Sonic 3.5 de Cartesia y la guía de TTS de Gemini.

Los detalles de despliegue y privacidad de la tabla proceden de los propios controles de los proveedores, no de páginas genéricas de seguridad:

¿Cómo se integra el TTS de KugelAudio?

Use una variable de entorno para la credencial y fije la región explícitamente cuando el tráfico deba ir al endpoint directo de la UE:

import os

from kugelaudio import KugelAudio

client = KugelAudio(
    api_key=os.environ["KUGELAUDIO_API_KEY"],
    region="eu",
)

audio = client.tts.generate(
    text="Guten Tag. Wie kann ich Ihnen helfen?",
    model_id="kugel-3",
)
audio.save("greeting.wav")

Para el texto parcial que llega de un LLM, use una sesión de streaming en lugar de llamar a generate repetidamente. Reutilice un cliente ya conectado, haga flush al final de cada turno y cancele el turno activo cuando el interlocutor interrumpa. La guía rápida de Python cubre la reutilización de la conexión, la guía de streaming cubre el ciclo de vida del turno y las marcas de tiempo, y la guía de autoalojamiento muestra cómo apuntar el mismo SDK a un despliegue del cliente.

¿Qué API de TTS tiene la menor latencia?

Las cifras públicas no son comparables. Mistral distingue el tiempo de procesamiento del modelo del tiempo de la API hasta el primer audio, y reporta comportamientos distintos para PCM y MP3. ElevenLabs indica que su cifra de Flash excluye la latencia de la aplicación y de la red. Cartesia expone el step_time del servidor por fragmento, mientras que KugelAudio distingue el TTFA de inferencia en el servidor de la latencia observada por el cliente. Google describe sus modelos de TTS como de baja latencia sin publicar una medición entre proveedores bajo el mismo límite.

Mida desde el proceso de su aplicación hasta el primer fotograma reproducible, no hasta el primer byte. Una respuesta en MP3 puede entregar bytes antes de que el decodificador tenga datos suficientes para reproducir, mientras que el PCM sin comprimir suele poder reproducirse de inmediato. Registre estos eventos por separado:

  1. DNS y TLS completados;
  2. petición o fragmento de texto enviado;
  3. primer byte de respuesta recibido;
  4. primer fotograma de audio decodificable disponible;
  5. comienza la reproducción;
  6. llega el audio final; y
  7. se confirma la cancelación y se detiene el audio obsoleto.

Ejecute las conexiones en frío y las reutilizadas como escenarios separados. Publique p50, p90, p99, tiempos de espera agotados y reintentos para entradas cortas, medias y largas. Para un protocolo reproducible, use la guía interna de benchmark de TTS en alemán en lugar de copiar la cifra de latencia aislada de un proveedor.

¿Qué API de TTS es la más barata?

Ningún proveedor es el más barato para todas las cargas de trabajo. En la fecha de esta revisión, KugelAudio cobra por minuto generado, Mistral por carácter de entrada, ElevenLabs por créditos por carácter según el modelo, Cartesia por créditos vinculados al tiempo de audio generado y Gemini por tokens de entrada y de salida. Esas unidades reaccionan de forma distinta a las pausas largas, la velocidad de habla, el marcado, los reintentos y el audio regenerado.

Por ejemplo, Gemini 3.1 Flash TTS factura el audio a 25 tokens por segundo, así que sus $20 por millón de tokens de salida equivalen a $0.03 por minuto generado, sin contar los tokens de entrada. Ese cálculo es útil, pero no es un coste mensual total: las cuotas de la vista previa, las peticiones fallidas, los mínimos del plan, el almacenamiento, la salida de datos y el tiempo de ingeniería siguen contando. Use los precios oficiales de KugelAudio, el precio de lanzamiento de Mistral, las reglas de créditos de ElevenLabs, los precios de Cartesia y los precios de Gemini como entradas de un único modelo de carga de trabajo.

¿Qué API de TTS es mejor para el alemán?

Este artículo no dispone de resultados ciegos comunes en alemán, así que no designa un ganador. Las cinco filas documentan soporte de alemán, pero una entrada en una lista de idiomas no demuestra que la pronunciación del texto que produce su aplicación sea correcta.

Construya un conjunto de aceptación en alemán a partir de ejemplos con forma de producción: fechas, importes, decimales, números de teléfono, IBAN, abreviaturas, nombres de calles, compuestos, alternancia con el inglés y cualquier variedad regional necesaria. Mantenga fijos el identificador exacto del modelo y la voz. Pida a oyentes nativos que puntúen la inteligibilidad, la naturalidad, la adecuación del acento y los errores que cambian el significado sin ver el nombre del proveedor. Compare también los controles de pronunciación y la normalización, porque leer sistemáticamente bien 1.234,56 € puede importar más que una puntuación media de preferencia más alta.

¿Qué deberían probar los desarrolladores antes de elegir una API?

Use una única matriz de aceptación con umbrales de apto/no apto acordados antes de escuchar:

PruebaQué registrarEjemplo de criterio de publicación
Fidelidad de la transcripciónsustituciones, omisiones, errores en números y nombresNingún error que cambie el significado en los guiones críticos
Habla percibidavaloraciones ciegas de oyentes por configuración regional y caso de usoMediana objetivo y sin valores atípicos graves
Streamingprimer fotograma reproducible, cortes, orden, marcador finalSin audio reordenado ni duplicado
Interrupcióncancelar durante el primer fragmento, el intermedio y el finalSin habla obsoleta una vez agotado el margen de cancelación
Comportamiento de colap50/p90/p99, tiempos de espera agotados, 429, 5xx, reintentosEl p99 y la tasa de fallos se mantienen dentro del presupuesto de la interacción
Contrato de salidacódec, frecuencia de muestreo, marcas de tiempo, sonoridadSe decodifica directamente en la ruta de reproducción de producción
Ciclo de vida de la vozconsentimiento, creación, listado, revocación, borradoLas voces y muestras borradas dejan de poder usarse
Privacidadregión del endpoint, logs, historial de cargas útiles, borradoEl comportamiento observado coincide con el contrato de encargo y con la configuración

Los límites de velocidad exigen una prueba de carga, no una suposición. ElevenLabs y Cartesia publican la concurrencia por plan y los límites de contexto. Mistral aplica niveles de RPS y de tokens por organización y por modelo, mientras que Gemini vincula los límites al nivel de uso del proyecto y advierte de que los modelos en vista previa están más restringidos. KugelAudio documenta las respuestas 429 y la cabecera Retry-After cuando está disponible en su referencia de API. Consulte los límites de la cuenta o del contrato que use en producción y verifique después el comportamiento en colas y en sobrecarga. No reintente nunca un 429 de inmediato en un bucle cerrado.

¿De qué debe encargarse un adaptador de TTS en producción?

Mantenga los campos propios de cada proveedor detrás de una interfaz pequeña, pero no reduzca todos los proveedores a una llamada de mínimo común denominador del tipo synthesize(text). El adaptador debería exponer las capacidades de las que realmente depende la aplicación:

  • un identificador fijado de modelo y de voz del proveedor;
  • la generación con texto completo y con texto parcial como métodos distintos;
  • el códec solicitado, la frecuencia de muestreo, el idioma y los controles de pronunciación;
  • eventos estructurados para el audio, las marcas de tiempo, la finalización y el identificador de petición del proveedor;
  • una cancelación explícita con confirmación;
  • errores tipados para autenticación, entrada no válida, modelo no disponible, cuota, tiempo de espera agotado, fallo del proveedor y cancelación; y
  • marcas de tiempo medidas en el cliente para la petición enviada, el primer byte, el primer fotograma reproducible y la finalización.

No sustituya la voz por otra ni devuelva silencio cuando falle la síntesis. Reintente solo los fallos transitorios, respete Retry-After y deténgase cuando el plazo restante de la interacción no permita otro intento. Registre el modelo, la voz, la región, el formato, el estado y el identificador de petición del proveedor, pero mantenga el texto del usuario y el audio fuera de los logs rutinarios salvo que la política de retención los permita explícitamente.

¿Cómo pueden los desarrolladores comparar costes de forma justa?

Reproduzca un mes representativo de texto anonimizado en cada candidato o use duraciones de salida medidas sobre el mismo corpus. Calcule tanto la factura marginal de uso como la factura mensual total. Una métrica común útil es:

all-in cost per generated hour =
  (plan + usage + regional/private deployment + egress + operations) /
  successful generated seconds * 3600

Lleve la cuenta por separado de las peticiones fallidas, canceladas y regeneradas para que su coste no desaparezca dentro de la media. En el autoalojamiento, incluya la capacidad de GPU reservada, el margen ocioso, las réplicas necesarias para el objetivo de p99, las actualizaciones, la monitorización y la guardia de incidencias. La guía de TTS autoalojado explica los requisitos de licencia y de coste operativo; la guía de infraestructura on-premise distingue el alojamiento en la UE, el ZDR y los controles on-premise.

¿Qué limitaciones tiene esta comparación?

El autor trabaja para KugelAudio. Es una comparación de capacidades documentadas, no un benchmark de calidad, disponibilidad o latencia. Cubre cinco opciones orientadas a desarrolladores en lugar de todo el mercado, y los precios y condiciones de despliegue empresariales suelen negociarse. Los modelos en vista previa, los alias mutables, las cuotas y los precios públicos pueden cambiar, así que fije versiones de modelo fechadas cuando estén disponibles y repita la comprobación de las fuentes antes de la compra.

Preguntas frecuentes

¿Cuál es la API de TTS más barata?

No hay una respuesta independiente de la carga de trabajo, porque estas APIs facturan por tiempo de audio, caracteres, créditos o tokens. Convierta un corpus representativo a coste por hora generada con éxito e incluya los mínimos del plan, los reintentos y los costes de despliegue.

¿Qué API de TTS tiene la menor latencia?

No existe un resultado público comparable entre estas cinco APIs. Mida el tiempo desde que su cliente envía el texto hasta su primer fotograma reproducible y publique p50, p90 y p99 por separado para conexiones nuevas y reutilizadas.

¿Cuál es la mejor API de TTS para el alemán?

Las cinco ofertas comparadas incluyen alemán, pero este artículo no dispone de un benchmark ciego en alemán que respalde a un ganador. Pruebe sus voces con nombres, números, abreviaturas, compuestos, alternancia de idioma y las variedades regionales necesarias con oyentes nativos.

¿Qué APIs de TTS admiten despliegue on-premise?

KugelAudio documenta un despliegue comercial con Kubernetes/Helm. ElevenLabs documenta un despliegue privado empresarial en la infraestructura de AWS del cliente, mientras que Mistral publica los pesos de Voxtral 4B TTS para autoalojamiento bajo la licencia no comercial CC BY-NC 4.0. El material citado de las APIs de Cartesia y de Gemini no documenta un despliegue de TTS operado por el cliente.

¿Qué API de TTS ofrece retención cero?

ElevenLabs, Cartesia, Mistral y Gemini documentan vías condicionales de ZRM o ZDR, pero los requisitos y las exclusiones difieren. Por ejemplo, Cartesia excluye la clonación, Mistral limita el ZDR a endpoints sin estado concretos y Gemini Interactions exige además store=false; verifique el producto y el contrato exactos en vez de aceptar una etiqueta que abarque toda la plataforma.

¿Admite KugelAudio los dialectos alemanes?

KugelAudio admite el alemán, pero esta comparación no ofrece una matriz pública de calidad por dialecto. Pruebe la variedad regional exacta con oyentes nativos y mantenga la adecuación dialectal separada del soporte genérico del alemán.

Build with KugelAudio

Put European voice infrastructure into production.

Use the EU endpoint or discuss a customer-operated Kubernetes deployment.