Sintesi vocale
Sintesi vocale in italiano: voci AI native
In italiano una consonante doppia è la differenza tra due parole, non una sfumatura d’accento. Le nostre voci italiane sono registrate in italiano, e si sente negli esempi qui sotto.
Ascolto
2 voci AI native in italiano
Ogni clip di questa pagina è stata generata in italiano. Mostriamo ciò che abbiamo davvero registrato invece di riempire la pagina.

Olivia
Registrazione nativa

Nick
Registrazione nativa
Dettagli
Cosa abbiamo curato per questa lingua
Consonanti doppie
Due parole italiane possono differire per una sola lettera, e la differenza sta nella durata, non nel suono. Un modello addestrato sull’inglese la accorcia fino a cancellarla; il nostro è addestrato su italiano parlato, dove quel contrasto porta significato.
Dove cade l’accento
L’accento italiano non è fisso, e spostarlo cambia la parola. I nostri dati in italiano insegnano dove va, invece di puntare sulla penultima sillaba e sperare.
Numeri e importi
Prezzi, date e riferimenti d’ordine vengono espansi in parole italiane prima della sintesi, così una virgola viene letta come separatore decimale e non come una pausa.
Domande frequenti
Text to speech italiano: domande frequenti
Quante voci italiane ci sono?
Questa pagina riproduce 2 voci registrate nativamente in italiano. Sono i campioni italiani che abbiamo davvero; il resto del catalogo può comunque parlare italiano grazie allo stesso modello Kugel 3.
Le consonanti doppie vengono pronunciate correttamente?
Sì, perché il contrasto è presente in tutti i nostri dati di addestramento in italiano. Le parole che risultano ancora sbagliate, di solito nomi di marchi, si correggono una volta sola nel dizionario di pronuncia.
Possiamo usarlo sui nostri server?
Sì. Lo stesso modello gira nel vostro data center, dietro il vostro firewall, con lo stesso SDK e la stessa API del servizio ospitato: di solito è questo che rende possibile un progetto italiano nella pubblica amministrazione o nella sanità.
Portate questa voce nel vostro prodotto
Un’unica API per la sintesi vocale in streaming, un dizionario di pronuncia per il vostro vocabolario e l’hosting nell’UE o nel vostro data center.