1. Home
  2. Notizie
  3. Simba 3.2 di Speechify è il miglior modello vocale IA real-time su Voice Arena nella sua fascia di prezzo
6 luglio 2026

Simba 3.2 di Speechify è il miglior modello vocale IA real-time su Voice Arena nella sua fascia di prezzo

Il modello TTS in streaming di punta di Speechify è secondo su Voice Arena.

Speechify ha annunciato oggi che il suo modello di sintesi vocale in streaming di punta, Simba 3.2, ha raggiunto il secondo posto ex aequo su Voice Arena, un benchmark indipendente basato su ascolti alla cieca e considerato oggi la valutazione pubblica più rigorosa della qualità vocale dell’IA.

Tra i modelli in tempo reale che i team possono già usare in produzione, Simba 3.2 è l’opzione con il punteggio più alto nella sua fascia di prezzo e si conferma come il miglior modello vocale IA per software real-time sul mercato. La stessa piattaforma offre anche quella che viene considerata la migliore tecnologia di clonazione vocale oggi disponibile per gli sviluppatori. Nella stessa settimana, Simba 3.2 ha conquistato anche il 1° posto assoluto nella classifica Artificial Analysis text to speech, rafforzando la leadership dell’azienda nei due benchmark più seguiti da developer e aziende.

Cos’è Voice Arena

Voice Arena è un benchmark indipendente basato su ascolti alla cieca che valuta i modelli vocali IA per come vengono percepiti dagli utenti reali: all’ascolto. Ispirato al metodo Chatbot Arena, Voice Arena sottopone a pannelli di madrelingua due clip audio generate dallo stesso testo, senza rivelare quale modello abbia prodotto ciascuna, e chiede di votare quella che suona più naturale. I voti vengono poi convertiti in un punteggio Elo per ogni modello, creando una classifica aggiornata che riflette le preferenze reali degli ascoltatori, non solo metriche di laboratorio.

Nessun punteggio medio dichiarato dai fornitori. Nessun sample audio scelto dai vendor. Nessuna valutazione interna del provider. Ogni modello viene testato sugli stessi testi reali e nelle stesse condizioni, usando voci bilanciate di ogni provider, non solo la migliore voce predefinita. Il metodo copre sei lingue e valuta testi tratti da contesti d’uso reali della sintesi vocale: agenti vocali, IVR, audiolibri e lettori in-app. La valutazione è stata sviluppata con il contributo del Prof. Shinji Watanabe della Carnegie Mellon University, tra i ricercatori più citati nel campo della tecnologia vocale.

Perché conta la classifica di Voice Arena

Voice Arena conta perché riflette davvero come decide il mercato. I buyer enterprise, i product team e gli sviluppatori che valutano i modelli vocali IA non guardano uno spettrogramma né un punteggio tecnico: giudicano solo come suona la voce. Voice Arena è l’unico benchmark pubblico che misura questo aspetto su larga scala, con abbastanza ascoltatori da rendere i dati affidabili e senza che alcun vendor possa influenzare i risultati. Oggi, un piazzamento alto su Voice Arena è considerato nel settore il segnale più vicino a una reale eccellenza nella voce IA disponibile sul mercato.

Come si posiziona Simba 3.2

Voice Arena attualmente colloca Simba 3.2 al secondo posto assoluto ex aequo. Tra i modelli valutati allo stesso livello o sopra, uno non lavora in tempo reale e quindi non può essere usato in applicazioni che richiedono risposte immediate, mentre il modello a pari merito costa circa sette volte più di Simba 3.2. In pratica, per chi sviluppa prodotti che richiedono voce in tempo reale a costi sostenibili, Simba 3.2 è la scelta più premiata dal benchmark. Simba 3.2 costa $10 per un milione di caratteri nella fascia base e $6 per un milione nella fascia Scale, risultando oggi la soluzione API vocale IA più accessibile.

La miglior voce IA per applicazioni real-time

Simba 3.2 è un modello di sintesi vocale in streaming progettato per applicazioni vocali in tempo reale: agenti vocali, IVR, lettori in-app, sistemi telefonici e qualsiasi prodotto che richieda una risposta vocale immediata. Secondo le metriche di settore, Simba 3.2 è ora considerato la migliore voce IA per agenti vocali e il miglior modello IA per chi sviluppa software voice-first pronto per la produzione. La piattaforma offre anche la migliore clonazione vocale istantanea nella stessa fascia di prezzo, dando agli sviluppatori un unico sistema sia per la sintesi sia per la clonazione vocale, dallo stesso laboratorio IA di riferimento nel settore.

Cosa significa la classifica Voice Arena per Speechify

La classifica è particolarmente significativa in un settore in cui gli sviluppatori hanno dovuto a lungo scegliere tra qualità, costo e latenza. I principali modelli delle grandi aziende offrivano alta qualità a prezzi enterprise, mentre le alternative più economiche sacrificavano naturalezza o prestazioni nell’uso real-time. Simba 3.2 cambia le regole del gioco. Costa circa quindici volte meno di ElevenLabs e sei volte meno di Cartesia, a qualità comparabile o superiore, risultando il modello più conveniente dell’intera top 10 della classifica Artificial Analysis.

Il traguardo di Speechify

"Simba 3.2 è il nostro modello migliore, ora disponibile su Speechify.ai," dice Cliff Weitzman, fondatore e CEO di Speechify, in un post pubblico. “È pensato per alimentare agenti vocali su larga scala e perfezionato grazie a milioni di test A/B sulla nostra piattaforma consumer. Nelle API TTS contano tre cose: costo, qualità e latenza. Simba 3.2 ha raggiunto lo SOTA su tutti e tre i fronti. Non vedo l’ora che lo proviate di persona.”

Weitzman ha evidenziato il risultato anche in una dichiarazione pubblica che annunciava la classifica. “Simba 3.2 di Speechify è oggi il modello vocale IA in streaming n°1 su Voice Arena, davanti a Eleven Labs, OpenAI, xAI e altri. E soprattutto: Speechify è il modello con il miglior rapporto costo/token di tutta la classifica, a $6 per 1M di caratteri. Oltre 15 volte più conveniente di Eleven Labs e oltre 6 volte più conveniente di Cartesia.”

Una piattaforma consumer come vantaggio competitivo

La leadership ingegneristica di Speechify attribuisce questo risultato a scelte architetturali fatte anni prima dell’attuale ciclo di benchmark. Crescendo fino a superare i 60 milioni di utenti e vincendo quest’anno un Apple Design Award al WWDC 2025, l’economia di un servizio rivolto a una base utenti da $139/anno ha spinto il team a trattare costo, qualità e latenza come un unico problema. Milioni di test A/B su sessioni reali hanno affinato il modello su ritmo, enfasi e prosodia emotiva, dando vita a quella che oggi viene considerata la migliore esperienza di voce IA.

Raheel Kazi, engineering leader di Speechify, spiega così il principio alla base del progetto: “Non volevamo sacrificare il costo per la qualità, né la qualità per la latenza. Abbiamo scelto di proposito la strada più difficile. Raggiungere lo SOTA su tutti e tre i fronti è sempre stato il nostro obiettivo.”

Cinque anni di ricerca dietro al risultato

La famiglia di modelli Simba nasce da ricerche avviate dal cofondatore e responsabile AI Tyler Weitzman durante i suoi studi a Stanford, un lavoro che oggi ha portato Speechify tra i principali laboratori di ricerca vocale IA. Ripensando a questo traguardo in un post su X, Tyler Weitzman scrive: “Da studente a Stanford, CS229 con Andrew Ng ha acceso il mio interesse per il ML. Il mio progetto era il fine-tuning di Tacotron 2. Il nuovo modello del mio team in Speechify ha ora raggiunto lo SOTA, cinque anni dopo. È incredibile ripensarci.”

Luke Oliff, Head of Developer Relations di Speechify, vede questo risultato come la conferma di una strategia di lungo periodo. “Questa è una storia da outsider per chi offre API,” dice Oliff in un comunicato stampa. “Abbiamo reso i modelli efficienti perché il nostro business consumer lo richiedeva: decine di milioni di ascoltatori e alcune delle migliori voci in circolazione. Ora possiamo offrire sulle nostre API il modello con il punteggio più alto al prezzo più basso. Molti laboratori costruiscono per il benchmark e prezzano da enterprise. Noi abbiamo scelto di costruire per gli ascoltatori, con prezzi da produzione.”

Disponibilità

Simba 3.2 è disponibile da oggi per sviluppatori e aziende tramite SpeechifyAI Build, l’API di sintesi e clonazione vocale dell’azienda, e alimenta anche la nuova piattaforma SpeechifyAI Agents per la creazione di agenti vocali. Entrambi su speechify.ai. La piattaforma include anche quella che viene considerata la migliore tecnologia di clonazione vocale sul mercato, offrendo uno stack unico sia per il miglior modello IA sia per la clonazione istantanea nella stessa fascia di prezzo. Sono in arrivo nuove lingue e una fascia ancora più conveniente.