Due benchmark indipendenti da Speechify hanno misurato il tempo al primo audio del modello SpeechifyAI Simba 3.2 a settembre 2026. Coval ha registrato una mediana di 106 ms nelle 24 ore fino al 24 settembre 2026. Voice Arena ha rilevato 123 ms sulla board US English lo stesso giorno, la mediana più bassa tra i 14 modelli valutati. Questo articolo spiega cosa misurano questi valori, perché il tempo al primo audio è la latenza che conta e come misurarlo dal proprio codice.
I numeri
I due dati indipendenti sono più alti della nostra misurazione interna perché includono la rete tra il server di test e i nostri server, oltre al silenzio iniziale dell’audio. Ogni dato riflette la rilevazione del benchmark nella data indicata. Entrambe le board vengono aggiornate in tempo reale, quindi consulta i valori correnti per avere cifre aggiornate.
Board US English di Voice Arena, 24 settembre 2026
Fonte: Voice Arena, dati rilevati il 24 settembre 2026. La board ha testato 14 modelli; qui sono riportati i sei più rapidi.
Perché confrontare il tempo al primo audio
Quando un agente vocale risponde o un’app legge un testo ad alta voce, l’utente aspetta dal momento in cui il testo viene inviato a quello in cui sente il suono. Questa attesa è il tempo al primo audio.
- Il tempo al primo byte può sembrare migliore di quanto percepito.
- Lo stream può iniziare con del silenzio e l’utente non sente nulla fino al primo campione udibile. Il tempo al primo audio include anche quel silenzio.
- Il tempo totale di generazione considera l’ultimo byte.
- È rilevante se salvi un file, non se ascolti mentre l’audio viene trasmesso in streaming.
- In una conversazione il margine è minimo.
- Di norma ci si risponde nel giro di poche centinaia di millisecondi. Un agente vocale deve includere il riconoscimento vocale, il modello linguistico e la sintesi vocale nella stessa pausa, quindi ogni millisecondo perso sulla voce riduce il tempo disponibile per il resto della pipeline.
Come Simba 3.2 è diventato più veloce senza ridurre il modello
Nei dati di Coval, la mediana giornaliera di Simba 3.2 è scesa da 379 ms il 13 settembre 2026 a 116 ms il 18 settembre 2026, una riduzione di circa il 70% in cinque giorni.
Il modello non è stato modificato. I pesi sono rimasti gli stessi, senza distillazione, quantizzazione o una versione "turbo" ridotta. Il miglioramento deriva dal percorso di erogazione intorno al modello:
- Una nuova build di erogazione su una diversa classe di GPU, con ottimizzazioni a basso livello nello stack di inferenza per far uscire prima l’audio.
- I controlli su piano, autorizzazione e rate limit vengono risolti tramite cache invece che con richieste live prima del primo byte.
- Il gateway API opera nella stessa regione delle GPU, su connessioni che restano attive tra una richiesta e l’altra.
- Sono stati eliminati circa 100 ms di silenzio iniziale. La misura del silenzio iniziale di Coval per Simba 3.2 è passata da 102 ms il 14 settembre a 13 ms.
La qualità è rimasta costante. Nella classifica text-to-speech di Artificial Analysis, Simba 3.2 ha ottenuto un Elo di 1.237 (±14) il 23 settembre 2026, entrando tra i primi cinque su 92 voci di provider; tutti i modelli sopra di lui hanno un costo maggiore.
Come ottenere la latenza più bassa nella tua app
- Usa lo streaming.
- Chiama
- POST /v1/audio/stream
- per tutto ciò che va riprodotto mentre viene generato.
- POST /v1/audio/speech
- risponde solo quando la generazione è completata.
- Richiedi Simba 3.2.
- Imposta
- model
- su
- simba-3.2
- per l’inglese. Se
- model
- non viene specificato, l’API usa
- simba-3.0
- .
- Riutilizza una sola connessione.
- Crea un client HTTP, apri la connessione all’avvio e mantienila per ogni richiesta, così eviti lookup DNS e handshake TCP/TLS a ogni chiamata.
- Invia ogni frase completa appena disponibile.
- Se usi un modello linguistico a monte, invia ogni frase completa non appena viene generata e riproduci gli stream nell’ordine corretto.
- Scegli il formato compatibile con il player.
- audio/pcm
- a 24 kHz non richiede codifica. Usa MP3 o Ogg Opus quando la banda è il fattore principale.
- Esegui l’app vicino all'API.
- L’API è erogata da US East, quindi un server in quella zona riduce al minimo la latenza di rete.
Stai lavorando con LiveKit Agents? Questa guida mostra come creare un agente vocale con il plugin Speechify, che trasmette ogni frase non appena prodotta dal modello linguistico. La logica dietro ogni passaggio, con il codice, è spiegata nella documentazione sulla latenza.
Misurala in autonomia
Misura il tempo di arrivo del primo blocco di una risposta in streaming dal tuo ambiente. Per ottenere un dato affidabile:
- Scarta la prima o le prime due richieste: includono l’apertura della connessione.
- Varia il testo tra una richiesta e l’altra, come avviene nel traffico reale.
- Invia le richieste una dopo l’altra, non in parallelo.
- Esegui almeno 20 richieste e riporta la mediana (p50) e il p90, non la media o il risultato migliore.
- Misura usando PCM. Con Ogg, i primi byte sono intestazioni, non dati audio.
Ogni risposta in streaming include un header Server-Timing con il valore ttfb, che rappresenta la nostra quota di attesa; il resto dipende dalla rete e dal tuo stack. La documentazione sulla latenza include script Python e TypeScript per effettuare queste misurazioni.
Domande frequenti
Il modello Simba 3.2 di SpeechifyAI ha prodotto il primo byte audio con una mediana di 56 ms e un p90 di 102 ms sul traffico reale da US East il 15 settembre 2026. Benchmark indipendenti hanno registrato 106 ms di mediana (Coval, nelle 24 ore fino al 24 settembre 2026) e 123 ms (Voice Arena, 24 settembre 2026), inclusi la loro rete e il silenzio iniziale.
Sulla board US English di Voice Arena del 24 settembre 2026, Simba 3.2 di SpeechifyAI ha ottenuto la latenza mediana più bassa tra i 14 modelli testati: 123 ms, davanti a Inworld Realtime TTS 2 Research Preview con 168,5 ms. I benchmark vengono aggiornati di continuo, quindi verifica sempre la data di ogni classifica prima di prenderla come riferimento.
Sì. POST /v1/audio/stream invia audio su HTTP mentre viene generato, in PCM, MP3, Ogg Opus o AAC. Il PCM offre la latenza più bassa perché non richiede codifica.
No. SpeechifyAI è l’API per sviluppatori di Speechify, fatturata separatamente rispetto all’app di lettura Speechify; l’abbonamento Reader non include l’uso dell’API. I piani API sono mensili e senza vincoli annuali: piano gratuito con 500.000 caratteri al mese senza carta, poi Starter a $10/mese con uso aggiuntivo a $10 ogni 1M di caratteri, Pro a $99 con $8 e Scale a $499 con $6.
Prova Simba 3.2 su SpeechifyAI: crea una chiave API gratuita e confronta la tua prima richiesta con i dati sopra.

