Skip to main content
  1. Home
  2. API
  3. Latenza delle API text-to-speech nel 2026: tempo al primo audio, misurato in modo indipendente
Published on •API

Latenza delle API text-to-speech nel 2026: tempo al primo audio, misurato in modo indipendente

Team di Speechify

Team di Speechify


L'API di Speechify offre 300 ms di latenza, voci naturali e oltre 50 lingue

AppleApple Design Award 2025
Oltre 50M di utenti

Due benchmark indipendenti da Speechify hanno misurato il tempo al primo audio del modello SpeechifyAI Simba 3.2 a settembre 2026. Coval ha registrato una mediana di 106 ms nelle 24 ore fino al 24 settembre 2026. Voice Arena ha rilevato 123 ms sulla board US English lo stesso giorno, la mediana più bassa tra i 14 modelli valutati. Questo articolo spiega cosa misurano questi valori, perché il tempo al primo audio è la latenza che conta e come misurarlo dal proprio codice.

I numeri

Benchmark

Cosa misura

Simba 3.2

Quando

Voice Arena, board US English

Tempo mediano al primo audio nel percorso di streaming in tempo reale

123 ms, il più basso tra i 14 modelli valutati

24 settembre 2026

Coval

Tempo mediano al primo audio, incluso l’eventuale silenzio prima del primo campione udibile. Strumento open-source, eseguito ogni 30 minuti da US East

106 ms

24 ore fino al 24 settembre 2026

Traffico di produzione SpeechifyAI (misurazione interna)

Tempo impiegato dall’API per inviare il primo byte audio su richieste reali dei clienti da US East

56 ms p50, 102 ms p90

15 settembre 2026

I due dati indipendenti sono più alti della nostra misurazione interna perché includono la rete tra il server di test e i nostri server, oltre al silenzio iniziale dell’audio. Ogni dato riflette la rilevazione del benchmark nella data indicata. Entrambe le board vengono aggiornate in tempo reale, quindi consulta i valori correnti per avere cifre aggiornate.

Board US English di Voice Arena, 24 settembre 2026

Modello

Tempo mediano al primo audio

SpeechifyAI Simba 3.2 in tempo reale

123 ms

Inworld Realtime TTS 2 Ricerca Preview

168,5 ms

Gradium TTS in tempo reale

236 ms

Cartesia Sonic-3.5 in tempo reale

250 ms

Smallest AI Lightning 3.1 Pro in tempo reale

263,5 ms

Fish Audio S2 Pro in tempo reale

267 ms

Fonte: Voice Arena, dati rilevati il 24 settembre 2026. La board ha testato 14 modelli; qui sono riportati i sei più rapidi.

Perché confrontare il tempo al primo audio

Quando un agente vocale risponde o un’app legge un testo ad alta voce, l’utente aspetta dal momento in cui il testo viene inviato a quello in cui sente il suono. Questa attesa è il tempo al primo audio.

  • Il tempo al primo byte può sembrare migliore di quanto percepito.
  • Lo stream può iniziare con del silenzio e l’utente non sente nulla fino al primo campione udibile. Il tempo al primo audio include anche quel silenzio.
  • Il tempo totale di generazione considera l’ultimo byte.
  • È rilevante se salvi un file, non se ascolti mentre l’audio viene trasmesso in streaming.
  • In una conversazione il margine è minimo.
  • Di norma ci si risponde nel giro di poche centinaia di millisecondi. Un agente vocale deve includere il riconoscimento vocale, il modello linguistico e la sintesi vocale nella stessa pausa, quindi ogni millisecondo perso sulla voce riduce il tempo disponibile per il resto della pipeline.

Come Simba 3.2 è diventato più veloce senza ridurre il modello

Nei dati di Coval, la mediana giornaliera di Simba 3.2 è scesa da 379 ms il 13 settembre 2026 a 116 ms il 18 settembre 2026, una riduzione di circa il 70% in cinque giorni.

Il modello non è stato modificato. I pesi sono rimasti gli stessi, senza distillazione, quantizzazione o una versione "turbo" ridotta. Il miglioramento deriva dal percorso di erogazione intorno al modello:

  • Una nuova build di erogazione su una diversa classe di GPU, con ottimizzazioni a basso livello nello stack di inferenza per far uscire prima l’audio.
  • I controlli su piano, autorizzazione e rate limit vengono risolti tramite cache invece che con richieste live prima del primo byte.
  • Il gateway API opera nella stessa regione delle GPU, su connessioni che restano attive tra una richiesta e l’altra.
  • Sono stati eliminati circa 100 ms di silenzio iniziale. La misura del silenzio iniziale di Coval per Simba 3.2 è passata da 102 ms il 14 settembre a 13 ms.

La qualità è rimasta costante. Nella classifica text-to-speech di Artificial Analysis, Simba 3.2 ha ottenuto un Elo di 1.237 (±14) il 23 settembre 2026, entrando tra i primi cinque su 92 voci di provider; tutti i modelli sopra di lui hanno un costo maggiore.

Come ottenere la latenza più bassa nella tua app

  1. Usa lo streaming.
  2. Chiama
  3. POST /v1/audio/stream
  4. per tutto ciò che va riprodotto mentre viene generato.
  5. POST /v1/audio/speech
  6. risponde solo quando la generazione è completata.
  7. Richiedi Simba 3.2.
  8. Imposta
  9. model
  10. su
  11. simba-3.2
  12. per l’inglese. Se
  13. model
  14. non viene specificato, l’API usa
  15. simba-3.0
  16. .
  17. Riutilizza una sola connessione.
  18. Crea un client HTTP, apri la connessione all’avvio e mantienila per ogni richiesta, così eviti lookup DNS e handshake TCP/TLS a ogni chiamata.
  19. Invia ogni frase completa appena disponibile.
  20. Se usi un modello linguistico a monte, invia ogni frase completa non appena viene generata e riproduci gli stream nell’ordine corretto.
  21. Scegli il formato compatibile con il player.
  22. audio/pcm
  23. a 24 kHz non richiede codifica. Usa MP3 o Ogg Opus quando la banda è il fattore principale.
  24. Esegui l’app vicino all'API.
  25. L’API è erogata da US East, quindi un server in quella zona riduce al minimo la latenza di rete.

Stai lavorando con LiveKit Agents? Questa guida mostra come creare un agente vocale con il plugin Speechify, che trasmette ogni frase non appena prodotta dal modello linguistico. La logica dietro ogni passaggio, con il codice, è spiegata nella documentazione sulla latenza.

Misurala in autonomia

Misura il tempo di arrivo del primo blocco di una risposta in streaming dal tuo ambiente. Per ottenere un dato affidabile:

  • Scarta la prima o le prime due richieste: includono l’apertura della connessione.
  • Varia il testo tra una richiesta e l’altra, come avviene nel traffico reale.
  • Invia le richieste una dopo l’altra, non in parallelo.
  • Esegui almeno 20 richieste e riporta la mediana (p50) e il p90, non la media o il risultato migliore.
  • Misura usando PCM. Con Ogg, i primi byte sono intestazioni, non dati audio.

Ogni risposta in streaming include un header Server-Timing con il valore ttfb, che rappresenta la nostra quota di attesa; il resto dipende dalla rete e dal tuo stack. La documentazione sulla latenza include script Python e TypeScript per effettuare queste misurazioni.

Domande frequenti

Il modello Simba 3.2 di SpeechifyAI ha prodotto il primo byte audio con una mediana di 56 ms e un p90 di 102 ms sul traffico reale da US East il 15 settembre 2026. Benchmark indipendenti hanno registrato 106 ms di mediana (Coval, nelle 24 ore fino al 24 settembre 2026) e 123 ms (Voice Arena, 24 settembre 2026), inclusi la loro rete e il silenzio iniziale.

Sulla board US English di Voice Arena del 24 settembre 2026, Simba 3.2 di SpeechifyAI ha ottenuto la latenza mediana più bassa tra i 14 modelli testati: 123 ms, davanti a Inworld Realtime TTS 2 Research Preview con 168,5 ms. I benchmark vengono aggiornati di continuo, quindi verifica sempre la data di ogni classifica prima di prenderla come riferimento.

Sì. POST /v1/audio/stream invia audio su HTTP mentre viene generato, in PCM, MP3, Ogg Opus o AAC. Il PCM offre la latenza più bassa perché non richiede codifica.

No. SpeechifyAI è l’API per sviluppatori di Speechify, fatturata separatamente rispetto all’app di lettura Speechify; l’abbonamento Reader non include l’uso dell’API. I piani API sono mensili e senza vincoli annuali: piano gratuito con 500.000 caratteri al mese senza carta, poi Starter a $10/mese con uso aggiuntivo a $10 ogni 1M di caratteri, Pro a $99 con $8 e Scale a $499 con $6.

Prova Simba 3.2 su SpeechifyAI: crea una chiave API gratuita e confronta la tua prima richiesta con i dati sopra.

Accedi alle voci più amate di Speechify tramite API: veloce, scalabile e perfetta per gli sviluppatori

Richiedi accesso API
Sparse JavaScript keywords import, from, const, await on a white background

Condividi questo articolo

Team di Speechify

Team di Speechify


Team di Speechify

Speechify

Informazioni su Speechify

Il lettore di sintesi vocale n.1

Speechify è la piattaforma di sintesi vocale leader al mondo, scelta da oltre 50 milioni di utenti e sostenuta da più di 500.000 recensioni a cinque stelle delle sue app di sintesi vocale disponibili per iOS, Android, estensione Chrome, web app e app desktop Mac. Nel 2025, Apple ha premiato Speechify con il prestigioso Apple Design Award al WWDC, definendolo “una risorsa essenziale che aiuta le persone a vivere meglio la propria vita”. Speechify offre più di 1.000 voci naturali in oltre 60 lingue ed è utilizzato in quasi 200 paesi. Tra le voci celebri ci sono Snoop Dogg e Gwyneth Paltrow. Per creatori e aziende, Speechify Studio offre strumenti avanzati tra cui l'AI Voice Generator, la clonazione vocale AI, il doppiaggio AI e il cambia voce AI. Speechify alimenta anche prodotti leader con la sua API di sintesi vocale di alta qualità e dal prezzo conveniente text to speech API. Citato su The Wall Street Journal, CNBC, Forbes, TechCrunch e molte altre importanti testate giornalistiche, Speechify è il principale fornitore di sintesi vocale al mondo. Visita speechify.com/news, speechify.com/blog e speechify.com/press per saperne di più.