Dois benchmarks independentes, sem vínculo com a Speechify, mediram o tempo até o primeiro áudio do modelo Simba 3.2 da SpeechifyAI em setembro de 2026. O Coval registrou mediana de 106 ms nas 24 horas até 24 de setembro de 2026. Já a Voice Arena mediu 123 ms em seu painel de inglês dos EUA no mesmo dia, a menor mediana entre os 14 modelos avaliados. Este artigo explica o que esses números medem, por que o tempo até o primeiro áudio é a métrica de latência ideal para comparação e como medi-lo no seu código.
Os números
As medições independentes aparecem acima das nossas porque incluem a rede entre o testador e nossos servidores, além de qualquer silêncio inicial. Cada número reflete a medição daquele benchmark na data indicada. Ambos os painéis seguem ativos — consulte-os para ver o resultado do dia.
Painel US English da Voice Arena, 24 set 2026
Fonte: Voice Arena, consulta em 24 set 2026. O painel media 14 modelos; os seis mais rápidos estão nesta lista.
Por que o tempo até o primeiro áudio é a melhor métrica para comparar
Quando um agente de voz responde ou um app narra um texto, o usuário conta o tempo desde o envio do texto até ouvir o som. Essa espera é o tempo até o primeiro áudio.
- O tempo até o primeiro byte pode parecer melhor do que a experiência real do usuário.
- Um streaming pode começar com silêncio, e o ouvinte só percebe a resposta quando chega o primeiro som audível. O tempo até o primeiro áudio inclui esse silêncio.
- O tempo total de geração mede a espera até o último byte.
- Isso importa para salvar um arquivo, mas não para quem ouve streaming em tempo real.
- Conversas têm pouca margem.
- Em geral, as pessoas reagem em algumas centenas de milissegundos. Um agente de voz precisa encaixar reconhecimento, modelo de linguagem e síntese nesse intervalo; cada ms gasto no áudio reduz o tempo disponível para o restante da cadeia.
Como o Simba 3.2 ficou mais rápido sem encolher o modelo
Nos dados da Coval, a mediana diária do Simba 3.2 caiu de 379 ms em 13/9/2026 para 116 ms em 18/9/2026 — uma redução de 70% em cinco dias.
O modelo não mudou. Continua com os mesmos pesos, sem distilação, quantização ou uma versão reduzida “turbo”. O ganho veio da camada de entrega ao redor do modelo:
- Nova infraestrutura em outra classe de GPU, além de otimizações na pilha de inferência, para liberar áudio mais cedo.
- Validações de plano, permissão e limites feitas por cache, sem consultas a cada requisição antes do primeiro byte.
- Gateway de API na mesma região das GPUs, com conexões mantidas abertas entre as chamadas.
- Cerca de 100 ms de silêncio inicial foram eliminados. A medição de silêncio da Coval para o Simba 3.2 caiu de 102 ms em 14/9 para apenas 13 ms.
A qualidade foi mantida. No ranking de Ler texto em voz alta do Artificial Analysis, o Simba 3.2 atingiu Elo de 1.237 (±14) em 23/9/2026, ficando entre os cinco melhores de 92 vozes, e os modelos acima dele custam mais caro.
Como obter a menor latência no seu app
- Use streaming.
- POST /v1/audio/stream
- serve para áudios reproduzidos enquanto são gerados.
- POST /v1/audio/speech
- só responde quando o áudio está completo.
- Peça o Simba 3.2.
- Defina
- model
- como
- simba-3.2
- para inglês. Se omitir, a API usa
- simba-3.0
- .
- Reaproveite a conexão.
- Crie um único cliente HTTP, abra a conexão na inicialização e reutilize-a em cada chamada, evitando o custo de DNS, TCP e TLS a cada requisição.
- Envie as frases assim que estiverem prontas.
- Se usar um modelo de linguagem, envie cada frase completa assim que for gerada; reproduza os áudios na ordem.
- Escolha o formato conforme o player.
- audio/pcm
- em 24 kHz dispensa codificação. Use MP3 ou Ogg Opus se a prioridade for economizar banda.
- Fique perto da API.
- A API opera em US East, então seus servidores devem estar nessa região ou próximos dela para reduzir a latência de rede.
Está desenvolvendo com LiveKit Agents? Este guia mostra como montar um agente de voz com o plugin da Speechify, transmitindo frases à medida que o modelo de linguagem as gera. O motivo de cada etapa, com código, está na documentação de latência.
Meça você mesmo
Meça o tempo até o primeiro fragmento da resposta em streaming, a partir do ponto em que seu código roda. Para medir corretamente:
- Descarte uma ou duas primeiras requisições, que incluem a abertura da conexão.
- Varie o texto para simular tráfego real.
- Envie as requisições em sequência, não em paralelo.
- Faça pelo menos 20 chamadas e reporte mediana (p50) e p90, nunca só a média ou o melhor caso isolado.
- Meça com PCM. Com Ogg, os primeiros bytes são cabeçalhos, não áudio.
Cada resposta em streaming traz o header Server-Timing com o valor ttfb, que mostra a parte da espera relativa à nossa infraestrutura — o restante é rede e seu stack. A documentação de latência traz scripts prontos em Python e TypeScript para isso.
Perguntas frequentes
No tráfego de produção em US East em 15/09/2026, o Simba 3.2 da SpeechifyAI enviou o primeiro byte de áudio com mediana de 56 ms e p90 de 102 ms. Benchmarks independentes registraram medianas de 106 ms (Coval, 24h até 24/09) e 123 ms (Voice Arena, 24/09), ambos incluindo rede e silêncio inicial.
No painel US English da Voice Arena em 24/09/2026, o Simba 3.2 da SpeechifyAI teve a menor mediana de tempo até o primeiro áudio entre 14 modelos: 123 ms, à frente do Inworld Realtime TTS 2 Research Preview, com 168,5 ms. Os benchmarks rodam continuamente — confira a data nos rankings antes de decidir.
Sim. POST /v1/audio/stream transmite áudio por HTTP à medida que é gerado, em PCM, MP3, Ogg Opus ou AAC. PCM tem a menor latência, pois não exige codificação.
Não. SpeechifyAI é a API para desenvolvedores da Speechify, com cobrança separada do app de leitura. A assinatura Reader não inclui uso da API. Os planos são mensais e sem fidelidade: plano gratuito com 500.000 caracteres/mês sem cartão, Starter a US$10/mês, adicionais por US$10 a cada 1M de caracteres, Pro a US$99 com US$8 e Scale a US$499 com US$6.
Teste o Simba 3.2 na SpeechifyAI: crie uma chave de API gratuita e compare seu tempo com os dados acima.

