Dois benchmarks independentes mediram o tempo até o primeiro áudio do modelo SpeechifyAI Simba 3.2 em setembro de 2026. A Coval registrou mediana de 106 ms nas 24 horas até 24 de setembro de 2026. A Voice Arena marcou 123 ms na tabela US English no mesmo dia — o menor tempo mediano entre os 14 modelos avaliados. Este artigo explica o que esses números representam, por que o tempo até o primeiro áudio é a melhor métrica de latência para comparação e como medi-lo no seu próprio código.
Os números
As duas medições independentes ficam acima das nossas porque incluem a rede entre os servidores deles e os nossos, além de qualquer silêncio inicial no áudio. Cada valor corresponde à leitura daquele benchmark na data indicada. As duas tabelas são atualizadas continuamente — confira sempre os dados mais recentes.
Tabela US English da Voice Arena, 24 set. 2026
Fonte: Voice Arena, acessada em 24 set. 2026. A tabela avaliou 14 modelos; os seis mais rápidos estão acima.
Por que o tempo até o primeiro áudio é a métrica certa para comparar
Quando um agente de voz responde ou um app lê um texto em voz alta, o ouvinte espera desde o envio do texto até ouvir o som. Essa espera é o tempo até o primeiro áudio.
- O tempo até o primeiro byte pode parecer melhor do que o usuário realmente percebe.
- O streaming pode começar com silêncio, e o ouvinte só escuta quando a primeira amostra audível chega. O tempo até o primeiro áudio inclui esse silêncio.
- O tempo total de geração vai até o último byte.
- Isso importa ao salvar um arquivo, mas não para quem ouve enquanto o áudio está sendo transmitido.
- Conversas não toleram demora.
- Em geral, espera-se uma resposta em poucas centenas de milissegundos. Um agente de voz precisa encaixar reconhecimento de fala, modelo de linguagem e síntese nesse intervalo — cada ms na voz reduz o tempo disponível para o restante do pipeline.
Como o Simba 3.2 ficou mais rápido sem encolher o modelo
Nos dados da Coval, a mediana diária do Simba 3.2 caiu de 379 ms em 13 set. 2026 para 116 ms em 18 set. 2026 — uma redução de ~70% em cinco dias.
O modelo permaneceu igual — mesmos pesos, sem destilação, quantização nem versão "turbo" reduzida. O ganho veio da camada de entrega ao redor do modelo:
- Nova build de entrega, em outra classe de GPU, com otimizações na pilha de inferência para liberar áudio mais cedo.
- Verificações de plano, permissão e rate limiting processadas em cache, em vez de consultas ao vivo, antes do primeiro byte.
- API gateway rodando na mesma região das GPUs, com conexões persistentes entre as requisições.
- Cerca de 100 ms a menos de silêncio inicial. O próprio medidor da Coval para o Simba 3.2 caiu de 102 ms em 14 set. para 13 ms.
A qualidade foi mantida. No ranking de texto para fala da Artificial Analysis, o Simba 3.2 atingiu Elo de 1.237 (±14) em 23 set. 2026, ficando entre os cinco melhores entre 92 vozes de provedores — e todos os modelos acima custam mais.
Como obter a menor latência no seu app
- Use streaming.
- Use
- POST /v1/audio/stream
- para reproduzir o áudio enquanto ele é gerado.
- POST /v1/audio/speech
- só responde no fim do clipe.
- Solicite o Simba 3.2.
- Defina
- model
- como
- simba-3.2
- para inglês. Se esse campo for omitido, a API usa
- simba-3.0
- .
- Reaproveite conexões.
- Crie um cliente HTTP, abra a conexão no início e mantenha-a para todas as requisições, evitando DNS e handshakes TCP/TLS.
- Envie as frases assim que estiverem prontas.
- Se houver um modelo de linguagem, envie cada frase ao terminar e toque os streams na ordem.
- Escolha o formato exigido pelo player.
- audio/pcm
- a 24 kHz dispensa codificação. Prefira MP3 ou Ogg Opus se a prioridade for economizar banda.
- Execute perto da API.
- A API é servida a partir do US East; hospede seu servidor nessa região para reduzir a latência de rede.
Vai usar LiveKit Agents? Este guia mostra como criar um agente de voz com o plugin da Speechify, transmitindo cada frase à medida que o modelo de linguagem conclui. A lógica por trás de cada etapa, com código, está na documentação de latência.
Meça por conta própria
Meça o tempo até o primeiro fragmento da resposta em streaming a partir do local onde seu código roda. Para obter um valor representativo:
- Descarte a primeira ou as duas primeiras solicitações — elas incluem a abertura da conexão.
- Varie o texto entre as chamadas, como acontece no uso real.
- Envie as requisições em sequência, não em paralelo.
- Faça pelo menos 20 chamadas e reporte mediana (p50) e p90, não a média nem o melhor resultado isolado.
- Meça usando PCM; com Ogg, os primeiros bytes são cabeçalhos, não áudio.
Cada resposta em streaming inclui um cabeçalho Server-Timing cujo valor ttfb mostra apenas a nossa parte do tempo de espera; o restante é rede e infraestrutura do seu lado. A documentação de latência traz scripts em Python e TypeScript para isso.
Perguntas frequentes
O modelo Simba 3.2 da SpeechifyAI registrou mediana de 56 ms e p90 de 102 ms na gravação do primeiro byte de áudio em tráfego real no US East, em 15 set. 2026. Benchmarks independentes apontaram mediana de 106 ms (Coval, 24h até 24 set. 2026) e 123 ms (Voice Arena, 24 set. 2026), incluindo rede e qualquer silêncio inicial.
Na tabela US English da Voice Arena em 24 set. 2026, o Simba 3.2 da SpeechifyAI teve o menor tempo mediano até o primeiro áudio entre 14 modelos: 123 ms, à frente do Inworld Realtime TTS 2 Research Preview (168,5 ms). Como os benchmarks rodam continuamente, sempre confira a data da comparação.
Sim. POST /v1/audio/stream envia áudio via HTTP enquanto ele é gerado, nos formatos PCM, MP3, Ogg Opus ou AAC. O PCM tem a menor latência, pois não exige codificação.
Não. SpeechifyAI é a API para desenvolvedores da Speechify, cobrada separadamente do app de leitura. A assinatura Reader não inclui uso da API. Os planos da API são mensais e sem compromisso anual: grátis (500.000 caracteres/mês, sem cartão), Starter por US$10/mês (US$10 por 1M adicionais), Pro por US$99 (US$8) e Scale por US$499 (US$6).
Teste o Simba 3.2 no SpeechifyAI: crie uma chave de API gratuita e compare o tempo da sua primeira requisição com os dados acima.

