Skip to main content
  1. Início
  2. API
  3. Latência da API de Ler texto em voz alta em 2026: tempo até o primeiro áudio e medição independente
Published on •API

Latência da API de Ler texto em voz alta em 2026: tempo até o primeiro áudio e medição independente

Equipe Speechify

Equipe Speechify


A API Speechify oferece latência de 300 ms, vozes com qualidade humana e suporte a mais de 50 idiomas

AppleApple Design Award 2025
50M+ usuários

Dois benchmarks independentes, sem vínculo com a Speechify, mediram o tempo até o primeiro áudio do modelo Simba 3.2 da SpeechifyAI em setembro de 2026. O Coval registrou mediana de 106 ms nas 24 horas até 24 de setembro de 2026. Já a Voice Arena mediu 123 ms em seu painel de inglês dos EUA no mesmo dia, a menor mediana entre os 14 modelos avaliados. Este artigo explica o que esses números medem, por que o tempo até o primeiro áudio é a métrica de latência ideal para comparação e como medi-lo no seu código.

Os números

Benchmark

O que mede

Simba 3.2

Data

Voice Arena, painel US English

Mediana do tempo até o primeiro áudio em streaming em tempo real

123 ms, a menor entre os 14 modelos medidos

24 set 2026

Coval

Mediana do tempo até o primeiro áudio, incluindo qualquer silêncio antes do primeiro som audível. Ferramenta open source, executada a cada 30 minutos a partir da região US East

106 ms

24h até 24 set 2026

Tráfego de produção da SpeechifyAI (medição interna)

Tempo da nossa API para enviar o primeiro byte de áudio em requisições reais de clientes na região US East

56 ms p50, 102 ms p90

15 set 2026

As medições independentes aparecem acima das nossas porque incluem a rede entre o testador e nossos servidores, além de qualquer silêncio inicial. Cada número reflete a medição daquele benchmark na data indicada. Ambos os painéis seguem ativos — consulte-os para ver o resultado do dia.

Painel US English da Voice Arena, 24 set 2026

Modelo

Mediana até o primeiro áudio

SpeechifyAI Simba 3.2 em tempo real

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS em tempo real

236 ms

Cartesia Sonic-3.5 em tempo real

250 ms

Smallest AI Lightning 3.1 Pro em tempo real

263,5 ms

Fish Audio S2 Pro em tempo real

267 ms

Fonte: Voice Arena, consulta em 24 set 2026. O painel media 14 modelos; os seis mais rápidos estão nesta lista.

Por que o tempo até o primeiro áudio é a melhor métrica para comparar

Quando um agente de voz responde ou um app narra um texto, o usuário conta o tempo desde o envio do texto até ouvir o som. Essa espera é o tempo até o primeiro áudio.

  • O tempo até o primeiro byte pode parecer melhor do que a experiência real do usuário.
  • Um streaming pode começar com silêncio, e o ouvinte só percebe a resposta quando chega o primeiro som audível. O tempo até o primeiro áudio inclui esse silêncio.
  • O tempo total de geração mede a espera até o último byte.
  • Isso importa para salvar um arquivo, mas não para quem ouve streaming em tempo real.
  • Conversas têm pouca margem.
  • Em geral, as pessoas reagem em algumas centenas de milissegundos. Um agente de voz precisa encaixar reconhecimento, modelo de linguagem e síntese nesse intervalo; cada ms gasto no áudio reduz o tempo disponível para o restante da cadeia.

Como o Simba 3.2 ficou mais rápido sem encolher o modelo

Nos dados da Coval, a mediana diária do Simba 3.2 caiu de 379 ms em 13/9/2026 para 116 ms em 18/9/2026 — uma redução de 70% em cinco dias.

O modelo não mudou. Continua com os mesmos pesos, sem distilação, quantização ou uma versão reduzida “turbo”. O ganho veio da camada de entrega ao redor do modelo:

  • Nova infraestrutura em outra classe de GPU, além de otimizações na pilha de inferência, para liberar áudio mais cedo.
  • Validações de plano, permissão e limites feitas por cache, sem consultas a cada requisição antes do primeiro byte.
  • Gateway de API na mesma região das GPUs, com conexões mantidas abertas entre as chamadas.
  • Cerca de 100 ms de silêncio inicial foram eliminados. A medição de silêncio da Coval para o Simba 3.2 caiu de 102 ms em 14/9 para apenas 13 ms.

A qualidade foi mantida. No ranking de Ler texto em voz alta do Artificial Analysis, o Simba 3.2 atingiu Elo de 1.237 (±14) em 23/9/2026, ficando entre os cinco melhores de 92 vozes, e os modelos acima dele custam mais caro.

Como obter a menor latência no seu app

  1. Use streaming.
  2. POST /v1/audio/stream
  3. serve para áudios reproduzidos enquanto são gerados.
  4. POST /v1/audio/speech
  5. só responde quando o áudio está completo.
  6. Peça o Simba 3.2.
  7. Defina
  8. model
  9. como
  10. simba-3.2
  11. para inglês. Se omitir, a API usa
  12. simba-3.0
  13. .
  14. Reaproveite a conexão.
  15. Crie um único cliente HTTP, abra a conexão na inicialização e reutilize-a em cada chamada, evitando o custo de DNS, TCP e TLS a cada requisição.
  16. Envie as frases assim que estiverem prontas.
  17. Se usar um modelo de linguagem, envie cada frase completa assim que for gerada; reproduza os áudios na ordem.
  18. Escolha o formato conforme o player.
  19. audio/pcm
  20. em 24 kHz dispensa codificação. Use MP3 ou Ogg Opus se a prioridade for economizar banda.
  21. Fique perto da API.
  22. A API opera em US East, então seus servidores devem estar nessa região ou próximos dela para reduzir a latência de rede.

Está desenvolvendo com LiveKit Agents? Este guia mostra como montar um agente de voz com o plugin da Speechify, transmitindo frases à medida que o modelo de linguagem as gera. O motivo de cada etapa, com código, está na documentação de latência.

Meça você mesmo

Meça o tempo até o primeiro fragmento da resposta em streaming, a partir do ponto em que seu código roda. Para medir corretamente:

  • Descarte uma ou duas primeiras requisições, que incluem a abertura da conexão.
  • Varie o texto para simular tráfego real.
  • Envie as requisições em sequência, não em paralelo.
  • Faça pelo menos 20 chamadas e reporte mediana (p50) e p90, nunca só a média ou o melhor caso isolado.
  • Meça com PCM. Com Ogg, os primeiros bytes são cabeçalhos, não áudio.

Cada resposta em streaming traz o header Server-Timing com o valor ttfb, que mostra a parte da espera relativa à nossa infraestrutura — o restante é rede e seu stack. A documentação de latência traz scripts prontos em Python e TypeScript para isso.

Perguntas frequentes

No tráfego de produção em US East em 15/09/2026, o Simba 3.2 da SpeechifyAI enviou o primeiro byte de áudio com mediana de 56 ms e p90 de 102 ms. Benchmarks independentes registraram medianas de 106 ms (Coval, 24h até 24/09) e 123 ms (Voice Arena, 24/09), ambos incluindo rede e silêncio inicial.

No painel US English da Voice Arena em 24/09/2026, o Simba 3.2 da SpeechifyAI teve a menor mediana de tempo até o primeiro áudio entre 14 modelos: 123 ms, à frente do Inworld Realtime TTS 2 Research Preview, com 168,5 ms. Os benchmarks rodam continuamente — confira a data nos rankings antes de decidir.

Sim. POST /v1/audio/stream transmite áudio por HTTP à medida que é gerado, em PCM, MP3, Ogg Opus ou AAC. PCM tem a menor latência, pois não exige codificação.

Não. SpeechifyAI é a API para desenvolvedores da Speechify, com cobrança separada do app de leitura. A assinatura Reader não inclui uso da API. Os planos são mensais e sem fidelidade: plano gratuito com 500.000 caracteres/mês sem cartão, Starter a US$10/mês, adicionais por US$10 a cada 1M de caracteres, Pro a US$99 com US$8 e Scale a US$499 com US$6.

Teste o Simba 3.2 na SpeechifyAI: crie uma chave de API gratuita e compare seu tempo com os dados acima.

Tenha acesso às vozes favoritas da Speechify via API de forma rápida, escalável e amigável para desenvolvedores

Acessar API
Sparse JavaScript keywords import, from, const, await on a white background

Compartilhar este artigo

Equipe Speechify

Equipe Speechify


Equipe Speechify

Speechify

Sobre a Speechify

Leitor de Texto em Voz Alta nº 1

Speechify é a principal plataforma de leitura de texto em voz alta do mundo, confiada por mais de 50 milhões de usuários e com mais de 500.000 avaliações cinco estrelas em seus aplicativos de leitura em voz alta para iOS, Android, extensão para Chrome, web app e para Mac. Em 2025, a Apple premiou a Speechify com o prestigiado Apple Design Award na WWDC, chamando a plataforma de “um recurso essencial que ajuda as pessoas a viverem suas vidas.” A Speechify oferece mais de 1.000 vozes naturais em mais de 60 idiomas, sendo usada em quase 200 países. Vozes de celebridades incluem Snoop Dogg e Gwyneth Paltrow. Para criadores e empresas, o Speechify Studio oferece ferramentas avançadas, incluindo Gerador de Voz IA, Clonagem de Voz IA, Dublagem IA e seu Modificador de Voz IA. A Speechify também impulsiona produtos líderes de mercado com sua solução de API de leitura em voz alta de alta qualidade e baixo custo. Destaque em The Wall Street Journal, CNBC, Forbes, TechCrunch e outros grandes veículos de imprensa, a Speechify é a maior provedora de leitura em voz alta do mundo. Acesse speechify.com/news, speechify.com/blog e speechify.com/press para saber mais.