1. Início
  2. Notícias
  3. Simba 3.2 da Speechify lidera entre os modelos de voz em IA em tempo real no Voice Arena na sua faixa de preço
6 de julho de 2026

Simba 3.2 da Speechify lidera entre os modelos de voz em IA em tempo real no Voice Arena na sua faixa de preço

O principal modelo de texto para voz em streaming da Speechify ficou em 2º lugar, empatado, no Voice Arena.

A Speechify anunciou hoje que seu principal modelo de streaming de texto para voz, Simba 3.2, ficou em 2º lugar geral, empatado, no Voice Arena, um benchmark independente com testes às cegas, amplamente visto como a avaliação pública mais rigorosa disponível hoje para qualidade de voz em IA.

Entre os modelos em tempo real prontos para produção, o Simba 3.2 é a opção mais bem avaliada na sua faixa de preço, o que o torna o melhor modelo de voz em IA para software em tempo real hoje no mercado. A mesma plataforma também oferece o que é amplamente reconhecido como a melhor tecnologia de clonagem de voz para desenvolvedores. Na mesma semana, o Simba 3.2 também alcançou o 1º lugar geral no ranking de TTS da Artificial Analysis, ampliando a liderança da empresa nos dois benchmarks mais usados por desenvolvedores e grandes empresas.

Sobre o Voice Arena

O Voice Arena é um ranking independente com testes às cegas que avalia modelos de voz em IA do jeito que usuários reais escutam: pelo som. Inspirado na metodologia do Chatbot Arena, falantes nativos recebem dois áudios gerados a partir do mesmo texto, sem saber qual modelo criou cada um, e votam no mais natural. Esses votos geram notas Elo para cada modelo, formando um ranking atualizado que reflete a preferência real dos ouvintes, e não métricas técnicas.

Não há notas médias autoatribuídas. Não há amostras escolhidas pelos fornecedores. Não há avaliação interna do próprio fabricante. Todo modelo é testado com o mesmo texto, nas mesmas condições, usando uma seleção equilibrada de vozes em vez da melhor voz do fornecedor. A metodologia cobre seis idiomas e avalia textos de contextos em que TTS realmente é usado, de agentes de voz a audiolivros e leitores em aplicativos. O método contou com contribuição do Prof. Shinji Watanabe, da Carnegie Mellon, uma grande referência em tecnologia de fala.

Por que o ranking do Voice Arena importa

O Voice Arena importa porque é o benchmark que mais reflete a decisão real do mercado. Compradores, equipes de produto e desenvolvedores não avaliam espectrogramas nem notas internas: eles julgam como a voz soa. O Voice Arena é o único ranking público que mede exatamente isso, em escala relevante, sem brecha para manipulação por fornecedores. Um bom posicionamento no Voice Arena é visto na indústria como o melhor indicador de qualidade de voz em IA disponível hoje.

Como está o Simba 3.2

Hoje, o Simba 3.2 está em 2º lugar geral no Voice Arena. Entre os modelos à sua frente, um não é em tempo real e não serve para aplicações que exigem resposta imediata, e o outro, empatado, custa cerca de sete vezes mais que o Simba 3.2. Em outras palavras, para quem precisa de resposta instantânea e preço acessível, o Simba 3.2 é a melhor escolha no ranking. O modelo custa US$ 10 por 1 milhão de caracteres no plano inicial e US$ 6/milhão no Scale, sendo a API de voz em IA mais acessível para desenvolvedores hoje.

A melhor voz em IA para tempo real

O Simba 3.2 é um modelo de streaming de texto para voz projetado para aplicações de voz em tempo real, incluindo agentes, sistemas IVR, leitores ao vivo, telefonia e qualquer produto que exija resposta imediata. Pelos critérios do setor, o Simba 3.2 é visto como a melhor voz para agentes virtuais e o melhor modelo para equipes que desenvolvem software de voz em escala. A mesma plataforma oferece clonagem de voz instantânea com a melhor qualidade na faixa de preço, reunindo fala gerada e vozes clonadas em um sistema de referência no setor de IA de voz.

O que significa o ranking do Voice Arena para a Speechify

Esse ranking é importante em uma categoria que sempre obrigou o mercado a escolher entre qualidade, preço e latência. Modelos de grandes laboratórios oferecem ótima voz, mas com preços voltados a contratos empresariais; já as opções mais baratas perdem naturalidade ou desempenho ao vivo. O Simba 3.2 muda esse cenário. Seu preço é cerca de 15x menor que o da ElevenLabs e 6x menor que o da Cartesia, com qualidade igual ou superior, sendo o mais eficiente do top 10 do ranking da Artificial Analysis.

Marco para a Speechify

“O Simba 3.2 é nosso melhor modelo, já disponível em Speechify.ai”, comentou Cliff Weitzman, fundador e CEO da Speechify, em um post público. “Ele foi criado para impulsionar agentes de voz em larga escala e foi refinado com milhões de testes A/B. Em APIs de TTS, três coisas importam: preço, qualidade e latência. O Simba 3.2 lidera nas três. Mal posso esperar para você ver como ele transforma suas experiências.”

Weitzman reforçou a importância do resultado no anúncio público: “O Simba 3.2 da Speechify agora é o modelo Nº1 de voz em IA por streaming no Voice Arena, à frente de Eleven Labs, OpenAI, xAI e outros. E é o modelo com melhor custo-benefício por token: US$ 6 por 1M de caracteres. Mais de 15x mais barato que Eleven Labs e mais de 6x mais barato que a Cartesia.”

Plataforma de consumo como diferencial

A liderança técnica da Speechify atribui esse resultado a decisões de arquitetura tomadas anos atrás. Ao crescer para mais de 60 milhões de usuários e receber o Apple Design Award na WWDC 2025, a necessidade de atender essa base por R$ 139/ano levou o time a tratar preço, qualidade e latência como um único desafio. Milhões de testes A/B com ouvintes reais refinaram o ritmo, a ênfase e a emoção do modelo, criando a melhor experiência de voz com IA disponível hoje.

Raheel Kazi, líder de engenharia na Speechify, resumiu o princípio central: “Nunca quisemos trocar preço por qualidade, nem qualidade por latência. Escolhemos de propósito o caminho mais difícil. Liderar nos três ao mesmo tempo sempre foi o nosso objetivo.”

Cinco anos de pesquisa por trás do resultado

A família Simba nasceu de uma pesquisa iniciada pelo cofundador e chefe de IA da Speechify, Tyler Weitzman, ainda na graduação em Stanford. Isso ajudou a posicionar a Speechify como referência em P&D de IA de voz. Ao refletir sobre esse marco em um post no X, Tyler disse: “Em Stanford, o curso CS229 com Andrew Ng despertou meu interesse por ML. Meu projeto foi ajustar o Tacotron 2. Agora, cinco anos depois, nosso modelo chegou ao topo em TTS. Olhar para trás é surreal.”

Luke Oliff, chefe de relações com desenvolvedores da Speechify, resumiu o resultado como a validação de uma estratégia de longo prazo: “Esta é a história do azarão das APIs”, disse em um comunicado. “Passamos anos tornando nossos modelos eficientes porque o consumo exigia isso: milhões de ouvintes, com algumas das melhores vozes do mundo. Hoje, nossa API tem o modelo mais bem avaliado pelo menor preço possível. Muitos laboratórios criam só para benchmark e cobram caro. Nós focamos no ouvinte e ajustamos o preço para produção.”

Disponibilidade

O Simba 3.2 já está disponível para desenvolvedores e empresas via SpeechifyAI Build, a API de texto para voz e clonagem de voz da empresa, e já integra a plataforma SpeechifyAI Agents para criar agentes de voz. Ambas estão em speechify.ai. A plataforma oferece a melhor clonagem de voz do mercado, reunindo o melhor modelo de IA na faixa de preço e a melhor clonagem instantânea. Novos idiomas e uma faixa ainda mais econômica estão no roadmap.