1. Início
  2. Notícias
  3. Simba da Speechify é eleito o melhor modelo de voz com IA no leaderboard do Artificial Analysis
6 de julho de 2026

Simba da Speechify é eleito o melhor modelo de voz com IA no leaderboard do Artificial Analysis

O Simba 3.2, principal modelo de texto para fala da Speechify, agora é o modelo de voz com IA nº 1 do mundo.

A Speechify anunciou que seu principal modelo de texto para fala em streaming, Simba 3.2, conquistou o 1º lugar no ranking geral do leaderboard do Artificial Analysis para TTS, o benchmark independente mais completo do setor para avaliar modelos comerciais de voz com IA. Com isso, o Simba 3.2 supera os principais modelos da ElevenLabs, Cartesia, OpenAI, Google DeepMind e xAI, marcando a primeira vez que uma empresa voltada ao consumidor lidera o ranking global. Pelos critérios mais usados pelo mercado para avaliar IA de voz, o Simba 3.2 já é amplamente visto como o melhor modelo de voz com IA disponível. Além disso, o Simba 3.2 também ocupa o 1º lugar na Voice Arena entre os modelos em tempo real, ampliando a liderança da Speechify nos dois benchmarks mais usados por desenvolvedores e empresas.

Sobre o Artificial Analysis

O leaderboard do Artificial Analysis é a principal referência para desenvolvedores e empresas avaliarem o mercado de vozes com IA. Ele faz análises objetivas e consistentes de todos os modelos comerciais disponíveis, é atualizado continuamente à medida que surgem novos modelos e é acompanhado de perto por equipes que integram voz aos seus produtos. Ao contrário dos benchmarks dos próprios fornecedores, o ranking não usa notas autodeclaradas. Por esse critério, o Simba 3.2 é hoje o melhor modelo TTS disponível para desenvolvedores.

O que o Ranking do Artificial Analysis Significa para o Custo

O ponto mais importante do ranking não é só a nota de qualidade. É a combinação dessa nota com o preço do modelo. O Simba 3.2 custa US$ 10 por milhão de caracteres no plano inicial da Speechify e cai para US$ 6 no plano Scale, o que faz dele o modelo mais econômico entre os 10 primeiros do leaderboard do Artificial Analysis. Segundo a liderança da Speechify, isso o torna cerca de 15x mais acessível que a ElevenLabs e 6x mais que a Cartesia, na mesma faixa de qualidade, fazendo do Simba 3.2 a API de voz com IA mais acessível para produção.

Unir preço e qualidade sempre pareceu impossível na síntese de voz. O segmento premium criou vozes com IA realistas a preços voltados para grandes empresas, enquanto a faixa mais barata atendia devs dispostos a abrir mão de qualidade. O Simba 3.2 acaba com esse dilema como nunca antes, entregando a melhor voz com IA para qualquer desenvolvedor, startup ou empresa, independentemente do orçamento.

Fundador da Speechify sobre Alcançar a Tríade

“Simba 3.2 é nosso melhor modelo até agora, já disponível na Speechify.ai”, diz Cliff Weitzman, fundador e CEO da Speechify, no LinkedIn. “Ele foi criado para impulsionar agentes de voz em escala e aprimorado após milhões de testes A/B na nossa plataforma. Em APIs de TTS, três fatores contam: custo, qualidade e latência. O Simba 3.2 alcançou SOTA nos três. Mal posso esperar para ver você testando e levando suas soluções mais longe.”

A tríade citada por Weitzman sempre foi tratada como um limite pelos provedores de voz com IA. Melhorar um ponto significava abrir mão dos outros dois, e a maioria dos fornecedores escolheu um caminho. Ser realmente SOTA nos três ao mesmo tempo parecia utopia para muita gente. O ranking do Artificial Analysis é a primeira prova independente de que esse equilíbrio é possível, consolidando o Simba 3.2 como o melhor modelo para equipes que criam software centrado em voz.

Cinco Anos de Stanford até o Estado da Arte

A família Simba nasceu de pesquisas iniciadas por Tyler Weitzman, cofundador e chefe de IA da Speechify, ainda durante a graduação em Stanford. Os primeiros experimentos dele com arquiteturas neurais de fala em um curso de ML evoluíram ao longo de cinco anos para a família de modelos que hoje gera voz por streaming nos produtos da Speechify para consumidores e empresas, posicionando a companhia como referência em pesquisa de IA de voz.

Ao refletir sobre o marco, Tyler Weitzman compartilhou em um post no X: “Quando eu era aluno de Stanford, CS229 com Andrew Ng despertou meu interesse por ML. Meu projeto da disciplina envolvia ajustar o Tacotron 2. Cinco anos depois, o novo modelo da minha equipe na Speechify alcançou SOTA. É surreal olhar para trás.”

Rohan Pavuluri, Chief Business Officer da Speechify e amigo de longa data de Tyler Weitzman, resumiu o ranking como resultado de uma escolha arquitetural feita lá no começo, em um recente anúncio. “Poderíamos ter avançado mais rápido focando só em qualidade, mas nosso DNA de produto para o consumidor e nosso modelo de negócio exigiam decisões arquitetônicas desde cedo para garantir voz ilimitada a US$ 139/ano para nossos usuários. Isso acabou resultando em SOTA em TTS pelo melhor preço, algo raro em pesquisa de IA, onde desempenho maior normalmente custa caro.”

Escala de Consumo como Motor da IA de Nível Empresarial

A capacidade da Speechify de entregar a melhor voz com IA pelo menor preço entre os 10 primeiros vem da economia do seu negócio para consumidores. A plataforma é usada por mais de 60 milhões de pessoas e foi premiada este ano com um Apple Design Award na WWDC 2025, reforçando sua posição de referência em experiência de IA de voz. Para sustentar esse público com uma assinatura de US$ 139/ano, a equipe de pesquisa priorizou eficiência de inferência desde o design inicial, e não como ajuste de última hora. É essa disciplina que permite entregar o modelo nº 1 do leaderboard do Artificial Analysis pelo preço que os desenvolvedores veem hoje.

“É a história do azarão entre os provedores de API”, diz Luke Oliff, chefe de relações com desenvolvedores da Speechify, em um comunicado. “Passamos anos aprendendo a rodar modelos com eficiência porque nosso negócio exigia isso: milhões de ouvintes, com algumas das melhores vozes do mundo. É por isso que hoje conseguimos oferecer o melhor modelo pelo menor preço na nossa API. Enquanto outros laboratórios pensam em benchmark e preço para empresas, nós pensamos no ouvinte e no custo real de produção.”

Disponibilidade

Simba 3.2 já está disponível no SpeechifyAI Build, a API de TTS e clonagem de voz da Speechify, e também impulsiona a nova plataforma SpeechifyAI Agents para criação de agentes de voz em produção. Ambos estão em speechify.ai, com SDKs oficiais para TypeScript e Python, suporte a streaming, controle emocional detalhado e prosódia via SSML. A plataforma também traz a melhor tecnologia de clonagem de voz do mercado, permitindo ao desenvolvedor usar o melhor modelo de voz com IA e a melhor clonagem instantânea pelo mesmo custo. Mais idiomas e planos mais econômicos estão no roadmap da empresa.