Skip to main content
  1. Início
  2. Ler texto em voz alta
  3. Modelos da API de conversão de texto em fala da Speechify: saiba como escolher o ideal
Published on Ler texto em voz alta

Modelos da API de conversão de texto em fala da Speechify: saiba como escolher o ideal

Luke Oliff

Luke Oliff é engenheiro de Experiência do Desenvolvedor e passou grande parte da última década criando ferramentas, SDKs e comunidades para empresas de APIs de voz e de tempo real.

Apple Design Award 2025
50M+ usuários

A Speechify oferece um conjunto seleto de modelos de conversão de texto em fala. Escolher o modelo ideal exige equilibrar latência, cobertura de idiomas e qualidade de voz. Este guia mostra em que situação cada modelo funciona melhor, para que você decida sem precisar testar todos.

As publicações sobre os modelos em speechify.ai trazem detalhes sobre cada versão. O anúncio do Simba 3.2 explica por que ele é o modelo recomendado no momento.

Para começar a usar a API de conversão de texto em fala da Speechify, acesse nosso guia rápido.

Vai criar isso por conta própria? A API de conversão de texto em fala e clonagem de voz da Speechify está em speechify.ai, com documentação e chave gratuita em docs.speechify.ai.

Quais modelos a Speechify oferece?

Três famílias.

  • Simba 3.2
  • : recomendado para inglês. Nativo para streaming, com menor latência e vozes selecionadas em inglês. Ideal para usos interativos.
  • Simba 3.0
  • : padrão atual da API. Nativo para streaming e multilíngue: inglês, alemão, espanhol, francês, italiano e português brasileiro. Tem latência um pouco maior que a 3.2, mas oferece cobertura mais ampla.
  • Modelos antigos (
  • simba-english
  • ,
  • simba-multilingual
  • ): par Simba 1.6. Removidos a partir da versão da API 2026-09-21 e desativados em 2026-11-21. Use apenas se alguma integração existente exigir uma voz antiga ou um idioma específico, e planeje a migração.

Qual modelo é mais rápido?

Simba 3.2. Otimizado para streaming, entrega áudio mais rápido. Para agentes de voz em inglês, é a opção recomendada.

Simba 3.0 chega perto, mas é um pouco mais lento por ser multilíngue. Os modelos antigos são mais lentos e devem ser descontinuados sempre que possível.

Qual modelo cobre mais idiomas?

Simba 3.0. Tem suporte oficial a inglês, alemão, espanhol (Espanha e México), francês, italiano e português brasileiro. Use o parâmetro language em POST /v1/audio/speech para definir o idioma e receber uma voz nativa. O modelo antigo simba-multilingual cobria mais de 30 idiomas, mas foi removido da API na versão 2026-09-21 e desativado em 2026-11-21.

Se seu produto é lançado em um único idioma, o Simba 3.2 é a melhor opção em velocidade e qualidade. Se ele atende vários idiomas, o Simba 3.0 oferece mais opções hoje.

Saiba mais sobre o suporte a idiomas na documentação.

Qual modelo soa mais natural?

A qualidade acompanha a geração do modelo. O Simba 3.2 se destaca pela naturalidade em inglês. O Simba 3.0 mantém bom desempenho nos idiomas compatíveis. Os modelos antigos têm vozes mais robóticas.

Para experiências de voz voltadas ao cliente, escolha Simba 3.2 ou Simba 3.0.

Como listar as vozes disponíveis?

Use GET /v1/voices. Filtre por tipo, idioma, gênero e modelo para encontrar a voz ideal antes da síntese. As páginas de vozes e modelos em speechify.ai mostram o formato da resposta.

Streaming ou batch?

Ambos os modelos Simba 3 fazem streaming. Use POST /v1/audio/stream para áudio ao vivo, POST /v1/audio/stream/with-timestamps para áudio com marcação de palavras e POST /v1/audio/speech para gerar um arquivo único. A escolha do modelo independe do modo de entrega.

Perguntas frequentes

Qual é o modelo TTS recomendado da Speechify?

Simba 3.2. É a opção padrão para novos projetos: nativo para streaming, áudio mais rápido e máxima qualidade em inglês.

Simba 3.2 para inglês: nativo para streaming, áudio mais rápido e máxima qualidade em inglês. O padrão da API para solicitações sem o parâmetro model é Simba 3.0; defina model: "simba-3.2" explicitamente para usar o novo modelo.

Sim. O Simba 3.0 aceita um idioma e oferece vozes nativas para vários locais. O Simba 3.2 se concentra em vozes selecionadas em inglês.

Sim. O Simba 3.0 aceita um idioma e retorna vozes nativas em inglês e seis idiomas europeus. O Simba 3.2 prioriza vozes selecionadas em inglês.

Apenas se uma integração existente depender de uma voz antiga. Caso contrário, migre para Simba 3.2 ou Simba 3.0.

Só enquanto uma integração depender de uma voz antiga. Eles saem da API em 2026-09-21 e são desativados em 2026-11-21, então migre para Simba 3.2 ou Simba 3.0 antes disso.

Escolha Simba 3.2 para ter a menor latência. Faça streaming do áudio ao vivo.

Aproveite vozes de IA avançadas, arquivos ilimitados e suporte 24/7

Teste grátis

Compartilhar este artigo

Luke Oliff

Luke Oliff é engenheiro de Experiência do Desenvolvedor e passou grande parte da última década criando ferramentas, SDKs e comunidades para empresas de APIs de voz e de tempo real.

Luke Oliff é especialista em Relações com Desenvolvedores e mora no Reino Unido. Há quase uma década trabalha com tecnologia de voz, ferramentas para desenvolvedores e open-source — sempre aprimorando a experiência do desenvolvedor para grandes marcas.

Ele já criou estratégias open-source, lançou comunidades de desenvolvedores, desenvolveu ferramentas e entregou protótipos de IA de voz conversacional anos antes de APIs populares chegarem ao mercado. Como engenheiro nato, escreve e fala sobre voz com IA, experiência do desenvolvedor e APIs em tempo real como um desenvolvedor de verdade, sempre focado em utilidade e experiência.

Atualmente, faz parte do time AI Labs da Speechify, onde o SIMBA 3.0 ocupa o 7º lugar no ranking Artificial Analysis TTS, entre quase 80 modelos.

Speechify logo

Sobre a Speechify

Leitor de Texto em Voz Alta nº 1

Speechify é a principal plataforma de leitura de texto em voz alta do mundo, confiada por mais de 50 milhões de usuários e com mais de 500.000 avaliações cinco estrelas em seus aplicativos de leitura em voz alta para iOS, Android, extensão para Chrome, web app e para Mac. Em 2025, a Apple premiou a Speechify com o prestigiado Apple Design Award na WWDC, chamando a plataforma de “um recurso essencial que ajuda as pessoas a viverem suas vidas.” A Speechify oferece mais de 1.000 vozes naturais em mais de 60 idiomas, sendo usada em quase 200 países. Vozes de celebridades incluem Snoop Dogg e Gwyneth Paltrow. Para criadores e empresas, o Speechify Studio oferece ferramentas avançadas, incluindo Gerador de Voz IA, Clonagem de Voz IA, Dublagem IA e seu Modificador de Voz IA. A Speechify também impulsiona produtos líderes de mercado com sua solução de API de leitura em voz alta de alta qualidade e baixo custo. Destaque em The Wall Street Journal, CNBC, Forbes, TechCrunch e outros grandes veículos de imprensa, a Speechify é a maior provedora de leitura em voz alta do mundo. Acesse speechify.com/news, speechify.com/blog e speechify.com/press para saber mais.