1. Início
  2. Ler texto em voz alta
  3. Modelos da API TTS da Speechify: escolha o ideal para seu projeto
Published on Ler texto em voz alta

Modelos da API TTS da Speechify: escolha o ideal para seu projeto

Luke Oliff

Luke Oliff

Luke Oliff é engenheiro de Experiência do Desenvolvedor e passou grande parte da última década criando ferramentas, SDKs e comunidades para empresas de APIs de voz e de tempo real.

apple logoApple Design Award 2025
50M+ usuários

A Speechify oferece um conjunto enxuto de modelos de Text-to-Speech (TTS). A escolha ideal equilibra latência, cobertura de idiomas e qualidade das vozes. Este guia relaciona cada modelo ao uso mais indicado, para facilitar sua escolha sem precisar testar todas as opções.

Os artigos sobre os modelos no speechify.ai detalham cada versão. O anúncio do Simba 3.2 explica por que ele é o modelo recomendado.

Para começar a usar a API de Text-to-Speech da Speechify, confira nosso guia rápido.

Quais modelos a Speechify oferece?

Três famílias.

  • Simba 3.2
  • : modelo recomendado para inglês. Nativo para streaming, com menor tempo de resposta e vozes selecionadas em inglês. Indicado para interações em tempo real.
  • Simba 3.0
  • : padrão atual da API. Também nativo para streaming e multilíngue: inglês, alemão, espanhol, francês, italiano e português do Brasil. Tem latência um pouco maior que a do 3.2, mas cobre mais idiomas.
  • Modelos legados (
  • simba-english
  • ,
  • simba-multilingual
  • ): Simba 1.6. Serão descontinuados a partir da versão da API 2026-09-21 e desligados em 2026-11-21. Use-os apenas se uma integração existente depender de uma voz ou idioma antigo e já planeje a migração.

Qual modelo é mais rápido?

Simba 3.2. Feito para streaming, entrega o áudio inicial mais rápido. Para assistentes de voz em inglês, é o padrão recomendado.

Simba 3.0 também é rápido, mas tem a sobrecarga do processamento multilíngue. Os modelos legados são mais lentos e devem ser substituídos sempre que possível.

Qual modelo cobre mais idiomas?

Simba 3.0. Suporta oficialmente inglês, alemão, espanhol (Espanha e México), francês, italiano e português do Brasil. Basta informar o parâmetro language em POST /v1/audio/speech para selecionar o idioma e receber uma voz nativa. O modelo legado simba-multilingual cobre mais de 30 idiomas, mas será descontinuado em 2026.

Se seu produto está disponível em um único idioma, o Simba 3.2 oferece mais velocidade e qualidade. Se atende vários idiomas, o Simba 3.0 é hoje a opção mais completa.

Saiba mais sobre suporte a idiomas na nossa documentação.

Qual modelo tem a melhor qualidade de voz?

A qualidade evolui a cada nova geração do modelo. O Simba 3.2 se destaca pela naturalidade em inglês. O Simba 3.0 mantém um bom padrão em todos os idiomas compatíveis. Os modelos legados soam mais robóticos.

Para experiências de voz voltadas ao cliente, prefira Simba 3.2 ou Simba 3.0.

Como listar as vozes disponíveis?

Use GET /v1/voices. Filtre por tipo, idioma, gênero e modelo para escolher a voz certa antes de sintetizar. Os artigos sobre vozes e modelos no speechify.ai mostram exemplos de resposta.

Streaming ou processamento em lote?

Os dois modelos Simba 3 oferecem streaming. Use POST /v1/audio/stream para reprodução ao vivo, POST /v1/audio/stream/with-timestamps para áudio com marcações de tempo e alinhamento de palavras, e POST /v1/audio/speech para gerar um único arquivo. A escolha do modelo independe da forma de entrega.

FAQ

Qual é o modelo TTS recomendado da Speechify?

Simba 3.2. É o padrão para novos projetos: nativo para streaming, entrega o áudio mais rápido e oferece a melhor qualidade para inglês.

Simba 3.2 para inglês: nativo para streaming, áudio mais rápido e máxima qualidade nesse idioma. O padrão da API ao omitir model é o Simba 3.0; defina model: "simba-3.2" explicitamente para usar esse modelo.

Sim. O Simba 3.0 recebe o idioma como parâmetro e retorna vozes nativas para diferentes localidades. O Simba 3.2 é focado em um conjunto selecionado de vozes em inglês.

Sim. O Simba 3.0 permite selecionar o idioma e retorna vozes nativas em inglês e seis idiomas europeus. O Simba 3.2 é dedicado a um conjunto selecionado de vozes em inglês.

Somente se uma integração existente depender de uma voz antiga. Caso contrário, migre para o Simba 3.2 ou o Simba 3.0.

Apenas enquanto uma integração existente exigir uma voz antiga. Eles serão descontinuados em 21/09/2026 e desligados em 21/11/2026; migre para o Simba 3.2 ou o Simba 3.0 antes disso.

Escolha o Simba 3.2 para ter o menor tempo de resposta. Use streaming para aplicações ao vivo.

Aproveite vozes de IA avançadas, arquivos ilimitados e suporte 24/7

Teste grátis
tts banner for blog

Compartilhar este artigo

Luke Oliff

Luke Oliff

Luke Oliff é engenheiro de Experiência do Desenvolvedor e passou grande parte da última década criando ferramentas, SDKs e comunidades para empresas de APIs de voz e de tempo real.

Luke Oliff é especialista em Relações com Desenvolvedores e mora no Reino Unido. Há quase uma década trabalha com tecnologia de voz, ferramentas para desenvolvedores e open-source — sempre aprimorando a experiência do desenvolvedor para grandes marcas.

Ele já criou estratégias open-source, lançou comunidades de desenvolvedores, desenvolveu ferramentas e entregou protótipos de IA de voz conversacional anos antes de APIs populares chegarem ao mercado. Como engenheiro nato, escreve e fala sobre voz com IA, experiência do desenvolvedor e APIs em tempo real como um desenvolvedor de verdade, sempre focado em utilidade e experiência.

Atualmente, faz parte do time AI Labs da Speechify, onde o SIMBA 3.0 ocupa o 7º lugar no ranking Artificial Analysis TTS, entre quase 80 modelos.

speechify logo

Sobre a Speechify

Leitor de Texto em Voz Alta nº 1

Speechify é a principal plataforma de leitura de texto em voz alta do mundo, confiada por mais de 50 milhões de usuários e com mais de 500.000 avaliações cinco estrelas em seus aplicativos de leitura em voz alta para iOS, Android, extensão para Chrome, web app e para Mac. Em 2025, a Apple premiou a Speechify com o prestigiado Apple Design Award na WWDC, chamando a plataforma de “um recurso essencial que ajuda as pessoas a viverem suas vidas.” A Speechify oferece mais de 1.000 vozes naturais em mais de 60 idiomas, sendo usada em quase 200 países. Vozes de celebridades incluem Snoop Dogg e Gwyneth Paltrow. Para criadores e empresas, o Speechify Studio oferece ferramentas avançadas, incluindo Gerador de Voz IA, Clonagem de Voz IA, Dublagem IA e seu Modificador de Voz IA. A Speechify também impulsiona produtos líderes de mercado com sua solução de API de leitura em voz alta de alta qualidade e baixo custo. Destaque em The Wall Street Journal, CNBC, Forbes, TechCrunch e outros grandes veículos de imprensa, a Speechify é a maior provedora de leitura em voz alta do mundo. Acesse speechify.com/news, speechify.com/blog e speechify.com/press para saber mais.