A Speechify oferece uma linha enxuta de modelos de conversão de texto em fala. A escolha certa depende de latência, cobertura de idiomas e qualidade de voz. Este guia relaciona cada modelo ao uso ideal para você decidir sem precisar testar todos.
As publicações sobre os modelos em speechify.ai detalham cada lançamento. O anúncio do Simba 3.2 explica por que ele é o modelo recomendado no momento.
Confira nosso guia rápido para começar a usar a API de conversão de texto em fala da Speechify.
Quais modelos a Speechify oferece?
São três famílias.
- Simba 3.2
- : modelo recomendado para inglês. Nativo para streaming, com menor latência e vozes selecionadas em inglês. Ideal para experiências interativas.
- Simba 3.0
- : padrão atual da API. Nativo para streaming e multilíngue: inglês, alemão, espanhol, francês, italiano e português brasileiro. Tem latência um pouco maior que a do 3.2, mas com cobertura mais ampla.
- Modelos legados (
- simba-english
- ,
- simba-multilingual
- ): equivalentes ao Simba 1.6. Serão descontinuados a partir da versão 2026-09-21 da API e desligados em 2026-11-21. Use-os apenas se integrações existentes dependerem de uma voz ou idioma antigo e já planeje a migração.
Qual modelo é mais rápido?
Simba 3.2. Otimizado para streaming, entrega o primeiro áudio mais rápido. Para agentes de voz em inglês, é a melhor opção.
Simba 3.0 chega perto, mas traz a sobrecarga do suporte multilíngue. Os modelos legados são mais lentos e devem ser descontinuados sempre que possível.
Qual modelo cobre mais idiomas?
Simba 3.0. Suporta oficialmente inglês, alemão, espanhol (Espanha e México), francês, italiano e português brasileiro. Use o parâmetro language em POST /v1/audio/speech para selecionar o idioma e receber uma voz nativa. O modelo legado simba-multilingual cobre mais de 30 idiomas, mas será descontinuado a partir da versão 2026-09-21 e desligado em 2026-11-21.
Se o seu produto for lançado em um único idioma, o Simba 3.2 é imbatível em velocidade e qualidade. Para vários idiomas, hoje o Simba 3.0 oferece a maior cobertura.
Saiba mais sobre o suporte a idiomas na nossa documentação.
Qual modelo soa melhor?
A qualidade acompanha a geração do modelo. Simba 3.2 lidera em naturalidade no inglês. Simba 3.0 mantém consistência nos idiomas compatíveis. Os modelos legados soam mais robóticos.
Para vozes voltadas ao cliente, prefira Simba 3.2 ou Simba 3.0.
Como listar as vozes disponíveis?
Faça uma chamada para GET /v1/voices. Filtre por tipo, idioma, gênero e modelo para encontrar a voz ideal antes de sintetizar. As publicações em speechify.ai mostram o formato da resposta.
Streaming ou batch?
Os dois modelos Simba 3 oferecem streaming. Use POST /v1/audio/stream para reprodução ao vivo, POST /v1/audio/stream/with-timestamps para áudio ao vivo com marcação de palavras e POST /v1/audio/speech para gerar um arquivo único. A escolha do modelo é independente do modo de entrega.
Perguntas frequentes
Qual modelo TTS da Speechify é recomendado?
Simba 3.2. É o padrão para novos projetos: streaming nativo, áudio inicial mais rápido e a melhor qualidade para inglês.
Simba 3.2 para inglês: streaming nativo, áudio inicial mais rápido e a melhor qualidade para o idioma. O padrão da API, quando a requisição não informa model, é o Simba 3.0; portanto, defina model: "simba-3.2" explicitamente para usá-lo.
Sim. O Simba 3.0 aceita um parâmetro de idioma e retorna vozes nativas em várias localidades. O Simba 3.2 é focado em vozes selecionadas para inglês.
Sim. O Simba 3.0 aceita um parâmetro de idioma e retorna vozes nativas em inglês e seis idiomas europeus. O Simba 3.2 é focado em vozes selecionadas para inglês.
Só se uma integração existente depender de uma voz antiga. Caso contrário, migre para o Simba 3.2 ou Simba 3.0.
Apenas enquanto uma integração existente depender de uma voz legada. Esses modelos serão descontinuados em 2026-09-21 e desligados em 2026-11-21, então migre para o Simba 3.2 ou Simba 3.0 até lá.
Escolha Simba 3.2 para ter a menor latência. Transmita o áudio ao vivo.

