A Speechify oferece uma linha enxuta de modelos de text-to-speech. Para escolher o ideal, é preciso equilibrar latência, cobertura de idiomas e qualidade de voz. Este guia mostra qual modelo faz mais sentido para cada uso, para você decidir sem precisar testar tudo.
As publicações sobre modelos em speechify.ai detalham cada lançamento. O anúncio do Simba 3.2 explica por que ele é hoje o modelo recomendado.
Veja nosso guia rápido para começar a usar a API de text-to-speech da Speechify.
Quais modelos a Speechify oferece?
Dois modelos atuais e um par de modelos legados em descontinuação.
- Simba 3.2
- : modelo recomendado para inglês. Nativo para streaming, com menor tempo até o primeiro byte e vozes selecionadas em inglês. Ideal para experiências interativas.
- Simba 3.0
- : padrão atual da API. Nativo para streaming e multilíngue: inglês, alemão, espanhol, francês, italiano e português brasileiro. Tem latência um pouco maior que a do 3.2, mas cobre mais idiomas.
- Modelos legados (
- simba-english
- ,
- simba-multilingual
- ): a dupla Simba 1.6. Será descontinuada na versão 2026-09-21 da API e desativada em 2026-11-21. Use apenas se uma integração existente depender de uma voz ou idioma antigo e já planeje a migração.
Qual modelo é mais rápido?
Simba 3.2. Ele foi projetado para streaming e entrega o primeiro áudio mais rápido. Para agentes de voz em inglês, é a opção mais indicada.
Simba 3.0 é quase tão rápido, mas traz a sobrecarga do suporte multilíngue. Os modelos legados são mais lentos e devem ser descontinuados sempre que possível.
Qual modelo cobre mais idiomas?
Simba 3.0. Ele oferece suporte oficial a inglês, alemão, espanhol (Espanha e México), francês, italiano e português brasileiro. Envie o parâmetro language em POST /v1/audio/speech para definir o idioma e receber uma voz nativa. O modelo legado simba-multilingual cobre mais de 30 idiomas, mas será descontinuado e desativado conforme o cronograma da API.
Se seu produto é lançado em apenas um idioma, o Simba 3.2 se destaca em velocidade e qualidade. Se ele é multilíngue, o Simba 3.0 oferece a melhor cobertura hoje.
Saiba mais sobre o suporte a idiomas na nossa documentação.
Qual modelo tem a melhor qualidade de voz?
A qualidade evolui com cada nova geração do modelo. Simba 3.2 lidera em naturalidade no inglês. Simba 3.0 entrega bons resultados nos idiomas compatíveis. Os modelos legados são mais antigos e soam mais robóticos.
Para aplicações voltadas ao cliente final, prefira Simba 3.2 ou Simba 3.0.
Como consultar as vozes disponíveis?
Use GET /v1/voices. Filtre por tipo, idioma, gênero e modelo para encontrar a voz ideal antes de sintetizar. As publicações em speechify.ai mostram o formato da resposta.
Streaming ou lote?
Os dois modelos Simba 3 fazem streaming de áudio. Use POST /v1/audio/stream para reprodução ao vivo, POST /v1/audio/stream/with-timestamps para áudio ao vivo com marcação de cada palavra e POST /v1/audio/speech para gerar um único arquivo. A escolha do modelo independe do modo de entrega.
FAQ
Qual é o modelo TTS recomendado da Speechify?
Simba 3.2. É o padrão para novos projetos: nativo para streaming, entrega o áudio mais rápido e oferece a melhor qualidade para inglês.
Qual modelo a API usa por padrão?
Simba 3.0. Se o campo model não for informado, a API usa o Simba 3.0. Defina model: "simba-3.2" explicitamente para usar o 3.2 em inglês.
O Speechify TTS oferece suporte a vários idiomas?
Sim. Simba 3.0 aceita o parâmetro language e retorna vozes nativas em inglês, alemão, espanhol (Espanha e México), francês, italiano e português brasileiro. Simba 3.2 é focado em vozes selecionadas em inglês.
Ainda devo usar os modelos legados?
Só se uma integração existente exigir uma voz antiga específica. simba-english e simba-multilingual serão descontinuados na versão 2026-09-21 da API e desativados em 2026-11-21. Migre para Simba 3.2 ou Simba 3.0 antes disso.
Qual modelo devo usar para agente de voz?
Use Simba 3.2 para obter o menor tempo de resposta e transmitir o áudio ao vivo.

