1. Início
  2. TTS
  3. Modelos da API TTS da Speechify: descubra a opção certa para cada uso
Published on TTS

Modelos da API TTS da Speechify: descubra a opção certa para cada uso

Luke Oliff

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

apple logoApple Design Award 2025
Mais de 50M de usuários

A Speechify oferece uma linha enxuta de modelos de conversão de texto em fala. A escolha certa depende de latência, cobertura de idiomas e qualidade de voz. Este guia relaciona cada modelo ao uso ideal para você decidir sem precisar testar todos.

As publicações sobre os modelos em speechify.ai detalham cada lançamento. O anúncio do Simba 3.2 explica por que ele é o modelo recomendado no momento.

Confira nosso guia rápido para começar a usar a API de conversão de texto em fala da Speechify.

Quais modelos a Speechify oferece?

São três famílias.

  • Simba 3.2
  • : modelo recomendado para inglês. Nativo para streaming, com menor latência e vozes selecionadas em inglês. Ideal para experiências interativas.
  • Simba 3.0
  • : padrão atual da API. Nativo para streaming e multilíngue: inglês, alemão, espanhol, francês, italiano e português brasileiro. Tem latência um pouco maior que a do 3.2, mas com cobertura mais ampla.
  • Modelos legados (
  • simba-english
  • ,
  • simba-multilingual
  • ): equivalentes ao Simba 1.6. Serão descontinuados a partir da versão 2026-09-21 da API e desligados em 2026-11-21. Use-os apenas se integrações existentes dependerem de uma voz ou idioma antigo e já planeje a migração.

Qual modelo é mais rápido?

Simba 3.2. Otimizado para streaming, entrega o primeiro áudio mais rápido. Para agentes de voz em inglês, é a melhor opção.

Simba 3.0 chega perto, mas traz a sobrecarga do suporte multilíngue. Os modelos legados são mais lentos e devem ser descontinuados sempre que possível.

Qual modelo cobre mais idiomas?

Simba 3.0. Suporta oficialmente inglês, alemão, espanhol (Espanha e México), francês, italiano e português brasileiro. Use o parâmetro language em POST /v1/audio/speech para selecionar o idioma e receber uma voz nativa. O modelo legado simba-multilingual cobre mais de 30 idiomas, mas será descontinuado a partir da versão 2026-09-21 e desligado em 2026-11-21.

Se o seu produto for lançado em um único idioma, o Simba 3.2 é imbatível em velocidade e qualidade. Para vários idiomas, hoje o Simba 3.0 oferece a maior cobertura.

Saiba mais sobre o suporte a idiomas na nossa documentação.

Qual modelo soa melhor?

A qualidade acompanha a geração do modelo. Simba 3.2 lidera em naturalidade no inglês. Simba 3.0 mantém consistência nos idiomas compatíveis. Os modelos legados soam mais robóticos.

Para vozes voltadas ao cliente, prefira Simba 3.2 ou Simba 3.0.

Como listar as vozes disponíveis?

Faça uma chamada para GET /v1/voices. Filtre por tipo, idioma, gênero e modelo para encontrar a voz ideal antes de sintetizar. As publicações em speechify.ai mostram o formato da resposta.

Streaming ou batch?

Os dois modelos Simba 3 oferecem streaming. Use POST /v1/audio/stream para reprodução ao vivo, POST /v1/audio/stream/with-timestamps para áudio ao vivo com marcação de palavras e POST /v1/audio/speech para gerar um arquivo único. A escolha do modelo é independente do modo de entrega.

Perguntas frequentes

Qual modelo TTS da Speechify é recomendado?

Simba 3.2. É o padrão para novos projetos: streaming nativo, áudio inicial mais rápido e a melhor qualidade para inglês.

Simba 3.2 para inglês: streaming nativo, áudio inicial mais rápido e a melhor qualidade para o idioma. O padrão da API, quando a requisição não informa model, é o Simba 3.0; portanto, defina model: "simba-3.2" explicitamente para usá-lo.

Sim. O Simba 3.0 aceita um parâmetro de idioma e retorna vozes nativas em várias localidades. O Simba 3.2 é focado em vozes selecionadas para inglês.

Sim. O Simba 3.0 aceita um parâmetro de idioma e retorna vozes nativas em inglês e seis idiomas europeus. O Simba 3.2 é focado em vozes selecionadas para inglês.

Só se uma integração existente depender de uma voz antiga. Caso contrário, migre para o Simba 3.2 ou Simba 3.0.

Apenas enquanto uma integração existente depender de uma voz legada. Esses modelos serão descontinuados em 2026-09-21 e desligados em 2026-11-21, então migre para o Simba 3.2 ou Simba 3.0 até lá.

Escolha Simba 3.2 para ter a menor latência. Transmita o áudio ao vivo.

Curta as vozes de IA mais avançadas, arquivos ilimitados e suporte 24/7

Experimente grátis
tts banner for blog

Compartilhe este artigo

Luke Oliff

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Luke Oliff is a Developer Relations leader based in the UK. For the better part of a decade he has been working with voice technology, developer tooling, and open-source — improving developer experience for well known brands.

He has architected open-source strategy, launched developer communities, built tools, and shipped conversational AI voice prototypes years before mainstream APIs were available. As an engineer at heart, he writes and speaks about voice AI, developer experience, and real-time APIs as a developer would, focussing on utility and experience.

He has now joined Speechify's AI Labs team, where SIMBA 3.0 ranks 7th on the Artificial Analysis TTS leaderboard out of nearly 80 models.

speechify logo

Sobre a Speechify

Leitor de texto para fala nº 1

Speechify é a principal plataforma de texto para fala do mundo, confiável por mais de 50 milhões de usuários e com mais de 500.000 avaliações cinco estrelas em suas versões para iOS, Android, extensão para Chrome, web app e aplicativos para Mac desktop. Em 2025, a Apple premiou a Speechify com o prestigiado Apple Design Award na WWDC, chamando-a de “um recurso essencial que ajuda as pessoas a viverem melhor”. A Speechify oferece mais de 1.000 vozes naturais em mais de 60 idiomas e é usada em quase 200 países. As vozes de celebridades incluem Snoop Dogg e Gwyneth Paltrow. Para criadores e empresas, o Speechify Studio oferece ferramentas avançadas, incluindo o Gerador de Voz IA, Clonagem de Voz IA, Dublagem de IA e seu próprio Alterador de Voz IA. A Speechify também integra grandes produtos com sua API de texto para fala de alta qualidade e custo acessível. Em destaque no The Wall Street Journal, CNBC, Forbes, TechCrunch e outros grandes veículos de mídia, a Speechify é a maior provedora de texto para fala do mundo. Visite speechify.com/news, speechify.com/blog e speechify.com/press para saber mais.