Skip to main content
  1. Início
  2. TTS
  3. Modelos da API de TTS do Speechify explicados: como escolher o ideal para sua aplicação
Published on TTS

Modelos da API de TTS do Speechify explicados: como escolher o ideal para sua aplicação

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Apple Design Award 2025
Mais de 50M de usuários

O Speechify oferece um conjunto enxuto de modelos de text-to-speech. Para escolher o ideal, é preciso equilibrar latência, cobertura de idiomas e qualidade de voz. Este guia mostra em que caso cada modelo funciona melhor, para você decidir sem precisar testar todos.

As publicações sobre modelos em speechify.ai detalham cada lançamento. O anúncio do Simba 3.2 explica por que ele passou a ser o modelo recomendado.

Saiba como começar a usar a API de text-to-speech do Speechify no nosso guia rápido.

Vai criar isso por conta própria? A API de text-to-speech e clonagem de voz do Speechify está em speechify.ai, com documentação e chave gratuita em docs.speechify.ai.

Quais modelos o Speechify oferece?

Três famílias.

  • Simba 3.2
  • : modelo recomendado para inglês. Feito para streaming, com menor tempo até o primeiro byte e vozes selecionadas em inglês. Use em aplicações interativas.
  • Simba 3.0
  • : padrão atual da API. Feito para streaming e multilíngue: inglês, alemão, espanhol, francês, italiano e português brasileiro. Tem latência um pouco maior que o 3.2, mas cobre mais idiomas.
  • Modelos legados (
  • simba-english
  • ,
  • simba-multilingual
  • ): a dupla Simba 1.6. Serão descontinuados na API a partir de 2026-09-21 e desligados em 2026-11-21. Use apenas se uma integração existente depender de uma voz ou idioma antigos — e já planeje a migração.

Qual modelo é o mais rápido?

Simba 3.2. Como foi feito para streaming, o primeiro áudio chega mais rápido. Para agentes de voz em inglês, é a melhor escolha padrão.

Simba 3.0 chega perto, mas traz a sobrecarga do suporte multilíngue. Os modelos legados são mais lentos e devem ser descontinuados sempre que possível.

Qual modelo cobre mais idiomas?

Simba 3.0. Tem suporte oficial a inglês, alemão, espanhol (Espanha e México), francês, italiano e português brasileiro. Use o parâmetro language no POST /v1/audio/speech para escolher o idioma e obter uma voz nativa. O modelo legado simba-multilingual cobre mais de 30 idiomas, mas será descontinuado na API a partir de 2026-09-21 e desligado em 2026-11-21.

Se o seu produto oferece apenas um idioma, Simba 3.2 leva vantagem em velocidade e qualidade. Para vários idiomas, Simba 3.0 oferece a maior cobertura no momento.

Veja mais sobre suporte a idiomas na nossa documentação.

Qual modelo tem a melhor qualidade de voz?

A qualidade acompanha a geração do modelo. Simba 3.2 lidera em naturalidade no inglês. Simba 3.0 se destaca nos idiomas que cobre. Os modelos legados são mais antigos e soam mais robóticos.

Para usos voltados ao cliente, prefira Simba 3.2 ou Simba 3.0.

Como listar as vozes disponíveis?

Use GET /v1/voices. Filtre por tipo, idioma, gênero e modelo para encontrar a voz ideal antes de sintetizar. As publicações sobre vozes e modelos em speechify.ai mostram o formato da resposta.

Streaming ou batch?

Os dois modelos Simba 3 fazem streaming. Use POST /v1/audio/stream para reprodução ao vivo, POST /v1/audio/stream/with-timestamps para áudio ao vivo com marcação de palavras e POST /v1/audio/speech para gerar um arquivo único. A escolha do modelo é independente da forma de entrega.

Dúvidas frequentes

Qual é o modelo TTS do Speechify recomendado?

Simba 3.2. É o padrão para novos projetos: streaming nativo, entrega de áudio mais rápida e melhor qualidade em inglês.

Simba 3.2 para inglês: streaming nativo, áudio entregue mais rápido e máxima qualidade em inglês. A escolha padrão da API, quando o campo model não é especificado, é Simba 3.0 — defina model: "simba-3.2" explicitamente para usar o 3.2.

Sim. O Simba 3.0 aceita o parâmetro de idioma e retorna vozes nativas em várias regiões. O Simba 3.2 é focado em vozes selecionadas em inglês.

Sim. O Simba 3.0 aceita o parâmetro de idioma e retorna vozes nativas em inglês e seis idiomas europeus. O Simba 3.2 é focado em vozes selecionadas em inglês.

Só se uma integração existente exigir uma voz antiga específica. Caso contrário, migre para Simba 3.2 ou Simba 3.0.

Somente enquanto uma integração existente depender de uma voz antiga específica. Eles serão descontinuados na API a partir de 2026-09-21 e desligados em 2026-11-21, então migre para Simba 3.2 ou Simba 3.0 antes disso.

Escolha Simba 3.2 para o menor tempo até o primeiro byte. Faça streaming da saída em tempo real.

Curta as vozes de IA mais avançadas, arquivos ilimitados e suporte 24/7

Experimente grátis

Compartilhe este artigo

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Luke Oliff is a Developer Relations leader based in the UK. For the better part of a decade he has been working with voice technology, developer tooling, and open-source — improving developer experience for well known brands.

He has architected open-source strategy, launched developer communities, built tools, and shipped conversational AI voice prototypes years before mainstream APIs were available. As an engineer at heart, he writes and speaks about voice AI, developer experience, and real-time APIs as a developer would, focussing on utility and experience.

He has now joined Speechify's AI Labs team, where SIMBA 3.0 ranks 7th on the Artificial Analysis TTS leaderboard out of nearly 80 models.

Speechify logo

Sobre a Speechify

Leitor de texto para fala nº 1

Speechify é a principal plataforma de texto para fala do mundo, confiável por mais de 50 milhões de usuários e com mais de 500.000 avaliações cinco estrelas em suas versões para iOS, Android, extensão para Chrome, web app e aplicativos para Mac desktop. Em 2025, a Apple premiou a Speechify com o prestigiado Apple Design Award na WWDC, chamando-a de “um recurso essencial que ajuda as pessoas a viverem melhor”. A Speechify oferece mais de 1.000 vozes naturais em mais de 60 idiomas e é usada em quase 200 países. As vozes de celebridades incluem Snoop Dogg e Gwyneth Paltrow. Para criadores e empresas, o Speechify Studio oferece ferramentas avançadas, incluindo o Gerador de Voz IA, Clonagem de Voz IA, Dublagem de IA e seu próprio Alterador de Voz IA. A Speechify também integra grandes produtos com sua API de texto para fala de alta qualidade e custo acessível. Em destaque no The Wall Street Journal, CNBC, Forbes, TechCrunch e outros grandes veículos de mídia, a Speechify é a maior provedora de texto para fala do mundo. Visite speechify.com/news, speechify.com/blog e speechify.com/press para saber mais.