Skip to main content
  1. Início
  2. API
  3. Como a API de Texto para Fala da Speechify Suporta 13 Emoções
Updated on •API

Como a API de Texto para Fala da Speechify Suporta 13 Emoções

Cliff Weitzman

CEO e fundador da Speechify

A API Speechify oferece latência de 300 ms, vozes com qualidade humana e suporte a mais de 50 idiomas

AppleApple Design Award 2025
50M+ usuários

Por que a emoção é o novo marco na síntese de voz

Vai desenvolver por conta própria? A API de texto para fala e clonagem de voz da Speechify está em speechify.ai, com documentação e chave gratuita em docs.speechify.ai.

O TTS moderno resolveu o problema da inteligibilidade há anos. O Blizzard Challenge, referência anual que acompanha os avanços em síntese de fala desde 2005, mostrou que, em 2021, a fala sintética já era indistinguível da fala natural em inteligibilidade e praticamente equivalente em naturalidade também (Perrotin et al., 2024). O setor evoluiu. A pergunta deixou de ser dá para entender a voz e passou a ser a voz transmite o sentido do que está dizendo. Agora, a Speechify oferece não só leitura em voz alta, mas também leitura em voz alta com emoção.

Speechify oferece leitura em voz alta com emoção

A seleção de emoções da Speechify inclui: Raiva, Alegre, Triste, Aterrorizado, Relaxado, Medroso, Surpreso, Calmo, Assertivo, Energético, Acolhedor, Direto e Brilhante. A seleção foi pensada para cobrir a variação tonal que um narrador, ator ou apresentador real usaria em um único projeto. Um vídeo explicativo pode começar Brilhante, passar para Calmo na parte técnica e terminar Acolhedor. Um personagem de jogo pode alternar de Assertivo para Aterrorizado entre duas falas.

Como usar emoções no Gerador de Voz IA da Speechify

O Gerador de Voz IA está disponível no Speechify Studio e é usado por criadores para narrações, vídeos de marketing, audiolivros e trechos de podcast. Basta colar o roteiro, escolher uma voz e aplicar o estilo emocional ao áudio inteiro ou apenas a uma seleção. Como as emoções são aplicadas por seleção, a mesma narração pode começar com um gancho Alegre, trazer um argumento Assertivo e terminar com uma despedida Acolhedora, sem trocar de voz.

Alguns casos práticos em que isso faz diferença:

Vídeos de marketing feitos em ferramentas como CapCut geralmente exigem duas ou três variações de tom: chamar atenção, gerar expectativa, engajar. Em vez de gravar três narrações separadas, basta uma única narração mudando de emoção a cada frase. Audiolivros e narrações de ficção ganham ainda mais, já que os diálogos podem ter diferentes cargas emocionais sem exigir mais de um narrador. Em vídeos explicativos, uma voz Calma lendo trechos densos soa mais clara do que tentar parecer "envolvente" o tempo todo.

Como usar emoções na API da Speechify

Para desenvolvedores, as mesmas 13 emoções estão disponíveis na API da Speechify por meio da tag SSML <speechify:style>. Basta envolver o trecho desejado, indicar a emoção, e a API retorna o áudio com a emoção aplicada apenas naquela parte. Assim, assistentes virtuais podem soar Assertivos ao confirmar um pagamento e Acolhedores ao cumprimentar o usuário, sem trocar de voz durante a sessão.

Plataformas de e-learning usam esse mesmo recurso para personalizar feedback de quiz: Alegre para acertos, Direto para correções, Calmo para dicas. Softwares de ficção interativa fazem a voz do personagem mudar de emoção a cada fala, permitindo que a voz clonada de um único ator dê conta de todo o elenco.

Gerador de Voz IA da Speechify vs. API da Speechify: qual usar?

Aplicação

Gerador de Voz IA (Studio)

API

Narrações, marketing, audiolivros

Sim, editor visual, emoção por seleção

Possível, mas pode ser demais

Voz integrada a apps, assistentes e e-learning

Não recomendado

Sim, com tags SSML <speechify:style>

Formato

Interface web

API REST

Melhor quando

Você está produzindo o áudio final

Você gera áudio sob demanda no seu produto

Como vozes emocionais ampliam o que é possível criar

O TTS emocional é a peça que faltava para projetos criativos. Uma única voz famosa pode narrar um audiolivro inteiro, um personagem animado pode tanto fazer piadas quanto lamentar, e a abertura de um podcast pode encontrar o tom certo — algo que não funcionava com uma síntese plana. Agora funciona, porque a emoção está na voz, não só na direção do roteiro. Para criadores que já usam vozes famosas e de personagens na Speechify, os estilos emocionais fazem com que a voz não apenas se pareça com a original, mas também interprete como ela.

Voz emocional melhora a compreensão do conteúdo?

Sim, e isso já foi comprovado também fora do universo da IA. Em um estudo de 2022 com jovens de 11 a 13 anos, repetido em 2025, Dylman e Champoux-Larsson descobriram que os ouvintes acertaram mais respostas quando o mesmo conteúdo era lido com prosódia positiva do que com tom neutro (Dylman et al., 2025). O ganho de compreensão não foi pequeno e se manteve tanto na lembrança imediata quanto na tardia. Para educação, tutoriais de produto e qualquer áudio longo em que a retenção importa, uma voz emocional contribui muito como apoio à compreensão.

Perguntas frequentes

O que é leitura em voz alta com emoção?

É fala sintética com um tom emocional escolhido (como alegre ou triste) além das palavras, então a mesma frase pode soar de formas diferentes. Com a Speechify, é possível escolher a emoção por trecho.

Quantas emoções a Speechify suporta?

Treze: Raiva, Alegre, Triste, Aterrorizado, Relaxado, Medroso, Surpreso, Calmo, Assertivo, Energético, Acolhedor, Direto e Brilhante — disponíveis no Gerador de Voz IA da Speechify e na API da Speechify.

Onde controlo a emoção no Gerador de Voz IA?

No Speechify Studio, depois de inserir o texto, o seletor de emoção aparece ao lado do seletor de voz. Aplique no áudio inteiro ou em uma seleção e renderize.

Como uso emoções na API da Speechify?

Envolva o trecho com a tag SSML <speechify:style>, definindo a emoção. A API retorna o áudio com a emoção aplicada apenas nessa parte.

Posso combinar emoções em uma narração?

Sim. Emoções podem ser aplicadas por seleção no Speechify Studio e por tag SSML na API, permitindo que uma narração mude de tom frase por frase sem trocar de voz.

As vozes emocionais soam tão naturais quanto as neutras?

Quase idênticas. Modelos de TTS emocional revisados por pares alcançam notas de 3,94/5,0 em expressividade e 3,98/5,0 em naturalidade, ou seja, os ouvintes avaliam ambas quase no mesmo nível.

Voz emocional realmente ajuda o ouvinte a reter o conteúdo?

Pesquisas com humanos mostram que sim. A prosódia positiva melhora a recordação de fatos em estudos controlados. O mesmo vale para narrações IA bem dirigidas.

Posso usar vozes emocionais em narrações comerciais?

A licença da Speechify cobre o uso comercial de narrações, incluindo estilos emocionais. Consulte seu plano para entender os limites de duração.

A emoção funciona com vozes clonadas ou de celebridades?

Sim. Os estilos emocionais são aplicados sobre a voz-base na Speechify, então uma voz clonada pode expressar todas as 13 emoções sem precisar gravar interpretações separadas.

Qual é a diferença entre usar emoção e ajustar só a velocidade ou o tom?

Emoções mudam toda a prosódia, incluindo pausas, ênfase, entonação e energia. Por isso, a versão "raiva" não soa apenas como a neutra mais rápida e aguda.


Tenha acesso às vozes favoritas da Speechify via API de forma rápida, escalável e amigável para desenvolvedores

Acessar API
Sparse JavaScript keywords import, from, const, await on a white background

Compartilhar este artigo

Cliff Weitzman

CEO e fundador da Speechify

Cliff Weitzman é um defensor da causa da dislexia e CEO e fundador da Speechify, o app nº 1 do mundo para leitura em voz alta, com mais de 100 mil avaliações cinco estrelas e em 1º lugar na App Store na categoria Notícias & Revistas. Em 2017, Weitzman foi incluído na lista Forbes 30 Under 30 por seu trabalho para tornar a internet mais acessível para pessoas com transtornos de aprendizagem. Cliff Weitzman já foi destaque em publicações como EdSurge, Inc., PC Mag, Entrepreneur e Mashable.

Speechify

Sobre a Speechify

Leitor de Texto em Voz Alta nº 1

Speechify é a principal plataforma de leitura de texto em voz alta do mundo, confiada por mais de 50 milhões de usuários e com mais de 500.000 avaliações cinco estrelas em seus aplicativos de leitura em voz alta para iOS, Android, extensão para Chrome, web app e para Mac. Em 2025, a Apple premiou a Speechify com o prestigiado Apple Design Award na WWDC, chamando a plataforma de “um recurso essencial que ajuda as pessoas a viverem suas vidas.” A Speechify oferece mais de 1.000 vozes naturais em mais de 60 idiomas, sendo usada em quase 200 países. Vozes de celebridades incluem Snoop Dogg e Gwyneth Paltrow. Para criadores e empresas, o Speechify Studio oferece ferramentas avançadas, incluindo Gerador de Voz IA, Clonagem de Voz IA, Dublagem IA e seu Modificador de Voz IA. A Speechify também impulsiona produtos líderes de mercado com sua solução de API de leitura em voz alta de alta qualidade e baixo custo. Destaque em The Wall Street Journal, CNBC, Forbes, TechCrunch e outros grandes veículos de imprensa, a Speechify é a maior provedora de leitura em voz alta do mundo. Acesse speechify.com/news, speechify.com/blog e speechify.com/press para saber mais.