Skip to main content
  1. Hem
  2. API
  3. Hur Speechify Text-to-Speech API stöder 13 känslolägen
Updated on •API

Hur Speechify Text-to-Speech API stöder 13 känslolägen

Cliff Weitzman

vd och grundare av Speechify

Speechify API erbjuder 300 ms latens, röster i mänsklig kvalitet och 50+ språk

Apple2025 Apple Design Award
50M+ användare

Varför känslor är nästa steg inom talsyntes

Bygger du själv? Speechifys text-till-tal- och röstklonings-API finns på speechify.ai, med dokumentation och gratis nyckel på docs.speechify.ai.

Modern TTS löste begriplighet redan för flera år sedan. Blizzard Challenge, ett årligt riktmärke som följt utvecklingen sedan 2005, rapporterade att syntetiskt tal 2021 var omöjligt att skilja från naturligt tal när det gäller förståelse och i princip även naturlighet (Perrotin et al., 2024). Fältet gick därför vidare. Frågan var inte längre går rösten att förstå utan låter rösten som att den menar det den säger. Nu erbjuder Speechify inte bara text-till-tal utan även emotionellt text-till-tal.

Speechify erbjuder emotionellt text-till-tal

Speechifys känsloregister omfattar Arg, Glad, Ledsen, Skräckslagen, Avslappnad, Rädd, Förvånad, Lugn, Bestämd, Energisk, Varm, Direkt och Ljusstark. De har valts för att täcka det tonala spann en berättarröst, skådespelare eller presentatör använder i ett och samma projekt. En produktvideo kan börja ljusstarkt, gå över till lugnt i de tekniska delarna och avsluta varmt. En spelkaraktär kan växla från bestämd till skräckslagen från en replik till nästa.

Använd känslor i Speechify AI Voice Generator

AI Voice Generator finns i Speechify Studio och används för voiceovers, marknadsföringsfilmer, ljudböcker och poddsegment. Klistra in ditt manus, välj en röst och lägg sedan på en känslostil på hela klippet eller ett valt avsnitt. Eftersom känslor väljs per markering kan samma voiceover ha en glad introduktion, en bestämd argumentation och ett varmt avslut utan att du behöver byta röst.

Några exempel där detta spelar stor roll:

Marknadsföringsfilmer som skapas i verktyg som CapCut behöver ofta flera tonlägen, till exempel för att fånga uppmärksamhet, bygga förväntan och landa i en uppmaning. I stället för tre separata röster får du en voiceover där känslan skiftar rad för rad. Ljudböcker och skönlitteratur vinner ännu mer på detta, eftersom karaktärsdialog kan få olika känslolägen utan att du behöver flera inläsare. För förklarande innehåll är en lugn röst genom en komplex sektion tydligare än att försöka låta "medryckande" hela vägen.

Använd känslor i Speechify API

För utvecklare finns samma 13 känslor i Speechify API via <speechify:style>-taggen i SSML. Du omsluter texten du vill styra, anger känsla och API:et returnerar ljud där känslan bara gäller den markerade delen. Det gör att virtuella assistenter kan låta bestämda vid betalningsbekräftelser och varma vid återkommande hälsningar, utan att byta röst mitt i sessionen.

E-lärande-plattformar använder samma metod för quizfeedback: glad vid rätt svar, direkt vid rättelse och lugn som ledtråd. Interaktiva berättelsemotorer märker också upp karaktärsdialog rad för rad via API:t, så en klonad röst kan täcka hela rollistan.

Speechify AI Voice Generator vs Speechify API: Vilken ska du välja?

Användningsområde

AI Voice Generator (Studio)

API

Voiceovers, marknadsföring, ljudböcker

Ja, visuell editor och känslor per markering

Möjligt, men oftast onödigt

App-röster, assistenter, e-lärande

Mindre lämplig

Ja, med SSML <speechify:style>-taggar

Format

Webbgränssnitt

REST API

Bäst när

Du skapar färdiga ljudfiler

Du genererar ljud direkt i din produkt

Här gör känslostyrda röster verklig skillnad

Emotionell TTS är det som har saknats för kreativt innehåll. En enda kändisröst kan bära en hel ljudbok, en animerad figur kan förmedla både humor och sorg och en poddintro kan träffa rätt ton direkt – något som inte var möjligt med platt syntes. Nu fungerar det, eftersom känslan sitter i rösten och inte bara i manuset. För dem som redan använder Speechifys kändis- och karaktärsröster är emotionella stilar skillnaden mellan en röst som bara låter som förlagan och en röst som faktiskt agerar som den.

Ger känslostyrt tal faktiskt bättre förståelse?

Ja, och det går också att mäta hos människor. I en studie från 2022 med 11–13-åringar och en replikering 2025 fann forskarna Dylman och Champoux-Larsson att lyssnare svarade rätt på fler frågor när samma information lästes med positiv känsla jämfört med neutral ton (Dylman et al., 2025). Förståelsen ökade tydligt och effekten höll i sig även vid senare återkallande. I utbildning, produktgenomgångar och längre ljudformat är en känslomässigt träffsäker röst ett verkligt stöd för förståelsen.

FAQ

Vad är text-till-tal med känslor?

Det är syntetiskt tal med en vald känsloton, som glad eller ledsen, utöver själva orden, så att samma mening kan låta på olika sätt. Med Speechify väljer du känsla per markering.

Hur många känslor stöder Speechify?

Tretton: Arg, Glad, Ledsen, Skräckslagen, Avslappnad, Rädd, Förvånad, Lugn, Bestämd, Energisk, Varm, Direkt och Ljusstark – tillgängliga både i Speechify AI Voice Generator och Speechify API.

Var styr jag känslan i AI Voice Generator?

I Speechify Studio visas en känsloväljare bredvid röstvalet efter att du har klistrat in ditt manus. Lägg på den på hela klippet eller på valda delar och rendera om.

Hur använder jag känslor i Speechify API?

Omslut texten med SSML-taggen <speechify:style> och ange önskad känsla som attribut. API:et returnerar ljud där känslan bara gäller den taggade delen.

Kan jag kombinera känslor i en och samma voiceover?

Ja. Känslor kan väljas per markering i Speechify Studio och per tagg i API:t, så en voiceover eller session kan skifta ton rad för rad utan att byta röst.

Låter känslostyrda röster lika naturliga som neutrala?

Nästan identiskt. Fackgranskade TTS-modeller med känslor får i dag cirka 3,94/5,0 för uttrycksfullhet och 3,98/5,0 för naturlighet – alltså nästan lika högt på båda punkterna.

Hjälper känslosam uppläsning lyssnaren att minnas?

Studier visar att svaret är ja för mänskliga talare. Positiv känsla förbättrar minnet av fakta. Samma gäller för välregisserade AI voiceovers.

Kan jag använda känslostyrda röster för kommersiella voiceovers?

Speechifys licens täcker kommersiell användning av genererade voiceovers, även med känslostil. Kontrollera din plan för eventuella längdbegränsningar.

Fungerar känsla med klonade eller kändisröster?

Ja. Känslostilar läggs ovanpå basrösten i Speechify, så en klonad röst kan bära alla 13 känslor utan att du behöver spela in nytt för varje variant.

Hur skiljer detta sig från att bara ändra hastighet eller tonhöjd?

Känslor ändrar prosodin som helhet – pauser, betoning, intonation och energi. Därför låter "arg" inte bara som en snabb, hög version av en neutral röst.


Få tillgång till Speechifys prisade röster via API – snabbt, skalbart och utvecklarvänligt

Få API-åtkomst
Sparse JavaScript keywords import, from, const, await on a white background

Dela artikeln

Cliff Weitzman

vd och grundare av Speechify

Cliff Weitzman är dyslexiförespråkare samt vd och grundare av Speechify, världens ledande text‑till‑tal‑app, med över 100 000 femstjärniga omdömen och har toppat App Store-kategorin Nyheter & Magasin. 2017 listade Forbes Weitzman på "30 under 30" för hans arbete med att göra internet mer tillgängligt för personer med lässvårigheter. Han har uppmärksammats i bland annat EdSurge, Inc., PC Mag, Entrepreneur och Mashable.

Speechify

Om Speechify

#1 text-till-tal-läsare

Speechify är världens ledande text-till-tal-plattform, betrodd av över 50 miljoner användare och med mer än 500 000 femstjärniga recensioner för sina text-till-tal-iOS-, Android-, Chrome-tillägg-, webbapp- och Mac desktop-appar. År 2025 tilldelade Apple Speechify det prestigefyllda Apple Design Award på WWDC och kallade det ”en avgörande resurs som hjälper människor leva sina liv”. Speechify erbjuder över 1 000 naturtrogna röster på 60+ språk och används i nästan 200 länder. Kändisröster inkluderar Snoop Dogg och Gwyneth Paltrow. För kreatörer och företag erbjuder Speechify Studio avancerade verktyg, inklusive AI Voice Generator, AI Voice Cloning, AI Dubbing och AI Voice Changer. Speechify driver även ledande produkter med sitt högkvalitativa och kostnadseffektiva text-till-tal-API. Med omnämnanden i The Wall Street Journal, CNBC, Forbes, TechCrunch och andra stora nyhetskanaler är Speechify världens största leverantör av text-till-tal. Besök speechify.com/news, speechify.com/blog och speechify.com/press för att läsa mer.