Speechify tilbyder et begrænset udvalg af text-to-speech-modeller. Valget af den rette model handler om at afveje latenstid, sprogunderstøttelse og stemmekvalitet. Denne guide hjælper dig med at matche hver model til den rette opgave, så du kan vælge uden at teste dem alle.
Indlæggene på speechify.ai går mere i dybden med hver version. Annonceringen af Simba 3.2 forklarer, hvorfor den nu anbefales.
Læs mere om, hvordan du bruger Speechifys text-to-speech API, i vores quickstart-guide.
Bygger du det selv? Speechifys text-to-speech- og stemmeklonings-API findes på speechify.ai, og dokumentation samt gratis nøgle finder du på docs.speechify.ai.
Hvilke modeller tilbyder Speechify?
Der er tre modelfamilier.
- Simba 3.2
- : den anbefalede model til engelsk. Bygget til streaming, hurtigst til første lyd og med udvalgte engelske stemmer. Brug den til alle interaktive oplevelser.
- Simba 3.0
- : den nuværende API-standard. Bygget til streaming og flersproget: engelsk, tysk, spansk, fransk, italiensk og brasiliansk portugisisk. Lidt højere latenstid end 3.2, men bredere sprogunderstøttelse.
- Ældre modeller (
- simba-english
- ,
- simba-multilingual
- ): Simba 1.6-parret. Udgår i API-version 2026-09-21 og lukkes ned 2026-11-21. Brug dem kun, hvis en eksisterende integration kræver en bestemt ældre stemme eller et bestemt sprog – og planlæg migreringen nu.
Hvilken model er hurtigst?
Simba 3.2. Den er bygget til streaming og leverer derfor første lyd hurtigst. Til engelsksprogede stemmeassistenter er den det bedste valg.
Simba 3.0 er næsten lige så hurtig, men flersproget understøttelse giver lidt ekstra ventetid. Ældre modeller er de langsomste og bør udfases, hvor det er muligt.
Hvilken model understøtter flest sprog?
Simba 3.0. Den understøtter officielt engelsk, tysk, spansk (Spanien og Mexico), fransk, italiensk samt brasiliansk portugisisk. Angiv parameteren language i POST /v1/audio/speech for at vælge sprog, så du får en stemme på modersmålsniveau. Den ældre simba-multilingual dækker 30+ sprog, men udfases og lukkes ned i 2026.
Hvis dit produkt kun bruger ét sprog, vinder Simba 3.2 på hastighed og kvalitet. Hvis det skal understøtte flere sprog, er Simba 3.0 det bedste valg lige nu.
Læs mere om sprogunderstøttelse i dokumentationen.
Hvilken model lyder bedst?
Kvaliteten følger modelgenerationen. Simba 3.2 lyder mest naturlig på engelsk. Simba 3.0 leverer god lyd på alle understøttede sprog. Ældre modeller lyder mest robotagtige.
Brug Simba 3.2 eller Simba 3.0 til kundevendt tale.
Hvordan ser jeg de tilgængelige stemmer?
Kald GET /v1/voices. Filtrer efter type, sprog, køn og model for at finde den rette stemme, før du syntetiserer. Indlæg på speechify.ai viser eksempeldata fra svaret.
Streaming eller batch?
Begge Simba 3-modeller understøtter streaming. Brug POST /v1/audio/stream til liveafspilning, POST /v1/audio/stream/with-timestamps til live lyd med tidskoder og ordmarkering samt POST /v1/audio/speech til en enkelt fil. Modelvalget er uafhængigt af leveringsformen.
FAQ
Hvilken Speechify TTS-model anbefales?
Simba 3.2. Som standard til nye projekter: bygget til streaming, hurtigst til første lyd og højeste kvalitet på engelsk.
Simba 3.2 til engelsk: bygget til streaming, hurtigst til første lyd og højeste kvalitet på engelsk. API-standarden ved anmodninger uden model er Simba 3.0, så angiv model: "simba-3.2" eksplicit for at vælge den.
Ja. Simba 3.0 tager en sprogparameter og leverer stemmer på modersmålsniveau på flere sprog. Simba 3.2 fokuserer på udvalgte engelske stemmer.
Ja. Simba 3.0 tager en sprogparameter og leverer stemmer på modersmålsniveau på engelsk og seks europæiske sprog. Simba 3.2 fokuserer på udvalgte engelske stemmer.
Kun hvis en eksisterende integration kræver en bestemt ældre stemme. Ellers bør du skifte til Simba 3.2 eller Simba 3.0.
Kun så længe en integration kræver en bestemt ældre stemme. De udfases og lukkes ned fra 2026, så migrer til Simba 3.2 eller Simba 3.0 inden da.
Vælg Simba 3.2 for den hurtigste responstid. Stream output til livebrug.

