Speechify har annonceret, at deres førende streamende tekst-til-tale-model, Simba 3.2, har taget førstepladsen på Artificial Analysis' tekst-til-tale-leaderboard – det mest omfattende uafhængige benchmark for kommercielle stemme-AI-modeller. Resultatet placerer Simba 3.2 foran flagskibsmodeller fra ElevenLabs, Cartesia, OpenAI, Google DeepMind og xAI og markerer første gang, at et forbrugerrettet taleselskab topper de globale ranglister. Ifølge branchens standarder bliver Simba 3.2 nu bredt vurderet som den bedste AI-stemmemodel på markedet. Derudover ligger Simba 3.2 også nummer ét på Voice Arena for realtidsmodeller, hvilket styrker Speechifys føring på de to benchmarks, som udviklere og erhvervskunder stoler mest på.
Om Artificial Analysis
Artificial Analysis-leaderboardet er det referencepunkt, udviklere og virksomheder bruger til at vurdere AI-stemmemarkedet. Det laver objektive evalueringer af alle kommercielle modeller, opdateres løbende, når nye modeller lanceres, og følges tæt af produktteams, der bygger stemmefunktioner ind i deres apps. I modsætning til leverandørernes egne tests bygger leaderboardet ikke på selvrapporterede resultater. Derfor er Simba 3.2 i dag den bedste tekst-til-tale-model, udviklere kan få adgang til.
Hvad Artificial Analysis-rangeringen betyder for prisen
Det vigtigste ved placeringen er ikke kun kvaliteten, men kombinationen med prisen. Simba 3.2 koster $10 pr. million tegn på Speechifys startniveau og $6 pr. million tegn på Scale-niveau, hvilket gør den til den mest omkostningseffektive model i Artificial Analysis' top ti. Ifølge Speechify-ledelsen er prisen cirka femten gange lavere end ElevenLabs og seks gange lavere end Cartesia ved samme eller bedre kvalitet, hvilket gør Simba 3.2 til den mest prisvenlige AI-stemme-API i produktionskvalitet i dag.
Den kombination er tidligere blevet set som strukturelt umulig i talegenerering. Premium-markedet har leveret livagtige AI-stemmer til enterprise-priser, mens den billige ende har henvendt sig til udviklere med lavere krav. Simba 3.2 bryder med den modsætning og leverer nu den bedste AI-stemme til både udviklere, startups og virksomheder – uanset budget.
Speechifys grundlægger om at ramme plet på alle tre
"Simba 3.2 er vores bedste model til dato, nu tilgængelig på Speechify.ai," siger Cliff Weitzman, grundlægger og CEO for Speechify på LinkedIn. "Den er bygget til at drive stemmeagenter i stor skala og finpudset gennem millioner af A/B-tests på vores platform. I TTS-API’er tæller tre ting: pris, kvalitet og latenstid. Simba 3.2 topper alle tre. Jeg glæder mig til, at du prøver den selv!"
Den tredobbelte sejr, Weitzman nævner, er en grænse, de fleste AI-stemmeudbydere har set som uopnåelig. At optimere ét område har krævet kompromiser på de andre, og leverandørerne har derfor valgt hvert sit fokus. At være i front på alle tre – pris, kvalitet og latenstid – har længe været mere en forskningsdrøm end virkelighed. Artificial Analysis-rangeringen er nu det første uafhængige bevis på, at det kompromis kan overvindes, og placerer Simba 3.2 som den bedste AI-stemmemodel for teams, der bygger voice-first software.
Fem år fra Stanford til banebrydende AI
Simba-modellerne udspringer af forskning fra Speechify-medstifter og Head of AI Tyler Weitzman under hans studier på Stanford University. Hans tidlige eksperimenter med neurale talearkitekturer til et maskinlæringskursus udviklede sig over fem år til den modellinje, der nu driver streamende stemmegenkendelse i Speechifys produkter, og har gjort Speechify til et førende forskningsmiljø inden for stemme-AI.
Om milepælen skriver Tyler Weitzman i et opslag på X: "Som bachelorstuderende på Stanford vækkede CS229 med Andrew Ng min interesse for ML. Mit kursusprojekt var finjustering af Tacotron 2. Fem år senere nåede vores nye model hos Speechify SOTA. Det er ret vildt at tænke tilbage på."
Rohan Pavuluri, Chief Business Officer hos Speechify og mangeårig ven af Tyler Weitzman, fremhævede rangeringen som resultatet af en tidlig arkitekturbeslutning i et opslag. "Vi kunne måske være gået hurtigere frem og kun have fokuseret på kvalitet, men vores forbruger-DNA og forretningsmodel krævede tidligt, at vi byggede, så vi næsten kunne tilbyde ubegrænset tale til brugerne for 139 USD/år. Det betyder, at vi i dag har en SOTA TTS-model til den bedste pris – sjældent i AI, hvor bedre ofte også betyder dyrere."
Forbrugerskala driver enterprise AI
Speechifys evne til at levere markedets bedste AI-stemme til den laveste pris i top ti bygger på økonomien i deres forretning. Platformen bruges af mere end 60 mio. mennesker globalt og vandt i år en Apple Design Award ved WWDC 2025 – et tegn på, at Speechifys forbrugerprodukt regnes blandt de bedste AI-stemmeoplevelser i dag. For at kunne betjene brugere for $139 om året blev effektiv inferens et grundlæggende designkrav fra start – ikke bare en senere optimering. Den tilgang gør det muligt at levere førstepladsen på Artificial Analysis-leaderboardet til den pris, udviklere nu ser.
"Det her er lidt af en underdog-historie for API-udbydere," siger Luke Oliff, Head of Developer Relations hos Speechify i en pressemeddelelse. "Vi brugte år på at gøre vores modeller effektive, fordi vores forretning krævede det – titusinder af millioner lyttere med nogle af verdens bedste stemmer. Derfor kan vi nu tilbyde verdens højest vurderede model via vores API til lavest mulige pris. De fleste laboratorier har bygget til benchmarks og prissat til virksomheder. Vi har bygget til lyttere og prissat til produktion."
Tilgængelighed
Simba 3.2 er tilgængelig nu via SpeechifyAI Build, Speechifys tekst-til-tale- og stemmeklonings-API, og driver den nye SpeechifyAI Agents-platform til stemmeagenter i produktion. Begge tilbydes på speechify.ai med TypeScript- og Python-SDK’er, streaming med lav latenstid, detaljeret følelsesstyring og SSML-prosodi. Platformen tilbyder markedets bredt anerkendte bedste stemmekloning, så udviklere kan bruge én samlet løsning til både topklasse AI-stemme og lynhurtig stemmekloning – til samme pris. Flere sprog og en billigere model er på vej.