Speechify har kunngjort at deres ledende strømmede tekst-til-tale-modell, Simba 3.2, har tatt 1. plass på Artificial Analysis' tekst-til-tale-ledertavle – det mest omfattende, uavhengige referansepunktet for kommersielt tilgjengelige tale-AI-modeller. Resultatet plasserer Simba 3.2 foran flaggskip fra ElevenLabs, Cartesia, OpenAI, Google DeepMind og xAI, og markerer første gang et forbrukerrettet taleselskap topper verdensrankingen. Med måltallene bransjen bruker for å vurdere tale-AI, regnes Simba 3.2 nå som markedets beste AI-stemmemodell. I tillegg topper Simba 3.2 også Voice Arena for sanntidsmodeller, og styrker Speechifys posisjon på de to benchmarkene utviklere og bedrifter stoler mest på.
Om Artificial Analysis
Artificial Analysis-ledertavlen er referansepunktet utviklere og bedrifter bruker for å vurdere AI-stemmemarkedet. Den gir en konsekvent og objektiv vurdering av alle kommersielle modeller, oppdateres fortløpende ved nye lanseringer, og følges tett av produktteam med stemmeintegrasjon i løsningene sine. I motsetning til leverandørenes egne tester, bygger tavlen ikke på selvrapporterte tall. Det gjør Simba 3.2 til den beste tekst-til-tale-modellen for utviklere i dag.
Hva Artificial Analysis-rangeringen betyr for prisnivået
Det viktigste ved rangeringen er ikke bare kvalitetspoengene, men kombinasjonen av dem og modellens prisnivå. Simba 3.2 koster $10 per million tegn på Speechifys startnivå og faller til $6 per million på Scale-nivået, og er dermed den mest kostnadseffektive modellen blant de ti beste på Artificial Analysis-ledertavlen. Speechifys ledelse beskriver prisen som rundt femten ganger lavere enn ElevenLabs og seks ganger lavere enn Cartesia med samme eller bedre kvalitet — og posisjonerer Simba 3.2 som markedets mest prisgunstige AI-stemme-API i produksjonskvalitet.
Denne kombinasjonen har historisk blitt sett på som umulig innen talesyntese. Toppsjiktet har levert naturtro AI-stemmer for bedriftsmarkedet, mens rimeligere nivåer har vært rettet mot utviklere med lavere kvalitetskrav. Simba 3.2 bryter med dette på en måte bransjen ikke har sett før, og gjør markedets beste AI-stemme tilgjengelig for enhver utvikler, startup eller bedrift, uansett budsjett.
Speechifys gründer om å oppnå trifectaen
«Simba 3.2 er vår beste modell til nå, og er nå tilgjengelig på Speechify.ai,» sier Cliff Weitzman, grunnlegger og CEO i Speechify, på LinkedIn. «Den er bygget for å drive stemmeagenter i stor skala, og er finpusset gjennom millioner av A/B-tester i forbrukerplattformen vår. For TTS-API-er er tre ting viktig: pris, kvalitet og latenstid. Simba 3.2 scorer topp på alle tre. Jeg gleder meg veldig til at folk får prøve den i sine egne løsninger.»
Den «trifectaen» Weitzman viser til, har for de fleste AI-stemmeleverandører vært en grense. Å optimalisere for én faktor har normalt krevd kompromisser på de to andre, og leverandørene har derfor valgt sitt segment. Å faktisk være best på alle tre samtidig har av mange blitt sett på som urealistisk. Artificial Analysis-rangeringen er det første uavhengige beviset på at dette lar seg gjøre, og slår fast at Simba 3.2 er den beste AI-stemmemodellen for team som bygger stemmebaserte løsninger.
Fem år fra Stanford til toppsjiktet
Simba-familien startet som forskning av Speechify-medgründer og AI-leder Tyler Weitzman under studiene hans ved Stanford University. De tidlige forsøkene med nevrale talearkitekturer i et maskinlæringskurs utviklet seg i løpet av de neste fem årene til modellserien som nå står bak strømmet stemmegenerering på tvers av Speechifys forbruker- og bedriftsprodukter — og plasserer Speechify som et ledende AI-talelab.
Tyler Weitzman ser tilbake på milepælen i et innlegg på X: «Som bachelorstudent på Stanford vekket CS229 med Andrew Ng interessen min for ML. Prosjektet mitt var finjustering av Tacotron 2. Teamets nye modell hos Speechify nådde toppnivå etter fem år. Det er ganske surrealistisk å se tilbake på.»
Rohan Pavuluri, forretningssjef i Speechify og mangeårig venn av Tyler Weitzman, omtaler plasseringen som resultatet av tidlige arkitekturbeslutninger i en nylig kunngjøring. «Vi kunne kanskje kommet raskere ut hvis vi bare fokuserte på kvalitet, men forbrukerfokuset og forretningsmodellen krevde tidlig at vi sikret at vi kunne levere nærmest ubegrenset tale til brukerne for $139/år. Det gir i dag toppmodellen innen TTS til best pris, noe som er sjeldent i AI-forskning med høy ytelse.»
Forbrukerskala driver bedrifts-AI
Speechifys evne til å levere markedets beste AI-stemme til lavest pris blant topp ti-modellene henger sammen med økonomien i forbrukervirksomheten. Plattformen brukes av over 60 millioner verden over, og ble i år tildelt Apple Design Award på WWDC 2025 – et tegn på at produktet regnes som blant de beste AI-stemmeopplevelsene i dag. Å kunne tilby dette for $139/år krevde at forskningen fra start var bygget rundt effektivitet, i stedet for å optimalisere det i ettertid. Denne disiplinen gjør det mulig å levere toppmodellen på Artificial Analysis-ledertavlen til prisene utviklerne nå får.
«Dette er underdog-historien for API-leverandører,» sier Luke Oliff, utvikleransvarlig i Speechify, i en pressemelding. «Vi brukte år på å gjøre modellene effektive fordi forbrukerne krevde det – titalls millioner lyttere, noen av verdens beste stemmer. Derfor kan vi nå levere verdens høyest rangerte modell som API så billig. De fleste laboratorier bygde for benchmarket, med priser for bedrifter. Vi bygde for lytterne, med priser for produksjon.»
Tilgjengelighet
Simba 3.2 er tilgjengelig nå via SpeechifyAI Build, Speechifys tekst-til-tale- og stemmeklonings-API, og driver også den nye SpeechifyAI Agents-plattformen for produksjonsklare stemmeagenter. Begge kan prøves på speechify.ai, med egne TypeScript- og Python-SDK-er, strømmestøtte med lav oppstartstid, avansert følelsesstyring og SSML-prosodi. Plattformen inkluderer markedets beste stemmekloningsteknologi, så utviklere får både verdens beste AI-stemmemodell og lynrask stemmekloning til samme pris. Flere språk og rimeligere modellnivåer står på selskapets veikart.