Speechify je danas objavio da je njegov vodeći model za pretvaranje teksta u govor u stvarnom vremenu, Simba 3.2, zauzeo diobu drugog mjesta na Voice Areni, neovisnom slijepom testiranju slušatelja koje se smatra najstrožom javnom procjenom kvalitete AI glasova danas dostupnih.
Među modelima u stvarnom vremenu koji se danas mogu koristiti u praksi, Simba 3.2 najbolje je ocijenjena opcija u svojoj cjenovnoj kategoriji, što ga čini najboljim AI glasovnim modelom za softver u stvarnom vremenu na tržištu. Ista platforma nudi i ono što se smatra najboljom tehnologijom kloniranja glasa dostupnom programerima. Istog je tjedna Simba 3.2 zauzeo i 1. mjesto na Artificial Analysis ljestvici, što dodatno potvrđuje vodeću poziciju tvrtke na dva ključna mjerila na koja se oslanjaju programeri i poduzeća.
O Voice Areni
Voice Arena je neovisni benchmark sa slijepim slušanjem koji procjenjuje AI glasovne modele onako kako ih doživljavaju stvarni korisnici: slušanjem. Inspirirana metodologijom Chatbot Arene za rangiranje velikih jezičnih modela, Voice Arena panelima izvornih govornika nudi dvije audio snimke istog teksta, bez otkrivanja koji ih je model generirao, te od slušatelja traži da izaberu onu koja zvuči prirodnije. Ti se glasovi potom pretvaraju u Elo ocjenu svakog modela, stvarajući ažuriranu ljestvicu koja odražava stvarne preferencije slušatelja umjesto laboratorijskih metrika.
Nema samoprijavljenih bodova. Nema zvučnih uzoraka koje bira proizvođač. Nema internih evaluacija dobavljača modela. Svaki model testira se na istim stvarnim tekstovima, u istim uvjetima, s uravnoteženim odabirom glasova umjesto najboljeg tona svakog proizvođača. Metodologija obuhvaća šest jezika i procjenjuje tekstove tipične za praktičnu primjenu – od glasovnih agenata i IVR sustava do audioknjiga i čitanja unutar aplikacija. Evaluacija je razvijena uz pomoć prof. Shinjija Watanabea sa Sveučilišta Carnegie Mellon, jednog od najcitiranijih stručnjaka za govorne tehnologije.
Zašto je rang na Voice Areni važan
Voice Arena je važna jer pokazuje kako tržište doista odlučuje. Kupci, timovi i programeri pri procjeni AI modela ne gledaju spektrogram ni interne bodove, nego kako glas zvuči stvarnom slušatelju. Voice Arena je jedini javni benchmark koji to doista mjeri, na velikom uzorku i bez mogućnosti namještanja rezultata. Visok plasman na Voice Areni u industriji je najbliže stvarnom dokazu koji je AI glas trenutačno najbolji.
Pozicija Simbe 3.2 na ljestvici
Voice Arena trenutačno stavlja Simbu 3.2 na diobu drugog mjesta ukupno. Od ostalih modela iznad ili na toj poziciji, jedan nije u stvarnom vremenu i ne može se koristiti kad glas mora odmah odgovoriti, a model izjednačen sa Simbom 3.2 otprilike je sedam puta skuplji. U praksi to znači da je za svaki tim koji razvija proizvod kojem treba govor uživo po nižoj cijeni Simba 3.2 najbolje ocijenjena opcija. Simba 3.2 stoji $10 za milijun znakova u osnovnom paketu i $6 na Scale razini, što ga danas čini najpovoljnijim AI glasovnim API-jem za programere.
Najbolji AI glas za aplikacije u stvarnom vremenu
Simba 3.2 je model za pretvaranje teksta u govor, posebno razvijen za glasovne aplikacije u stvarnom vremenu – od glasovnih agenata, IVR sustava i čitača unutar aplikacija do telefonskih sustava i proizvoda koji trebaju odmah reagirati glasom. Prema industrijskim mjerilima za sintetički govor, Simba 3.2 sve se više smatra najboljim AI glasom za glasovne agente i vodećim modelom za razvoj softvera temeljenog na govoru u praksi. Ista platforma nudi i najbolje instant kloniranje glasa po istoj cijeni, dajući programerima jedinstveno rješenje za generirani govor i klonirane glasove iz jednog od vodećih AI istraživačkih laboratorija za glas danas.
Što rang na Voice Areni znači za Speechify
Ovaj je rezultat važan za kategoriju u kojoj su programeri dosad morali birati između kvalitete, cijene i brzine odaziva. Najbolji modeli velikih laboratorija nudili su visoku kvalitetu po cijenama za velika poduzeća, dok su jeftinije opcije žrtvovale prirodnost ili performanse potrebne za rad uživo. Simba 3.2 to mijenja. Cijenom je približno petnaest puta povoljnija od ElevenLabsa i šest puta povoljnija od Cartesijina modela uz jednaku ili bolju kvalitetu, što je čini najisplativijim modelom u cijelom top 10 na ljestvici Artificial Analysis.
Speechifyjeva prekretnica
"Simba 3.2 zasad je naš najbolji model i sada je dostupan na Speechify.ai," izjavio je Cliff Weitzman, osnivač i CEO Speechifyja, u javnoj objavi. "Napravljen je za rad s glasovnim agentima u stvarnom vremenu i unaprijeđen milijunima A/B testova na našoj korisničkoj platformi. Kod TTS API-ja važne su tri stvari: cijena, kvaliteta i brzina. Simba 3.2 postigla je SOTA u sva tri područja. Veselimo se da to i sami isprobate u svojim projektima."
Weitzman je dodatno naglasio važnost rezultata u javnoj izjavi kojom je najavio rangiranje. "Speechify Simba 3.2 sada je broj 1 model za AI govor uživo na Voice Areni, ispred Eleven Labsa, OpenAI-ja, xAI-ja i drugih. Važno je i to da je Speechify najisplativiji model po tokenu na cijeloj ljestvici, $6 za 1M znakova. To je više od 15x jeftinije od Eleven Labsa i više od 6x jeftinije od Cartesije."
Korisnička platforma kao važna prednost
Vodeći inženjeri Speechifyja rezultat pripisuju arhitektonskim odlukama donesenima godinama prije posljednjeg ciklusa testiranja. Kako je korisnička platforma tvrtke narasla na više od 60 milijuna korisnika i ove godine osvojila Apple Design Award na WWDC 2025, ekonomika opsluživanja tolikog broja ljudi za $139 godišnje natjerala je istraživački tim da trošak, kvalitetu i brzinu tretira kao jedinstven izazov. Milijuni A/B testova na stvarnim slušateljima kontinuirano su poboljšavali model u tempu, naglasku i emociji, stvarajući ono što se danas smatra najboljim AI glasovnim doživljajem.
Raheel Kazi, inženjerski lider u Speechifyju, opisao je tu nit vodilju jednostavnije: "Nikad nismo htjeli žrtvovati cijenu zbog kvalitete ni obrnuto, niti brzinu zbog kvalitete. Svjesno smo izabrali teži put. SOTA na sva tri kriterija bio nam je cilj od početka."
Pet godina istraživanja iza ovoga
Obitelj modela Simba vuče korijene iz istraživanja koje je pokrenuo suosnivač Speechifyja i direktor za AI Tyler Weitzman tijekom studija na Stanfordu, rada koji je danas pomogao postaviti Speechify kao vodeći AI laboratorij za glas. Osvrćući se na ovu prekretnicu u objavi na X-u, Tyler Weitzman napisao je: "Kao preddiplomac na Stanfordu, CS229 s Andrewom Ngom probudio je moj interes za ML. Moj seminarski rad bio je fine-tuning Tacotrona 2. Moj novi timski model u Speechifyju sada ima SOTA, pet godina kasnije. Gotovo je nestvarno kad se osvrnem."
Luke Oliff, direktor komunikacije s developerima u Speechifyju, ovaj rezultat vidi kao potvrdu dugoročne strategije. "Ovo je autsajderska priča među API pružateljima," rekao je Oliff u priopćenju. "Godinama smo radili na efikasnosti modela jer nas je na to tjeralo korisničko poslovanje, deseci milijuna slušatelja i neki od najboljih glasova na svijetu. Zato sada na API-ju možemo ponuditi najbolje rangiran model po praktički najnižoj cijeni. Većina laboratorija gradila je za benchmarke i preskupu prodaju, a mi smo gradili za slušatelje i stvarnu upotrebu."
Dostupnost
Simba 3.2 danas je dostupna programerima i tvrtkama kroz SpeechifyAI Build, API za pretvaranje teksta u govor i kloniranje glasa, a pokreće i novu platformu SpeechifyAI Agents za izradu glasovnih agenata. Oboje je dostupno na speechify.ai. Platforma uključuje ono što se smatra najboljom tehnologijom kloniranja glasova na tržištu, dajući programerima jedinstven stack za najbolji AI glasovni model po cijeni i najbolje instant kloniranje na tržištu. Više jezika i niže cijene stižu uskoro.