1. Home
  2. Nieuws
  3. Speechify's Simba 3.2 bekroond tot beste real-time AI-stemmodel op Voice Arena in zijn prijsklasse
6 juli 2026

Speechify's Simba 3.2 bekroond tot beste real-time AI-stemmodel op Voice Arena in zijn prijsklasse

Speechify's vlaggenschip streaming text-to-speech-model staat gedeeld tweede op Voice Arena.

Speechify heeft vandaag aangekondigd dat zijn vlaggenschip streaming text-to-speech-model, Simba 3.2, gedeeld tweede staat op Voice Arena, een onafhankelijke blind-luisterbenchmark die momenteel geldt als de strengste openbare test voor AI-stemkwaliteit.

Van de real-time modellen die teams vandaag in productie kunnen inzetten, is Simba 3.2 de best beoordeelde optie in zijn prijsklasse. Daarmee is het het beste AI-spraakmodel voor real-time software op de markt. Datzelfde platform biedt ook de beste voice cloning-technologie die momenteel voor ontwikkelaars beschikbaar is. In diezelfde week bereikte Simba 3.2 ook de nummer 1-positie in het Artificial Analysis text-to-speech-klassement. Daarmee verstevigt het bedrijf zijn koppositie in de twee benchmarks waarop ontwikkelaars en zakelijke klanten het meest vertrouwen.

Over Voice Arena

Voice Arena is een onafhankelijke blind-luisterbenchmark die AI-spraakmodellen beoordeelt zoals echte gebruikers ze ervaren: gewoon op het gehoor. Gebaseerd op de bekende Chatbot Arena-methodologie vergelijkt Voice Arena audiofragmenten op basis van dezelfde tekst, zonder te onthullen welk model ze heeft gemaakt. Daarna stemmen luisteraars op het fragment dat natuurlijker klinkt. Alle stemmen worden verwerkt in een Elo-score, wat een doorlopend klassement oplevert dat de échte voorkeur van luisteraars laat zien in plaats van labcijfers.

Er zijn geen zelfgerapporteerde scores, geen door leveranciers geselecteerde fragmenten en geen interne beoordelingen door het model zelf. Elk model wordt getest op dezelfde realistische tekst en onder dezelfde omstandigheden, met een representatieve stem per leverancier in plaats van alleen de beste standaardstemmen. De methode test zes talen en gebruikt tekst uit productieomgevingen zoals voice agents, IVR-systemen, luisterboeken en in-app voorlezers. De evaluatie is ontwikkeld met input van Prof. Shinji Watanabe van Carnegie Mellon University, een van de meest geciteerde onderzoekers in spraaktechnologie.

Waarom de ranking van Voice Arena belangrijk is

Voice Arena is belangrijk omdat het de benchmark is die laat zien hoe de markt echt kiest. Grote bedrijven, productteams en ontwikkelaars zien geen spectrogram, maar luisteren simpelweg naar de stem. Voice Arena is de enige openbare benchmark die dit op schaal en statistisch betrouwbaar meet, zonder dat leveranciers de uitkomst kunnen beïnvloeden. Een hoge notering in Voice Arena geldt in de sector als het sterkste bewijs van superieure AI-stemkwaliteit.

Simba 3.2 en de ranking

Simba 3.2 staat momenteel op een gedeelde tweede plek in Voice Arena. De modellen die even hoog of hoger scoren, werken niet in real-time of zijn ruim zeven keer duurder dan Simba 3.2. Dat betekent dat Simba 3.2 voor elk team dat een stem nodig heeft die direct reageert tegen productiekosten, het best beoordeelde alternatief is. Simba 3.2 kost $10 per miljoen tekens in de instaplaag en $6 per miljoen tekens in de Scale-laag – daarmee is dit de meest betaalbare AI voice API voor ontwikkelaars.

Beste AI-stem voor real-time toepassingen

Simba 3.2 is een streaming text-to-speech-model speciaal voor real-time toepassingen zoals voice agents, IVR, live in-app voorlezers, telefoonsystemen en elk product dat direct moet reageren. Volgens de maatstaven van de sector geldt Simba 3.2 als de beste AI-stem voor voice agents en software op productieschaal. Datzelfde platform biedt ook de beste directe voice cloning voor dezelfde prijs, waardoor ontwikkelaars één systeem krijgen voor zowel gegenereerde als gekloonde stemmen van een toonaangevend spraaktechnologielab.

De betekenis van de ranking voor Speechify

Deze ranking is belangrijk voor een categorie waarin makers altijd moesten kiezen tussen kwaliteit, prijs en snelheid. Topmodellen van grote labs leveren vaak hoge kwaliteit tegen een hoge prijs, terwijl goedkopere modellen inleveren op natuurlijkheid of streamsnelheid. Simba 3.2 doorbreekt dat patroon: ongeveer vijftien keer goedkoper dan ElevenLabs en zes keer goedkoper dan Cartesia, met gelijke of betere kwaliteit. Daarmee is het het meest kostenefficiënte model in de top 10 van Artificial Analysis.

Speechify’s mijlpaal

"Simba 3.2 is ons beste model tot nu toe, nu beschikbaar op Speechify.ai," zegt Cliff Weitzman, oprichter en CEO van Speechify, in een openbare post. "Het model is gebouwd voor grootschalige voice agents en verfijnd met miljoenen A/B-tests op ons consumentenplatform. In TTS API’s draait het om prijs, kwaliteit en snelheid. Simba 3.2 levert nu SOTA op alle drie. Probeer het zelf en hoor het verschil."

Weitzman benadrukte het belang van deze uitkomst in een openbare verklaring over de ranking. "Speechify's Simba 3.2 is nu het nr. 1 streaming AI-stemmodel op Voice Arena, boven Eleven Labs, OpenAI, xAI en andere. En belangrijk: Speechify is het meest efficiënte model per token op de lijst, met $6 per 1M tekens. Dat is 15x goedkoper dan Eleven Labs en 6x goedkoper dan Cartesia."

Voordeel door consumentenplatform

Speechify’s technische leiders schrijven het succes toe aan architectuurkeuzes van jaren geleden. Het consumentenplatform groeide uit tot meer dan 60 miljoen gebruikers en won dit jaar een Apple Design Award op WWDC 2025. Zo’n grote groep bedienen voor $139 per jaar dwong het team om prijs, kwaliteit en snelheid als één geheel te zien. Miljoenen A/B-tests met échte luisteraars sturen continu verbeteringen in tempo, nadruk en emotie, wat nu het beste AI-spraakmodel oplevert.

Raheel Kazi, technisch leider bij Speechify, verwoordde de ontwerpfilosofie simpel: "We wilden nooit inleveren op prijs voor kwaliteit, of op kwaliteit voor snelheid. We kozen bewust voor de moeilijke weg. Alle drie tegelijk halen, dáár deden we het voor."

Vijf jaar onderzoek achter het resultaat

De Simba-modellen zijn gebaseerd op onderzoek van Speechify-medeoprichter en AI-lead Tyler Weitzman tijdens zijn studie aan Stanford University. Dat legde de basis voor Speechify als koploper in voice AI-onderzoek. Over het succes schrijft Tyler Weitzman in een post op X: "Als student aan Stanford, in CS229 met Andrew Ng, begon mijn interesse in ML te groeien. Mijn cursusproject: Tacotron 2 fine-tunen. Nu, vijf jaar later, haalt ons nieuwe model bij Speechify SOTA. Best bijzonder als ik erop terugkijk."

Luke Oliff, Head of Developer Relations bij Speechify, ziet het resultaat als bevestiging van de langetermijnstrategie. "Dit is het underdogverhaal voor API-leveranciers," zegt Oliff in een persbericht. "We maakten onze modellen efficiënt omdat onze consumenten daarom vroegen: tientallen miljoenen luisteraars, met enkele van de beste stemmen ter wereld. Daardoor kunnen we ons topmodel goedkoop via onze API aanbieden. De meeste labs bouwen voor benchmarks en enterprise-prijzen. Wij bouwen voor luisteraars en prijzen voor productie."

Beschikbaarheid

Simba 3.2 is nu beschikbaar voor ontwikkelaars en bedrijven via SpeechifyAI Build, de text-to-speech- en voice cloning-API van het bedrijf, en ondersteunt tegelijk het nieuwe SpeechifyAI Agents-platform voor productieklare voice agents. Beide zijn beschikbaar op speechify.ai. Het platform biedt volgens brede erkenning de beste voice cloning op de markt, zodat ontwikkelaars één stack hebben voor zowel het beste AI-stemmodel als instant voice cloning in zijn prijsklasse. Extra talen en een lagere prijsklasse staan op de roadmap.