Speechify hat heute bekannt gegeben, dass sein führendes Streaming-Text-to-Speech-Modell, Simba 3.2, auf Voice Arena den geteilten zweiten Platz erreicht hat – einem unabhängigen Blindtest-Benchmark, der weithin als strengste öffentliche Bewertung für die Qualität von KI-Stimmen gilt.
Unter den Echtzeitmodellen, die Teams heute produktiv einsetzen können, ist Simba 3.2 die am besten bewertete Option in seiner Preisklasse – und damit das beste KI-Stimmenmodell für Echtzeit-Software am Markt. Die gleiche Plattform bietet außerdem die wohl beste Sprachklontechnologie für Entwickler. In derselben Woche erreichte Simba 3.2 auch Platz 1 auf dem Artificial Analysis Text-to-Speech-Leaderboard und baut damit die Führung von Speechify auf den beiden wichtigsten Benchmarks aus, auf die Entwickler und Unternehmen setzen.
Über Voice Arena
Voice Arena ist ein unabhängiger Blindtest-Benchmark, der KI-Stimmenmodelle so bewertet, wie echte Nutzer sie erleben: mit dem Ohr. Nach dem Vorbild der Chatbot-Arena-Methode zur Bewertung großer Sprachmodelle erhalten Panels aus Muttersprachlern zwei identische Audioclips – ohne zu wissen, welches Modell sie erzeugt hat – und stimmen darüber ab, welche Stimme natürlicher klingt. Die Stimmen erhalten daraus eine Elo-Bewertung, aus der ein fortlaufend aktualisiertes Leaderboard entsteht, das echte Nutzerurteile statt Labormetriken widerspiegelt.
Es gibt keine selbst eingereichten Bewertungen, keine von Anbietern kuratierten Audiodateien und keine interne Beurteilung. Jedes Modell wird mit demselben realen Text unter gleichen Bedingungen getestet – mit ausgewogen ausgewählten Stimmen je Anbieter und nicht nur mit deren Standardstimme. Die Methode umfasst sechs Sprachen und nutzt Texte aus echten Text-to-Speech-Anwendungsfällen – von Sprachassistenten und IVR bis hin zu Hörbüchern und In-App-Readern. Entwickelt wurde die Bewertung mit Input von Prof. Shinji Watanabe von der Carnegie Mellon University, einem der meistzitierten Forscher im Bereich Sprachtechnologie.
Warum das Voice-Arena-Ranking zählt
Das Voice-Arena-Ranking ist marktentscheidend, weil es die reale Entscheidungsgrundlage abbildet. Käufer, Produktteams und Entwickler erleben keine Spektrogramme oder internen Qualitätswerte – sie hören Stimmen. Voice Arena ist der einzige öffentliche Benchmark, der genau dieses reale Nutzererlebnis in großem Maßstab misst und dabei keine Möglichkeit bietet, das Ergebnis zu beeinflussen. Ein hoher Rang bei Voice Arena gilt in der Branche als maßgeblicher Indikator für die beste verfügbare KI-Stimme.
Wie Simba 3.2 abschneidet
Voice Arena führt Simba 3.2 derzeit auf dem geteilten zweiten Platz. Von den darüber platzierten Modellen läuft eines nicht in Echtzeit und kann daher in produktiven Anwendungen nicht eingesetzt werden, und das Modell, das sich den Platz mit Simba 3.2 teilt, kostet etwa das Siebenfache. Praktisch heißt das: Für Teams, die ein Produkt bauen, das Stimmen in Echtzeit und kosteneffizient benötigt, ist Simba 3.2 im Benchmark die bestbewertete Option. Simba 3.2 kostet 10 $ pro eine Million Zeichen im Einstiegstarif und 6 $ im Scale-Tarif – aktuell die günstigste KI-Stimmen-API für Entwickler.
Die beste KI-Stimme für Echtzeitanwendungen
Simba 3.2 ist ein Streaming-Text-to-Speech-Modell, das speziell für Echtzeit-Sprachanwendungen entwickelt wurde – von Sprachassistenten, IVR und Live-In-App-Readern bis hin zu Telefonsystemen und überall dort, wo sofortige Reaktionen zählen. Nach allen branchenüblichen Maßstäben gilt Simba 3.2 als beste KI-Stimme für Voice Agents und als bestes verfügbares KI-Stimmenmodell für Teams, die Sprachsoftware produktiv entwickeln. Die Plattform liefert zudem die beste Instant-Sprachklonung zum selben Preis – alles in einem System aus einem der führenden Voice-AI-Forschungslabore von heute.
Was das Voice-Arena-Ranking für Speechify bedeutet
Das Ranking ist bedeutsam für eine Kategorie, in der Entwickler bislang zwischen Qualität, Kosten und Latenz wählen mussten. Spitzenmodelle der größten Labore lieferten hohe Qualität oft nur in teuren Enterprise-Verträgen, günstigere Alternativen machten Abstriche bei Natürlichkeit oder Streaming-Leistung. Simba 3.2 ändert das: Der Preis ist rund 15-mal niedriger als bei ElevenLabs und 6-mal niedriger als bei Cartesia – bei vergleichbarer oder besserer Qualität. Damit ist Simba 3.2 das kosteneffizienteste Modell in den Top 10 des Artificial Analysis Leaderboards.
Speechifys Meilenstein
„Simba 3.2 ist unser bisher bestes Modell – jetzt auf Speechify.ai verfügbar“, so Cliff Weitzman, Gründer und CEO von Speechify, in einem öffentlichen Beitrag. „Es ist für Sprachagenten im großen Maßstab gebaut und durch Millionen von A/B-Tests auf unserer Plattform perfektioniert. Bei TTS-APIs zählen drei Faktoren: Kosten, Qualität, Latenz. Simba 3.2 hat in allen drei Bereichen SOTA erreicht. Ich freue mich, wenn ihr es selbst ausprobiert.“
Weitzman betonte die Bedeutung des Ergebnisses in einer öffentlichen Stellungnahme zur Platzierung: „Speechifys Simba 3.2 ist jetzt das bestbewertete Streaming-KI-Stimmenmodell auf Voice Arena – vor ElevenLabs, OpenAI, xAI und anderen. Wichtig: Speechify ist mit 6 $ pro 1 Mio. Zeichen das kosteneffizienteste Modell auf dem Leaderboard. Über 15× günstiger als ElevenLabs und über 6× günstiger als Cartesia.“
Eine Consumer-Plattform als unfairer Vorteil
Speechifys Technikführung sieht das Ergebnis als Folge früher Architekturentscheidungen. Als die Nutzerbasis der Plattform auf über 60 Millionen wuchs und dieses Jahr bei der WWDC 2025 mit dem Apple Design Award ausgezeichnet wurde, zwang das Abo-Modell für 139 $ pro Jahr das Forschungsteam dazu, Kosten, Qualität und Latenz als gemeinsames Problem zu betrachten. Millionen von A/B-Tests aus echten Hörsessions haben die Sprachleistung – etwa Tempo, Betonung und Emotion – stetig verbessert und ermöglichen heute das beste KI-Stimmenerlebnis.
Raheel Kazi, ein Technikleiter bei Speechify, beschreibt das Leitprinzip so: „Wir wollten nie bei den Kosten sparen und dafür Qualität einbüßen – oder umgekehrt. Wir haben uns bewusst für den schwierigeren Weg entschieden. Alle drei SOTA-Maßstäbe gleichzeitig zu erreichen – genau darum ging es uns immer.“
Fünf Jahre Forschung für dieses Ergebnis
Die Simba-Modellfamilie geht auf Forschung zurück, die Speechify-Mitgründer und KI-Chef Tyler Weitzman während seines Informatikstudiums in Stanford begann. Das hat Speechify zu einem führenden Voice-AI-Forschungslabor gemacht. In einem Beitrag auf X blickt Tyler Weitzman zurück: „Als Undergrad in Stanford, in CS229 mit Andrew Ng, begann mein Interesse an ML. Mein Kursprojekt war das Fine-Tuning von Tacotron 2. Unser neues Modell bei Speechify hat jetzt SOTA erreicht, fünf Jahre später. Schwer zu glauben, wenn ich zurückblicke.“
Luke Oliff, Head of Developer Relations bei Speechify, sieht das Ergebnis als Bestätigung eines langfristigen Ansatzes: „Das ist die Underdog-Story für API-Anbieter“, so Oliff in einer Pressemitteilung. „Jahrelang haben wir unsere Modelle auf Effizienz getrimmt, weil unser Consumer-Geschäft das verlangt hat – zig Millionen Zuhörer, mit einigen der besten Stimmen weltweit. Nur so können wir jetzt das weltweit beste Modell als günstige API anbieten. Die meisten Labs bauen für Benchmarks und Enterprise. Wir bauen für Hörer und den Produktiveinsatz.“
Verfügbarkeit
Simba 3.2 steht ab heute für Entwickler und Unternehmen über SpeechifyAI Build – die Text-to-Speech- und Sprachklonungs-API – sowie über die neue SpeechifyAI Agents Plattform für produktive Sprachagenten bereit. Beide sind unter speechify.ai verfügbar. Die Plattform umfasst die wohl beste Sprachklontechnologie und bietet Entwicklern einen vollständigen Stack mit dem besten Modell und der besten Sprachklonung in jeder Preisklasse. Weitere Sprachen und ein günstigeres Modell sind geplant.