Speechify hat bekannt gegeben, dass sein führendes Streaming-Modell für Text-to-Speech, Simba 3.2, Platz 1 auf der Artificial Analysis Bestenliste für Text-to-Speech erreicht hat – dem umfassendsten unabhängigen Benchmark für kommerziell verfügbare KI-Stimmenmodelle. Damit liegt Simba 3.2 vor den Spitzenmodellen von ElevenLabs, Cartesia, OpenAI, Google DeepMind und xAI und zum ersten Mal steht ein verbraucherorientiertes Sprachunternehmen an der Weltspitze. Nach den Maßstäben der Branche gilt Simba 3.2 nun weithin als das beste KI-Stimmenmodell auf dem Markt. Zudem belegt Simba 3.2 auch Platz 1 bei Voice Arena für Echtzeit-Modelle und baut damit Speechifys Vorsprung bei den beiden Benchmarks aus, denen Entwickler und Unternehmen am meisten vertrauen.
Über Artificial Analysis
Die Artificial Analysis Bestenliste ist der Referenzpunkt, den Entwickler und Unternehmen zur Bewertung des KI-Stimmenmarkts nutzen. Sie bietet eine konsistente, objektive Bewertung aller kommerziell verfügbaren Modelle, wird laufend aktualisiert und von Produktteams, die Sprachausgabe integrieren, genau verfolgt. Im Gegensatz zu von Anbietern veröffentlichten Benchmarks basiert sie nicht auf selbst gemeldeten Werten. Nach diesem Maßstab ist Simba 3.2 derzeit das beste Text-to-Speech-Modell für Entwickler.
Was die Platzierung bei Artificial Analysis für die Erschwinglichkeit bedeutet
Das Bemerkenswerteste an der Platzierung ist nicht nur die Qualitätsbewertung, sondern die Kombination mit dem Preis. Simba 3.2 kostet bei Speechifys Einstiegstarif $10 pro eine Million Zeichen und sinkt im Scale-Tarif auf $6 pro Million Zeichen – und ist damit das günstigste Modell unter den Top 10 der Artificial Analysis Bestenliste. Die Geschäftsführung von Speechify beschreibt den Preis als rund 15-mal günstiger als ElevenLabs und 6-mal günstiger als Cartesia – bei gleicher oder besserer Qualität. Damit ist Simba 3.2 aktuell die erschwinglichste KI-Stimmen-API auf Produktionsniveau.
Diese Kombination galt in der Sprachsynthese lange als strukturell unmöglich. Das Premium-Segment bot lebensechte KI-Stimmen zu Preisen für Großunternehmen an – günstige Modelle richteten sich an Entwickler, die geringere Qualität in Kauf nahmen. Simba 3.2 durchbricht dieses Dilemma auf völlig neue Weise: Es liefert jetzt die beste KI-Stimme für Entwickler, Start-ups und Unternehmen – unabhängig vom Budget.
Speechifys Gründer über das Erreichen der Trifecta
„Simba 3.2 ist unser bisher bestes Modell, jetzt verfügbar auf Speechify.ai“, sagt Cliff Weitzman, Gründer und CEO von Speechify, auf LinkedIn. „Es wurde entwickelt, um Sprachagenten im großen Maßstab anzutreiben, und auf Millionen A/B-Tests auf unserer Verbraucherplattform optimiert. Bei TTS-APIs zählen drei Faktoren: Kosten, Qualität und Latenz. Simba 3.2 hat in allen drei SOTA erreicht. Ich freue mich darauf, dass ihr es selbst ausprobieren und eure Anwendungen damit bauen könnt.“
Die von Weitzman genannte Trifecta galt bei den meisten KI-Stimmenanbietern als Obergrenze: Wer einen Faktor optimierte, musste die anderen opfern – Anbieter entschieden sich meist für ihren Kernbereich. In allen drei Feldern gleichzeitig führend zu sein, galt in der Branche als Wunschdenken. Die Platzierung bei Artificial Analysis liefert erstmals unabhängige Belege dafür, dass dieser Kompromiss überwindbar ist, und positioniert Simba 3.2 als bestes Modell für Voice-First-Teams.
Fünf Jahre von Stanford bis zum Stand der Technik
Die Simba-Modellreihe entstand aus der Forschung von Speechify-Mitgründer und KI-Leiter Tyler Weitzman während seines Studiums an der Stanford University. Seine frühen Experimente mit neuronalen Spracharchitekturen in einem ML-Kurs entwickelten sich über fünf Jahre zu der Modellfamilie, die heute die Sprachgenerierung in Speechifys Produkten für Endkunden und Unternehmen ermöglicht. Damit ist Speechify heute ein führendes KI-Sprachlabor.
Im Rückblick auf den Meilenstein schrieb Tyler Weitzman in einem Post auf X: „Damals als Bachelorstudent in Stanford hat CS229 mit Andrew Ng mein Interesse an ML geweckt. Mein Kursprojekt war das Fine-Tuning von Tacotron 2. Das neue Modell meines Teams bei Speechify hat jetzt nach fünf Jahren SOTA erreicht. Rückblickend ist das ziemlich surreal.“
Rohan Pavuluri, Chief Business Officer von Speechify und langjähriger Freund von Tyler Weitzman, sieht die Platzierung in einer aktuellen Ankündigung als Ergebnis einer frühen Architekturentscheidung: „Wir hätten schneller sein können, wenn wir nur auf Qualität gesetzt hätten, doch unsere DNA und unser Geschäftsmodell verlangten von Anfang an, dass wir die Architektur so planen, dass wir unbegrenzt Sprache für $139/Jahr anbieten können. So entstand heute das beste TTS-Modell zum besten Preis – was in der KI-Forschung selten ist, denn bessere Leistung bedeutet meist höhere Kosten.“
Verbraucherskalierung als Motor für Enterprise-KI
Speechifys Fähigkeit, die beste KI-Stimme am Markt zum niedrigsten Preis der Top 10 anzubieten, beruht auf der Wirtschaftlichkeit seines Verbrauchergeschäfts. Die Plattform wird von über 60 Mio. Menschen weltweit genutzt und erhielt 2025 den Apple Design Award bei der WWDC – ein Zeichen dafür, dass Speechifys Verbraucherprodukt zu den besten KI-Spracherlebnissen zählt. Ein $139-Jahresabo für diese Nutzerzahl erforderte es, effizientes Inferenz-Design schon früh zur Grundlage zu machen und nicht erst später zu optimieren. Diese Konsequenz macht es möglich, das führende Modell der Artificial-Analysis-Liste zum heute sichtbaren Preis anzubieten.
„Das ist die Underdog-Story der API-Anbieter“, sagt Luke Oliff, Head of Developer Relations bei Speechify, in einer Pressemitteilung. „Wir haben jahrelang daran gearbeitet, unsere Modelle effizient zu machen – unser Verbrauchergeschäft verlangte das, bei zig Millionen Nutzern und einigen der besten Stimmen überhaupt. Deshalb können wir jetzt das bestbewertete Modell so günstig anbieten. Die meisten Labore entwickelten für Benchmarks und Unternehmen; wir für Hörer und den Praxiseinsatz.“
Verfügbarkeit
Simba 3.2 ist ab sofort über SpeechifyAI Build, Speechifys Text-to-Speech- und Voice-Cloning-API, erhältlich und treibt die neue SpeechifyAI Agents Plattform für produktive Sprachagenten an. Beides gibt es auf speechify.ai, mit nativen TypeScript- und Python-SDKs, Streaming mit niedriger First-Byte-Latenz, feiner Emotionssteuerung und SSML-Prosodie. Die Plattform enthält die branchenweit beste Voice-Cloning-Technologie – für Entwickler alles in einem Stack: das weltweit beste KI-Stimmenmodell und sofortiges Voice-Cloning zum selben Preis. Weitere Sprachen und günstigere Modellstufen sind geplant.