Speechify bietet eine kleine Auswahl an Text-to-Speech-Modellen. Welches Modell am besten passt, hängt vom Zusammenspiel aus Latenz, Sprachabdeckung und Stimmqualität ab. Dieser Leitfaden zeigt, welches Modell sich für welchen Anwendungsfall eignet, damit Sie nicht alles selbst testen müssen.
Die Modelldokumentation auf speechify.ai liefert zu jedem Release detaillierte Informationen. Die Ankündigung von Simba 3.2 erklärt, warum dieses Modell jetzt empfohlen wird.
In unserem Quickstart-Guide erfahren Sie mehr über den Einstieg in die Speechify Text-to-Speech API.
Welche Modelle bietet Speechify an?
Es gibt drei Modellfamilien.
- Simba 3.2
- : Das empfohlene Modell für Englisch. Streaming-nativ, mit der kürzesten Zeit bis zum ersten Byte und sorgfältig kuratierten englischen Stimmen. Ideal für interaktive Anwendungen.
- Simba 3.0
- : Das aktuelle Standardmodell der API. Streaming-nativ und mehrsprachig: Englisch, Deutsch, Spanisch, Französisch, Italienisch und brasilianisches Portugiesisch. Etwas höhere Latenz als 3.2, dafür größere Abdeckung.
- Legacy-Modelle (
- simba-english
- ,
- simba-multilingual
- ): Das Simba-1.6-Duo. Ab API-Version 2026-09-21 eingestellt, Abschaltung am 2026-11-21. Nur noch verwenden, wenn eine bestehende Integration auf eine bestimmte ältere Stimme oder Sprache angewiesen ist, und die Umstellung frühzeitig planen.
Welches Modell ist am schnellsten?
Simba 3.2. Es wurde für Streaming entwickelt und liefert das erste Audio am schnellsten. Für englischsprachige Sprachassistenten ist es die erste Wahl.
Simba 3.0 ist ähnlich schnell, wegen seiner Mehrsprachigkeit aber etwas langsamer. Die Legacy-Modelle sind am langsamsten und sollten nach Möglichkeit ersetzt werden.
Welches Modell unterstützt die meisten Sprachen?
Simba 3.0. Dieses Modell unterstützt offiziell Englisch sowie Deutsch, Spanisch (Spanien und Mexiko), Französisch, Italienisch und brasilianisches Portugiesisch. Übergeben Sie den language-Parameter bei POST /v1/audio/speech, und Sie erhalten jeweils eine native Stimme. Das Legacy-Modell simba-multilingual deckt noch mehr als 30 Sprachen ab, wird aber ab API-Version 2026-09-21 eingestellt und am 2026-11-21 abgeschaltet.
Wenn Ihr Produkt nur eine Sprache unterstützt, ist Simba 3.2 bei Geschwindigkeit und Qualität klar im Vorteil. Für mehrere Sprachen bietet Simba 3.0 derzeit die größte Abdeckung.
Weitere Informationen zur Sprachunterstützung finden Sie in unserer Dokumentation.
Welches Modell klingt am besten?
Die Qualität steigt mit jeder Modellgeneration. Simba 3.2 setzt bei englischen Stimmen Maßstäbe in Sachen Natürlichkeit. Simba 3.0 überzeugt in allen unterstützten Sprachen. Die Legacy-Modelle sind am ältesten und klingen am stärksten nach Maschine.
Für kundennahe Anwendungen empfehlen wir Simba 3.2 oder Simba 3.0.
Wie kann ich verfügbare Stimmen auflisten?
Verwenden Sie GET /v1/voices. Filtern Sie nach Typ, Sprache, Geschlecht und Modell, um vor der Synthese die passende Stimme auszuwählen. Die Voice- und Modelldokumentation auf speechify.ai zeigt das Response-Format.
Streaming oder Batch?
Beide Simba-3-Modelle unterstützen Streaming. Verwenden Sie POST /v1/audio/stream für die Live-Ausgabe, POST /v1/audio/stream/with-timestamps für Live-Audio mit Timestamps und Wortmarkierung sowie POST /v1/audio/speech für eine einzelne Datei. Die Modellauswahl ist unabhängig vom Ausgabemodus.
FAQ
Welches Speechify Text-to-Speech-Modell wird empfohlen?
Simba 3.2. Der Standard für neue Projekte: streaming-nativ, mit dem schnellsten ersten Audio und der höchsten Qualität für Englisch.
Simba 3.2 für Englisch: streaming-nativ, mit dem schnellsten ersten Audio und der besten Qualität für Englisch. Setzen Sie model: "simba-3.2", da die API standardmäßig Simba 3.0 verwendet, wenn model nicht angegeben wird.
Ja. Simba 3.0 akzeptiert einen Sprachparameter und liefert native Stimmen für viele Sprachen. Simba 3.2 konzentriert sich auf kuratierte englische Stimmen.
Ja. Simba 3.0 erlaubt die Auswahl der Sprache und liefert native Stimmen für Englisch und sechs europäische Sprachen. Simba 3.2 bietet kuratierte englische Stimmen.
Nur wenn eine bestehende Integration eine bestimmte ältere Stimme benötigt. Andernfalls empfehlen wir Simba 3.2 oder Simba 3.0.
Nur solange eine bestehende Integration auf eine ältere Stimme angewiesen ist. Ab API-Version 2026-09-21 eingestellt, Abschaltung am 2026-11-21. Bitte stellen Sie rechtzeitig auf Simba 3.2 oder Simba 3.0 um.
Wählen Sie Simba 3.2 für die kürzeste Zeit bis zum ersten Byte. Streamen Sie das Ergebnis für Live-Anwendungen.

