Speechify bietet eine klar strukturierte Auswahl an Text-to-Speech-Modellen. Die Wahl des passenden Modells ist immer ein Abwägen zwischen Latenz, unterstützten Sprachen und Stimmqualität. Dieser Leitfaden zeigt, welches Modell sich für welchen Anwendungsfall eignet, damit Sie gezielt entscheiden können, ohne alle Modelle selbst testen zu müssen.
Die Model-Posts auf speechify.ai bieten zu jeder Version detaillierte Einblicke. Die Simba-3.2-Ankündigung erklärt, warum dieses Modell jetzt empfohlen wird.
Mehr zum Einstieg in die Speechify Text-to-Speech-API finden Sie in unserem Quickstart-Guide.
Sie möchten das selbst umsetzen? Die Speechify Text-to-Speech- und Voice-Cloning-API finden Sie auf speechify.ai; Dokumentation und einen kostenlosen Schlüssel gibt es unter docs.speechify.ai.
Welche Modelle bietet Speechify?
Es gibt drei Modellreihen.
- Simba 3.2
- : Das empfohlene Modell für Englisch. Für Streaming optimiert, mit der geringsten Latenz und ausgewählten englischen Stimmen. Ideal für interaktive Anwendungen.
- Simba 3.0
- : Die aktuelle Standardoption der API. Ebenfalls für Streaming optimiert und mehrsprachig: Englisch, Deutsch, Spanisch, Französisch, Italienisch und brasilianisches Portugiesisch. Die Latenz ist etwas höher als bei 3.2, dafür ist die Sprachabdeckung größer.
- Legacy-Modelle (
- simba-english
- ,
- simba-multilingual
- ): Das Simba-1.6-Duo. Ab API-Version 2026-09-21 veraltet, Abschaltung am 2026-11-21. Nur verwenden, wenn eine bestehende Integration auf eine bestimmte ältere Stimme oder Sprache angewiesen ist – planen Sie die Migration jetzt.
Welches Modell ist am schnellsten?
Simba 3.2. Es wurde für Streaming entwickelt und liefert den ersten Ton am schnellsten. Für englische Voice-Agents ist es die beste Wahl.
Simba 3.0 liegt nur knapp dahinter, bringt aber den Mehraufwand für Mehrsprachigkeit mit. Die älteren Modelle sind am langsamsten und sollten möglichst ersetzt werden.
Welches Modell unterstützt die meisten Sprachen?
Simba 3.0. Es unterstützt offiziell Englisch, Deutsch, Spanisch (Spanien und Mexiko), Französisch, Italienisch und brasilianisches Portugiesisch. Übergeben Sie den language-Parameter bei POST /v1/audio/speech, um die Sprache auszuwählen – zurückgegeben wird dann eine passende Stimme. Das ältere simba-multilingual deckt mehr als 30 Sprachen ab, wird aber ab API-Version 2026-09-21 eingestellt und am 2026-11-21 abgeschaltet.
Wenn Ihr Produkt nur in einer Sprache erscheint, liegt Simba 3.2 bei Tempo und Qualität vorn. Für mehrsprachige Angebote bietet Simba 3.0 derzeit die größere Sprachabdeckung.
Mehr zur Sprachunterstützung finden Sie in unseren Docs.
Welches Modell klingt am besten?
Die Qualität steigt mit jeder Modellgeneration. Simba 3.2 überzeugt mit besonders natürlichem Englisch. Simba 3.0 bietet solide Qualität in allen verfügbaren Sprachen. Die Legacy-Modelle klingen am stärksten maschinell.
Für Anwendungen mit direktem Kundenkontakt sollten Sie bevorzugt Simba 3.2 oder Simba 3.0 einsetzen.
Wie kann ich verfügbare Stimmen auflisten?
Nutzen Sie GET /v1/voices. Filtern Sie nach Typ, Sprache, Geschlecht und Modell, um die passende Stimme auszuwählen. Die Voice- und Model-Posts auf speechify.ai zeigen das Antwortformat.
Streaming oder Batch?
Beide Simba-3-Modelle unterstützen Streaming. Nutzen Sie POST /v1/audio/stream für die Live-Wiedergabe, POST /v1/audio/stream/with-timestamps für Live-Audio mit Zeitstempeln und Wortmarkierungen und POST /v1/audio/speech für einzelne Dateien. Die Modellauswahl ist unabhängig vom Auslieferungsweg.
FAQ
Welches Speechify TTS-Modell wird empfohlen?
Simba 3.2. Der Standard für neue Projekte: für Streaming optimiert, mit der schnellsten Ausgabe und der besten Qualität für Englisch.
Simba 3.2 für Englisch: für Streaming optimiert, schnellste Ausgabe, höchste Qualität. Standardmäßig verwendet die API Simba 3.0, wenn kein model angegeben ist. Setzen Sie model: "simba-3.2", um Simba 3.2 gezielt zu nutzen.
Ja. Simba 3.0 unterstützt einen Sprachparameter und liefert passende native Stimmen für viele Sprachen. Simba 3.2 konzentriert sich auf ausgewähltes Englisch.
Ja. Simba 3.0 unterstützt einen Sprachparameter und liefert native Stimmen für Englisch sowie sechs europäische Sprachen. Simba 3.2 konzentriert sich auf ausgewähltes Englisch.
Nur wenn eine bestehende Integration auf eine ältere Stimme angewiesen ist. Andernfalls wechseln Sie zu Simba 3.2 oder Simba 3.0.
Nur solange eine Integration auf eine ältere Stimme angewiesen ist. Die Modelle werden ab API-Version 2026-09-21 eingestellt und am 2026-11-21 abgeschaltet. Migrieren Sie rechtzeitig zu Simba 3.2 oder Simba 3.0.
Nutzen Sie Simba 3.2 für die geringste Latenz. Streamen Sie die Ausgabe für Live-Anwendungen.

