Zwei Benchmarks, die nicht von Speechify durchgeführt wurden, ermittelten im September 2026 die Zeit bis zur ersten Audioausgabe des SpeechifyAI Simba-3.2-Modells. Coval verzeichnete über die 24 Stunden bis zum 24.09.2026 einen Medianwert von 106 ms. Voice Arena meldete am selben Tag auf dem US-Board einen Wert von 123 ms – den niedrigsten Medianwert unter 14 getesteten Modellen. In diesem Beitrag erfahren Sie, was diese Zahlen bedeuten, warum die Zeit bis zum ersten Audio die wichtigste Latenzkennzahl ist und wie Sie sie in Ihrem eigenen Code messen.
Die Zahlen
Die beiden unabhängigen Werte liegen über unseren eigenen Messungen, da sie das Netzwerk zwischen dem Messsystem und unseren Servern sowie mögliche Stille am Anfang des Audios einschließen. Jeder Wert bezieht sich auf das jeweilige Benchmark und Datum. Die Boards werden laufend aktualisiert – prüfen Sie dort die aktuellen Werte.
Voice Arenas US-Board Englisch, 24.09.2026
Quelle: Voice Arena, Stand 24.09.2026. Das Board verglich 14 Modelle; hier sind die sechs schnellsten aufgeführt.
Warum die Zeit bis zur ersten Audioausgabe der wichtigste Wert ist
Wenn ein Sprachagent antwortet oder eine App Text vorliest, wartet der Zuhörer vom Absenden bis zum ersten hörbaren Ton. Diese Wartezeit ist die Zeit bis zur ersten Audioausgabe.
- Time to First Byte kann besser aussehen, als das Hörerlebnis tatsächlich ist. Ein Stream kann mit Stille beginnen, sodass der Zuhörer erst dann etwas hört, wenn das erste hörbare Sample ankommt. Die Zeit bis zum ersten Audio erfasst auch diese Stille.
- Die gesamte Generierungsdauer ist die Wartezeit bis zum letzten Byte. Das ist beim Speichern einer Datei relevant, aber nicht fürs Zuhören beim Streaming.
- In Gesprächen bleibt kaum Zeit. Menschen antworten meist innerhalb weniger Hundert Millisekunden. Ein Sprachagent muss Spracherkennung, Sprachmodell und Sprachsynthese in diese Pause einpassen – jede Millisekunde bei der Stimme fehlt dem Rest des Ablaufs.
Wie Simba 3.2 schneller wurde – ohne kleineres Modell
Laut Coval-Daten sank der Tagesmedian von Simba 3.2 von 379 ms am 13.09.2026 auf 116 ms am 18.09.2026 – also um rund 70 % in fünf Tagen.
Das Modell selbst blieb unverändert: gleiche Gewichte, keine Distillation, keine Quantisierung, keine verkleinerte „Turbo“-Version. Die kürzere Zeit ist ausschließlich auf den Serving Path rund um das Modell zurückzuführen:
- Neuer Serving-Build auf einer anderen GPU-Klasse mit Low-Level-Optimierungen im Inference-Stack – das Audio verlässt den Stack früher.
- Plan-, Berechtigungs- und Rate-Limit-Prüfungen erfolgen aus dem Cache statt per Live-Abfrage vor dem ersten Byte.
- Das API-Gateway läuft in derselben Region wie die GPUs, auf Verbindungen, die zwischen Anfragen warm bleiben.
- Etwa 100 ms Anfangsstille wurden entfernt. Covals Messung für Simba 3.2 sank von 102 ms (14.09.) auf 13 ms.
Die Qualität blieb erhalten. Auf dem Artificial Analysis Text-to-Speech-Leaderboard gehörte Simba 3.2 am 23.09.2026 mit einem Elo-Median von 1.237 (±14) und 92 Stimmen zu den Top 5 – und jedes besser bewertete Modell ist teurer.
So erzielen Sie die niedrigste Latenz in Ihrer App
- Streaming nutzen. Verwenden Sie POST /v1/audio/stream für alles, was schon während der Generierung abgespielt wird. POST /v1/audio/speech liefert erst, wenn der gesamte Audioclip fertig ist.
- Simba 3.2 anfordern. Setzen Sie model für Englisch auf simba-3.2. Ohne model wird simba-3.0 verwendet.
- Eine Verbindung wiederverwenden. Legen Sie einen HTTP-Client an, öffnen Sie die Verbindung beim Start und nutzen Sie sie anschließend für alle Anfragen – so entfallen DNS- und TCP/TLS-Aufbau bei jeder Anfrage.
- Sätze sofort senden. Wenn ein Sprachmodell vorgeschaltet ist, sollte jeder vollständige Satz sofort gesendet und die Audios in der richtigen Reihenfolge abgespielt werden.
- Das passende Format wählen. audio/pcm mit 24 kHz benötigt keine Kodierung. Wählen Sie MP3 oder Ogg Opus, wenn Bandbreite wichtiger ist.
- Die Nähe zur API nutzen. Die API wird aus US East bereitgestellt – ein Server vor Ort oder in der Nähe minimiert die Netzwerkzeit.
Sie bauen auf LiveKit Agents auf? Diese Anleitung zeigt, wie Sie mit dem Speechify-Plugin einen Sprachagenten erstellen, bei dem jeder Satz schon während der Generierung gestreamt wird. Hintergründe und Beispielcode finden Sie in der Latenz-Dokumentation.
Selbst messen
Messen Sie die Zeit bis zum ersten Datenblock einer Streaming-Antwort direkt in Ihrem Code. Für aussagekräftige Werte:
- Verwerfen Sie die ersten 1–2 Anfragen – sie enthalten den Verbindungsaufbau.
- Variieren Sie den Text wie im echten Betrieb.
- Senden Sie die Anfragen nacheinander, nicht parallel.
- Führen Sie mindestens 20 Anfragen durch und notieren Sie Median (p50) und p90, nicht den Durchschnitt oder Bestwert.
- Messen Sie mit PCM – Ogg beginnt mit Headern statt mit Audio.
Jede Streaming-Antwort enthält im Server-Timing-Header das Feld ttfb für unseren Anteil an der Wartezeit. Der Rest entfällt auf Netzwerk und Ihre Infrastruktur. Die Latenz-Dokumentation enthält dazu Python- und TypeScript-Skripte.
Häufig gestellte Fragen
Das Simba-3.2-Modell von SpeechifyAI schrieb bei Produktiv-Traffic in US East am 15.09.2026 das erste Audio-Byte nach 56 ms im Median beziehungsweise 102 ms p90. Unabhängige Benchmarks maßen eine mediane Zeit bis zur ersten Audioausgabe von 106 ms (Coval, 24 Stunden bis 24.09.2026) und 123 ms (Voice Arena, 24.09.2026), jeweils einschließlich Netzwerk und möglicher Anfangsstille.
Auf Voice Arenas US-Board Englisch am 24.09.2026 hatte SpeechifyAI’s Simba 3.2 mit 123 ms die niedrigste mediane Zeit bis zur ersten Audioausgabe unter allen 14 getesteten Modellen – vor Inworld Realtime TTS 2 Research Preview (168,5 ms). Benchmarks werden laufend neu berechnet – prüfen Sie daher immer das Datum, bevor Sie sich darauf verlassen.
Ja. POST /v1/audio/stream sendet Audio in Echtzeit als PCM, MP3, Ogg Opus oder AAC über HTTP. PCM bietet die geringste Latenz, da kein Kodierungsschritt nötig ist.
Nein. SpeechifyAI ist die Entwickler-API von Speechify und wird separat von der Lese-App abgerechnet. Ein Reader-Abo umfasst keine API-Nutzung. Es gibt folgende Pläne: Gratis (500.000 Zeichen/Monat ohne Karte), Starter ($10/Monat, zusätzlicher Verbrauch 10 $/1 Mio. Zeichen), Pro ($99, 8 $), Scale ($499, 6 $).
Testen Sie Simba 3.2 auf SpeechifyAI: Erstellen Sie einen kostenlosen API-Key und vergleichen Sie Ihre eigenen Messungen mit den obigen Werten.

