Skip to main content
  1. Startseite
  2. API
  3. Text-to-Speech-API-Latenz 2026: Zeit bis zur ersten Audioausgabe, unabhängig gemessen
Published on •API

Text-to-Speech-API-Latenz 2026: Zeit bis zur ersten Audioausgabe, unabhängig gemessen

Speechify Team

Speechify Team


Die Speechify API bietet 300 ms Latenz, Stimmen in menschlicher Qualität und über 50 Sprachen

AppleApple Design Award 2025
50 Mio.+ Nutzer

Zwei Benchmarks, die nicht von Speechify durchgeführt wurden, ermittelten im September 2026 die Zeit bis zur ersten Audioausgabe des SpeechifyAI Simba-3.2-Modells. Coval verzeichnete über die 24 Stunden bis zum 24.09.2026 einen Medianwert von 106 ms. Voice Arena meldete am selben Tag auf dem US-Board einen Wert von 123 ms – den niedrigsten Medianwert unter 14 getesteten Modellen. In diesem Beitrag erfahren Sie, was diese Zahlen bedeuten, warum die Zeit bis zum ersten Audio die wichtigste Latenzkennzahl ist und wie Sie sie in Ihrem eigenen Code messen.

Die Zahlen

Benchmark

Was gemessen wird

Simba 3.2

Wann

Voice Arena, US-Board Englisch

Mediane Zeit bis zur ersten Audioausgabe beim Echtzeit-Streaming

123 ms, niedrigster Wert unter 14 getesteten Modellen

24.09.2026

Coval

Mediane Zeit bis zur ersten Audioausgabe einschließlich möglicher Stille vor dem ersten hörbaren Sample. Open-Source-Tool, alle 30 Minuten aus US-East ausgeführt

106 ms

24 Stunden bis 24.09.2026

SpeechifyAI Produktiv-Traffic (eigene Messung)

Zeit, die unsere API benötigt, um bei echten Kundenanfragen in US East das erste Audio-Byte zu schreiben

56 ms p50, 102 ms p90

15.09.2026

Die beiden unabhängigen Werte liegen über unseren eigenen Messungen, da sie das Netzwerk zwischen dem Messsystem und unseren Servern sowie mögliche Stille am Anfang des Audios einschließen. Jeder Wert bezieht sich auf das jeweilige Benchmark und Datum. Die Boards werden laufend aktualisiert – prüfen Sie dort die aktuellen Werte.

Voice Arenas US-Board Englisch, 24.09.2026

Modell

Mediane Zeit bis zur ersten Audioausgabe

SpeechifyAI Simba 3.2 Echtzeit

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS Echtzeit

236 ms

Cartesia Sonic-3.5 Echtzeit

250 ms

Smallest AI Lightning 3.1 Pro Echtzeit

263,5 ms

Fish Audio S2 Pro Echtzeit

267 ms

Quelle: Voice Arena, Stand 24.09.2026. Das Board verglich 14 Modelle; hier sind die sechs schnellsten aufgeführt.

Warum die Zeit bis zur ersten Audioausgabe der wichtigste Wert ist

Wenn ein Sprachagent antwortet oder eine App Text vorliest, wartet der Zuhörer vom Absenden bis zum ersten hörbaren Ton. Diese Wartezeit ist die Zeit bis zur ersten Audioausgabe.

  • Time to First Byte kann besser aussehen, als das Hörerlebnis tatsächlich ist. Ein Stream kann mit Stille beginnen, sodass der Zuhörer erst dann etwas hört, wenn das erste hörbare Sample ankommt. Die Zeit bis zum ersten Audio erfasst auch diese Stille.
  • Die gesamte Generierungsdauer ist die Wartezeit bis zum letzten Byte. Das ist beim Speichern einer Datei relevant, aber nicht fürs Zuhören beim Streaming.
  • In Gesprächen bleibt kaum Zeit. Menschen antworten meist innerhalb weniger Hundert Millisekunden. Ein Sprachagent muss Spracherkennung, Sprachmodell und Sprachsynthese in diese Pause einpassen – jede Millisekunde bei der Stimme fehlt dem Rest des Ablaufs.

Wie Simba 3.2 schneller wurde – ohne kleineres Modell

Laut Coval-Daten sank der Tagesmedian von Simba 3.2 von 379 ms am 13.09.2026 auf 116 ms am 18.09.2026 – also um rund 70 % in fünf Tagen.

Das Modell selbst blieb unverändert: gleiche Gewichte, keine Distillation, keine Quantisierung, keine verkleinerte „Turbo“-Version. Die kürzere Zeit ist ausschließlich auf den Serving Path rund um das Modell zurückzuführen:

  • Neuer Serving-Build auf einer anderen GPU-Klasse mit Low-Level-Optimierungen im Inference-Stack – das Audio verlässt den Stack früher.
  • Plan-, Berechtigungs- und Rate-Limit-Prüfungen erfolgen aus dem Cache statt per Live-Abfrage vor dem ersten Byte.
  • Das API-Gateway läuft in derselben Region wie die GPUs, auf Verbindungen, die zwischen Anfragen warm bleiben.
  • Etwa 100 ms Anfangsstille wurden entfernt. Covals Messung für Simba 3.2 sank von 102 ms (14.09.) auf 13 ms.

Die Qualität blieb erhalten. Auf dem Artificial Analysis Text-to-Speech-Leaderboard gehörte Simba 3.2 am 23.09.2026 mit einem Elo-Median von 1.237 (±14) und 92 Stimmen zu den Top 5 – und jedes besser bewertete Modell ist teurer.

So erzielen Sie die niedrigste Latenz in Ihrer App

  1. Streaming nutzen. Verwenden Sie POST /v1/audio/stream für alles, was schon während der Generierung abgespielt wird. POST /v1/audio/speech liefert erst, wenn der gesamte Audioclip fertig ist.
  2. Simba 3.2 anfordern. Setzen Sie model für Englisch auf simba-3.2. Ohne model wird simba-3.0 verwendet.
  3. Eine Verbindung wiederverwenden. Legen Sie einen HTTP-Client an, öffnen Sie die Verbindung beim Start und nutzen Sie sie anschließend für alle Anfragen – so entfallen DNS- und TCP/TLS-Aufbau bei jeder Anfrage.
  4. Sätze sofort senden. Wenn ein Sprachmodell vorgeschaltet ist, sollte jeder vollständige Satz sofort gesendet und die Audios in der richtigen Reihenfolge abgespielt werden.
  5. Das passende Format wählen. audio/pcm mit 24 kHz benötigt keine Kodierung. Wählen Sie MP3 oder Ogg Opus, wenn Bandbreite wichtiger ist.
  6. Die Nähe zur API nutzen. Die API wird aus US East bereitgestellt – ein Server vor Ort oder in der Nähe minimiert die Netzwerkzeit.

Sie bauen auf LiveKit Agents auf? Diese Anleitung zeigt, wie Sie mit dem Speechify-Plugin einen Sprachagenten erstellen, bei dem jeder Satz schon während der Generierung gestreamt wird. Hintergründe und Beispielcode finden Sie in der Latenz-Dokumentation.

Selbst messen

Messen Sie die Zeit bis zum ersten Datenblock einer Streaming-Antwort direkt in Ihrem Code. Für aussagekräftige Werte:

  • Verwerfen Sie die ersten 1–2 Anfragen – sie enthalten den Verbindungsaufbau.
  • Variieren Sie den Text wie im echten Betrieb.
  • Senden Sie die Anfragen nacheinander, nicht parallel.
  • Führen Sie mindestens 20 Anfragen durch und notieren Sie Median (p50) und p90, nicht den Durchschnitt oder Bestwert.
  • Messen Sie mit PCM – Ogg beginnt mit Headern statt mit Audio.

Jede Streaming-Antwort enthält im Server-Timing-Header das Feld ttfb für unseren Anteil an der Wartezeit. Der Rest entfällt auf Netzwerk und Ihre Infrastruktur. Die Latenz-Dokumentation enthält dazu Python- und TypeScript-Skripte.

Häufig gestellte Fragen

Das Simba-3.2-Modell von SpeechifyAI schrieb bei Produktiv-Traffic in US East am 15.09.2026 das erste Audio-Byte nach 56 ms im Median beziehungsweise 102 ms p90. Unabhängige Benchmarks maßen eine mediane Zeit bis zur ersten Audioausgabe von 106 ms (Coval, 24 Stunden bis 24.09.2026) und 123 ms (Voice Arena, 24.09.2026), jeweils einschließlich Netzwerk und möglicher Anfangsstille.

Auf Voice Arenas US-Board Englisch am 24.09.2026 hatte SpeechifyAI’s Simba 3.2 mit 123 ms die niedrigste mediane Zeit bis zur ersten Audioausgabe unter allen 14 getesteten Modellen – vor Inworld Realtime TTS 2 Research Preview (168,5 ms). Benchmarks werden laufend neu berechnet – prüfen Sie daher immer das Datum, bevor Sie sich darauf verlassen.

Ja. POST /v1/audio/stream sendet Audio in Echtzeit als PCM, MP3, Ogg Opus oder AAC über HTTP. PCM bietet die geringste Latenz, da kein Kodierungsschritt nötig ist.

Nein. SpeechifyAI ist die Entwickler-API von Speechify und wird separat von der Lese-App abgerechnet. Ein Reader-Abo umfasst keine API-Nutzung. Es gibt folgende Pläne: Gratis (500.000 Zeichen/Monat ohne Karte), Starter ($10/Monat, zusätzlicher Verbrauch 10 $/1 Mio. Zeichen), Pro ($99, 8 $), Scale ($499, 6 $).

Testen Sie Simba 3.2 auf SpeechifyAI: Erstellen Sie einen kostenlosen API-Key und vergleichen Sie Ihre eigenen Messungen mit den obigen Werten.

Greifen Sie schnell und flexibel über die API auf Speechifys beliebte Stimmen zu – ideal für Entwickler

API-Zugang erhalten
Sparse JavaScript keywords import, from, const, await on a white background

Diesen Artikel teilen

Speechify Team

Speechify Team


Speechify Team

Speechify

Über Speechify

#1 Text-vorlesen-lassen-Reader

Speechify ist die weltweit führende Text-vorlesen-lassen-Plattform, der mehr als 50 Millionen Nutzer vertrauen und die von über 500.000 Fünf-Sterne-Bewertungen für die Text-vorlesen-lassen-iOS-, Android-, Chrome-Erweiterung-, Web-App- und Mac-Desktop-Anwendungen unterstützt wird. 2025 verlieh Apple Speechify den renommierten Apple Design Award auf der WWDC und bezeichnete es als „eine wichtige Ressource, die Menschen hilft, ihren Alltag zu meistern“. Speechify bietet über 1.000 natürlich klingende Stimmen in mehr als 60 Sprachen und wird in fast 200 Ländern genutzt. Zu den prominenten Stimmen gehören Snoop Dogg und Gwyneth Paltrow. Für Kreative und Unternehmen bietet Speechify Studio fortschrittliche Tools wie den KI-Stimmengenerator, KI-Stimmenklonen, KI-Dubbing und den KI-Stimmenveränderer. Mit seiner hochwertigen und zugleich erschwinglichen Text-vorlesen-lassen-API ermöglicht Speechify zudem branchenführende Produkte. In The Wall Street Journal, CNBC, Forbes, TechCrunch und anderen namhaften Medien vorgestellt, ist Speechify der weltweit führende Anbieter für Text vorlesen lassen. Besuchen Sie speechify.com/news, speechify.com/blog und speechify.com/press, um mehr zu erfahren.