Dwa benchmarki, niezależne od Speechify, zmierzyły we wrześniu 2026 czas do pierwszego dźwięku modelu SpeechifyAI Simba 3.2. Coval odnotował medianę 106 ms w ciągu 24 godzin do 24.09.2026. Voice Arena pokazała tego samego dnia 123 ms na tablicy US English — najniższą medianę spośród 14 mierzonych modeli. W tym artykule wyjaśniamy, co dokładnie oznaczają te liczby, dlaczego czas do pierwszego dźwięku jest najważniejszym wskaźnikiem opóźnienia i jak samodzielnie zmierzyć go w swoim kodzie.
Liczby
Dwa niezależne pomiary są wyższe od naszego, bo uwzględniają sieć między testerem a naszymi serwerami oraz ciszę na początku nagrania. Każdy wynik pokazuje stan z dnia testu. Obie tablice są aktualizowane na bieżąco — sprawdź najnowsze wyniki.
Tablica US English Voice Arena, 24.09.2026
Źródło: Voice Arena, odczyt z 24.09.2026. Tablica obejmowała 14 modeli; tutaj pokazujemy sześć najszybszych.
Dlaczego czas do pierwszego dźwięku ma znaczenie
Gdy agent głosowy odpowiada albo aplikacja odczytuje tekst, użytkownik czeka od chwili wysłania tekstu do momentu, gdy usłyszy dźwięk. Ten czas to właśnie czas do pierwszego dźwięku.
- Czas do pierwszego bajtu może wyglądać lepiej, niż odbiera to użytkownik.
- Strumień może zaczynać się ciszą; użytkownik nic nie słyszy aż do pierwszej słyszalnej próbki. Czas do pierwszego dźwięku uwzględnia tę ciszę.
- Całkowity czas generowania to oczekiwanie do ostatniego bajtu.
- Ma znaczenie przy zapisie pliku, ale nie przy strumieniowanym odsłuchu w czasie rzeczywistym.
- W rozmowie liczy się każda chwila.
- Ludzie zwykle odpowiadają w ciągu kilkuset milisekund. Agent głosowy musi w tej krótkiej przerwie zmieścić rozpoznawanie mowy, model językowy i syntezę, więc każda dodatkowa milisekunda zabiera czas pozostałym etapom.
Jak Simba 3.2 przyspieszył bez zmniejszania modelu
Według danych Coval mediana dla Simby 3.2 spadła z 379 ms 13.09.2026 do 116 ms 18.09.2026 — o ok. 70% w pięć dni.
Sam model się nie zmienił. Ma te same wagi, bez destylacji, kwantyzacji ani wersji „turbo”. Skrócono za to czas obsługi wokół modelu:
- Nowe wdrożenie na innym typie GPU oraz niskopoziomowe optymalizacje w stosie inferencyjnym, dzięki którym dźwięk pojawia się szybciej.
- Sprawdzanie planu, uprawnień i limitów z pamięci podręcznej zamiast zapytań „na żywo” przed pierwszym bajtem.
- API gateway działa w tej samej lokalizacji co GPU i korzysta z utrzymywanych połączeń.
- Usunięto ok. 100 ms początkowej ciszy. Coval zmierzył spadek ciszy w Simba 3.2 ze 102 ms (14.09) do 13 ms.
Jakość pozostała bez zmian. Na tablicy text-to-speech Artificial Analysis Simba 3.2 miała 23.09.2026 wynik Elo 1 237 (±14), co dawało jej miejsce w czołowej piątce spośród 92 głosów dostawców, a każdy wyżej notowany model kosztował więcej.
Jak uzyskać najniższe opóźnienie w swojej aplikacji
- Strumieniuj.
- Używaj
- POST /v1/audio/stream
- do treści odtwarzanej już podczas generowania.
- POST /v1/audio/speech
- zwraca odpowiedź dopiero wtedy, gdy cały klip jest gotowy.
- Wybierz Simbę 3.2.
- Dla języka angielskiego ustaw
- model
- na
- simba-3.2
- . Bez tego parametru API wybierze
- simba-3.0
- .
- Korzystaj z jednego połączenia.
- Utwórz jednego klienta HTTP, otwórz połączenie przy starcie i używaj go dla wszystkich żądań — unikniesz opóźnień związanych z DNS, TCP i TLS.
- Wysyłaj zdania od razu.
- Jeśli przed TTS działa model językowy, wysyłaj każde pełne zdanie od razu i odtwarzaj strumienie po kolei.
- Wybierz format zgodny z odtwarzaczem.
- audio/pcm
- 24 kHz nie wymaga dodatkowego kodowania. Wybierz MP3 lub Ogg Opus, jeśli ważniejsze jest zużycie łącza.
- Działaj blisko API.
- API działa w regionie US East, więc serwer w tym regionie lub w pobliżu spędzi najmniej czasu w sieci.
Budujesz na LiveKit Agents? Ten przewodnik pokazuje, jak zbudować agenta głosowego z pluginem Speechify, który strumieniuje każde zdanie, gdy model językowy je tworzy. Omówienie każdego kroku wraz z kodem znajdziesz też w dokumentacji opóźnień.
Zmierz opóźnienie samodzielnie
Zmierz czas do pierwszego segmentu strumieniowanej odpowiedzi z miejsca, w którym uruchamiasz swój kod. Aby uzyskać wiarygodne wyniki:
- Odrzuć pierwsze jedno lub dwa żądania — obejmują koszt otwarcia połączenia.
- Za każdym razem zmieniaj tekst, tak jak w prawdziwym ruchu.
- Wysyłaj żądania jedno po drugim, a nie równolegle.
- Wykonaj co najmniej 20 żądań i raportuj medianę (p50) oraz p90, a nie średnią ani najlepszy pojedynczy wynik.
- Testuj z PCM. W przypadku Ogg pierwsze bajty to nagłówki, a nie audio.
Każda strumieniowana odpowiedź zawiera nagłówek Server-Timing z wartością ttfb — to nasza część opóźnienia; reszta wynika z sieci i Twojego własnego stosu. Dokumentacja opóźnień zawiera gotowe skrypty w Pythonie i TypeScript.
Najczęściej zadawane pytania
Model SpeechifyAI Simba 3.2 zapisywał pierwszy bajt audio po 56 ms (mediana) i 102 ms (p90) w ruchu produkcyjnym (US East, 15.09.2026). Niezależne benchmarki zmierzyły medianę czasu do pierwszego dźwięku na poziomie 106 ms (Coval, 24 godziny do 24.09.2026) i 123 ms (Voice Arena, 24.09.2026) — z uwzględnieniem ich sieci i ciszy na początku nagrania.
Na tablicy US English Voice Arena z 24.09.2026 model SpeechifyAI Simba 3.2 miał najniższą medianę czasu do pierwszego dźwięku spośród 14 modeli: 123 ms, wyprzedzając Inworld Realtime TTS 2 Research Preview (168,5 ms). Benchmarki są stale aktualizowane, dlatego przed podjęciem decyzji sprawdź datę odświeżenia rankingu.
Tak. POST /v1/audio/stream przesyła audio przez HTTP w trakcie generowania (PCM, MP3, Ogg Opus lub AAC). PCM zapewnia najniższe opóźnienie, bo nie wymaga kodowania.
Nie. SpeechifyAI to API dla deweloperów, rozliczane osobno od aplikacji czytnika Speechify; subskrypcja Reader nie obejmuje API. Dostępne są miesięczne plany: bezpłatny (500 000 znaków), Starter za $10/mc, dodatkowo $10 za każdy 1 mln znaków; Pro za $99 (dodatkowo $8) i Scale za $499 (dodatkowo $6).
Wypróbuj Simbę 3.2 w SpeechifyAI: utwórz darmowy klucz API i porównaj czas pierwszego żądania z podanymi wynikami.

