Два бенчмарка, които не се провеждат от Speechify, измериха времето до първи аудио байт на модела SpeechifyAI Simba 3.2 през септември 2026. Coval отчете медиана от 106 ms за 24-те часа до 24 септември 2026 г. Voice Arena отчете 123 ms в класацията си за US English в същия ден — най-ниската медиана сред 14-те тествани модела. Този материал обяснява какво измерват числата, защо времето до първи аудио байт е най-ценният показател и как да го измерите от своя код.
Числата
Двете независими измервания са по-високи от нашите, защото включват мрежовото закъснение между тестовите и нашите сървъри, както и всяка начална тишина. Всяко число е валидно за съответния ден. И двете платформи са активни — проверете актуалните стойности към днешна дата.
Класацията на Voice Arena за US English, 24 септември 2026
Източник: Voice Arena, прегледано на 24 септември 2026. Таблицата сравнява 14 модела; тук са показани шестте най-бързи.
Защо времето до първи аудио байт е най-важният показател
Когато гласов агент отговаря или приложение чете на глас, слушателят чака от изпращането на текста до първия чут звук. Това изчакване е времето до първи аудио байт.
- Времето до първи байт може да изглежда по-добро от реалното изживяване.
- Потокът може да започне с тишина и слушателят не чува нищо до първия чуваем семпъл. Времето до първи аудио байт включва и тази тишина.
- Общото време за генериране е изчакването до последния байт.
- То има значение, когато се записва файл, но не и при слушане по време на стрийминг.
- В реалния разговор времето е малко.
- Обикновено хората си отговарят в рамките на части от секундата. Един гласов агент трябва да побере разпознаване, езиков модел и синтез на реч точно в тази пауза, така че всяка милисекунда намалява времето за останалата част от процеса.
Как Simba 3.2 стана по-бърз без по-малък модел
В данните на Coval медианата на Simba 3.2 спадна от 379 ms на 13 септември 2026 до 116 ms на 18 септември 2026 — с около 70% за пет дни.
Моделът не е променян. Теглата са същите, без дистилация, без квантизация и без "турбо" вариант. Времето е спестено по основния път до модела:
- Нова сървърна инсталация на различен клас GPU, с нисконивоови оптимизации в inference стека — аудиото тръгва по-рано.
- Плановете, достъпите и ограниченията се проверяват от кеш, а не чрез live заявки, преди първия байт.
- API gateway работи в същия регион като GPU-тата, по стабилни връзки, които остават отворени между заявките.
- Премахнати са около 100 ms начална тишина. При Coval водещата тишина за Simba 3.2 спада от 102 ms (14 септ.) на 13 ms.
Качеството се запази. В класацията за синтез на реч на Artificial Analysis Simba 3.2 има Elo 1 237 (±14) към 23 септември 2026, в топ 5 от 92 гласа, а всеки по-високо оценен модел е и по-скъп.
Как да постигнете най-ниска латентност във вашето приложение
- Стриймвайте.
- Използвайте
- POST /v1/audio/stream
- за възпроизвеждане в реално време.
- POST /v1/audio/speech
- отговаря, когато цялото аудио е готово.
- Използвайте Simba 3.2.
- Задайте
- model
- на
- simba-3.2
- за английски. Ако
- model
- липсва, по подразбиране се използва
- simba-3.0
- .
- Използвайте една връзка.
- Създайте един HTTP клиент, отворете връзката при стартиране и я използвайте за всички заявки, за да избегнете допълнително време за DNS lookup и handshake.
- Изпращайте изреченията веднага.
- При езиков модел изпращайте всяко завършено изречение веднага и ги възпроизвеждайте по ред.
- Изберете правилния формат за плеъра си.
- audio/pcm
- при 24 kHz не изисква кодиране. Използвайте MP3 или Ogg Opus, ако компресията е по-важна.
- Използвайте географска близост до API.
- API се обслужва от US East, така че сървър близо до този регион ще има по-ниско мрежово закъснение.
Използвате LiveKit Agents? Това ръководство показва как се изгражда гласов агент с плъгин за Speechify, който стриймва всяко изречение веднага щом езиковият модел го предложи. Обясненията, с код, са в документацията за латентност.
Измерете го сами
Измервайте първия chunk от streaming отговор от мястото, където работи вашият код. За коректна стойност:
- Игнорирайте първите една-две заявки — те включват отваряне на връзката.
- Променяйте текста между отделните заявки, както е при действителния ви трафик.
- Изпращайте заявките последователно, не паралелно.
- Направете поне 20 заявки и отчетете медианата (p50) и p90, а не средното или най-добрия единичен резултат.
- Измервайте с PCM. При Ogg първите байтове са header-и, не аудио.
Всеки streaming отговор съдържа header Server-Timing, където ttfb е нашият дял от изчакването — останалото е мрежата и вашият собствен код. В документацията за латентност има Python и TypeScript скриптове за тези измервания.
Често задавани въпроси
Simba 3.2 на SpeechifyAI е отчел първи аудио байт при медиана 56 ms и 102 ms p90 при реален трафик в US East на 15 септември 2026. Независими бенчмаркове измерват медианно време до първи аудио байт от 106 ms (Coval, 24 ч. до 24 септември 2026) и 123 ms (Voice Arena, 24 септември), включително мрежата и началната тишина.
В класацията на Voice Arena за US English на 24 септември 2026 Simba 3.2 на SpeechifyAI има най-ниска медиана до първи аудио байт сред 14 модела: 123 ms, пред Inworld Realtime TTS 2 Research Preview (168.5 ms). Бенчмарковете се обновяват постоянно — винаги проверявайте датата, преди да разчитате на класация.
Да. POST /v1/audio/stream изпраща аудиото по HTTP в момента на създаване, като PCM, MP3, Ogg Opus или AAC. PCM има най-ниската латентност, тъй като не изисква кодиране.
Не. SpeechifyAI е API за разработчици, който се таксува отделно от приложението за четене Speechify, а абонаментът за Reader не включва използване на API. Плановете за API са месечни без годишен ангажимент: безплатен план с 500 000 знака месечно без карта, Starter за $10/месец + $10 за 1M знака, Pro за $99 + $8 и Scale за $499 + $6.
Изпробвайте Simba 3.2 в SpeechifyAI: създайте безплатен API ключ и сравнете първата си заявка с горните стойности.

