Два бенчмарки, не пов’язані зі Speechify, у вересні 2026 року виміряли час до першого аудіо для моделі SpeechifyAI Simba 3.2. Coval зафіксував медіану 106 мс за 24 години до 24 вересня 2026 року. Voice Arena того ж дня виміряла 123 мс на своїй дошці US English — це був найнижчий показник серед усіх 14 моделей. У цій публікації пояснюємо, що саме означають ці числа, чому варто порівнювати час до першого аудіо та як виміряти його у власному коді.
Показники
Два незалежні показники трохи вищі за наші власні, бо враховують мережу між точкою запуску та нашими серверами, а також початкову тишу. Кожен результат відображає дані саме цього бенчмарку на цю дату. Обидві дошки оновлюються — тож актуальні дані дивіться там.
Дошка US English Voice Arena, 24 вересня 2026
Джерело: Voice Arena, дані станом на 24 вересня 2026. Виміряно 14 моделей, показано шість найшвидших.
Чому саме цей показник варто порівнювати
Коли голосовий агент відповідає або застосунок озвучує текст, слухач чекає від моменту надсилання тексту до моменту, коли чує звук. Це і є час до першого аудіо.
- Час до першого байта виглядає кращим, ніж те, що чує слухач.
- Потік може починатися з тиші, і слухач нічого не почує до першого звукового фрагмента. Час до першого аудіо враховує і цю тишу.
- Загальний час генерації — це очікування останнього байта.
- Це важливо, коли ви зберігаєте файл, але не тоді, коли хтось слухає аудіо в потоці.
- У розмові часу обмаль.
- Люди зазвичай відповідають одне одному за кілька сотень мілісекунд. Голосовий агент має вкласти розпізнавання, генерацію й синтез у цю паузу — тож кожна мілісекунда синтезу відбирає час в інших етапів ланцюжка.
Як Simba 3.2 стала швидшою без зменшення моделі
За даними Coval, добова медіана Simba 3.2 знизилася з 379 мс (13 вересня 2026) до 116 мс (18 вересня 2026) — майже на 70% за п’ять днів.
Сама модель не змінювалася. Архітектура та ваги ті самі — без дистиляції, квантування чи версій «turbo». Час зменшився на етапі обслуговування моделі:
- Новий білд для іншого класу GPU та оптимізація інференсу для швидшого виводу аудіо.
- Перевірки тарифного плану й лімітів бралися з кешу, а не через live-запити — ще до першого байта.
- API gateway працює в тому ж регіоні, що й GPU, а підключення між запитами підтримується постійно.
- Близько 100 мс початкової тиші зникло. У Coval для Simba 3.2 тиша скоротилася зі 102 мс (14 вересня) до 13 мс.
Якість збереглася. На лідерборді Artificial Analysis Simba 3.2 мала Elo 1 237 (±14) станом на 23 вересня 2026 року, входила до топ-5 із 92 голосів, і всі моделі з вищим рейтингом коштують дорожче.
Як досягти мінімальної затримки у вашому застосунку
- Використовуйте стрімінг.
- Викликайте
- POST /v1/audio/stream
- для всього, що потрібно озвучувати «на льоту».
- POST /v1/audio/speech
- повертає звук тільки після повної генерації.
- Обирайте Simba 3.2.
- Встановіть
- model
- у
- simba-3.2
- для англійської. Якщо
- model
- не вказано, API використовує
- simba-3.0
- .
- Використовуйте одне підключення.
- Створіть один HTTP-клієнт, відкрийте з’єднання на старті й повторно використовуйте його для всіх запитів — так не доведеться щоразу чекати DNS і TCP/TLS handshake.
- Надсилайте речення окремо.
- Якщо попереду мовна модель, надсилайте кожне завершене речення й відтворюйте потоки послідовно.
- Обирайте потрібний формат.
- audio/pcm
- з частотою 24 кГц не потребує кодування. Використовуйте MP3 чи Ogg Opus, якщо важливіша економія трафіку.
- Розміщуйте сервер ближче до API.
- API хоститься в US East, тому сервер поблизу витрачає менше часу на передавання мережею.
Використовуєте LiveKit Agents? У цьому гайді показано, як побудувати голосового агента з плагіном Speechify, який стрімить речення в міру їх створення мовною моделлю. Детальний розбір усіх кроків із кодом — у документації про затримку.
Виміряйте самі
Виміряйте час до першого блоку в потоковій відповіді — саме з точки запуску вашого коду. Щоб отримати коректний результат:
- Відкидайте перші 1–2 запити: вони йдуть на встановлення з’єднання із сервером.
- Змінюйте текст запитів, як у реальному трафіку.
- Надсилайте запити послідовно, а не паралельно.
- Зробіть щонайменше 20 запитів і вкажіть медіану (p50) та p90, а не середнє чи найкраще значення.
- Вимірюйте з PCM. В Ogg перші байти — це заголовки, а не саме аудіо.
У кожній потоковій відповіді є заголовок Server-Timing з ttfb — це наш час генерації; решта — це мережа й ваш стек. У документації про затримку є скрипти Python і TypeScript для такого вимірювання.
Поширені запитання
Simba 3.2 від SpeechifyAI записала перший байт аудіо за 56 мс у медіані та 102 мс на p90 на реальному трафіку в US East 15 вересня 2026. Незалежні бенчмарки виміряли медіанний час до першого аудіо: 106 мс (Coval, 24 години до 24.09.2026) і 123 мс (Voice Arena, 24.09.2026). Ці дані включають мережу й початкову тишу.
На дошці US English Voice Arena станом на 24 вересня 2026 року Simba 3.2 від SpeechifyAI показала найнижчу медіану часу до першого аудіо серед 14 виміряних моделей: 123 мс, випередивши Inworld Realtime TTS 2 Research Preview (168,5 мс). Бенчмарки оновлюються, тому завжди перевіряйте дату рейтингу.
Так. POST /v1/audio/stream надсилає аудіо через HTTP у міру створення — у форматах PCM, MP3, Ogg Opus або AAC. Найменша затримка — у PCM, бо він не потребує кодування.
Ні. SpeechifyAI — це API для розробників, який тарифікується окремо від застосунку для читання Speechify, а підписка Reader не включає використання API. Тарифи: безкоштовний план (500 000 символів/місяць); Starter $10/міс + $10/млн символів; Pro — $99/міс + $8; Scale — $499/міс + $6.
Спробуйте Simba 3.2 на SpeechifyAI: створіть безкоштовний API-ключ і самі виміряйте свою затримку, щоб порівняти її з наведеними показниками.

