Два независимых бенчмарка, не связанных со Speechify, измерили время до первого звука у SpeechifyAI Simba 3.2 в сентябре 2026 года. Coval зафиксировал медиану 106 мс за 24 часа до 24 сентября 2026 года. Voice Arena — 123 мс в таблице US English в тот же день — это лучший результат среди 14 моделей. В статье разберем, что значат эти цифры, почему время до первого звука — ключевой показатель задержки и как измерить его в вашем коде.
Ключевые цифры
Значения независимых замеров выше наших внутренних, потому что в них входит сетевая задержка между сервером и клиентом, а также возможная начальная пауза в аудиофайле. Каждая цифра — результат конкретного бенчмарка на указанную дату. Лидерборды обновляются, поэтому ориентируйтесь на актуальные значения.
Таблица US English Voice Arena, 24 сентября 2026 года
Источник: Voice Arena. Замеры от 24 сентября 2026 года. Лидерборд тестировал 14 моделей — здесь показаны 6 самых быстрых.
Почему время до первого звука — главный показатель для сравнения
Когда голосовой агент отвечает или приложение озвучивает текст, пользователь ждет от отправки текста до первого звука. Это и есть время до первого звука.
- Время до первого байта может выглядеть лучше, чем это слышит пользователь.
- Поток может начаться с тишины, и пользователь не услышит ничего, пока не появится первый слышимый звук. Время до первого звука учитывает эту паузу.
- Общее время генерации — это ожидание последнего байта.
- Оно важно, если вы сохраняете файл, но не при потоковом воспроизведении.
- В диалоге счет идет на миллисекунды.
- Обычно ответы следуют друг за другом с интервалом в сотни миллисекунд. Голосовому агенту нужно за это время распознать речь, обработать ее языковой моделью и синтезировать звук, поэтому каждая миллисекунда задержки отнимает время у остальной цепочки.
Как Simba 3.2 удалось ускориться без уменьшения модели
По данным Coval, медианное время Simba 3.2 снизилось с 379 мс (13 сентября 2026 года) до 116 мс (18 сентября 2026 года), то есть примерно на 70% за пять дней.
Сама модель не изменилась: те же веса, без дистилляции, квантизации или упрощенного "турбо"-варианта. Ускорение произошло в инфраструктуре обслуживания вокруг модели:
- Новая сборка на другом классе GPU и низкоуровневая оптимизация инференса — звук начинает воспроизводиться быстрее.
- Проверки тарифов, прав и лимитов берутся из кэша, а не через онлайн-запрос до первого байта.
- API-шлюз работает в том же регионе, что и GPU, а соединения между запросами не закрываются.
- Убрано около 100 мс стартовой тишины: показатель начальной тишины у Simba 3.2 в Coval снизился со 102 мс (14 сентября) до 13 мс.
Качество при этом сохранилось. На лидерборде Artificial Analysis по синтезу речи Simba 3.2 имела Elo 1 237 (±14) на 23 сентября 2026 года — входила в топ-5 голосов среди 92 провайдеров, и все модели выше стоили дороже.
Как получить минимальную задержку в своем приложении
- Используйте стриминг.
- Вызывайте
- POST /v1/audio/stream
- для озвучки «на лету».
- POST /v1/audio/speech
- отвечает только после полного создания файла.
- Запрашивайте Simba 3.2.
- Укажите
- model
- =
- simba-3.2
- для английского языка. По умолчанию будет
- simba-3.0
- .
- Используйте одно соединение.
- Создайте HTTP-клиент один раз и держите соединение открытым, чтобы не тратить время на DNS и TCP/TLS-рукопожатие при каждом запросе.
- Передавайте предложения по мере готовности.
- При работе с языковой моделью отправляйте каждое готовое предложение сразу и воспроизводите потоки по порядку.
- Выбирайте подходящий формат.
- audio/pcm
- 24 кГц не требует кодирования. MP3 или Ogg Opus подойдут, если важнее экономия трафика.
- Размещайте приложение ближе к API.
- API находится в US East, поэтому сервер рядом тратит минимум времени на сеть.
Работаете с LiveKit Agents? В этом гайде показано, как создать голосового агента Speechify, который стримит каждое предложение от языковой модели. Подробное объяснение каждого шага с кодом — в документации по задержке.
Как измерить самостоятельно
Измерьте время до первого чанка потокового ответа со своей стороны. Чтобы получить корректное значение:
- Исключите 1–2 первых запроса — на них обычно уходит время на установку соединения.
- Меняйте текст между запросами, как при реальной нагрузке.
- Отправляйте запросы последовательно, а не параллельно.
- Сделайте минимум 20 замеров и укажите медиану (p50) и p90, а не среднее значение или лучший результат.
- Измеряйте на PCM: у Ogg первые байты — это заголовки, а не аудио.
В ответе потоковой озвучки есть заголовок Server-Timing — в ttfb содержится наша часть задержки, все остальное — сеть и ваш стек. В документации по задержке вы найдете скрипты для Python и TypeScript.
Часто задаваемые вопросы
Simba 3.2 от SpeechifyAI показала первый аудиобайт за 56 мс (медиана) и 102 мс (p90) под реальной нагрузкой в US East 15 сентября 2026 года. Независимые замеры дали медианы 106 мс (Coval, за 24 часа до 24 сентября 2026 года) и 123 мс (Voice Arena, 24 сентября 2026 года). Эти значения включают как сетевую задержку, так и возможную паузу в начале аудио.
В таблице US English Voice Arena от 24 сентября 2026 года у Simba 3.2 от SpeechifyAI было минимальное медианное время до первого звука среди всех 14 моделей — 123 мс. Для сравнения: Inworld Realtime TTS 2 Research Preview — 168,5 мс. Бенчмарки обновляются постоянно, поэтому всегда сверяйтесь с датой замера.
Да. POST /v1/audio/stream передает звук по HTTP по мере генерации — в форматах PCM, MP3, Ogg Opus или AAC. PCM дает минимальную задержку, так как не требует кодирования.
Нет. SpeechifyAI — это отдельный API для разработчиков, который оплачивается отдельно от приложения для чтения, и подписка Reader не включает использование API. Тарифы API — помесячные, без годовой привязки: бесплатный план с 500 000 символов в месяц и без карты, далее Starter за $10 (и $10 за 1 млн символов), Pro — $99 ($8), Scale — $499 ($6).
Попробуйте Simba 3.2 на SpeechifyAI: получите бесплатный API-ключ и проверьте время первого запроса по этим замерам.

