Skip to main content
  1. Главная
  2. API
  3. Задержка API синтеза речи в 2026 году: время до первого звука по независимым измерениям
Published on •API

Задержка API синтеза речи в 2026 году: время до первого звука по независимым измерениям

Команда Speechify

Команда Speechify


API Speechify обеспечивает задержку 300 мс, голоса человеческого качества и поддержку более чем 50 языков

AppleApple Design Award 2025
50М+ пользователей

Два независимых бенчмарка, не связанных со Speechify, измерили время до первого звука у SpeechifyAI Simba 3.2 в сентябре 2026 года. Coval зафиксировал медиану 106 мс за 24 часа до 24 сентября 2026 года. Voice Arena — 123 мс в таблице US English в тот же день — это лучший результат среди 14 моделей. В статье разберем, что значат эти цифры, почему время до первого звука — ключевой показатель задержки и как измерить его в вашем коде.

Ключевые цифры

Бенчмарк

Что измеряется

Simba 3.2

Когда

Voice Arena, таблица US English

Медианное время до первого звука в потоковой аудиодорожке реального времени

123 мс, лучший результат среди 14 моделей

24 сентября 2026 года

Coval

Медианное время до первого звука с учетом паузы до первого слышимого сигнала. Открытый стенд, запускается каждые 30 минут из US East

106 мс

24 часа до 24 сентября 2026 года

Продакшен-трафик SpeechifyAI (наши замеры)

Время до первого байта аудио в реальных запросах клиентов из US East

56 мс p50, 102 мс p90

15 сентября 2026 года

Значения независимых замеров выше наших внутренних, потому что в них входит сетевая задержка между сервером и клиентом, а также возможная начальная пауза в аудиофайле. Каждая цифра — результат конкретного бенчмарка на указанную дату. Лидерборды обновляются, поэтому ориентируйтесь на актуальные значения.

Таблица US English Voice Arena, 24 сентября 2026 года

Модель

Медианное время до первого звука

SpeechifyAI Simba 3.2, реальное время

123 мс

Inworld Realtime TTS 2 Research Preview

168,5 мс

Gradium TTS, реальное время

236 мс

Cartesia Sonic-3.5, реальное время

250 мс

Smallest AI Lightning 3.1 Pro, реальное время

263,5 мс

Fish Audio S2 Pro, реальное время

267 мс

Источник: Voice Arena. Замеры от 24 сентября 2026 года. Лидерборд тестировал 14 моделей — здесь показаны 6 самых быстрых.

Почему время до первого звука — главный показатель для сравнения

Когда голосовой агент отвечает или приложение озвучивает текст, пользователь ждет от отправки текста до первого звука. Это и есть время до первого звука.

  • Время до первого байта может выглядеть лучше, чем это слышит пользователь.
  • Поток может начаться с тишины, и пользователь не услышит ничего, пока не появится первый слышимый звук. Время до первого звука учитывает эту паузу.
  • Общее время генерации — это ожидание последнего байта.
  • Оно важно, если вы сохраняете файл, но не при потоковом воспроизведении.
  • В диалоге счет идет на миллисекунды.
  • Обычно ответы следуют друг за другом с интервалом в сотни миллисекунд. Голосовому агенту нужно за это время распознать речь, обработать ее языковой моделью и синтезировать звук, поэтому каждая миллисекунда задержки отнимает время у остальной цепочки.

Как Simba 3.2 удалось ускориться без уменьшения модели

По данным Coval, медианное время Simba 3.2 снизилось с 379 мс (13 сентября 2026 года) до 116 мс (18 сентября 2026 года), то есть примерно на 70% за пять дней.

Сама модель не изменилась: те же веса, без дистилляции, квантизации или упрощенного "турбо"-варианта. Ускорение произошло в инфраструктуре обслуживания вокруг модели:

  • Новая сборка на другом классе GPU и низкоуровневая оптимизация инференса — звук начинает воспроизводиться быстрее.
  • Проверки тарифов, прав и лимитов берутся из кэша, а не через онлайн-запрос до первого байта.
  • API-шлюз работает в том же регионе, что и GPU, а соединения между запросами не закрываются.
  • Убрано около 100 мс стартовой тишины: показатель начальной тишины у Simba 3.2 в Coval снизился со 102 мс (14 сентября) до 13 мс.

Качество при этом сохранилось. На лидерборде Artificial Analysis по синтезу речи Simba 3.2 имела Elo 1 237 (±14) на 23 сентября 2026 года — входила в топ-5 голосов среди 92 провайдеров, и все модели выше стоили дороже.

Как получить минимальную задержку в своем приложении

  1. Используйте стриминг.
  2. Вызывайте
  3. POST /v1/audio/stream
  4. для озвучки «на лету».
  5. POST /v1/audio/speech
  6. отвечает только после полного создания файла.
  7. Запрашивайте Simba 3.2.
  8. Укажите
  9. model
  10. =
  11. simba-3.2
  12. для английского языка. По умолчанию будет
  13. simba-3.0
  14. .
  15. Используйте одно соединение.
  16. Создайте HTTP-клиент один раз и держите соединение открытым, чтобы не тратить время на DNS и TCP/TLS-рукопожатие при каждом запросе.
  17. Передавайте предложения по мере готовности.
  18. При работе с языковой моделью отправляйте каждое готовое предложение сразу и воспроизводите потоки по порядку.
  19. Выбирайте подходящий формат.
  20. audio/pcm
  21. 24 кГц не требует кодирования. MP3 или Ogg Opus подойдут, если важнее экономия трафика.
  22. Размещайте приложение ближе к API.
  23. API находится в US East, поэтому сервер рядом тратит минимум времени на сеть.

Работаете с LiveKit Agents? В этом гайде показано, как создать голосового агента Speechify, который стримит каждое предложение от языковой модели. Подробное объяснение каждого шага с кодом — в документации по задержке.

Как измерить самостоятельно

Измерьте время до первого чанка потокового ответа со своей стороны. Чтобы получить корректное значение:

  • Исключите 1–2 первых запроса — на них обычно уходит время на установку соединения.
  • Меняйте текст между запросами, как при реальной нагрузке.
  • Отправляйте запросы последовательно, а не параллельно.
  • Сделайте минимум 20 замеров и укажите медиану (p50) и p90, а не среднее значение или лучший результат.
  • Измеряйте на PCM: у Ogg первые байты — это заголовки, а не аудио.

В ответе потоковой озвучки есть заголовок Server-Timing — в ttfb содержится наша часть задержки, все остальное — сеть и ваш стек. В документации по задержке вы найдете скрипты для Python и TypeScript.

Часто задаваемые вопросы

Simba 3.2 от SpeechifyAI показала первый аудиобайт за 56 мс (медиана) и 102 мс (p90) под реальной нагрузкой в US East 15 сентября 2026 года. Независимые замеры дали медианы 106 мс (Coval, за 24 часа до 24 сентября 2026 года) и 123 мс (Voice Arena, 24 сентября 2026 года). Эти значения включают как сетевую задержку, так и возможную паузу в начале аудио.

В таблице US English Voice Arena от 24 сентября 2026 года у Simba 3.2 от SpeechifyAI было минимальное медианное время до первого звука среди всех 14 моделей — 123 мс. Для сравнения: Inworld Realtime TTS 2 Research Preview — 168,5 мс. Бенчмарки обновляются постоянно, поэтому всегда сверяйтесь с датой замера.

Да. POST /v1/audio/stream передает звук по HTTP по мере генерации — в форматах PCM, MP3, Ogg Opus или AAC. PCM дает минимальную задержку, так как не требует кодирования.

Нет. SpeechifyAI — это отдельный API для разработчиков, который оплачивается отдельно от приложения для чтения, и подписка Reader не включает использование API. Тарифы API — помесячные, без годовой привязки: бесплатный план с 500 000 символов в месяц и без карты, далее Starter за $10 (и $10 за 1 млн символов), Pro — $99 ($8), Scale — $499 ($6).

Попробуйте Simba 3.2 на SpeechifyAI: получите бесплатный API-ключ и проверьте время первого запроса по этим замерам.

Быстрый, масштабируемый и удобный для разработчиков доступ к любимым голосам Speechify через API

Получить доступ к API
Sparse JavaScript keywords import, from, const, await on a white background

Поделиться этой статьёй

Команда Speechify

Команда Speechify


Команда Speechify

Speechify

О Speechify

№1 в мире сервис преобразования текста в речь

Speechify — ведущая в мире платформа синтеза речи, которой доверяют более 50 миллионов пользователей и которая имеет свыше 500 000 отзывов с пятью звёздами во всех своих приложениях для iOS, Android, расширения Chrome, веб‑приложения и десктопа Mac. В 2025 году Apple вручила Speechify престижную Apple Design Award на WWDC, назвав приложение «критически важным ресурсом, который помогает людям жить лучше». Speechify предлагает более 1 000 натурально звучащих голосов на 60+ языках и используется почти в 200 странах. Среди голосов знаменитостей — Snoop Dogg и Гвинет Пэлтроу. Для создателей и бизнеса Speechify Studio предлагает продвинутые инструменты, такие как генератор голосов на ИИ, ИИ‑клонирование голоса, ИИ‑дубляж и ИИ‑изменение голоса. Speechify также интегрируется в ведущие продукты с помощью своего высококачественного и доступного API синтеза речи. О нас писали в The Wall Street Journal, CNBC, Forbes, TechCrunch и других крупных СМИ: Speechify — крупнейший поставщик услуг синтеза речи в мире. Подробнее на speechify.com/news, speechify.com/blog и speechify.com/press.