Skip to main content
  1. Начало
  2. API
  3. Латентност на API за синтез на реч през 2026: време до първи аудио байт, независимо измерено
Published on •API

Латентност на API за синтез на реч през 2026: време до първи аудио байт, независимо измерено

Екипът на Speechify

Екипът на Speechify


Speechify API осигурява 300 ms латентност, естествени човешки гласове и поддръжка на над 50 езика

AppleApple Design Award 2025
50M+ потребители

Два бенчмарка, които не се провеждат от Speechify, измериха времето до първи аудио байт на модела SpeechifyAI Simba 3.2 през септември 2026. Coval отчете медиана от 106 ms за 24-те часа до 24 септември 2026 г. Voice Arena отчете 123 ms в класацията си за US English в същия ден — най-ниската медиана сред 14-те тествани модела. Този материал обяснява какво измерват числата, защо времето до първи аудио байт е най-ценният показател и как да го измерите от своя код.

Числата

Бенчмарк

Какво измерва

Simba 3.2

Кога

Voice Arena, класация за US English

Медианно време до първи аудио байт в реално време при стрийминг

123 ms, най-ниското от 14 модела

24 септември 2026

Coval

Медианно време до първи аудио байт; отчита и всяка тишина преди първия чуваем семпъл. Open-source система, измервана на всеки 30 минути от US East

106 ms

24 ч. до 24 септ. 2026

Трафик в продукционна среда на SpeechifyAI (собствено измерване)

Време, за което нашето API изпраща първия аудио байт при реални клиентски заявки в US East

56 ms p50, 102 ms p90

15 септември 2026

Двете независими измервания са по-високи от нашите, защото включват мрежовото закъснение между тестовите и нашите сървъри, както и всяка начална тишина. Всяко число е валидно за съответния ден. И двете платформи са активни — проверете актуалните стойности към днешна дата.

Класацията на Voice Arena за US English, 24 септември 2026

Модел

Медианно време до първи аудио байт

SpeechifyAI Simba 3.2 Real-time

123 ms

Inworld Realtime TTS 2 Research Preview

168.5 ms

Gradium TTS Real-time

236 ms

Cartesia Sonic-3.5 Real-time

250 ms

Smallest AI Lightning 3.1 Pro Real-time

263.5 ms

Fish Audio S2 Pro Real-time

267 ms

Източник: Voice Arena, прегледано на 24 септември 2026. Таблицата сравнява 14 модела; тук са показани шестте най-бързи.

Защо времето до първи аудио байт е най-важният показател

Когато гласов агент отговаря или приложение чете на глас, слушателят чака от изпращането на текста до първия чут звук. Това изчакване е времето до първи аудио байт.

  • Времето до първи байт може да изглежда по-добро от реалното изживяване.
  • Потокът може да започне с тишина и слушателят не чува нищо до първия чуваем семпъл. Времето до първи аудио байт включва и тази тишина.
  • Общото време за генериране е изчакването до последния байт.
  • То има значение, когато се записва файл, но не и при слушане по време на стрийминг.
  • В реалния разговор времето е малко.
  • Обикновено хората си отговарят в рамките на части от секундата. Един гласов агент трябва да побере разпознаване, езиков модел и синтез на реч точно в тази пауза, така че всяка милисекунда намалява времето за останалата част от процеса.

Как Simba 3.2 стана по-бърз без по-малък модел

В данните на Coval медианата на Simba 3.2 спадна от 379 ms на 13 септември 2026 до 116 ms на 18 септември 2026 — с около 70% за пет дни.

Моделът не е променян. Теглата са същите, без дистилация, без квантизация и без "турбо" вариант. Времето е спестено по основния път до модела:

  • Нова сървърна инсталация на различен клас GPU, с нисконивоови оптимизации в inference стека — аудиото тръгва по-рано.
  • Плановете, достъпите и ограниченията се проверяват от кеш, а не чрез live заявки, преди първия байт.
  • API gateway работи в същия регион като GPU-тата, по стабилни връзки, които остават отворени между заявките.
  • Премахнати са около 100 ms начална тишина. При Coval водещата тишина за Simba 3.2 спада от 102 ms (14 септ.) на 13 ms.

Качеството се запази. В класацията за синтез на реч на Artificial Analysis Simba 3.2 има Elo 1 237 (±14) към 23 септември 2026, в топ 5 от 92 гласа, а всеки по-високо оценен модел е и по-скъп.

Как да постигнете най-ниска латентност във вашето приложение

  1. Стриймвайте.
  2. Използвайте
  3. POST /v1/audio/stream
  4. за възпроизвеждане в реално време.
  5. POST /v1/audio/speech
  6. отговаря, когато цялото аудио е готово.
  7. Използвайте Simba 3.2.
  8. Задайте
  9. model
  10. на
  11. simba-3.2
  12. за английски. Ако
  13. model
  14. липсва, по подразбиране се използва
  15. simba-3.0
  16. .
  17. Използвайте една връзка.
  18. Създайте един HTTP клиент, отворете връзката при стартиране и я използвайте за всички заявки, за да избегнете допълнително време за DNS lookup и handshake.
  19. Изпращайте изреченията веднага.
  20. При езиков модел изпращайте всяко завършено изречение веднага и ги възпроизвеждайте по ред.
  21. Изберете правилния формат за плеъра си.
  22. audio/pcm
  23. при 24 kHz не изисква кодиране. Използвайте MP3 или Ogg Opus, ако компресията е по-важна.
  24. Използвайте географска близост до API.
  25. API се обслужва от US East, така че сървър близо до този регион ще има по-ниско мрежово закъснение.

Използвате LiveKit Agents? Това ръководство показва как се изгражда гласов агент с плъгин за Speechify, който стриймва всяко изречение веднага щом езиковият модел го предложи. Обясненията, с код, са в документацията за латентност.

Измерете го сами

Измервайте първия chunk от streaming отговор от мястото, където работи вашият код. За коректна стойност:

  • Игнорирайте първите една-две заявки — те включват отваряне на връзката.
  • Променяйте текста между отделните заявки, както е при действителния ви трафик.
  • Изпращайте заявките последователно, не паралелно.
  • Направете поне 20 заявки и отчетете медианата (p50) и p90, а не средното или най-добрия единичен резултат.
  • Измервайте с PCM. При Ogg първите байтове са header-и, не аудио.

Всеки streaming отговор съдържа header Server-Timing, където ttfb е нашият дял от изчакването — останалото е мрежата и вашият собствен код. В документацията за латентност има Python и TypeScript скриптове за тези измервания.

Често задавани въпроси

Simba 3.2 на SpeechifyAI е отчел първи аудио байт при медиана 56 ms и 102 ms p90 при реален трафик в US East на 15 септември 2026. Независими бенчмаркове измерват медианно време до първи аудио байт от 106 ms (Coval, 24 ч. до 24 септември 2026) и 123 ms (Voice Arena, 24 септември), включително мрежата и началната тишина.

В класацията на Voice Arena за US English на 24 септември 2026 Simba 3.2 на SpeechifyAI има най-ниска медиана до първи аудио байт сред 14 модела: 123 ms, пред Inworld Realtime TTS 2 Research Preview (168.5 ms). Бенчмарковете се обновяват постоянно — винаги проверявайте датата, преди да разчитате на класация.

Да. POST /v1/audio/stream изпраща аудиото по HTTP в момента на създаване, като PCM, MP3, Ogg Opus или AAC. PCM има най-ниската латентност, тъй като не изисква кодиране.

Не. SpeechifyAI е API за разработчици, който се таксува отделно от приложението за четене Speechify, а абонаментът за Reader не включва използване на API. Плановете за API са месечни без годишен ангажимент: безплатен план с 500 000 знака месечно без карта, Starter за $10/месец + $10 за 1M знака, Pro за $99 + $8 и Scale за $499 + $6.

Изпробвайте Simba 3.2 в SpeechifyAI: създайте безплатен API ключ и сравнете първата си заявка с горните стойности.

Достъпвайте любимите си гласове на Speechify чрез API – бързо, мащабируемо и удобно за разработчици

Вземете достъп до API
Sparse JavaScript keywords import, from, const, await on a white background

Споделете тази статия

Екипът на Speechify

Екипът на Speechify


Екипът на Speechify

Speechify

За Speechify

#1 четец за текст към реч

Speechify е водещата в света платформа за текст към реч, на която се доверяват над 50 милиона потребители и която има повече от 500 000 петзвездни отзива за своите приложения за текст към реч за iOS, Android, разширение за Chrome, уеб приложение и настолно приложение за Mac. През 2025 година Apple отличи Speechify с престижната Apple Design Award на WWDC, определяйки я като „ключов ресурс, който помага на хората да живеят по-добре“. Speechify предлага над 1000 естествено звучащи гласа на над 60 езика и се използва в близо 200 държави. Сред известните гласове са Snoop Dogg и Гуинет Полтроу. За създатели и бизнеси Speechify Studio предоставя напреднали инструменти, включително AI генератор на гласове, AI клониране на глас, AI дублаж и AI променящ глас. Speechify също задвижва водещи продукти със своето висококачествено и достъпно като цена API за текст към реч. Представено в The Wall Street Journal, CNBC, Forbes, TechCrunch и други водещи медии, Speechify е най-големият доставчик на услуги за текст към реч в света. Посетете speechify.com/news, speechify.com/blog и speechify.com/press, за да научите повече.