Speechify оголосила, що її флагманська модель потокового синтезу мовлення, Simba 3.2, посіла перше місце в загальному рейтингу Artificial Analysis — найповнішому незалежному бенчмарку серед комерційно доступних AI-моделей голосу. Simba 3.2 обійшла лідерів ринку — ElevenLabs, Cartesia, OpenAI, Google DeepMind і xAI. Уперше світовий рейтинг очолила компанія зі споживчим фокусом. За ключовими метриками голосового AI Simba 3.2 нині вважається найкращою моделлю на ринку. Окремо Simba 3.2 також посідає перше місце у Voice Arena серед моделей реального часу, зміцнюючи лідерство Speechify у двох головних індустріальних рейтингах.
Про Artificial Analysis
Рейтинг Artificial Analysis — головний орієнтир для розробників і компаній у сфері голосового AI. Він об'єктивно оцінює всі комерційні моделі на ринку, постійно оновлюється з появою новинок і є важливим інструментом для команд, які додають голос у свої продукти. На відміну від рейтингів самих постачальників, він не спирається на самозвіти. За цим показником Simba 3.2 — найкраща TTS-модель для розробників на сьогодні.
Що цей рейтинг означає для доступності
Важлива не лише якість, а й її співвідношення з ціною. Simba 3.2 коштує $10 за мільйон символів (стартовий тариф Speechify) і $6 за мільйон (тариф Scale), що робить її найвигіднішою моделлю в першій десятці Artificial Analysis. У Speechify оцінюють, що це приблизно в 15 разів дешевше за ElevenLabs і в 6 разів дешевше за Cartesia за такої самої або вищої якості — Simba 3.2 нині є найдоступнішим API голосового AI для production.
Ще донедавна таке поєднання в синтезі мовлення вважалося неможливим: преміумсегмент давав реалістичні голоси за корпоративними цінами, а бюджетний — втрачав у якості. Simba 3.2 ламає цей компроміс: найкращий голосовий AI стає доступним кожному — розробникам, стартапам і корпораціям, незалежно від бюджету.
Засновник Speechify про ідеальний баланс
"Simba 3.2 — наша найкраща модель, уже доступна на Speechify.ai," — каже Кліфф Вайтцман, засновник і CEO Speechify, на LinkedIn. "Вона створена для масштабування й відточена на мільйонах A/B-тестів. У TTS API вирішальними є вартість, якість і швидкість. Simba 3.2 досягла SOTA за всіма трьома. Не можемо дочекатися, коли ви випробуєте її у своїх проєктах!"
Баланс, про який говорить Вайтцман, довгий час був недосяжним для більшості AI-сервісів голосу. Зазвичай поліпшення однієї характеристики вимагало поступитися іншою, і на цьому більшість зупинялася. Досягти найкращих результатів одночасно за всіма напрямами довго вважалося фантастикою. Рейтинг Artificial Analysis став першим незалежним підтвердженням того, що цей компроміс подолано. Simba 3.2 стала найкращою моделлю для команд, які створюють голосові продукти.
Від Стенфорда до передових технологій за 5 років
Сімейство моделей Simba виросло з досліджень співзасновника та Head of AI у Speechify Тайлера Вайтцмана під час навчання у Стенфорді. Його експерименти з нейронними голосовими архітектурами на курсі з машинного навчання за п’ять років перетворилися на технологію, яка сьогодні забезпечує синтез мовлення в усіх продуктах Speechify для споживачів і бізнесу, закріпивши позицію компанії як провідної AI-лабораторії.
Згадуючи той етап, Тайлер Вайтцман написав у пості на X: "Ще на курсі CS229 у Стенфорді з Ендрю Інгом я по-справжньому захопився ML. Наш проєкт був про Tacotron 2. А тепер, через 5 років, наша нова модель у Speechify — це вже SOTA. Дивовижно озиратися на цей шлях."
Рохан Павулурі, Chief Business Officer Speechify і давній друг Тайлера Вайтцмана, в оголошенні назвав цей рейтинг результатом раннього архітектурного рішення. "Можливо, ми могли б рости швидше, якби зосередилися лише на якості, але наш споживчий фокус і бізнес-модель від самого початку продиктували інше рішення: дати клієнтам практично необмежену кількість озвучувань за $139/рік. Саме це й дозволило створити SOTA TTS за найкращою ціною — у сфері AI таке трапляється рідко, бо зазвичай краща якість означає вищу ціну."
Масштаб споживчого продукту — рушій корпоративного AI
Можливість Speechify пропонувати найкращий AI-голос за найнижчою ціною пояснюється економікою її B2C-напрямку. Платформа має понад 60 млн користувачів і цьогоріч отримала Apple Design Award на WWDC 2025. Щоб обслуговувати таку базу за підпискою $139/рік, дослідницька команда від самого початку заклала в основу проєктування максимально ефективний інференс, а не додавала його як подальшу оптимізацію. Саме ця дисципліна дала змогу сьогодні запропонувати розробникам модель №1 у рейтингу Artificial Analysis за доступною ціною.
"Це справді чудова новина для API-розробників," — каже Люк Оліфф, Head of Developer Relations у Speechify, у пресрелізі. "Ми роками оптимізували моделі для максимальної ефективності — цього вимагав наш бізнес і десятки мільйонів слухачів, яким ми пропонуємо найкращі голоси. Саме тому сьогодні можемо вивести топову модель у наш API за найвигіднішою ціною. Інші лабораторії будували моделі під бенчмарки й продавали їх бізнесу, а ми — для слухачів і production."
Доступність
Simba 3.2 уже доступна через SpeechifyAI Build — API для озвучування та клонування голосу — і лежить в основі нової платформи SpeechifyAI Agents для створення повноцінних голосових агентів. Обидва продукти доступні на speechify.ai, мають SDK для TypeScript і Python, стрімінг, низьку затримку, тонкі емоційні налаштування та SSML-просодію. Платформа також містить визнану найкращою на ринку технологію клонування голосу — тож розробники отримують єдине рішення для найкращого AI-голосу й миттєвого клонування за тією самою ціною. У планах компанії — нові мови та ще дешевша модель.