ორმა დამოუკიდებელმა ბენჩმარკმა (რომლებსაც Speechify არ მართავს) 2026 წლის სექტემბერში გაზომა SpeechifyAI-ის Simba 3.2 მოდელის პირველი აუდიოს დრო. Coval-მა 24 სექტემბრამდე 24-საათიან პერიოდში 106 მს მედიანა დააფიქსირა. Voice Arena-მ კი იმავე დღეს US English დაფაზე 123 მს აჩვენა — 14 მოდელს შორის ყველაზე დაბალი მაჩვენებელი. ამ პოსტში განვმარტავთ, რას ზომავს ეს რიცხვები, რატომ არის პირველი აუდიოს დრო შედარებისთვის მნიშვნელოვანი და როგორ გაზომოთ ის საკუთარი კოდიდან.
რიცხვები
ორი დამოუკიდებელი შედეგი ჩვენს მაჩვენებელზე მაღალია, რადგან მათში შედის გზა დამკვირვებლის მხრიდან ჩვენს სერვერებამდე და აუდიოს საწყისი სიჩუმეც. თითოეული შედეგი შესაბამის დღეს არის დაფიქსირებული. ორივე დაფა ყოველდღიურად ახლდება, ამიტომ გადაამოწმეთ მიმდინარე მაჩვენებლები.
Voice Arena-ს US English დაფა, 24 სექტემბერი, 2026
წყარო: Voice Arena, 24 სექტემბერი, 2026 წლის მდგომარეობით. დაფა 14 მოდელს ზომავს — აქ სწრაფი ექვსეულია ნაჩვენები.
რატომ არის პირველი აუდიოს დრო შედარებისთვის ყველაზე მნიშვნელოვანი
როცა ხმოვანი აგენტი პასუხობს ან აპლიკაცია ტექსტს ხმამაღლა კითხულობს, მსმენელი სწორედ იმ დროს ელოდება, რომელიც ტექსტის გაგზავნიდან პირველ ხმამდე გადის. ეს არის პირველი აუდიოს დრო.
- პირველი ბაიტის დრო მსმენელისთვის ხშირად უფრო სწრაფად ჩანს, ვიდრე რეალურად ისმის.
- სტრიმი შეიძლება სიჩუმით დაიწყოს და მსმენელმა ხმა მანამდე ვერ გაიგოს, სანამ პირველი ხმოვანი სემპლი არ მოვა. პირველი აუდიოს დრო ამასაც ითვლის.
- მთლიანი გენერირების დრო ბოლო ბაიტამდე ლოდინს ნიშნავს.
- ეს მნიშვნელოვანია, როცა ფაილს ინახავთ, მაგრამ ნაკლებად მნიშვნელოვანია, როცა აუდიო სტრიმით გადაიცემა.
- საუბარში პაუზა მოკლეა.
- ადამიანები ხშირად რამდენიმე ასეულ მილიწამში პასუხობენ. ხმოვან აგენტს ამ შუალედში უნდა მოასწროს turn-taking, ენობრივი მოდელი და მეტყველების სინთეზი, ამიტომ ხმოვან ნაწილში მოგებული ყოველი მილიწამი მნიშვნელოვანია.
როგორ დაიკლო Simba 3.2-ის დრო მოდელის შემცირების გარეშე
Coval-ის მონაცემებით, Simba 3.2-ის დღის მედიანა 13 სექტემბერს 379 მს იყო, 18 სექტემბერს კი 116 მს-მდე ჩამოვიდა — დაახლოებით 70%-იანი გაუმჯობესება ხუთ დღეში.
მოდელი არ შეცვლილა. წონები იგივე დარჩა; არც დაპატარავებული, არც დამსუბუქებული და არც შემცირებული ვერსია არ არის. გაუმჯობესება მოდელის გარშემო არსებულ ინფრასტრუქტურაში მივიღეთ:
- ახალი serving build სხვა კლასის GPU-ზე, დაბალი დონის inference stack-ის ოპტიმიზაციით, რათა აუდიო უფრო სწრაფად გაიგზავნოს.
- წევრობისა და ლიმიტების შემოწმება ახლა ქეშიდან ხდება და არა ცოცხალი მოთხოვნით პირველი ბაიტის დაბრუნებამდე.
- API gateway იგივე რეგიონში მუშაობს, სადაც GPU-ებია, და კავშირი მუდმივად გახსნილია.
- დაახლოებით 100 მს საწყისი სიჩუმე გაქრა. Coval-ის გაზომვით, Simba 3.2-ის საწყისი სიჩუმე 102 მს-დან 13 მს-მდე შემცირდა.
ხარისხი შენარჩუნდა. Artificial Analysis-ის ტექსტიდან-ხმის ლიდერბორდზე Simba 3.2-ს 2026 წლის 23 სექტემბერს Elo 1237 (±14) ჰქონდა, რაც 92 პროვაიდერს შორის საუკეთესო ხუთეულში აყენებდა — და მასზე უკეთ შეფასებული ყველა მოდელი უფრო ძვირია.
როგორ მიაღწიოთ ყველაზე დაბალ დაყოვნებას თქვენს აპში
- გამოიყენეთ სტრიმინგი.
- დინამიკური გაშვებისთვის გამოიყენეთ
- POST /v1/audio/stream
- .
- POST /v1/audio/speech
- პასუხს მხოლოდ მთელი აუდიოს გენერირების შემდეგ აბრუნებს.
- აირჩიეთ Simba 3.2.
- ინგლისურისთვის
- model
- -ის მნიშვნელობად მიუთითეთ
- simba-3.2
- . თუ
- model
- არ არის მითითებული, API იყენებს
- simba-3.0
- -ს.
- ერთი კავშირი მრავალჯერ გამოიყენეთ.
- შექმენით ერთი HTTP კლიენტი, შეინარჩუნეთ მუდმივი კავშირი და გამოიყენეთ ყველა მოთხოვნისთვის, რომ დრო არ დაიხარჯოს DNS-, TCP- და TLS-ხელის ჩამორთმევებზე.
- წინადადება გაგზავნეთ მაშინვე, როგორც კი მზად იქნება.
- გაგზავნეთ ყოველი დასრულებული წინადადება, როგორც კი ენობრივი მოდელი დააბრუნებს, და ისინი თქვენს რიგში თანმიმდევრულად დაუკარით.
- აირჩიეთ ფორმატი, რომელიც თქვენს ფლეიერს სჭირდება.
- audio/pcm
- 24 კჰც-ზე ყველაზე დაბალ დაყოვნებას იძლევა, რადგან კოდირება არ სჭირდება. MP3 ან Ogg Opus გამოიყენეთ, როცა გამტარუნარიანობა უფრო მნიშვნელოვანია.
- იმუშავეთ API-სთან ახლოს.
- API US East-შია განთავსებული, ამიტომ სერვერი ამ რეგიონში ან ახლოს ქსელურ დროს ამცირებს.
აშენებთ რამეს LiveKit Agents-ზე? ეს სახელმძღვანელო გაჩვენებთ, როგორ შექმნათ ხმოვანი აგენტი Speechify-ის პლაგინით, რომელიც თითოეულ წინადადებას სტრიმინგით აგზავნის, როგორც კი ენობრივი მოდელი დაასრულებს. ნაბიჯ-ნაბიჯ ახსნა და კოდის მაგალითები იხილეთ დაყოვნების დოკუმენტაციაში.
ზომეთ თავად
დააფიქსირეთ პირველი სტრიმინგ-პასუხი იქიდან, სადაც თქვენი კოდი მუშაობს. ობიექტური შედეგისთვის:
- პირველი ერთი-ორი მოთხოვნა გამოტოვეთ — მათში კავშირის გახსნის დროც შედის.
- მოთხოვნებს შორის ტექსტები შეცვალეთ, როგორც რეალურ გამოყენებაში ხდება.
- მოთხოვნები გააგზავნეთ მიყოლებით და არა პარალელურად.
- შეასრულეთ მინიმუმ 20 მოთხოვნა და საშუალოს ან საუკეთესო შედეგის ნაცვლად წარმოადგინეთ მედიანა (p50) და p90.
- ზომეთ PCM-ით. Ogg-ის შემთხვევაში პირველი ბაიტები მხოლოდ ჰედერებია და არა აუდიო.
თითოეულ სტრიმინგ-პასუხს ახლავს Server-Timing ჰედერი, ხოლო მასში ttfb ჩვენი ნაწილია — დანარჩენი დრო ქსელსა და თქვენს სტეკზე მოდის. დაყოვნების დოკუმენტაცია შეიცავს სკრიპტებს Python-ისა და TypeScript-ისთვის.
ხშირად დასმული კითხვები
SpeechifyAI-ის Simba 3.2 მოდელმა 2026 წლის 15 სექტემბერს US East-ში რეალური მომხმარებლის ტრაფიკზე პირველი აუდიო ბაიტი p50-ზე 56 მს-ში და p90-ზე 102 მს-ში დააბრუნა. დამოუკიდებელმა ბენჩმარკებმა მედიანა გაზომეს 106 მს (Coval, 24 საათი 24 სექტემბრამდე) და 123 მს (Voice Arena, 24 სექტემბერს), მათ შორის საკუთარი ქსელის დრო და საწყისი სიჩუმეც.
Voice Arena-ს US English დაფაზე 2026 წლის 24 სექტემბერს SpeechifyAI-ის Simba 3.2-ს 14 მოდელს შორის პირველი აუდიოს ყველაზე დაბალი მედიანა ჰქონდა — 123 მს — და უსწრებდა უახლოეს მოდელს, Inworld Realtime TTS 2 Research Preview-ს (168.5 მს). ბენჩმარკები მუდმივად ახლდება, ამიტომ ნებისმიერი რეიტინგის გამოყენებამდე თარიღი გადაამოწმეთ.
დიახ. POST /v1/audio/stream აუდიოს სტრიმინგით აგზავნის გენერირების პარალელურად: PCM, MP3, Ogg Opus ან AAC ფორმატში. PCM-ს ყველაზე დაბალი დაყოვნება აქვს, რადგან კოდირება არ სჭირდება.
არა. SpeechifyAI არის Speechify-ის დეველოპერული API და მისი ფასი ცალკეა Speechify Reader აპის გამოწერისგან. Reader-ის გამოწერა API-ის გამოყენებას არ მოიცავს. API-ს აქვს ყოველთვიური გეგმა წლიური ვალდებულების გარეშე: უფასო გეგმაზე — 500,000 სიმბოლო თვეში ბარათის გარეშე; შემდეგ Starter — $10/თვე და დამატებითი მოხმარება $10 მილიონ სიმბოლოზე; Pro — $99; Scale — $499/თვე და $6.
სცადეთ Simba 3.2 SpeechifyAI-ზე: შექმენით უფასო API გასაღები და თავად გაზომეთ, როგორია თქვენი პირველი მოთხოვნის შედეგი ზემოთ მოცემულ მაჩვენებლებთან შედარებით.

