सितंबर 2026 में दो बेंचमार्क—जिन्हें Speechify नहीं चलाता—ने SpeechifyAI के Simba 3.2 मॉडल के फर्स्ट ऑडियो तक का समय मापा। Coval ने 24 सितंबर 2026 तक 24 घंटों में 106 ms का मीडियन दर्ज किया। Voice Arena ने उसी दिन US English बोर्ड पर 123 ms मापा, जो उसके मापे गए 14 मॉडलों में सबसे कम था। यह पोस्ट बताती है कि ये आंकड़े क्या मापते हैं, तुलना के लिए फर्स्ट ऑडियो तक का समय सबसे अहम क्यों है, और इसे अपने कोड से कैसे मापें।
आंकड़े
दोनों स्वतंत्र माप हमारे अपने आंकड़ों से अधिक हैं, क्योंकि इनमें उनके रनर और हमारे सर्वरों के बीच की नेटवर्क देरी और ऑडियो की शुरुआती चुप्पी शामिल है। हर आंकड़ा उस बेंचमार्क की उसी तारीख की रीडिंग है। दोनों बोर्ड लगातार चलते रहते हैं, इसलिए आज की स्थिति के लिए उन्हें देखें।
Voice Arena का US English बोर्ड, 24 सितंबर 2026
स्रोत: Voice Arena, 24 सितंबर 2026 को देखा गया। बोर्ड ने 14 मॉडल मापे; यहां छह सबसे तेज़ दिखाए गए हैं।
तुलना के लिए फर्स्ट ऑडियो तक का समय क्यों अहम है
जब कोई वॉइस एजेंट जवाब देता है या कोई ऐप टेक्स्ट पढ़ता है, तो श्रोता को टेक्स्ट भेजे जाने से आवाज़ सुनाई देने तक इंतजार करना पड़ता है। यही इंतजार फर्स्ट ऑडियो तक का समय है।
- फर्स्ट बाइट तक का समय श्रोता के अनुभव से बेहतर दिख सकता है।
- स्ट्रीम चुप्पी से शुरू हो सकती है, और श्रोता को तब तक कुछ सुनाई नहीं देता जब तक पहला ऑडियो सैंपल नहीं आता। फर्स्ट ऑडियो तक का समय उस चुप्पी को भी शामिल करता है।
- कुल जेनरेशन टाइम आखिरी बाइट तक का इंतजार है।
- यह फाइल सेव करते समय मायने रखता है, लेकिन तब नहीं जब कोई श्रोता स्ट्रीमिंग ऑडियो सुन रहा हो।
- संवाद में समय की गुंजाइश बहुत कम होती है।
- लोग आमतौर पर कुछ सौ मिलीसेकंड में जवाब देते हैं। वॉइस एजेंट को इसी अंतराल में स्पीच रिकग्निशन, लैंग्वेज मॉडल और स्पीच सिंथेसिस पूरा करना होता है, इसलिए हर मिलीसेकंड अहम है।
Simba 3.2 बिना छोटा मॉडल बनाए कैसे तेज़ हुआ
Coval के डेटा में, Simba 3.2 का डेली मीडियन 13 सितंबर 2026 को 379 ms से घटकर 18 सितंबर 2026 को 116 ms हो गया—यानी 5 दिनों में लगभग 70% कम।
मॉडल बदला नहीं। वही वेट्स, न डिस्टिलेशन, न क्वांटाइज़ेशन, न कोई 'टर्बो' वर्जन। समय मॉडल के सर्विंग पाथ से कम किया गया:
- नया सर्विंग बिल्ड, अलग GPU क्लास पर, और इंफ्रेंस स्टैक में लो-लेवल सुधार, जिससे ऑडियो जल्दी निकलता है।
- प्लान, एंटाइटलमेंट और रेट-लिमिट जांच अब लाइव के बजाय कैश से हल होती हैं, जिससे पहला बाइट जल्दी निकलता है।
- API गेटवे उसी रीजन में चलता है जहां GPU हैं, और कनेक्शन हर रिक्वेस्ट के बीच गर्म रहता है।
- करीब 100 ms की शुरुआती चुप्पी हटाई गई। Coval के माप में शुरुआती चुप्पी 14 सितंबर को 102 ms से घटकर 13 ms रह गई।
गुणवत्ता बरकरार रही। Artificial Analysis text-to-speech लीडरबोर्ड पर 23 सितंबर 2026 को Simba 3.2 की Elo रेटिंग 1,237 (±14) थी, 92 प्रोवाइडर वॉइस में शीर्ष 5 में, और इससे ऊपर के सभी शीर्ष मॉडल अधिक महंगे हैं।
अपने ऐप में सबसे कम लेटेंसी कैसे पाएं
- स्ट्रीमिंग का इस्तेमाल करें।
- जो भी लाइव चलाना हो, उसके लिए
- POST /v1/audio/stream
- कॉल करें।
- POST /v1/audio/speech
- पूरी क्लिप बनने के बाद ही जवाब भेजता है।
- Simba 3.2 चुनें।
- अंग्रेज़ी के लिए
- model
- को
- simba-3.2
- पर सेट करें। अगर इसे खाली छोड़ते हैं, तो API
- simba-3.0
- इस्तेमाल करती है।
- एक ही कनेक्शन दोबारा इस्तेमाल करें।
- एक HTTP क्लाइंट बनाएं, स्टार्टअप पर कनेक्शन खोलें, और हर रिक्वेस्ट में उसी का इस्तेमाल करें, ताकि DNS, TCP और TLS हैंडशेक का समय बार-बार न लगे।
- वाक्य मिलते ही भेजें।
- अगर आगे लैंग्वेज मॉडल है, तो हर पूरा वाक्य तुरंत भेजें और स्ट्रीम्स को क्रम से चलाएं।
- अपने प्लेयर के हिसाब से फॉर्मेट चुनें।
- audio/pcm
- 24 kHz पर सबसे कम लेटेंसी देता है, क्योंकि इसमें एन्कोडिंग स्टेप नहीं होता। बैंडविड्थ बचाने के लिए MP3 या Ogg Opus चुनें।
- API के करीब चलाएं।
- API US East से चलती है, इसलिए उसी रीजन या पास के सर्वर से सबसे कम नेटवर्क समय मिलेगा।
LiveKit Agents पर बना रहे हैं? यह गाइड Speechify प्लगइन के साथ एक वॉइस एजेंट बनाती है, जो लैंग्वेज मॉडल के वाक्य लिखते ही उन्हें स्ट्रीम कर देता है। हर स्टेप का कारण और कोड लेटेंसी डाक्यूमेंटेशन में है।
खुद मापें
जहां आपका कोड चलता है, वहीं से स्ट्रीमिंग रिस्पॉन्स के पहले हिस्से का समय नोट करें। सही आकलन के लिए:
- पहली या दूसरी रिक्वेस्ट छोड़ दें। उनमें कनेक्शन खोलना शामिल होता है।
- हर रिक्वेस्ट में अलग टेक्स्ट भेजें, जैसा आपके असली ट्रैफिक में होता है।
- रिक्वेस्ट एक-एक करके भेजें, साथ-साथ नहीं।
- कम से कम 20 रिक्वेस्ट लें और मीडियन (p50) व p90 रिपोर्ट करें, औसत या सिर्फ सर्वश्रेष्ठ नहीं।
- PCM के साथ मापें। Ogg में पहले बाइट हेडर होते हैं, ऑडियो नहीं।
हर स्ट्रीमिंग रिस्पॉन्स में Server-Timing हेडर होता है, जिसमें ttfb हमारा हिस्सा दिखाता है; बाकी हिस्सा नेटवर्क या आपके अपने स्टैक का होता है। लेटेंसी डाक्यूमेंटेशन में Python और TypeScript के लिए स्क्रिप्ट्स भी हैं।
अक्सर पूछे जाने वाले सवाल
SpeechifyAI के Simba 3.2 मॉडल ने प्रोडक्शन ट्रैफिक (US East, 15 सितंबर 2026) में पहला ऑडियो बाइट लिखने का मीडियन समय 56 ms और p90 समय 102 ms दर्ज किया। स्वतंत्र बेंचमार्क ने 106 ms (Coval, 24 सितंबर 2026 तक 24 घंटे) और 123 ms (Voice Arena, 24 सितंबर 2026) का मीडियन समय मापा, जिसमें नेटवर्क और किसी भी शुरुआती चुप्पी को शामिल किया गया।
24 सितंबर 2026 को Voice Arena के US English बोर्ड पर SpeechifyAI के Simba 3.2 ने 14 मॉडलों में सबसे कम फर्स्ट ऑडियो मीडियन समय दर्ज किया: 123 ms। तुलना में Inworld Realtime TTS 2 रिसर्च प्रिव्यू 168.5 ms पर था। बेंचमार्क लगातार अपडेट होते हैं, इसलिए भरोसा करने से पहले तारीख जरूर देखें।
हाँ। POST /v1/audio/stream ऑडियो बनते ही उसे HTTP पर भेजता है। उपलब्ध फॉर्मेट हैं: PCM, MP3, Ogg Opus और AAC। PCM में लेटेंसी सबसे कम होती है, क्योंकि इसमें एन्कोडिंग की जरूरत नहीं पड़ती।
नहीं। SpeechifyAI, Speechify का डेवलपर API है। इसका बिल पढ़ने वाले ऐप से अलग बनता है, और इसका उपयोग रीडर सब्सक्रिप्शन में शामिल नहीं है। API प्लान मासिक हैं, कोई वार्षिक प्रतिबद्धता नहीं: एक मुफ्त प्लान (5 लाख अक्षर/माह, बिना कार्ड), फिर Starter $10/माह (अतिरिक्त $10/1M अक्षर), Pro $99 ($8), और Scale $499 ($6)।
Simba 3.2 को SpeechifyAI पर आज़माएं: एक मुफ्त API कुंजी बनाएं और ऊपर दिए गए आंकड़ों के मुकाबले अपनी पहली रिक्वेस्ट का समय मापें।

