ستمبر 2026 میں دو ایسے بینچ مارکس، جو Speechify نہیں چلاتا، نے SpeechifyAI کے Simba 3.2 ماڈل کے پہلے آڈیو تک وقت کی پیمائش کی۔ Coval نے 24 ستمبر 2026 کو 24 گھنٹوں کے دوران 106 ملی سیکنڈ کا درمیانی وقت ریکارڈ کیا۔ Voice Arena نے اسی دن اپنے امریکی انگریزی بورڈ پر 123 ملی سیکنڈ ریکارڈ کیے، جو اس کے ناپے گئے 14 ماڈلز میں سب سے کم تھا۔ یہ مضمون واضح کرتا ہے کہ یہ اعداد کیا ناپتے ہیں، پہلے آڈیو تک وقت لیٹنسی کے موازنے کے لیے کیوں اہم ہے، اور آپ اسے اپنے کوڈ سے کیسے ناپ سکتے ہیں۔
اعداد و شمار
یہ دونوں آزاد ریڈنگز ہماری اپنی پیمائش سے زیادہ ہیں، کیونکہ ان میں اپنے رنر اور ہمارے سرورز کے درمیان نیٹ ورک بھی شامل ہے، اور آڈیو کے آغاز کی خاموشی بھی۔ ہر ایک اسی دن کی پیمائش ہے۔ دونوں بورڈز اب بھی چل رہے ہیں، اس لیے تازہ ترین اعداد کے لیے انہیں ضرور دیکھیں۔
Voice Arena کا امریکی انگریزی بورڈ، 24 ستمبر 2026
ماخذ: Voice Arena، ملاحظہ کردہ 24 ستمبر 2026۔ بورڈ نے 14 ماڈلز کا وقت ناپا؛ یہاں چھ تیز ترین دکھائے گئے ہیں۔
پہلے آڈیو تک وقت موازنے کا اصل پیمانہ کیوں ہے
جب کوئی وائس ایجنٹ جواب دیتا ہے یا کوئی ایپ متن پڑھتی ہے، تو سننے والا متن بھیجنے کے لمحے سے آواز سنائی دینے تک انتظار کرتا ہے۔ یہی انتظار پہلے آڈیو تک وقت کہلاتا ہے۔
- پہلے بائٹ تک وقت سننے کے تجربے کی درست عکاسی نہیں کرتا۔
- اسٹریمنگ خاموشی سے شروع ہو سکتی ہے، اور سننے والے کو پہلے سنائی دینے والے سیمپل تک کچھ سنائی نہیں دیتا۔ پہلے آڈیو تک وقت اس خاموشی کو بھی شامل کرتا ہے۔
- کل جنریشن وقت آخری بائٹ تک انتظار کو ناپتا ہے۔
- یہ تب اہم ہوتا ہے جب آپ فائل محفوظ کر رہے ہوں، نہ کہ اس وقت جب کوئی اسٹریمنگ کے دوران سن رہا ہو۔
- گفتگو میں وقت بہت کم ہوتا ہے۔
- لوگ عموماً چند سو ملی سیکنڈ میں جواب دیتے ہیں۔ وائس ایجنٹ کو اسی وقفے میں اسپیچ ریکگنیشن، لینگویج ماڈل اور اسپیچ سنتھیسس سب سنبھالنا ہوتا ہے، اس لیے ہر ملی سیکنڈ اہم ہے۔
Simba 3.2 نے ماڈل چھوٹا کیے بغیر رفتار کیسے بڑھائی
Coval کے ڈیٹا میں، Simba 3.2 کا روزانہ درمیانی وقت 13 ستمبر 2026 کو 379 ملی سیکنڈ سے کم ہو کر 18 ستمبر کو 116 ملی سیکنڈ رہ گیا، یعنی پانچ دن میں تقریباً 70٪ کمی۔
ماڈل تبدیل نہیں ہوا۔ ویٹس وہی رہیں، نہ ڈسٹلیشن ہوئی، نہ کوانٹائزیشن، نہ کوئی مختصر "ٹربو" ورژن آیا۔ وقت ماڈل کے گرد موجود سروس پاتھ میں بہتری سے کم ہوا:
- مختلف GPU کلاس پر ایک نیا سروسنگ بلڈ، انفرینس اسٹیک میں کم سطحی کام کے ساتھ، جس سے آڈیو جلدی نکلتی ہے۔
- پلان، اینٹائٹلمنٹ اور ریٹ لمٹ چیکس اب براہ راست چیک کے بجائے کیش سے حل ہوتے ہیں۔
- API گیٹ وے اسی ریجن میں چلتا ہے جہاں GPUs ہیں، اور ایسے کنکشنز پر جو ہر درخواست کے لیے گرم رہتے ہیں۔
- تقریباً 100 ملی سیکنڈ کی ابتدائی خاموشی ختم ہو گئی۔ Coval کی لیڈنگ سائلنس پیمائش Simba 3.2 کے لیے 14 ستمبر کو 102 ملی سیکنڈ سے گھٹ کر 13 ملی سیکنڈ رہ گئی۔
کوالٹی برقرار رہی۔ Artificial Analysis text-to-speech leaderboard پر، 23 ستمبر 2026 کو Simba 3.2 کو 1,237 (±14) Elo ملا، جو 92 فراہم کنندگان کی آوازوں میں اسے سرفہرست پانچ میں لاتا ہے، اور اس سے اوپر ہر ماڈل زیادہ مہنگا ہے۔
اپنی ایپ میں کم سے کم لیٹنسی کیسے حاصل کریں
- اسٹریم کریں۔
- POST /v1/audio/stream
- ہر اس چیز کے لیے کال کریں جو پلے ہوتے ہوئے جنریٹ ہو رہی ہو۔
- POST /v1/audio/speech
- صرف تب جواب دیتا ہے جب پورا کلپ تیار ہو جائے۔
- Simba 3.2 منتخب کریں۔
- انگریزی کے لیے
- model
- کو
- simba-3.2
- پر سیٹ کریں۔ اگر
- model
- نہ دیا جائے تو API
- simba-3.0
- استعمال کرتی ہے۔
- ایک ہی کنکشن دوبارہ استعمال کریں۔
- ایک HTTP کلائنٹ بنائیں، کنکشن اسٹارٹ اپ پر کھولیں اور ہر ریکویسٹ میں وہی برقرار رکھیں، تاکہ DNS lookup اور TCP, TLS handshake کا وقت نہ لگے۔
- جملے مکمل ہوتے ہی بھیج دیں۔
- اگر لینگویج ماڈل استعمال ہو رہا ہے، تو ہر مکمل جملہ بنتے ہی فوراً بھیجیں اور اسٹریمز کو ترتیب سے پلے کریں۔
- پلیئر کے مطابق فارمیٹ چنیں۔
- audio/pcm
- 24 kHz پر بغیر انکوڈنگ کے ہوتا ہے۔ اگر بینڈوڈتھ اہم ہو تو MP3 یا Ogg Opus استعمال کریں۔
- API کے قریب چلائیں۔
- API US East سے سروس دی جاتی ہے، اس لیے وہیں یا قریبی سرور پر نیٹ ورک تاخیر کم ہوگی۔
LiveKit Agents پر کام کر رہے ہیں؟ یہ گائیڈ Speechify پلگ ان کے ساتھ ایک وائس ایجنٹ بناتی ہے، جو لینگویج ماڈل کے تیار کرتے ہی ہر جملہ اسٹریم کرتا ہے۔ ہر مرحلے کی منطق اور کوڈ لیٹنسی ڈاکیومنٹیشن میں موجود ہے۔
خود پیمائش کریں
اپنے کوڈ سے اسٹریمنگ ریسپانس کے پہلے حصے کی پیمائش کریں۔ درست نتیجے کے لیے:
- پہلی ایک یا دو درخواستیں نظرانداز کریں۔ ان میں کنکشن کھلنے کا وقت شامل ہوتا ہے۔
- درخواستوں میں متن مختلف رکھیں، جیسے حقیقی ٹریفک میں ہوتا ہے۔
- درخواستیں بیک وقت نہیں، بلکہ یکے بعد دیگرے بھیجیں۔
- کم از کم 20 درخواستیں لیں اور اوسط نہیں بلکہ درمیانہ (p50) اور p90 رپورٹ کریں، بہترین رن نہیں۔
- پیمائش PCM میں کریں۔ Ogg میں ابتدائی بائٹس ہیڈرز ہوتے ہیں، آڈیو نہیں۔
ہر اسٹریمنگ ریسپانس میں Server-Timing ہیڈر ہوتا ہے، جس میں ttfb وہ حصہ دکھاتا ہے جو ہماری طرف سے ہے؛ باقی نیٹ ورک اور آپ کے اسٹیک کا ہوتا ہے۔ لیٹنسی ڈاکیومنٹیشن میں خود پیمائش کے لیے Python اور TypeScript اسکرپٹس موجود ہیں۔
اکثر پوچھے گئے سوالات
SpeechifyAI کے Simba 3.2 ماڈل نے 15 ستمبر 2026 کو US East میں حقیقی ٹریفک پر درمیانی طور پر 56 ملی سیکنڈ اور p90 میں 102 ملی سیکنڈ میں پہلا آڈیو بائٹ لکھا۔ آزاد بینچ مارکس نے پہلے آڈیو تک درمیانی وقت 106 ملی سیکنڈ (Coval، 24 گھنٹے تا 24 ستمبر 2026) اور 123 ملی سیکنڈ (Voice Arena، 24 ستمبر 2026) ریکارڈ کیا، جن میں نیٹ ورک اور آڈیو کے آغاز کی خاموشی شامل ہے۔
24 ستمبر 2026 کو Voice Arena کے امریکی انگریزی بورڈ پر، SpeechifyAI کے Simba 3.2 نے 14 ماڈلز میں سب سے کم 123 ملی سیکنڈ کا درمیانی وقت ریکارڈ کیا؛ یہ Inworld Realtime TTS 2 Research Preview سے آگے تھا، جس کا وقت 168.5 ملی سیکنڈ تھا۔ بینچ مارکس مسلسل اپ ڈیٹ ہوتے رہتے ہیں، اس لیے ان پر انحصار کرنے سے پہلے تاریخ ضرور دیکھیں۔
جی ہاں۔ POST /v1/audio/stream جاری آڈیو کو HTTP پر اسٹریم کرتا ہے، جیسے PCM, MP3, Ogg Opus یا AAC۔ PCM میں لیٹنسی سب سے کم ہوتی ہے کیونکہ اس میں انکوڈنگ نہیں ہوتی۔
نہیں۔ SpeechifyAI، Speechify کا ڈیولپر API ہے، اور اس کی بلنگ ریڈنگ ایپ سے الگ ہے، جبکہ Reader سبسکرپشن API کے استعمال پر لاگو نہیں ہوتی۔ API پلانز ماہانہ ہیں، سالانہ کمٹمنٹ کے بغیر: 500,000 کریکٹرز ماہانہ کا مفت پلان، بغیر کریڈٹ کارڈ کے؛ اس کے بعد Starter $10/ماہ، اضافی استعمال $10 فی 1M کریکٹرز؛ Pro $99/ماہ پر $8، اور Scale $499/ماہ پر $6۔
Simba 3.2 آزمانا چاہتے ہیں؟ SpeechifyAI پر مفت API کلید بنائیں اور اپنی درخواست کا اوپر دیے گئے نمبروں سے موازنہ کریں۔

