قاس مرجعان مستقلان (لا تديرهما Speechify) الزمن حتى أول صوت لنموذج SpeechifyAI Simba 3.2 في سبتمبر 2026. فقد سجّل Coval متوسطًا بلغ 106 مللي ثانية خلال 24 ساعة حتى 24 سبتمبر 2026. وفي اليوم نفسه، سجّلت Voice Arena 123 مللي ثانية على لوحة الإنجليزية الأمريكية، وهو أقل رقم بين 14 نموذجًا خضع للاختبار. تشرح هذه المقالة ما الذي تقيسه هذه الأرقام، ولماذا ينبغي مقارنة الزمن حتى أول صوت تحديدًا، وكيف يمكنك قياسه بنفسك من خلال الكود الخاص بك.
الأرقام
القراءتان المستقلتان أعلى من نتائجنا لأنهما تحتسبان الشبكة بين الجهاز وخوادمنا، وأي صمت في بداية الصوت. وتمثل كل نتيجة قراءة ذلك المعيار في ذلك اليوم. وتستمر اللوحتان في التحديث، لذا تحقّق دائمًا من أحدث رقم فيهما.
لوحة الإنجليزية الأمريكية في Voice Arena، 24 سبتمبر 2026
المصدر: Voice Arena، تاريخ الاطلاع 24 سبتمبر 2026. جرى قياس 14 نموذجًا، والمعروض هنا هو الأسرع بينها.
لماذا يُعد الوقت حتى أول صوت هو المقياس الذي ينبغي مقارنته
عندما يرد وكيل صوتي أو يقرأ تطبيق نصًا بصوت عالٍ، فإن المستمع ينتظر من لحظة إرسال النص إلى أن يسمع الصوت. هذا الانتظار هو الزمن حتى أول صوت.
- وقت أول بايت قد يبدو أفضل مما يسمعه المستمع.
- قد يبدأ البث بصمت، فلا يسمع المستخدم شيئًا حتى تصدر أول عينة صوتية مسموعة. والزمن حتى أول صوت يحتسب هذا الصمت.
- إجمالي مدة التوليد يعني الانتظار حتى آخر بايت.
- هذا مهم عند حفظ ملف، لكنه أقل أهمية إذا كان المستخدم يستمع أثناء البث.
- المحادثة لا تحتمل التأخير.
- عادةً ما يرد البشر خلال بضع مئات من المللي ثواني؛ لذلك يجب أن ينجز الوكيل الصوتي التعرّف على الكلام، والنموذج اللغوي، وتوليد الصوت ضمن هذه المهلة، وكل مللي ثانية إضافية تُقتطع من بقية السلسلة.
كيف أصبح Simba 3.2 أسرع من دون تصغير النموذج
في بيانات Coval، انخفض المتوسط اليومي لـ Simba 3.2 من 379 مللي ثانية في 13 سبتمبر 2026 إلى 116 مللي ثانية في 18 سبتمبر 2026، أي تراجع بنحو 70% خلال خمسة أيام.
النموذج نفسه لم يتغير. بقيت الأوزان كما هي، من دون تقطير أو تكميم أو إصدار مختصر باسم "توربو". وجاء هذا التحسّن من مسار تقديم الخدمة المحيط بالنموذج:
- بنية تقديم جديدة على بطاقة GPU مختلفة، مع تحسينات منخفضة المستوى في حزمة الاستدلال لتسريع بث الصوت.
- أصبحت فحوصات الخطة والصلاحية والحدود تُحل من الذاكرة المؤقتة بدلًا من البحث الفوري قبل البايت الأول.
- تعمل بوابة واجهة برمجة التطبيقات في المنطقة نفسها مع وحدات GPU، وعلى اتصالات تظل نشطة بين الطلبات.
- أُزيل نحو 100 مللي ثانية من الصمت المبدئي. فقد انخفض مقياس Coval لصمت البداية في Simba 3.2 من 102 مللي ثانية (14 سبتمبر) إلى 13 مللي ثانية.
وظلت الجودة على مستواها. على لوحة ترتيب تحويل النص إلى كلام في Artificial Analysis، حقق Simba 3.2 تصنيف Elo بلغ 1,237 (±14) في 23 سبتمبر 2026، ليكون ضمن أفضل خمسة أصوات من أصل 92 مزودًا، وجميع النماذج ذات التقييم الأعلى أعلى تكلفة.
كيف تحقق أقل زمن استجابة في تطبيقك
- استخدم البث اللحظي.
- استدعِ
- POST /v1/audio/stream
- لكل ما يجب تشغيله أثناء توليده. أما
- POST /v1/audio/speech
- فلا يرد إلا بعد اكتمال المقطع بالكامل.
- اطلب Simba 3.2.
- اضبط
- model
- على
- simba-3.2
- للإنجليزية. وعند عدم تحديد
- model
- ، تستخدم الواجهة
- simba-3.0
- .
- أعد استخدام الاتصال نفسه.
- أنشئ عميل HTTP واحدًا وأبقِ الاتصال مفتوحًا لكل الطلبات، حتى لا تتحمل في كل مرة كلفة DNS أو تهيئة اتصال TCP/TLS.
- أرسل الجمل فور اكتمالها.
- إذا كان لديك نموذج لغوي في المقدمة، فأرسل كل جملة مكتملة فور توليدها، وشغّل التدفقات بالترتيب.
- اختر الصيغة التي يحتاجها المشغّل لديك.
- لا يحتاج
- audio/pcm
- عند 24 كيلوهرتز إلى ترميز إضافي. واستخدم MP3 أو Ogg Opus عند الحاجة إلى تقليل حجم النقل.
- شغّل من موقع قريب من الواجهة.
- تعمل الواجهة من الساحل الشرقي الأمريكي، لذا يقضي الخادم الأقرب وقتًا أقل على الشبكة.
هل تعمل على LiveKit Agents؟ هذا الدليل يشرح بناء وكيل صوتي باستخدام إضافة Speechify، بحيث يبث كل جملة فور توليدها من النموذج اللغوي. كما ستجد شرحًا خطوة بخطوة مع الكود في توثيق زمن الاستجابة.
قِس ذلك بنفسك
قِس زمن وصول أول جزء من رد البث من المكان الذي يعمل فيه كودك. ولضمان المقارنة العادلة:
- تجاهل الطلب الأول أو الثاني، لأنهما يتضمنان عادةً زمن فتح الاتصال.
- غيّر النص بين الطلبات، كما يحدث في حركة تطبيقك الفعلية.
- أرسل الطلبات بالتتابع لا بالتوازي.
- نفّذ 20 طلبًا على الأقل، واذكر الوسيط (p50) وp90، لا المتوسط أو أفضل محاولة فقط.
- قِس باستخدام PCM؛ ففي Ogg تكون أول البيانات ترويسات لا صوتًا فعليًا.
يحمل كل رد بث متواصل ترويسة Server-Timing، حيث تمثل قيمة ttfb الجزء الخاص بنا من زمن الانتظار، وما يتبقى يعود إلى الشبكة ونظامك أنت. وتتوفر سكريبتات Python وTypeScript لقياس ذلك في توثيق زمن الاستجابة.
الأسئلة الشائعة
كتب نموذج Simba 3.2 من SpeechifyAI أول بايت صوتي في 56 مللي ثانية كوسيط، و102 مللي ثانية عند p90، على حركة الإنتاج في الساحل الشرقي الأمريكي بتاريخ 15 سبتمبر 2026. أما القياسات المستقلة فأظهرت متوسط زمن حتى أول صوت بلغ 106 مللي ثانية (Coval، خلال 24 ساعة حتى 24 سبتمبر 2026) و123 مللي ثانية (Voice Arena، 24 سبتمبر 2026)، وتشمل نتائجهم الشبكة وأي صمت في بداية الصوت.
على لوحة الإنجليزية الأمريكية في Voice Arena بتاريخ 24 سبتمبر 2026، سجّل نموذج Simba 3.2 من SpeechifyAI أقل متوسط زمن حتى أول صوت بين 14 نموذجًا: 123 مللي ثانية، متقدمًا على Inworld Realtime TTS 2 Research Preview الذي سجّل 168.5 مللي ثانية. وتُحدَّث القياسات باستمرار، لذا تحقّق دائمًا من التاريخ قبل الاعتماد على أي ترتيب.
نعم. يرسل POST /v1/audio/stream الصوت عبر HTTP أثناء توليده بصيغة PCM أو MP3 أو Ogg Opus أو AAC. وتحقق PCM أقل زمن تأخير لأنها لا تحتاج إلى خطوة ترميز إضافية.
لا. SpeechifyAI هي واجهة برمجة تطبيقات للمطورين من Speechify، وتُحاسب بشكل منفصل عن تطبيق القراءة من Speechify، ولا يشملها اشتراك القارئ. وتتوفر خطط API شهرية من دون التزام سنوي: خطة مجانية مع 500,000 حرف شهريًا من دون بطاقة، ثم Starter بسعر 10 دولارات شهريًا مع استخدام إضافي قدره $10 لكل مليون حرف، وPro بسعر 99 دولارًا و$8، وScale بسعر 499 دولارًا و$6.
جرّب Simba 3.2 على SpeechifyAI: أنشئ مفتاح API مجانيًا وقِس أول طلب لك مقارنةً بالأرقام أعلاه.

