أعلنت Speechify اليوم أن نموذجها الرئيسي لتحويل النص إلى كلام بالبث الفوري، Simba 3.2، حلّ في المركز الثاني مكررًا على Voice Arena، وهو معيار تقييم مستقل قائم على آراء المستمعين ويُعد اليوم الأكثر صرامة لقياس جودة أصوات الذكاء الاصطناعي.
ومن بين النماذج الفورية المتاحة للفرق اليوم، يُعد Simba 3.2 الأعلى تقييماً ضمن فئته السعرية، ما يجعله أفضل نموذج للأصوات الفورية في السوق. كما توفر المنصة نفسها أفضل تقنيات استنساخ الصوت المتاحة للمطورين حالياً. وفي الأسبوع نفسه، تصدّر Simba 3.2 أيضاً قائمة Artificial Analysis لتحويل النص إلى كلام، ما عزز مكانة الشركة على أهم معيارين يعتمد عليهما المطورون والمؤسسات.
حول Voice Arena
يُعد Voice Arena معياراً مستقلاً يستند إلى تجارب المستمعين الفعلية عند تقييم أصوات الذكاء الاصطناعي، أي بالطريقة التي يسمع بها المستخدمون الحقيقيون. وقد بُني على منهجية Chatbot Arena الشهيرة لتصنيف نماذج الذكاء الاصطناعي الكبيرة، حيث يستمع المشاركون إلى مقطعين صوتيين متطابقين من دون معرفة النموذج الذي أنشأهما، ثم يختارون الأكثر طبيعية. وبعدها تُحوَّل الأصوات إلى تقييم Elo محدّث يعكس تفضيلات المستمعين الفعلية، لا مجرد مقاييس مخبرية.
لا درجات مبنية على الانطباع الشخصي، ولا عينات صوتية ينتقيها البائعون، ولا تقييم داخلي من مزود النموذج. فكل نموذج في التصنيف يُختبر بالنصوص نفسها من العالم الحقيقي وتحت ظروف متكافئة، مع مجموعة أصوات متوازنة لكل مزود بدلاً من الاعتماد على أفضل صوت لديه فقط. وتغطي المنهجية ست لغات، وتختبر نصوصاً من استخدامات إنتاجية فعلية مثل وكلاء الصوت وأنظمة IVR والكتب الصوتية وقارئات التطبيقات. كما طُوّر هذا التقييم بمساهمة من البروفيسور شينجي واتانابي من جامعة كارنيجي ميلون، أحد أبرز الباحثين في تقنيات الكلام.
لماذا تصنيف Voice Arena مهم
تكمن أهمية Voice Arena في أنه يعكس الطريقة التي يتخذ بها السوق قراره فعلاً. فالمشترون والمؤسسات والمطورون لا يحكمون عبر مخطط طيفي، بل من خلال جودة الصوت كما يسمعها المستمع. وVoice Arena هو المعيار العام الوحيد الذي يقيس ذلك فعلياً وعلى نطاق واسع، من دون أن يتمكن أي بائع من التأثير في نتائجه. لذلك، يُعد التصنيف المرتفع على Voice Arena أقرب مؤشر حقيقي اليوم على جودة صوت الذكاء الاصطناعي في السوق.
مكانة Simba 3.2 في التصنيف
يضع Voice Arena حالياً Simba 3.2 في المركز الثاني مكررًا. ومن بين النماذج التي تتقدمه، هناك نموذج لا يعمل في الزمن الحقيقي ولا يناسب التطبيقات التي تتطلب استجابة فورية، بينما يرتبط الآخر بسعر أعلى بنحو سبعة أضعاف مقارنةً بـ Simba 3.2. عملياً، هذا يعني أن أي فريق يحتاج إلى صوت يعمل مباشرة وبتكلفة مناسبة للإنتاج سيجد أن Simba 3.2 هو الخيار الأعلى تصنيفاً. ويبلغ سعر Simba 3.2 10 دولارات لكل مليون حرف في الفئة الأساسية و6 دولارات لكل مليون حرف في فئة Scale، ما يجعله الأقل تكلفة للمطورين اليوم.
أفضل صوت ذكاء اصطناعي للتطبيقات الفورية
Simba 3.2 هو نموذج لتحويل النص إلى كلام صُمم خصيصاً لتطبيقات الصوت الفوري، مثل وكلاء الصوت، وأنظمة IVR، والقارئات الفورية داخل التطبيقات، وأنظمة الهاتف، وأي منتج يحتاج إلى استجابة صوتية مباشرة. وهذه هي الفئة التي يقيس عليها القطاع أداءه، ويُعد Simba 3.2 اليوم الأفضل لوكلاء الصوت وأقوى نموذج متاح لبناء برمجيات صوتية على نطاق واسع. كما تقدم المنصة نفسها استنساخاً صوتياً فورياً بجودة عالية وسعر تنافسي، لتجمع كل شيء في نظام واحد من مختبر ذكاء اصطناعي رائد في المجال.
ماذا يعني تصنيف Voice Arena لـ Speechify
تكتسب هذه النتيجة أهمية خاصة في مجال طالما فرض على المطورين المقايضة بين الجودة والتكلفة والسرعة. فغالباً ما كانت النماذج الرائدة تقدم جودة صوت عالية بأسعار مرتفعة، بينما كانت البدائل الأرخص تضحي بطبيعية الصوت أو بسرعة البث اللازمة للاستخدام الفوري. لكن Simba 3.2 غيّر هذه المعادلة؛ فسعره أقل بنحو 15 مرة من ElevenLabs وأقل 6 مرات من Cartesia مع جودة مماثلة أو أفضل، ما يجعله الأكفأ في قائمة Artificial Analysis Top Ten.
إنجاز Speechify
قال كليف ويتزمان، مؤسس Speechify ورئيسها، في منشور عام: "Simba 3.2 هو أفضل نماذجنا حتى الآن، وهو متوفر الآن على Speechify.ai. صُمم لتشغيل وكلاء الصوت على نطاق واسع، وتم تحسينه عبر ملايين اختبارات A/B على منصتنا. وفي واجهات TTS هناك 3 معايير: التكلفة والجودة والزمن. وقد تفوق Simba 3.2 فيها جميعاً. متحمسون لأن تجربوه بأنفسكم في تطبيقاتكم."
وأكد ويتزمان أهمية هذا الإنجاز في بيان عام، قائلاً: "Simba 3.2 من Speechify هو النموذج الأعلى تصنيفاً للبث الفوري على Voice Arena، متقدماً على Eleven Labs وOpenAI وxAI وغيرهم. والأهم من ذلك أن Speechify هو الأكفأ سعرياً عند 6 دولارات لكل مليون حرف. وهذا يعني توفيراً يزيد على 15 مرة مقارنة بـ Eleven Labs وأكثر من 6 مرات مقارنة بـ Cartesia."
منصة المستهلك كميزة إضافية
تعزو القيادة الهندسية في Speechify هذه النتيجة إلى قرارات معمارية اتُّخذت قبل سنوات. ومع توسع منصة المستهلك لتخدم أكثر من 60 مليون مستخدم وفوزها بجائزة تصميم Apple في WWDC 2025، فرضت التكاليف على فريق البحث التعامل مع الجودة والتكلفة والسرعة باعتبارها معادلة واحدة. كما ساعدت ملايين اختبارات A/B الحية على تحسين السرعة والتأكيد والنبرة، ما أسهم في تقديم أفضل تجربة صوت ذكاء اصطناعي حالياً.
وشرح رحيل قاضي، وهو قائد هندسي في Speechify، الفكرة ببساطة: "لم نرِد يوماً التضحية بالتكلفة من أجل الجودة، ولا العكس، ولا التضحية بالسرعة للحفاظ على الجودة. اخترنا الطريق الأصعب عن قصد. والتفوق في الثلاثة معاً هو ما سعينا إليه دائماً."
خمس سنوات من البحث وراء الإنجاز
تعود سلسلة نماذج Simba إلى أبحاث بدأها تايلر ويتزمان، الشريك المؤسس ورئيس الذكاء الاصطناعي في Speechify، خلال دراسته الجامعية في ستانفورد، والتي ساعدت في ترسيخ مكانة Speechify كمختبر رائد. وفي منشوره على X قال ويتزمان: "كطالب في ستانفورد، بدأ شغفي بالذكاء الاصطناعي مع مادة CS229 لدى أندرو نغ. وكان مشروعي الجامعي عبارة عن تعديل على Tacotron 2. واليوم حقق فريقي SOTA بعد خمس سنوات. الشعور لا يوصف حين أنظر إلى الوراء."
وقدّم لوك أوليف، رئيس علاقات المطورين في Speechify، هذه النتيجة بوصفها دليلاً على استراتيجية طويلة المدى. وقال في بيان صحفي: "هذه قصة اللاعب الأصغر بين مزودي واجهات البرمجة. أمضينا سنوات في تطوير نماذجنا بكفاءة لأن ملايين المستخدمين يفرضون ذلك. وتقديم أفضل صوت في العالم عبر API منخفضة التكلفة هو ثمرة هذا العمل. معظم المختبرات تبني للمعايير والمؤسسات، أما نحن فبنينا للمستمعين وسعّرنا للإنتاج."
التوافر
Simba 3.2 متوفر الآن للمطورين والشركات عبر SpeechifyAI Build، وهي واجهة برمجة النص إلى كلام واستنساخ الأصوات الخاصة بالشركة، كما يشغّل منصة SpeechifyAI Agents الجديدة. ويمكن الوصول إليهما عبر speechify.ai. وتشمل المنصة أفضل تقنية استنساخ صوتي متاحة، ما يتيح للمطورين الحصول على نموذج صوت ذكاء اصطناعي واستنساخ فوري بالجودة نفسها والسعر نفسه تقريباً. وتخطط الشركة أيضاً لإضافة لغات جديدة وإطلاق نموذج منخفض التكلفة.