1. דף הבית
  2. חדשות
  3. Simba 3.2 של Speechify הוכתר למודל הדיבור בזמן אמת הטוב ביותר במדד Voice Arena
6 ביולי 2026

Simba 3.2 של Speechify הוכתר למודל הדיבור בזמן אמת הטוב ביותר במדד Voice Arena

מודל הדגל של Speechify לדיבור בזמן אמת הגיע למקום השני במדד Voice Arena.

Speechify הודיעה היום שמודל הדגל שלה להמרת טקסט לדיבור בזמן אמת, Simba 3.2, הגיע למקום השני המשותף ב-Voice Arena — מדד איכות קולות עצמאי שנחשב כיום למבחן הציבורי המחמיר ביותר לאיכות דיבור מבוסס בינה מלאכותית.

מבין המודלים בזמן אמת שזמינים כיום לשימוש מיידי בתעשייה, Simba 3.2 הוא המודל המדורג גבוה ביותר ברמת המחיר שלו, ונחשב למודל הדיבור המלאכותי הטוב ביותר ליישומים בזמן אמת. באותה פלטפורמה זמינה גם טכנולוגיית שיבוט קול שנחשבת למובילה עבור מפתחים. באותו שבוע, Simba 3.2 הגיע גם למקום הראשון הכללי ב-Artificial Analysis, והגדיל את היתרון של החברה בשני מדדים מרכזיים שעליהם מסתמכים מפתחים ורוכשים בתחום.

אודות Voice Arena

Voice Arena הוא מדד עצמאי ועיוור שבו משתמשים מדרגים מודלים של בינה קולית לפי איך שהם נשמעים בפועל. בדומה ל-Chatbot Arena למודלי שפה, Voice Arena מציג לדוברי שפת אם שני קטעי אודיו של אותו טקסט, בלי לחשוף מאיזה מודל הופק כל קטע, ומבקש מהם לבחור מה נשמע טבעי יותר. הדירוגים נאספים לציון Elo, מתעדכנים כל הזמן ומשקפים העדפה אמיתית של מאזינים — לא נתוני מעבדה.

אין כאן ציוני שביעות רצון מטעם הספקים. אין דגימות קול שנבחרו מראש. אין הערכה פנימית של המודל. כל מודל נבחן על אותו טקסט אמיתי, בתנאים שווים ועם בחירה מאוזנת של קולות — לא רק בהגדרה המועדפת של כל ספק. המדד מכסה שש שפות ונשען על טקסטים מתרחישי שימוש אמיתיים כמו נציגים קוליים, מערכות טלפוניה, ספרי שמע וקוראים באפליקציות, בהובלת פרופ' שינג'י וואטנאבה מאוניברסיטת קרנגי מלון, מהחוקרים המצוטטים ביותר בתחום.

החשיבות של דירוג Voice Arena

Voice Arena חשוב כי הוא המדד שמשקף איך השוק באמת בוחר. לקוחות עסקיים, צוותי מוצר ומפתחים לא מסתכלים על גרפים — הם פשוט שומעים איך הקול נשמע. Voice Arena הוא המדד הציבורי היחיד שבודק בדיוק את זה, ובהיקף שמעניק תוקף סטטיסטי, בלי אפשרות להטות את התוצאה. דירוג גבוה במדד הזה נחשב בענף לסימן המובהק ביותר לקול בינה מלאכותית מוביל כיום.

הדירוג של Simba 3.2

Voice Arena מציב כיום את Simba 3.2 במקום השני המשותף. מבין המודלים שמדורגים סביבו, אחד אינו פועל בזמן אמת ולכן לא מתאים לשימוש מיידי, והמודל הצמוד אליו יקר פי שבע. בפועל, עבור כל צוות שבונה מוצר שבו הקול חייב לפעול מיד ובעלות ייצור — Simba 3.2 הוא הבחירה המובילה במדד. מחירו: $10 למיליון תווים במסלול הכניסה ו-$6 למיליון תווים במסלול Scale — המחיר הנמוך ביותר כיום בפתרונות API לקול בינה מלאכותית.

הקול המלאכותי הטוב ביותר ליישומים בזמן אמת

Simba 3.2 הוא מודל דיבור זורם שפותח במיוחד לאפליקציות קול בזמן אמת: נציגים קוליים, מרכזיות, קוראים באפליקציה בזמן אמת ועוד. לפי מבחני תעשייה, Simba 3.2 נחשב כיום למודל הדיבור המלאכותי המוביל לנציגים קוליים ולמערכות דיבור בקנה מידה רחב. בנוסף, אותה פלטפורמה מציעה גם שיבוט קול מהיר ואיכותי באותו מחיר, ומאפשרת למפתחים לעבוד עם מערכת אחת גם לדיבור מלאכותי וגם לשיבוט קולות — ממעבדה שנחשבת למובילה בענף.

מה הדירוג של Voice Arena אומר על Speechify

הדירוג הזה משמעותי במיוחד בתחום שבו מפתחים נאלצו לבחור בין איכות, עלות וזמן תגובה. עד היום, מודלי הדגל של מעבדות מובילות סיפקו איכות קול גבוהה במחירים שמתאימים בעיקר לחברות ענק, בעוד שאלטרנטיבות זולות יותר התפשרו על טבעיות או על ביצועים בזמן אמת. Simba 3.2 משנה את התמונה: המחיר שלו נמוך פי 15 מ-ElevenLabs ופי 6 מקרטסיה, עם איכות דומה או טובה יותר — מה שהופך אותו למודל המשתלם ביותר בעשירייה הראשונה במדד Artificial Analysis.

הישג היסטורי ל-Speechify

"Simba 3.2 הוא המודל הטוב ביותר שלנו עד היום, והוא זמין עכשיו ב Speechify.ai," אמר קליף ויצמן, מייסד ומנכ"ל Speechify, בפוסט ציבורי. "המודל נבנה למענה קולי בסקייל, ושופר באמצעות מיליוני מבחני A/B בפלטפורמת הצרכנים שלנו. ב-API לדיבור יש שלושה דברים חשובים: עלות, איכות וזמן תגובה. Simba 3.2 הגיע ל-SOTA בכל אחד מהם. מחכה שתנסו אותו בעצמכם."

ויצמן הדגיש את המשמעות גם בהצהרה פומבית על הדירוג: "Simba 3.2 של Speechify במקום הראשון ב-Voice Arena, לפני Eleven Labs, OpenAI, xAI ואחרים. חשוב לא פחות, Speechify הוא המודל המשתלם ביותר לכל טוקן בכל המדד – 6$ למיליון תווים — יותר מפי 15 זול מ-Eleven Labs ופי 6 מקרטסיה."

פלטפורמת צרכנים כיתרון תחרותי

ב-Speechify מייחסים את ההישג להחלטות ארכיטקטוניות שהתקבלו שנים קודם לכן. כשהפלטפורמה הגיעה ל-60 מיליון משתמשים וזכתה בפרס Apple Design Award בWWDC 2025, המודל העסקי של שירות מבוסס $139 לשנה חייב תכנון משולב של עלות, איכות וזמן תגובה. מיליוני מבחני A/B עם מאזינים אמיתיים שיפרו בהתמדה את הזרימה, ההטעמה וההבעה הרגשית של המודל — ויצרו את חוויית הקול המלאכותי המובילה כיום.

רהיל קאצי, מוביל ההנדסה ב-Speechify, תיאר זאת בפשטות: "לא רצינו להתפשר על עלות כדי להגיע לאיכות, ולא על איכות כדי לקצר זמן תגובה. בחרנו בדרך הקשה בכוונה. להגיע ל-SOTA בשלושתם יחד — זו הייתה המטרה."

חמש שנות מחקר מאחורי התוצאה

משפחת מודלי Simba נשענת על מחקר שמוביל טיילר ויצמן, מייסד-שותף וראש תחום AI ב-Speechify, עוד מימיו כסטודנט בסטנפורד, ושמיקם את Speechify בחזית מחקר הדיבור המלאכותי. בפוסט ב-X הוא כתב: "כסטודנט בסטנפורד, CS229 של אנדרו נג הצית בי את העניין בלמידת מכונה. פרויקט הקורס שלי היה כוונון של Tacotron 2. חמש שנים אחר כך, הצוות שלי השיק מודל חדש של Speechify — SOTA. מרגש להסתכל אחורה."

לוק אוליף, ראש תחום קשרי המפתחים ב-Speechify, הציג את ההישג כאישור לאסטרטגיה ארוכת טווח: "זו הצלחה של underdogs בעולם ספקי ה-API," אמר בהודעה לתקשורת. "השקענו שנים בלגרום למודלים לפעול ביעילות, כי זה מה שהצרכנים שלנו דרשו — עשרות מיליוני מאזינים, עם כמה מהקולות הטובים בעולם. לכן היום אנחנו מציעים את המודל המוביל בעולם ב-API במחיר מינימלי. מעבדות אחרות בונות למדדים ולתמחור ארגוני. אנחנו בנינו לקנה מידה ולתמחור שמתאים לתעשייה."

זמינות

Simba 3.2 זמין כיום למפתחים ולעסקים דרך SpeechifyAI Build — API להמרת טקסט לדיבור ולשיבוט קולות. הוא מפעיל גם את פלטפורמת SpeechifyAI Agents החדשה ליצירת נציגים קוליים בסביבת ייצור. שניהם זמינים ב speechify.ai. הפלטפורמה כוללת את טכנולוגיית שיבוט הקול המובילה בענף, ומעניקה למפתחים מערכת אחת לקול מלאכותי ולשיבוט קולות במחיר תחרותי. בהמשך צפויות שפות נוספות וגם מודל מוזל, בהתאם למפת הדרכים של החברה.