שני מדדים שאינם מופעלים ע"י Speechify מדדו את הזמן עד לאודיו הראשון של SpeechifyAI במודל Simba 3.2 בספטמבר 2026. Coval רשם חציון של 106 מ"ש במשך 24 השעות שעד 24 בספטמבר 2026. Voice Arena רשם 123 מ"ש בלוח האנגלית האמריקאית באותו יום — החציון הנמוך ביותר מבין 14 מודלים שנמדדו. בפוסט הזה נסביר מה המדדים בודקים, למה זמן עד לאודיו ראשון הוא המדד הנכון להשוואה, ואיך למדוד אותו בקוד שלכם.
המספרים
שני המדדים הבלתי תלויים גבוהים יותר מהמדידה שלנו, כי הם כוללים את זמן הרשת מהמערכת שלהם לשרתים שלנו ואת כל השקט שבתחילת האודיו. כל תוצאה מייצגת את המדידה הספציפית באותו תאריך. שני הלוחות מתעדכנים באופן שוטף — אפשר לבדוק בהם את הנתונים העדכניים.
לוח האנגלית האמריקאית של Voice Arena, 24 בספטמבר 2026
מקור: Voice Arena, לפי נתונים מ-24 בספטמבר 2026. הלוח מדד 14 מודלים; כאן מוצגים ששת המהירים ביותר.
למה זמן עד לאודיו ראשון הוא הנתון המרכזי להשוואה
כשסוכן קולי משיב או אפליקציה מקריאה טקסט, המאזין מחכה מהרגע שבו הטקסט נשלח ועד ששומעים קול. זהו זמן ההמתנה שנמדד כזמן עד לאודיו הראשון.
- הזמן עד למקטע הראשון עשוי להיראות טוב יותר ממה שהמאזין שומע בפועל.
- ההזרמה יכולה להתחיל בשקט, והמאזין לא ישמע דבר עד לדגימה הנשמעות הראשונה. זמן עד לאודיו ראשון כולל גם את השקט הזה.
- הזמן הכולל ליצירה נמדד עד המקטע האחרון.
- זה חשוב ליצירת קובץ, לא להזרמת שמע למאזין.
- בשיחה יש מעט מאוד מרווח להמתנה.
- אנשים בדרך כלל מגיבים בתוך כמה מאות מילישניות. הסוכן הקולי צריך להספיק לזיהוי דיבור, למודל שפה ולסינתזת דיבור — וכל מילישנייה שסינתזת הדיבור לוקחת מצמצמת את הזמן שנשאר לשאר הרכיבים.
איך Simba 3.2 הפך למהיר יותר — בלי שינויים במודל
בנתוני Coval, החציון היומי של Simba 3.2 ירד מ-379 מ"ש ב-13 בספטמבר 2026 ל-116 מ"ש ב-18 בספטמבר — ירידה של כ-70% בתוך חמישה ימים.
המודל עצמו לא השתנה: אותם משקלים, בלי דיסטילציה, קוונטיזציה או גרסת "turbo" מוקטנת. השיפור הגיע ממסלול ההפעלה שסביב המודל:
- פריסה חדשה על כרטיס גרפי אחר, עם אופטימיזציות בערימת האינפרנס כדי להוציא אודיו מהר יותר.
- בדיקות הרשאות, מנוי והגבלת קצב עוברות למטמון במקום בדיקות חיות לפני מקטע האודיו הראשון.
- שער ה-API פועל באותו אזור כמו ה-GPU, על חיבורים שנשמרים פתוחים בין בקשות.
- כ-100 מ"ש של שקט בפתיחה נעלמו. מדד השקט של Coval עבור Simba 3.2 ירד מ-102 מ"ש ב-14 בספטמבר ל-13 מ"ש.
האיכות נשמרה. בדירוג text-to-speech של Artificial Analysis, Simba 3.2 הגיע לציון Elo של 1,237 (±14) ב-23 בספטמבר 2026, בין חמשת הטובים מתוך 92 קולות, וכל מודל שמדורג מעליו יקר יותר.
איך להשיג שיהוי מינימלי באפליקציה שלך
- הזרימו.
- השתמשו ב-
- POST /v1/audio/stream
- לכל השמעה בזמן יצירה.
- POST /v1/audio/speech
- מחזיר תשובה רק אחרי שכל השמע נוצר.
- בקשו את Simba 3.2.
- הגדירו
- model
- כ-
- simba-3.2
- באנגלית. אם
- model
- לא מצוין, ברירת המחדל היא
- simba-3.0
- .
- השתמשו בחיבור קבוע אחד.
- צרו לקוח HTTP יחיד, פתחו חיבור בתחילת ההפעלה והשתמשו בו לכל הבקשות — כך תחסכו זמן של חיפושי DNS ולחיצות היד של TCP ו-TLS.
- שלחו משפטים מיד כשהם מוכנים.
- כשמודל שפה עובד לפני ההשמעה, שלחו כל משפט מלא ברגע שהוא מוכן, ונגנו אותם לפי הסדר.
- בחרו את הפורמט שהנגן שלכם דורש.
- audio/pcm
- ב-24 קילוהרץ לא דורש קידוד. MP3 או Ogg Opus עדיפים כשחשוב לחסוך ברוחב פס.
- הריצו קרוב ל-API.
- ה-API מוגש מ-US East, לכן שרת באזורים האלה יקצר למינימום את זמן הרשת.
בונים על LiveKit Agents? המדריך הזה מראה איך לבנות סוכן קולי עם תוסף Speechify, שמזרים כל משפט מיד כשמודל השפה כותב אותו. ההסבר המלא לכל שלב, עם קוד, נמצא בתיעוד השיהוי.
למדוד בעצמך
מדדו את הזמן עד למקטע הראשון של תגובת ההזרמה מהמיקום שבו הקוד שלכם רץ. כדי לקבל תוצאה הוגנת:
- התעלמו מהבקשה הראשונה או השתיים הראשונות — הן כוללות פתיחת חיבור.
- שנו את הטקסט בין בקשות, כמו בתעבורה אמיתית.
- שלחו בקשות ברצף, לא במקביל.
- בצעו לפחות 20 בקשות ודווחו על החציון (p50) וגם על p90 — לא על ממוצע ולא על הריצה הטובה ביותר.
- מדדו עם PCM. באודיו Ogg, הבתים הראשונים הם כותרות ולא שמע.
כל תגובת הזרמה כוללת כותרת Server-Timing עם הערך ttfb, שמציג את חלק ההמתנה בצד שלנו, כך שהשאר הוא זמן הרשת והקוד שלכם. בתיעוד השיהוי תמצאו סקריפטים ב-Python וב-TypeScript שעושים זאת.
שאלות נפוצות
המודל Simba 3.2 של SpeechifyAI הגיע למקטע האודיו הראשון בתוך 56 מ"ש בחציון ו-102 מ"ש ב-p90, בתעבורת ייצור ב-US East ב-15 בספטמבר 2026. מדדים בלתי תלויים מצאו חציון של 106 מ"ש (Coval, ב-24 השעות שעד 24 בספטמבר) ו-123 מ"ש (Voice Arena, 24 בספטמבר), כולל הרשת והשקט שבתחילת האודיו.
בלוח האנגלית האמריקאית של Voice Arena, נכון ל-24 בספטמבר 2026, Simba 3.2 של SpeechifyAI הוביל בזמן החציוני עד לאודיו ראשון מבין 14 מודלים: 123 מ"ש, לעומת 168.5 מ"ש של Inworld Realtime TTS 2 Research Preview. המדדים מתעדכנים ברציפות — כדאי לבדוק את התאריך העדכני לפני שמסתמכים על התוצאה.
כן. POST /v1/audio/stream מזרים אודיו מיידית דרך HTTP, בפורמטים PCM, MP3, Ogg Opus או AAC. PCM מציע את השיהוי הנמוך ביותר כי הוא לא דורש קידוד.
לא. SpeechifyAI הוא API למפתחים שמתומחר ומחויב בנפרד מאפליקציית הקריאה של Speechify; מנוי Reader לא כולל גישה ל-API. יש מסלולי חיוב חודשיים בלבד: מסלול חינמי עם 500,000 תווים בחודש ללא צורך בכרטיס, Starter ב-$10 לחודש (ותוספת של $10 למיליון תווים), Pro ב-$99 ($8 למיליון נוספים), ו-Scale ב-$499 ($6).
נסו את Simba 3.2 ב-SpeechifyAI: צרו מפתח API חינמי ובדקו את זמני השיהוי מול המספרים שמופיעים למעלה.

