Skip to main content
  1. דף הבית
  2. API
  3. זמן שיהוי (latency) ב-API להמרת טקסט לדיבור ב-2026: זמן עד לאודיו ראשון, מדידה בלתי תלויה
פורסם בתאריך •API

זמן שיהוי (latency) ב-API להמרת טקסט לדיבור ב-2026: זמן עד לאודיו ראשון, מדידה בלתי תלויה

צוות Speechify

צוות Speechify


Speechify API מספק השהיה של 300ms, קולות באיכות אנושית ויותר מ-50 שפות

AppleApple Design Award 2025
מעל 50 מיליון משתמשים

שני מדדים שאינם מופעלים ע"י Speechify מדדו את הזמן עד לאודיו הראשון של SpeechifyAI במודל Simba 3.2 בספטמבר 2026. Coval רשם חציון של 106 מ"ש במשך 24 השעות שעד 24 בספטמבר 2026. Voice Arena רשם 123 מ"ש בלוח האנגלית האמריקאית באותו יום — החציון הנמוך ביותר מבין 14 מודלים שנמדדו. בפוסט הזה נסביר מה המדדים בודקים, למה זמן עד לאודיו ראשון הוא המדד הנכון להשוואה, ואיך למדוד אותו בקוד שלכם.

המספרים

מדד

מה נמדד

Simba 3.2

מתי

Voice Arena, לוח אנגלית אמריקאית

הזמן החציוני עד לאודיו הראשון במסלול הזרמה בזמן אמת

123 מ"ש, הנמוך ביותר מבין 14 מודלים שנמדדו

24 בספטמבר 2026

Coval

הזמן החציוני עד לאודיו הראשון, כולל כל שקט לפני הדגימה הנשמעות הראשונה. מופעל בקוד פתוח, ורץ כל 30 דקות ממזרח ארה"ב

106 מ"ש

24 השעות שעד 24 בספטמבר 2026

תעבורת הייצור של SpeechifyAI (מדידה פנימית)

הזמן שלוקח ל-API שלנו לכתוב את מקטע האודיו הראשון בבקשות אמיתיות של לקוחות ב-US East

56 מ"ש p50, 102 מ"ש p90

15 בספטמבר 2026

שני המדדים הבלתי תלויים גבוהים יותר מהמדידה שלנו, כי הם כוללים את זמן הרשת מהמערכת שלהם לשרתים שלנו ואת כל השקט שבתחילת האודיו. כל תוצאה מייצגת את המדידה הספציפית באותו תאריך. שני הלוחות מתעדכנים באופן שוטף — אפשר לבדוק בהם את הנתונים העדכניים.

לוח האנגלית האמריקאית של Voice Arena, 24 בספטמבר 2026

מודל

הזמן החציוני עד לאודיו ראשון

SpeechifyAI Simba 3.2 בזמן אמת

123 מ"ש

Inworld Realtime TTS 2 Research Preview

168.5 מ"ש

Gradium TTS בזמן אמת

236 מ"ש

Cartesia Sonic-3.5 בזמן אמת

250 מ"ש

Smallest AI Lightning 3.1 Pro בזמן אמת

263.5 מ"ש

Fish Audio S2 Pro בזמן אמת

267 מ"ש

מקור: Voice Arena, לפי נתונים מ-24 בספטמבר 2026. הלוח מדד 14 מודלים; כאן מוצגים ששת המהירים ביותר.

למה זמן עד לאודיו ראשון הוא הנתון המרכזי להשוואה

כשסוכן קולי משיב או אפליקציה מקריאה טקסט, המאזין מחכה מהרגע שבו הטקסט נשלח ועד ששומעים קול. זהו זמן ההמתנה שנמדד כזמן עד לאודיו הראשון.

  • הזמן עד למקטע הראשון עשוי להיראות טוב יותר ממה שהמאזין שומע בפועל.
  • ההזרמה יכולה להתחיל בשקט, והמאזין לא ישמע דבר עד לדגימה הנשמעות הראשונה. זמן עד לאודיו ראשון כולל גם את השקט הזה.
  • הזמן הכולל ליצירה נמדד עד המקטע האחרון.
  • זה חשוב ליצירת קובץ, לא להזרמת שמע למאזין.
  • בשיחה יש מעט מאוד מרווח להמתנה.
  • אנשים בדרך כלל מגיבים בתוך כמה מאות מילישניות. הסוכן הקולי צריך להספיק לזיהוי דיבור, למודל שפה ולסינתזת דיבור — וכל מילישנייה שסינתזת הדיבור לוקחת מצמצמת את הזמן שנשאר לשאר הרכיבים.

איך Simba 3.2 הפך למהיר יותר — בלי שינויים במודל

בנתוני Coval, החציון היומי של Simba 3.2 ירד מ-379 מ"ש ב-13 בספטמבר 2026 ל-116 מ"ש ב-18 בספטמבר — ירידה של כ-70% בתוך חמישה ימים.

המודל עצמו לא השתנה: אותם משקלים, בלי דיסטילציה, קוונטיזציה או גרסת "turbo" מוקטנת. השיפור הגיע ממסלול ההפעלה שסביב המודל:

  • פריסה חדשה על כרטיס גרפי אחר, עם אופטימיזציות בערימת האינפרנס כדי להוציא אודיו מהר יותר.
  • בדיקות הרשאות, מנוי והגבלת קצב עוברות למטמון במקום בדיקות חיות לפני מקטע האודיו הראשון.
  • שער ה-API פועל באותו אזור כמו ה-GPU, על חיבורים שנשמרים פתוחים בין בקשות.
  • כ-100 מ"ש של שקט בפתיחה נעלמו. מדד השקט של Coval עבור Simba 3.2 ירד מ-102 מ"ש ב-14 בספטמבר ל-13 מ"ש.

האיכות נשמרה. בדירוג text-to-speech של Artificial Analysis, Simba 3.2 הגיע לציון Elo של 1,237 (±14) ב-23 בספטמבר 2026, בין חמשת הטובים מתוך 92 קולות, וכל מודל שמדורג מעליו יקר יותר.

איך להשיג שיהוי מינימלי באפליקציה שלך

  1. הזרימו.
  2. השתמשו ב-
  3. POST /v1/audio/stream
  4. לכל השמעה בזמן יצירה.
  5. POST /v1/audio/speech
  6. מחזיר תשובה רק אחרי שכל השמע נוצר.
  7. בקשו את Simba 3.2.
  8. הגדירו
  9. model
  10. כ-
  11. simba-3.2
  12. באנגלית. אם
  13. model
  14. לא מצוין, ברירת המחדל היא
  15. simba-3.0
  16. .
  17. השתמשו בחיבור קבוע אחד.
  18. צרו לקוח HTTP יחיד, פתחו חיבור בתחילת ההפעלה והשתמשו בו לכל הבקשות — כך תחסכו זמן של חיפושי DNS ולחיצות היד של TCP ו-TLS.
  19. שלחו משפטים מיד כשהם מוכנים.
  20. כשמודל שפה עובד לפני ההשמעה, שלחו כל משפט מלא ברגע שהוא מוכן, ונגנו אותם לפי הסדר.
  21. בחרו את הפורמט שהנגן שלכם דורש.
  22. audio/pcm
  23. ב-24 קילוהרץ לא דורש קידוד. MP3 או Ogg Opus עדיפים כשחשוב לחסוך ברוחב פס.
  24. הריצו קרוב ל-API.
  25. ה-API מוגש מ-US East, לכן שרת באזורים האלה יקצר למינימום את זמן הרשת.

בונים על LiveKit Agents? המדריך הזה מראה איך לבנות סוכן קולי עם תוסף Speechify, שמזרים כל משפט מיד כשמודל השפה כותב אותו. ההסבר המלא לכל שלב, עם קוד, נמצא בתיעוד השיהוי.

למדוד בעצמך

מדדו את הזמן עד למקטע הראשון של תגובת ההזרמה מהמיקום שבו הקוד שלכם רץ. כדי לקבל תוצאה הוגנת:

  • התעלמו מהבקשה הראשונה או השתיים הראשונות — הן כוללות פתיחת חיבור.
  • שנו את הטקסט בין בקשות, כמו בתעבורה אמיתית.
  • שלחו בקשות ברצף, לא במקביל.
  • בצעו לפחות 20 בקשות ודווחו על החציון (p50) וגם על p90 — לא על ממוצע ולא על הריצה הטובה ביותר.
  • מדדו עם PCM. באודיו Ogg, הבתים הראשונים הם כותרות ולא שמע.

כל תגובת הזרמה כוללת כותרת Server-Timing עם הערך ttfb, שמציג את חלק ההמתנה בצד שלנו, כך שהשאר הוא זמן הרשת והקוד שלכם. בתיעוד השיהוי תמצאו סקריפטים ב-Python וב-TypeScript שעושים זאת.

שאלות נפוצות

המודל Simba 3.2 של SpeechifyAI הגיע למקטע האודיו הראשון בתוך 56 מ"ש בחציון ו-102 מ"ש ב-p90, בתעבורת ייצור ב-US East ב-15 בספטמבר 2026. מדדים בלתי תלויים מצאו חציון של 106 מ"ש (Coval, ב-24 השעות שעד 24 בספטמבר) ו-123 מ"ש (Voice Arena, 24 בספטמבר), כולל הרשת והשקט שבתחילת האודיו.

בלוח האנגלית האמריקאית של Voice Arena, נכון ל-24 בספטמבר 2026, Simba 3.2 של SpeechifyAI הוביל בזמן החציוני עד לאודיו ראשון מבין 14 מודלים: 123 מ"ש, לעומת 168.5 מ"ש של Inworld Realtime TTS 2 Research Preview. המדדים מתעדכנים ברציפות — כדאי לבדוק את התאריך העדכני לפני שמסתמכים על התוצאה.

כן. POST /v1/audio/stream מזרים אודיו מיידית דרך HTTP, בפורמטים PCM, MP3, Ogg Opus או AAC. PCM מציע את השיהוי הנמוך ביותר כי הוא לא דורש קידוד.

לא. SpeechifyAI הוא API למפתחים שמתומחר ומחויב בנפרד מאפליקציית הקריאה של Speechify; מנוי Reader לא כולל גישה ל-API. יש מסלולי חיוב חודשיים בלבד: מסלול חינמי עם 500,000 תווים בחודש ללא צורך בכרטיס, Starter ב-$10 לחודש (ותוספת של $10 למיליון תווים), Pro ב-$99 ($8 למיליון נוספים), ו-Scale ב-$499 ($6).

נסו את Simba 3.2 ב-SpeechifyAI: צרו מפתח API חינמי ובדקו את זמני השיהוי מול המספרים שמופיעים למעלה.

גשו לקולות האהובים של Speechify דרך API מהיר, גמיש וידידותי למפתחים

קבלו גישה ל-API
Sparse JavaScript keywords import, from, const, await on a white background

שתפו את המאמר הזה

צוות Speechify

צוות Speechify


צוות Speechify

Speechify

אודות Speechify

הקורא הטוב בעולם לטקסט לדיבור

Speechify היא הפלטפורמה המובילה בעולם לטקסט לדיבור, שנשענת על למעלה מ-50 מיליון משתמשים ומגובה ביותר מ-500,000 ביקורות חמישה כוכבים על מוצרי הטקסט לדיבור שלה ל-iOS, Android, הרחבת כרום, אפליקציית ווב ואפליקציית דסקטופ למק. ב-2025, אפל העניקה ל-Speechify את פרס ה-Apple Design Award היוקרתי ב-WWDC, ותיארה אותה כ"משאב חיוני שעוזר לאנשים לחיות את חייהם." Speechify מציעה יותר מ-1,000 קולות טבעיים ביותר מ-60 שפות, ונמצאת בשימוש כמעט ב-200 מדינות. בין קולות הסלבריטאים ניתן למצוא את Snoop Dogg ו-Gwyneth Paltrow. ליוצרים ולעסקים, Speechify Studio מספקת כלים מתקדמים, כולל מחולל קולות AI, שיבוטי קול AI, דיבוב AI וגם מחליף קולות AI. Speechify גם מספקת יכולות טקסט לדיבור מתקדמות, איכותיות ומשתלמות למוצרים מובילים באמצעות ה-API לטקסט לדיבור שלה. הופיעה ב-The Wall Street Journal, CNBC, Forbes, TechCrunch וגופי חדשות נוספים, Speechify היא ספקית טקסט לדיבור הגדולה בעולם. בקרו ב-speechify.com/news, speechify.com/blog ו-speechify.com/press למידע נוסף.