兩個由 Speechify 以外單位執行的基準測試,於 2026 年 9 月測量了 SpeechifyAI Simba 3.2 模型產生首音所需的時間。Coval 在 2026 年 9 月 24 日 24 小時內測得中位數為 106 毫秒。Voice Arena 同日於其美式英語榜單測得 123 毫秒,為 14 款受測模型中最快。本篇將說明這些數字代表的意義、為什麼首音時間是值得比較的延遲指標,以及如何在自己的程式中測量這項數值。
數據解析
兩組獨立讀數都比我們的自測結果高,因為它們納入了測試端與我們伺服器之間的網路延遲,以及首音前的任何靜音。每組數據都反映該日基準測試的實際結果。榜單會持續更新,請以當日最新數據為準。
Voice Arena 美式英語榜,2026 年 9 月 24 日
來源:Voice Arena,讀取時間為 2026 年 9 月 24 日。共計時 14 款模型,此處顯示最快的六款。
為何首音時間值得拿來比較
當語音代理回應,或應用程式開始朗讀文字時,聆聽者從送出文字的那一刻起,就得等待直到真正聽見聲音;這段等待時間就是首音時間。
- 首字節時間看起來可能較短,但實際聽感未必如此。
- 串流一開始可能是靜音,聽眾要等到第一個有聲樣本出現才真的聽得到聲音。首音時間會把這段靜音算進去。
- 總生成時間反映的是等到最後一個位元組所需的時間。
- 這對儲存檔案很重要,但如果是邊生成邊播放,就不是最關鍵的指標。
- 對話中的等待空間其實很有限。
- 人與人之間通常會在幾百毫秒內接話。語音代理必須在這段時間內完成語音辨識、語言模型處理和語音合成,因此語音處理多花的每一毫秒,都會擠壓後續流程。
Simba 3.2 如何在模型大小不變下加快速度
根據 Coval 數據,Simba 3.2 的日中位數從 2026 年 9 月 13 日的 379 毫秒降至 9 月 18 日的 116 毫秒,5 天內大幅下降約 70%。
模型本身沒有變動。權重未改、沒有精簡版、沒有量化,也沒有「turbo」變體。這些改進主要來自模型服務流程本身:
- 採用新架構部署到不同 GPU 類型,並針對推論堆疊做底層優化,讓音訊更快送出。
- 方案、授權與流量控管查詢改由快取處理,不再於首字節前即時查驗。
- API Gateway 與 GPU 部署在同一區域,並維持連線常駐。
- 移除了約 100 毫秒的起始靜音。Coval 自行測得 Simba 3.2 的前置靜音從 9 月 14 日的 102 毫秒降至 13 毫秒。
品質並未受影響。於 Artificial Analysis TTS 排行榜,Simba 3.2 在 2026 年 9 月 23 日獲得 Elo 1,237(±14),於 92 款優質語音模型中名列前五,而且分數更高的模型價格也更高。
應用程式如何做到最低延遲
- 使用串流。
- 如果需要邊生成邊播放,請呼叫
- POST /v1/audio/stream
- 。
- POST /v1/audio/speech
- 只會在完整音檔生成後才回應。
- 指定 Simba 3.2。
- 英文請將
- model
- 設為
- simba-3.2
- 。若未指定,預設會使用
- simba-3.0
- 。
- 重複使用同一條連線。
- 初始化時建立一個 HTTP client,開啟連線後讓所有請求共用,避免每次請求都重新做 DNS 查詢與 TCP/TLS 握手。
- 句子一完成就送出。
- 如果前端有語言模型,句子一組好就立刻送出,並維持串流的播放順序。
- 選擇播放端需要的格式。
- audio/pcm
- 24 kHz 無需編碼,延遲最低;如果頻寬更重要,可選 MP3 或 Ogg Opus。
- 盡量靠近 API 部署。
- API 部署於美東,若伺服器位於美東或附近,網路延遲會最低。
用 LiveKit Agents 開發?這篇指南示範如何利用 Speechify 外掛打造語音代理,即時串流語言模型寫出的每一句話。每個步驟與範例程式碼,詳見延遲文件。
如何自行測量延遲
請從自己的程式碼出發,測量串流回應第一個區塊抵達的時間。建議做法如下:
- 捨棄前一到兩次請求,因為其中通常包含連線建立延遲。
- 讓請求內容保持變化,以模擬真實流量。
- 請逐一送出請求,不要平行執行。
- 至少取樣 20 次請求,回報中位數(p50)與 p90,不要只報單次最佳值或平均值。
- 請用 PCM 格式測量。Ogg 格式前幾個位元組是標頭,不是音訊。
每次串流回應都會帶有 Server-Timing 標頭,其中 ttfb 的值是我們這一端的處理時間,其餘延遲則來自網路與你的自家堆疊。延遲文件也提供了 Python 與 TypeScript 的測試腳本。
常見問題
SpeechifyAI Simba 3.2 模型在 2026 年 9 月 15 日於美東正式流量上的首音中位數為 56 毫秒,p90 為 102 毫秒。獨立基準測試記錄到的首音中位數則分別為 106 毫秒(Coval,2026 年 9 月 24 日 24 小時內)與 123 毫秒(Voice Arena,2026 年 9 月 24 日),其中包含其網路延遲與首音前靜音。
在 Voice Arena 美式英語榜 2026 年 9 月 24 日的數據中,SpeechifyAI Simba 3.2 的首音中位數為 123 毫秒,為 14 款受測模型中最短,領先 Inworld Realtime TTS 2 Research Preview(168.5 毫秒)。榜單會持續更新,查閱時請參考最新日期。
支援。POST /v1/audio/stream 會在產生音訊時,透過 HTTP 即時傳送 PCM、MP3、Ogg Opus 或 AAC 格式。PCM 因無需編碼,延遲最低。
沒有。SpeechifyAI 是 Speechify 的開發者 API,與 Speechify 閱讀應用程式分開計費,Reader 訂閱也不包含 API 使用。API 採月費制,無年繳限制:免費方案每月 50 萬字,免綁卡;Starter 每月 10 美元(超額每百萬字 10 美元)、Pro 每月 99 美元(超額 8 美元),Scale 每月 499 美元(超額 6 美元)。
前往 SpeechifyAI 試用 Simba 3.2:免費領取 API 金鑰、測試第一個請求,並驗證上述延遲數字。

