Skip to main content
  1. 首頁
  2. API
  3. 2026 年文字轉語音 API 延遲:首音時間獨立測量
Published on •API

2026 年文字轉語音 API 延遲:首音時間獨立測量

Speechify 團隊

Speechify 團隊


Speechify API 提供 300ms 延遲、
高品質人聲以及 50+ 種語言

Apple2025 Apple 設計大獎
超過 5000 萬用戶

兩個由 Speechify 以外單位執行的基準測試,於 2026 年 9 月測量了 SpeechifyAI Simba 3.2 模型產生首音所需的時間。Coval 在 2026 年 9 月 24 日 24 小時內測得中位數為 106 毫秒。Voice Arena 同日於其美式英語榜單測得 123 毫秒,為 14 款受測模型中最快。本篇將說明這些數字代表的意義、為什麼首音時間是值得比較的延遲指標,以及如何在自己的程式中測量這項數值。

數據解析

基準測試

測量內容

Simba 3.2

時間

Voice Arena,美式英語榜

串流路徑上首音的中位時間

123 毫秒(14 款受測模型中最短)

2026 年 9 月 24 日

Coval

首音中位時間,包含所有前置靜音。開源測試平台,每 30 分鐘自美東執行一次

106 毫秒

2026 年 9 月 24 日 24 小時內

SpeechifyAI 正式流量(自測數據)

API 在美東送出真實客戶請求首個音訊位元組的時間

56 毫秒中位數,102 毫秒 p90

2026 年 9 月 15 日

兩組獨立讀數都比我們的自測結果高,因為它們納入了測試端與我們伺服器之間的網路延遲,以及首音前的任何靜音。每組數據都反映該日基準測試的實際結果。榜單會持續更新,請以當日最新數據為準。

Voice Arena 美式英語榜,2026 年 9 月 24 日

模型

首音中位時間

SpeechifyAI Simba 3.2 即時版

123 毫秒

Inworld Realtime TTS 2 Research Preview

168.5 毫秒

Gradium TTS 即時版

236 毫秒

Cartesia Sonic-3.5 即時版

250 毫秒

Smallest AI Lightning 3.1 Pro 即時版

263.5 毫秒

Fish Audio S2 Pro 即時版

267 毫秒

來源:Voice Arena,讀取時間為 2026 年 9 月 24 日。共計時 14 款模型,此處顯示最快的六款。

為何首音時間值得拿來比較

當語音代理回應,或應用程式開始朗讀文字時,聆聽者從送出文字的那一刻起,就得等待直到真正聽見聲音;這段等待時間就是首音時間。

  • 首字節時間看起來可能較短,但實際聽感未必如此。
  • 串流一開始可能是靜音,聽眾要等到第一個有聲樣本出現才真的聽得到聲音。首音時間會把這段靜音算進去。
  • 總生成時間反映的是等到最後一個位元組所需的時間。
  • 這對儲存檔案很重要,但如果是邊生成邊播放,就不是最關鍵的指標。
  • 對話中的等待空間其實很有限。
  • 人與人之間通常會在幾百毫秒內接話。語音代理必須在這段時間內完成語音辨識、語言模型處理和語音合成,因此語音處理多花的每一毫秒,都會擠壓後續流程。

Simba 3.2 如何在模型大小不變下加快速度

根據 Coval 數據,Simba 3.2 的日中位數從 2026 年 9 月 13 日的 379 毫秒降至 9 月 18 日的 116 毫秒,5 天內大幅下降約 70%。

模型本身沒有變動。權重未改、沒有精簡版、沒有量化,也沒有「turbo」變體。這些改進主要來自模型服務流程本身:

  • 採用新架構部署到不同 GPU 類型,並針對推論堆疊做底層優化,讓音訊更快送出。
  • 方案、授權與流量控管查詢改由快取處理,不再於首字節前即時查驗。
  • API Gateway 與 GPU 部署在同一區域,並維持連線常駐。
  • 移除了約 100 毫秒的起始靜音。Coval 自行測得 Simba 3.2 的前置靜音從 9 月 14 日的 102 毫秒降至 13 毫秒。

品質並未受影響。於 Artificial Analysis TTS 排行榜,Simba 3.2 在 2026 年 9 月 23 日獲得 Elo 1,237(±14),於 92 款優質語音模型中名列前五,而且分數更高的模型價格也更高。

應用程式如何做到最低延遲

  1. 使用串流。
  2. 如果需要邊生成邊播放,請呼叫
  3. POST /v1/audio/stream
  4. 。
  5. POST /v1/audio/speech
  6. 只會在完整音檔生成後才回應。
  7. 指定 Simba 3.2。
  8. 英文請將
  9. model
  10. 設為
  11. simba-3.2
  12. 。若未指定,預設會使用
  13. simba-3.0
  14. 。
  15. 重複使用同一條連線。
  16. 初始化時建立一個 HTTP client,開啟連線後讓所有請求共用,避免每次請求都重新做 DNS 查詢與 TCP/TLS 握手。
  17. 句子一完成就送出。
  18. 如果前端有語言模型,句子一組好就立刻送出,並維持串流的播放順序。
  19. 選擇播放端需要的格式。
  20. audio/pcm
  21. 24 kHz 無需編碼,延遲最低;如果頻寬更重要,可選 MP3 或 Ogg Opus。
  22. 盡量靠近 API 部署。
  23. API 部署於美東,若伺服器位於美東或附近,網路延遲會最低。

用 LiveKit Agents 開發?這篇指南示範如何利用 Speechify 外掛打造語音代理,即時串流語言模型寫出的每一句話。每個步驟與範例程式碼,詳見延遲文件。

如何自行測量延遲

請從自己的程式碼出發,測量串流回應第一個區塊抵達的時間。建議做法如下:

  • 捨棄前一到兩次請求,因為其中通常包含連線建立延遲。
  • 讓請求內容保持變化,以模擬真實流量。
  • 請逐一送出請求,不要平行執行。
  • 至少取樣 20 次請求,回報中位數(p50)與 p90,不要只報單次最佳值或平均值。
  • 請用 PCM 格式測量。Ogg 格式前幾個位元組是標頭,不是音訊。

每次串流回應都會帶有 Server-Timing 標頭,其中 ttfb 的值是我們這一端的處理時間,其餘延遲則來自網路與你的自家堆疊。延遲文件也提供了 Python 與 TypeScript 的測試腳本。

常見問題

SpeechifyAI Simba 3.2 模型在 2026 年 9 月 15 日於美東正式流量上的首音中位數為 56 毫秒,p90 為 102 毫秒。獨立基準測試記錄到的首音中位數則分別為 106 毫秒(Coval,2026 年 9 月 24 日 24 小時內)與 123 毫秒(Voice Arena,2026 年 9 月 24 日),其中包含其網路延遲與首音前靜音。

在 Voice Arena 美式英語榜 2026 年 9 月 24 日的數據中,SpeechifyAI Simba 3.2 的首音中位數為 123 毫秒,為 14 款受測模型中最短,領先 Inworld Realtime TTS 2 Research Preview(168.5 毫秒)。榜單會持續更新,查閱時請參考最新日期。

支援。POST /v1/audio/stream 會在產生音訊時,透過 HTTP 即時傳送 PCM、MP3、Ogg Opus 或 AAC 格式。PCM 因無需編碼,延遲最低。

沒有。SpeechifyAI 是 Speechify 的開發者 API,與 Speechify 閱讀應用程式分開計費,Reader 訂閱也不包含 API 使用。API 採月費制,無年繳限制:免費方案每月 50 萬字,免綁卡;Starter 每月 10 美元(超額每百萬字 10 美元)、Pro 每月 99 美元(超額 8 美元),Scale 每月 499 美元(超額 6 美元)。

前往 SpeechifyAI 試用 Simba 3.2:免費領取 API 金鑰、測試第一個請求,並驗證上述延遲數字。

通過 API 快速、可擴展且對開發者友好的方式訪問 Speechify 的受歡迎聲音

獲取 API 訪問權限
Sparse JavaScript keywords import, from, const, await on a white background

分享這篇文章

Speechify 團隊

Speechify 團隊


Speechify 團隊

Speechify

關於 Speechify

#1 文字轉語音工具

Speechify 是全球領先的 文字轉語音 平台,擁有超過 5,000 萬用戶信賴,並在其 iOS、Android、Chrome 擴展、網頁應用 和 Mac 桌面 應用中獲得超過 50 萬個五星評價。2025 年,Apple 將 Speechify 授予了備受矚目的 Apple 設計大獎,並在 WWDC 上稱其為「幫助人們更好生活的重要資源」。Speechify 提供超過 1,000 種自然語音,支持 60 多種語言,並在近 200 個國家使用。名人語音包括 Snoop Dogg、Mr. Beast 和 Gwyneth Paltrow。對於創作者和企業,Speechify Studio 提供高級工具,包括 AI 語音生成器、AI 語音克隆、AI 配音 和 AI 語音變換器。Speechify 還通過其高品質且具成本效益的 文字轉語音 API 為領先產品提供支持。Speechify 曾被報導於 華爾街日報、CNBC、福布斯、TechCrunch 等主要媒體,是全球最大的文字轉語音提供商。訪問 speechify.com/news、speechify.com/blog 和 speechify.com/press 了解更多。