Skip to main content
  1. 首页
  2. API
  3. 2026年文本转语音API延迟:独立测得的首次音频输出时间
Published on •API

2026年文本转语音API延迟:独立测得的首次音频输出时间

Speechify 团队

Speechify 团队


Speechify API 实现 300ms 级延迟、人声级音质及 50+ 种语言支持

Apple2025 年苹果设计大奖
5000 万+ 用户

两项由Speechify未参与的独立基准测试于2026年9月测量了SpeechifyAI Simba 3.2模型的首次音频输出时间。Coval在截至2026年9月24日的24小时内测得中位值为106毫秒。Voice Arena在同一天的美式英语榜单中测得为123毫秒,为榜单14款模型中的最低值。本文将解释这些数字的含义、为什么首次音频时间是值得比较的延迟指标,以及如何用自己的代码进行测量。

如何解读这些数据

基准测试

测量指标

Simba 3.2

时间范围

Voice Arena,美式英语榜

实时流路径中首次音频输出的中位时间

123毫秒,14款模型中最低

2026年9月24日

Coval

首次音频中位时间,包含首个可听音频样本前的全部静默时间。采用开源运行架构,每30分钟从美国东部执行一次

106毫秒

截至2026年9月24日的24小时

SpeechifyAI生产流量(内部测量)

API在美国东部真实客户请求中写出首个音频字节所需的时间

56毫秒 p50,102毫秒 p90

2026年9月15日

这两项独立测量高于我们的内部数据,因为它们包含了测试方与我们服务器之间的网络延迟,以及音频开头的静默。每项数据都对应当天的测试结果。两大榜单会持续更新,最新数据请以其官网为准。

Voice Arena美式英语榜(2026年9月24日)

模型

首次音频中位时间

SpeechifyAI Simba 3.2 实时

123毫秒

Inworld Realtime TTS 2 Research Preview

168.5毫秒

Gradium TTS 实时

236毫秒

Cartesia Sonic-3.5 实时

250毫秒

Smallest AI Lightning 3.1 Pro 实时

263.5毫秒

Fish Audio S2 Pro 实时

267毫秒

来源:Voice Arena,查阅日期为2026年9月24日。榜单共测得14个模型,表中列出的是速度最快的前六项。

为什么首次音频时间是关键对比指标

无论是语音助手回答问题,还是App实时朗读,用户的等待都始于文本发出、终于听到第一声。这段等待时间,就是“首次音频时间”。

  • 首字节时间不一定反映真实听感。
  • 流式传输可能包含开头静默,用户要等到真正听见声音才会感知到响应,而首次音频时间会把这段静默算进去。
  • 总生成时间主要在保存文件时才重要。
  • 但对流式播放的即时体验来说,首字节之后还要多久完成,影响反而没那么大。
  • 对话场景尤其依赖响应速度。
  • 人类通常会在数百毫秒内接话,语音助手需要在听写、推理和合成之间留出足够空间,因此每一毫秒都很关键。

Simba 3.2如何在不缩小模型的情况下提速

在Coval的数据中,Simba 3.2的每日中位延迟从9月13日的379毫秒降至9月18日的116毫秒,5天内下降约70%。

模型本身没有任何变化。权重完全相同,没有压缩、量化,也没有“turbo”版本。提速来自模型之外的服务链路优化:

  • 全新服务构建,采用不同的GPU类型,并对推理栈底层进行了优化,让音频能更早输出。
  • 套餐、权限和限速检查改为缓存查询,无需在首字节前进行实时检索。
  • API网关与GPU部署在同一区域,并保持连接常驻,避免冷启动开销。
  • 约100毫秒的开头静默已被消除。Coval对Simba 3.2的静默测量从9月14日的102毫秒降至13毫秒。

输出质量依然保持领先。在Artificial Analysis文本转语音排行榜中,Simba 3.2于2026年9月23日获得Elo 1,237分(±14),在92款供应商语音中跻身前五,而排名更高的模型价格也更高。

如何在你的应用中获得更低的语音延迟

  1. 使用流式接口。
  2. 如果需要边生成边播放,请调用
  3. POST /v1/audio/stream
  4. 。
  5. POST /v1/audio/speech
  6. 则需要等音频全部生成完毕后才会响应。
  7. 指定Simba 3.2。
  8. 英文语音请将
  9. model
  10. 设为
  11. simba-3.2
  12. 。如果不指定,默认使用
  13. simba-3.0
  14. 。
  15. 复用连接。
  16. 创建一个HTTP客户端,在启动时建立连接并持续复用,避免每次请求都重新进行DNS解析以及TCP、TLS握手。
  17. 按句推送。
  18. 如果前面接了语言模型,可在每生成一句后立刻发送,并按顺序播放。
  19. 选择合适的格式。
  20. audio/pcm
  21. (24kHz)无需额外编码。若带宽受限,可使用MP3或Ogg Opus。
  22. 尽量靠近API部署。
  23. API部署在美国东部,若你的服务器靠近该区域,网络耗时可降到更低。

在用LiveKit Agents开发?这篇指南介绍了如何用Speechify插件打造语音助手,实现句子一生成就立即流式推送。每一步的思路和代码详见延迟文档。

如何自行测量

在你的代码环境中记录流式响应返回首个数据块的时间。为了让数据更公正:

  • 忽略前1到2次请求,因为它们通常包含建连开销。
  • 每次请求的文本都应有所变化,这样更贴近真实流量。
  • 请求应依次发送,不要并发。
  • 建议至少测试20次,并报告中位数(p50)和p90,而不是平均值或单次最佳结果。
  • 建议用PCM测量。Ogg的首字节是文件头,不代表实际音频数据。

每个流式响应都包含Server-Timing头,其中ttfb表示我们这一侧的耗时,其余部分就是网络和你本地代码带来的延迟。延迟文档中提供了可直接使用的Python和TypeScript脚本。

常见问题

2026年9月15日,SpeechifyAI Simba 3.2模型在美国东部生产流量中的首个音频字节写出中位时间为56毫秒,p90为102毫秒。独立基准测试测得的首次音频中位时间分别为106毫秒(Coval,截至2026年9月24日的前24小时)和123毫秒(Voice Arena,2026年9月24日),两者都包含网络耗时和开头静默。

在2026年9月24日的Voice Arena美式英语榜中,SpeechifyAI Simba 3.2在14款模型里拥有最低的首次音频中位时间,仅为123毫秒,领先于Inworld Realtime TTS 2 Research Preview(168.5毫秒)。基准榜单会持续刷新,查看排名时请留意结果日期。

支持。POST /v1/audio/stream可将音频以PCM、MP3、Ogg Opus或AAC格式流式传输。其中PCM无需编码,延迟最低。

不包含。SpeechifyAI是Speechify专为开发者提供的API服务,计费独立于Speechify阅读应用,Reader订阅不包含API用量。API套餐按月计费、无需年付:免费套餐每月50万字符且免信用卡;Starter为$10/月,超额为$10/100万字符;Pro为$99/$8,Scale为$499/$6。

欢迎前往SpeechifyAI试用Simba 3.2:可免费创建API密钥,并将你的首次请求延迟与上述数据进行对比。

通过 API 快速接入 Speechify 的高级语音服务,弹性扩展,开发者友好

获取 API 访问权限
Sparse JavaScript keywords import, from, const, await on a white background

分享此文

Speechify 团队

Speechify 团队


Speechify 团队

Speechify

关于 Speechify

No.1 文字转语音阅读器

Speechify 是全球领先的文字转语音平台,深受超过 5000 万用户信赖,并在其文字转语音 iOS、Android、Chrome 扩展、网页版应用和 Mac 桌面端应用上,收获超过 50 万条五星好评。2025 年,Apple 授予 Speechify 备受业界瞩目的 苹果设计大奖,并在 WWDC 盛会上称其为“帮助人们更好生活的重要资源”。Speechify 提供 1000+ 自然音色、60+ 种语言支持,服务覆盖近 200 个国家/地区。明星声音包括 Snoop Dogg 和 Gwyneth Paltrow。面向创作者和企业用户,Speechify Studio 提供强大工具,包括 AI 语音生成器、AI 语音克隆、AI 配音和高阶AI 变声器。Speechify 还通过高品质、低成本的文字转语音 API赋能行业领先产品。Speechify 被众多主流媒体报道,包括《华尔街日报》、CNBC、福布斯、TechCrunch等,现已成为全球最大的文字转语音服务提供商。更多信息请访问 speechify.com/news、speechify.com/blog 和 speechify.com/press 了解更多。