Skip to main content
  1. 首页
  2. API
  3. 2026年文本转语音API延迟:首次音频输出时间独立测评
Published on •API

2026年文本转语音API延迟:首次音频输出时间独立测评

Speechify 团队

Speechify 团队


Speechify API:300 毫秒超低延迟、媲美真人的语音,支持 50+ 种语言

Apple2025 年 Apple 设计奖
5000 万+ 用户

在两项与 Speechify 无关的基准测试中,SpeechifyAI 的 Simba 3.2 模型于2026年9月的首次音频时间被分别测得。Coval 记录的中位时间为106毫秒,统计区间为截至2026年9月24日的24小时。Voice Arena 在同日的美式英语榜单上测得123毫秒,为14个计时模型中最低。本文将说明这些数据具体测量了什么、为什么首次音频时间是关键的延迟指标,以及如何用您自己的代码进行测量。

这些数值怎么看

基准测试

测量项

Simba 3.2

日期

Voice Arena 美式英语榜单

实时流式链路的首次音频中位时间

123毫秒,14个模型中最低

2026年9月24日

Coval

首次音频中位时间,包含首个可听采样前的全部静音。使用开源工具,每30分钟从美国东部运行一次

106毫秒

截至2026年9月24日的24小时

SpeechifyAI 生产流量(自测)

我们的 API 在美国东部真实客户请求中写出首个音频字节所需的时间

56毫秒(中位数),102毫秒(p90)

2026年9月15日

两项独立读数高于我们的自测值,是因为其中还包含了它们与我们服务器之间的网络延迟,以及音频开头的静音。每个数据点都对应基准测试在当天的读数;榜单会持续更新,您可随时查看最新结果。

Voice Arena 美式英语榜单,2026年9月24日

模型

首次音频中位时间

SpeechifyAI Simba 3.2 实时版

123毫秒

Inworld Realtime TTS 2 Research Preview

168.5毫秒

Gradium TTS 实时版

236毫秒

Cartesia Sonic-3.5 实时版

250毫秒

Smallest AI Lightning 3.1 Pro 实时版

263.5毫秒

Fish Audio S2 Pro 实时版

267毫秒

来源:Voice Arena,读取于2026年9月24日。榜单共对14个模型进行了计时,这里仅展示最快的6个。

为什么首次音频时间值得比较

当语音助手作答或应用开始朗读文本时,听众要等多久才能真正听到声音?这段从发出文本到听见声音的等待时间,就是首次音频输出时间。

  • 首字节时间未必等于用户真实感知。
  • 数据流的开头可能是静音,用户要等到第一个可听采样出现才会察觉到声音。首次音频时间会把这段静音也算进去。
  • 总生成时间对应最后一个字节。
  • 如果您是在保存完整音频文件,才需要关注整体耗时;如果是流式播放,更关键的是第一段可听音频何时到达。
  • 对话场景的容错空间很小。
  • 人与人对话通常会在几百毫秒内接上话。语音代理还要在停顿之间完成语音识别、语言模型推理和语音合成,因此每多耗掉一毫秒,留给其他环节的时间就会更少。

Simba 3.2 在不缩水的前提下实现更快响应

根据 Coval 的数据,Simba 3.2 的日中位值从2026年9月13日的379毫秒降到9月18日的116毫秒,5天内下降约70%。

模型本身并没有变化:权重未改、没有蒸馏、没有量化,也没有所谓的 “turbo” 精简版。优化发生在模型的服务链路上:

  • 升级到新一代 GPU,并优化推理栈底层操作,让音频能更早输出。
  • 套餐、权限和速率限制检查通过缓存完成,无需在首次请求时实时查表。
  • API 网关与 GPU 部署在同一区域,请求之间的连接始终保持活跃。
  • 大约100毫秒的首段静音已被消除。Coval 测得 Simba 3.2 的开头静音从9月14日的102毫秒降至13毫秒。

音质保持不变。在 Artificial Analysis 文本转语音榜单 上,Simba 3.2 于2026年9月23日获得 1,237(±14) 的 Elo 分数,位列92家公司前五,而且排在它前面的模型价格也更高。

如何让您的应用获得更低延迟

  1. 使用流式播放。
  2. 实时播放请调用
  3. POST /v1/audio/stream
  4. 。
  5. POST /v1/audio/speech
  6. 需要等全部内容生成完毕后才会返回。
  7. 明确指定 Simba 3.2。
  8. 在英文场景中,将
  9. model
  10. 设为
  11. simba-3.2
  12. 。如果省略,API 默认使用
  13. simba-3.0
  14. 。
  15. 复用连接。
  16. 启动时创建一个 HTTP 客户端并保持连接,用于所有请求,避免每次请求都重复承担 DNS 解析和 TCP/TLS 握手的开销。
  17. 句子一生成就立即发送。
  18. 如果前面接的是语言模型,就在每个完整句子生成后立刻发出,并按顺序播放返回的音频流。
  19. 选择合适的音频格式。
  20. 如果播放器支持,24kHz 的
  21. audio/pcm
  22. 无需额外编码。若您更在意带宽,可选 MP3 或 Ogg Opus。
  23. 尽量靠近 API 部署。
  24. API 托管在美国东部,将服务器部署在美国东部或邻近地区,可获得更低的网络延迟。

如果您在用 LiveKit Agents 开发,这份指南介绍了如何借助 Speechify 插件构建语音代理,实现语言模型写一句、语音就流式播一句。各步骤的原理和代码,请参阅延迟文档。

自己动手测一测

请在您的代码运行环境中,对流式响应的首个音频分片进行计时。想拿到更公平的数据,建议:

  • 丢弃前1到2次请求,因为连接建立时延通常更高。
  • 每次请求都稍微改动文本,以模拟真实流量。
  • 串行发送请求,不要并行。
  • 至少测20次,并报告中位数(p50)和 p90,而不是均值或最佳值。
  • 用 PCM 做测量。Ogg 格式的首字节是头信息,不是真正的音频数据。

每个流式响应都会带有 Server-Timing 响应头,其中 ttfb 的值就是我们服务端这一段的延迟;其余延迟则来自您的网络和自身技术栈。延迟文档中提供了 Python 和 TypeScript 脚本。

常见问题

2026年9月15日,SpeechifyAI 的 Simba 3.2 模型在美国东部生产流量中的首字节中位耗时为56毫秒,p90 为102毫秒。独立基准测试测得的首次音频中位值分别为106毫秒(Coval,截至2026年9月24日的24小时)和123毫秒(Voice Arena,2026年9月24日);这些结果都包含各自的网络延迟和音频起始静音。

在2026年9月24日的 Voice Arena 美式英语榜单上,SpeechifyAI 的 Simba 3.2 在14个计时模型中拥有最低的首次音频中位时间,为123毫秒,快于 Inworld Realtime TTS 2 Research Preview 的168.5毫秒。由于基准会持续更新,使用前请先核对日期。

支持。POST /v1/audio/stream 可在生成过程中通过 HTTP 流式返回音频,支持 PCM、MP3、Ogg Opus 和 AAC。其中 PCM 延迟最低,也无需额外编码。

不包含。SpeechifyAI 是 Speechify 面向开发者的 API,计费独立于阅读应用,Reader 订阅不含 API 用量。API 套餐按月计费,无需年付:免费方案每月含50万字符,无需绑定银行卡;Starter 每月10美元,超额按每100万字符10美元计费;Pro 每月99美元,超额每100万字符8美元;Scale 每月499美元,超额每100万字符6美元。

前往SpeechifyAI 试用 Simba 3.2:生成免费 API 密钥,并按上文的方法测试您的首次请求延迟。

通过 API 以快速、可扩展、对开发者友好的方式接入广受好评的 Speechify 语音

获取 API 访问权限
Sparse JavaScript keywords import, from, const, await on a white background

分享本文

Speechify 团队

Speechify 团队


Speechify 团队

Speechify

关于 Speechify

#1 文字转语音阅读器

Speechify 是全球领先的文字转语音平台,深受超过 5000 万用户信赖,并在其文字转语音 iOS、Android、Chrome 扩展、网页版应用及Mac 桌面应用上收获了超 50 万条五星好评。2025 年,Apple 授予 Speechify 备受推崇的Apple 设计奖(WWDC),称其为“帮助人们生活的关键资源”。Speechify 提供 1000+ 种自然音色,支持 60+ 种语言,服务覆盖近 200 个国家/地区。明星声音包括Snoop Dogg、Mr. Beast和Gwyneth Paltrow等。面向创作者和企业,Speechify Studio 提供多种高级工具,包括AI 语音生成器、AI 语音克隆、AI 配音及AI 变声器。Speechify 还通过高质量、具成本优势的文字转语音 API为众多头部产品提供支持。曾被《华尔街日报》、CNBC、《福布斯》、TechCrunch 等主流媒体报道,Speechify 是全球最大的文字转语音服务商。访问 speechify.com/news、speechify.com/blog 和 speechify.com/press 了解更多信息。