在两项与 Speechify 无关的基准测试中,SpeechifyAI 的 Simba 3.2 模型于2026年9月的首次音频时间被分别测得。Coval 记录的中位时间为106毫秒,统计区间为截至2026年9月24日的24小时。Voice Arena 在同日的美式英语榜单上测得123毫秒,为14个计时模型中最低。本文将说明这些数据具体测量了什么、为什么首次音频时间是关键的延迟指标,以及如何用您自己的代码进行测量。
这些数值怎么看
两项独立读数高于我们的自测值,是因为其中还包含了它们与我们服务器之间的网络延迟,以及音频开头的静音。每个数据点都对应基准测试在当天的读数;榜单会持续更新,您可随时查看最新结果。
Voice Arena 美式英语榜单,2026年9月24日
来源:Voice Arena,读取于2026年9月24日。榜单共对14个模型进行了计时,这里仅展示最快的6个。
为什么首次音频时间值得比较
当语音助手作答或应用开始朗读文本时,听众要等多久才能真正听到声音?这段从发出文本到听见声音的等待时间,就是首次音频输出时间。
- 首字节时间未必等于用户真实感知。
- 数据流的开头可能是静音,用户要等到第一个可听采样出现才会察觉到声音。首次音频时间会把这段静音也算进去。
- 总生成时间对应最后一个字节。
- 如果您是在保存完整音频文件,才需要关注整体耗时;如果是流式播放,更关键的是第一段可听音频何时到达。
- 对话场景的容错空间很小。
- 人与人对话通常会在几百毫秒内接上话。语音代理还要在停顿之间完成语音识别、语言模型推理和语音合成,因此每多耗掉一毫秒,留给其他环节的时间就会更少。
Simba 3.2 在不缩水的前提下实现更快响应
根据 Coval 的数据,Simba 3.2 的日中位值从2026年9月13日的379毫秒降到9月18日的116毫秒,5天内下降约70%。
模型本身并没有变化:权重未改、没有蒸馏、没有量化,也没有所谓的 “turbo” 精简版。优化发生在模型的服务链路上:
- 升级到新一代 GPU,并优化推理栈底层操作,让音频能更早输出。
- 套餐、权限和速率限制检查通过缓存完成,无需在首次请求时实时查表。
- API 网关与 GPU 部署在同一区域,请求之间的连接始终保持活跃。
- 大约100毫秒的首段静音已被消除。Coval 测得 Simba 3.2 的开头静音从9月14日的102毫秒降至13毫秒。
音质保持不变。在 Artificial Analysis 文本转语音榜单 上,Simba 3.2 于2026年9月23日获得 1,237(±14) 的 Elo 分数,位列92家公司前五,而且排在它前面的模型价格也更高。
如何让您的应用获得更低延迟
- 使用流式播放。
- 实时播放请调用
- POST /v1/audio/stream
- 。
- POST /v1/audio/speech
- 需要等全部内容生成完毕后才会返回。
- 明确指定 Simba 3.2。
- 在英文场景中,将
- model
- 设为
- simba-3.2
- 。如果省略,API 默认使用
- simba-3.0
- 。
- 复用连接。
- 启动时创建一个 HTTP 客户端并保持连接,用于所有请求,避免每次请求都重复承担 DNS 解析和 TCP/TLS 握手的开销。
- 句子一生成就立即发送。
- 如果前面接的是语言模型,就在每个完整句子生成后立刻发出,并按顺序播放返回的音频流。
- 选择合适的音频格式。
- 如果播放器支持,24kHz 的
- audio/pcm
- 无需额外编码。若您更在意带宽,可选 MP3 或 Ogg Opus。
- 尽量靠近 API 部署。
- API 托管在美国东部,将服务器部署在美国东部或邻近地区,可获得更低的网络延迟。
如果您在用 LiveKit Agents 开发,这份指南介绍了如何借助 Speechify 插件构建语音代理,实现语言模型写一句、语音就流式播一句。各步骤的原理和代码,请参阅延迟文档。
自己动手测一测
请在您的代码运行环境中,对流式响应的首个音频分片进行计时。想拿到更公平的数据,建议:
- 丢弃前1到2次请求,因为连接建立时延通常更高。
- 每次请求都稍微改动文本,以模拟真实流量。
- 串行发送请求,不要并行。
- 至少测20次,并报告中位数(p50)和 p90,而不是均值或最佳值。
- 用 PCM 做测量。Ogg 格式的首字节是头信息,不是真正的音频数据。
每个流式响应都会带有 Server-Timing 响应头,其中 ttfb 的值就是我们服务端这一段的延迟;其余延迟则来自您的网络和自身技术栈。延迟文档中提供了 Python 和 TypeScript 脚本。
常见问题
2026年9月15日,SpeechifyAI 的 Simba 3.2 模型在美国东部生产流量中的首字节中位耗时为56毫秒,p90 为102毫秒。独立基准测试测得的首次音频中位值分别为106毫秒(Coval,截至2026年9月24日的24小时)和123毫秒(Voice Arena,2026年9月24日);这些结果都包含各自的网络延迟和音频起始静音。
在2026年9月24日的 Voice Arena 美式英语榜单上,SpeechifyAI 的 Simba 3.2 在14个计时模型中拥有最低的首次音频中位时间,为123毫秒,快于 Inworld Realtime TTS 2 Research Preview 的168.5毫秒。由于基准会持续更新,使用前请先核对日期。
支持。POST /v1/audio/stream 可在生成过程中通过 HTTP 流式返回音频,支持 PCM、MP3、Ogg Opus 和 AAC。其中 PCM 延迟最低,也无需额外编码。
不包含。SpeechifyAI 是 Speechify 面向开发者的 API,计费独立于阅读应用,Reader 订阅不含 API 用量。API 套餐按月计费,无需年付:免费方案每月含50万字符,无需绑定银行卡;Starter 每月10美元,超额按每100万字符10美元计费;Pro 每月99美元,超额每100万字符8美元;Scale 每月499美元,超额每100万字符6美元。
前往SpeechifyAI 试用 Simba 3.2:生成免费 API 密钥,并按上文的方法测试您的首次请求延迟。

