两项由Speechify未参与的独立基准测试于2026年9月测量了SpeechifyAI Simba 3.2模型的首次音频输出时间。Coval在截至2026年9月24日的24小时内测得中位值为106毫秒。Voice Arena在同一天的美式英语榜单中测得为123毫秒,为榜单14款模型中的最低值。本文将解释这些数字的含义、为什么首次音频时间是值得比较的延迟指标,以及如何用自己的代码进行测量。
如何解读这些数据
这两项独立测量高于我们的内部数据,因为它们包含了测试方与我们服务器之间的网络延迟,以及音频开头的静默。每项数据都对应当天的测试结果。两大榜单会持续更新,最新数据请以其官网为准。
Voice Arena美式英语榜(2026年9月24日)
来源:Voice Arena,查阅日期为2026年9月24日。榜单共测得14个模型,表中列出的是速度最快的前六项。
为什么首次音频时间是关键对比指标
无论是语音助手回答问题,还是App实时朗读,用户的等待都始于文本发出、终于听到第一声。这段等待时间,就是“首次音频时间”。
- 首字节时间不一定反映真实听感。
- 流式传输可能包含开头静默,用户要等到真正听见声音才会感知到响应,而首次音频时间会把这段静默算进去。
- 总生成时间主要在保存文件时才重要。
- 但对流式播放的即时体验来说,首字节之后还要多久完成,影响反而没那么大。
- 对话场景尤其依赖响应速度。
- 人类通常会在数百毫秒内接话,语音助手需要在听写、推理和合成之间留出足够空间,因此每一毫秒都很关键。
Simba 3.2如何在不缩小模型的情况下提速
在Coval的数据中,Simba 3.2的每日中位延迟从9月13日的379毫秒降至9月18日的116毫秒,5天内下降约70%。
模型本身没有任何变化。权重完全相同,没有压缩、量化,也没有“turbo”版本。提速来自模型之外的服务链路优化:
- 全新服务构建,采用不同的GPU类型,并对推理栈底层进行了优化,让音频能更早输出。
- 套餐、权限和限速检查改为缓存查询,无需在首字节前进行实时检索。
- API网关与GPU部署在同一区域,并保持连接常驻,避免冷启动开销。
- 约100毫秒的开头静默已被消除。Coval对Simba 3.2的静默测量从9月14日的102毫秒降至13毫秒。
输出质量依然保持领先。在Artificial Analysis文本转语音排行榜中,Simba 3.2于2026年9月23日获得Elo 1,237分(±14),在92款供应商语音中跻身前五,而排名更高的模型价格也更高。
如何在你的应用中获得更低的语音延迟
- 使用流式接口。
- 如果需要边生成边播放,请调用
- POST /v1/audio/stream
- 。
- POST /v1/audio/speech
- 则需要等音频全部生成完毕后才会响应。
- 指定Simba 3.2。
- 英文语音请将
- model
- 设为
- simba-3.2
- 。如果不指定,默认使用
- simba-3.0
- 。
- 复用连接。
- 创建一个HTTP客户端,在启动时建立连接并持续复用,避免每次请求都重新进行DNS解析以及TCP、TLS握手。
- 按句推送。
- 如果前面接了语言模型,可在每生成一句后立刻发送,并按顺序播放。
- 选择合适的格式。
- audio/pcm
- (24kHz)无需额外编码。若带宽受限,可使用MP3或Ogg Opus。
- 尽量靠近API部署。
- API部署在美国东部,若你的服务器靠近该区域,网络耗时可降到更低。
在用LiveKit Agents开发?这篇指南介绍了如何用Speechify插件打造语音助手,实现句子一生成就立即流式推送。每一步的思路和代码详见延迟文档。
如何自行测量
在你的代码环境中记录流式响应返回首个数据块的时间。为了让数据更公正:
- 忽略前1到2次请求,因为它们通常包含建连开销。
- 每次请求的文本都应有所变化,这样更贴近真实流量。
- 请求应依次发送,不要并发。
- 建议至少测试20次,并报告中位数(p50)和p90,而不是平均值或单次最佳结果。
- 建议用PCM测量。Ogg的首字节是文件头,不代表实际音频数据。
每个流式响应都包含Server-Timing头,其中ttfb表示我们这一侧的耗时,其余部分就是网络和你本地代码带来的延迟。延迟文档中提供了可直接使用的Python和TypeScript脚本。
常见问题
2026年9月15日,SpeechifyAI Simba 3.2模型在美国东部生产流量中的首个音频字节写出中位时间为56毫秒,p90为102毫秒。独立基准测试测得的首次音频中位时间分别为106毫秒(Coval,截至2026年9月24日的前24小时)和123毫秒(Voice Arena,2026年9月24日),两者都包含网络耗时和开头静默。
在2026年9月24日的Voice Arena美式英语榜中,SpeechifyAI Simba 3.2在14款模型里拥有最低的首次音频中位时间,仅为123毫秒,领先于Inworld Realtime TTS 2 Research Preview(168.5毫秒)。基准榜单会持续刷新,查看排名时请留意结果日期。
支持。POST /v1/audio/stream可将音频以PCM、MP3、Ogg Opus或AAC格式流式传输。其中PCM无需编码,延迟最低。
不包含。SpeechifyAI是Speechify专为开发者提供的API服务,计费独立于Speechify阅读应用,Reader订阅不包含API用量。API套餐按月计费、无需年付:免费套餐每月50万字符且免信用卡;Starter为$10/月,超额为$10/100万字符;Pro为$99/$8,Scale为$499/$6。
欢迎前往SpeechifyAI试用Simba 3.2:可免费创建API密钥,并将你的首次请求延迟与上述数据进行对比。

