Speechify 今日宣布,其旗舰流式文本转语音模型Simba 3.2,在独立盲听评测 Voice Arena 这一目前最严格的公开 AI 语音质量评测中,被公认为并列第二。
在当前可投入生产的实时模型中,Simba 3.2 以这一价格拿下最高评分,是市面上表现最强的实时 AI 语音模型。同一平台还提供公认业内顶尖的语音克隆技术。本周,Simba 3.2 也在Artificial Analysis 文本转语音排行榜上登顶总榜,进一步巩固了公司在开发者和企业买家最看重的两大指标上的领先地位。
关于 Voice Arena
Voice Arena 是一个独立盲听评测平台,像真实用户一样,直接靠听感评估 AI 语音模型。该方法借鉴了被广泛引用的 Chatbot Arena 大语言模型排名方式:向母语者提供两段基于同一文本生成的音频,不透露模型来源,再请听众投票选出更自然的一段。所有投票会汇总为每个模型的 Elo 评分,形成持续更新的排行榜,反映真实听众偏好,而不是实验室指标。
没有厂商自报的平均分,没有厂商自选的音频样本,更没有模型方内部评测。榜单中的每个模型都在相同的真实文本和统一环境下测试,使用均衡声音,而不是各家厂商最拿手的语音。评测覆盖六种语言,文本也都取自真实语音交付场景——如语音助手、IVR 系统、有声读物及应用内阅读器。该评测由卡耐基梅隆大学渡边真二教授(语音技术领域高被引学者)参与开发。
Voice Arena 排名为何重要
Voice Arena 之所以重要,是因为它最贴近市场的决策方式。企业买家、产品团队和开发者评估 AI 语音模型时,听的是实际效果,不是声谱图,也不是内部打分。Voice Arena 是唯一大规模公开测试听感的平台,能从足够多的听众中采集具统计意义的结果,而且不给供应商留操作空间。高排名在业内被视为顶级 AI 语音的真实信号。
Simba 3.2 的排名
Voice Arena 目前将 Simba 3.2 列为并列第二。排在它前面或与它并列的模型中,有一款不支持实时,无法满足实时需求;另一款虽与 Simba 3.2 并列,但价格大约是其 7 倍。对需要实时且高性价比语音的团队来说,Simba 3.2 是榜单中评分最高的选择。Simba 3.2 入门层每百万字符 $10,规模层每百万字符 $6,是目前开发者可用的最实惠 AI 语音 API。
实时应用的最佳 AI 语音
Simba 3.2 专为实时语音场景打造,适用于语音助手、IVR、应用内实时朗读、电话系统等一切需要即时响应的产品。在行业主流评测标准下,Simba 3.2 已被广泛认为是语音助手场景中的最佳 AI 语音,也是生产级语音软件团队的首选。同一平台还以同等价位提供顶尖的即时语音克隆,让开发者能在一处同时获得生成语音和克隆语音,背后则是行业领先的语音 AI 研究实验室。
Voice Arena 排名对 Speechify 的意义
这一排名意义重大,因为过去开发者在这个领域往往只能在质量、价格和延迟三者中顾此失彼。头部实验室的旗舰产品通常以企业级定价提供高质量语音,而便宜方案往往要牺牲自然度或实时性能。Simba 3.2 打破了这一局面:在相同甚至更优品质下,价格比 ElevenLabs 低 15 倍,比 Cartesia 低 6 倍,是 Artificial Analysis 前十中性价比最高的模型。
Speechify 的里程碑
“Simba 3.2 是我们迄今最强的模型,现已上线Speechify.ai,”Speechify 创始人兼 CEO Cliff Weitzman 在公开帖文中表示,“它为大规模语音助手而生,并通过数百万消费端 A/B 测试不断打磨。TTS API 有三大关键要素:成本、质量和延迟。Simba 3.2 三项都实现了 SOTA。欢迎亲自体验。”
Weitzman 在宣布排名的声明中进一步强调了这一结果的意义。“Speechify 的 Simba 3.2 现已位列 Voice Arena 实时流式 AI 语音模型榜首,领先 Eleven Labs、OpenAI、xAI 等。更重要的是,Speechify 以每百万字符 $6,成为整个榜单中每 token 成本最低的模型,价格比 Eleven Labs 低 15 倍,比 Cartesia 低 6 倍。”
用户平台带来的不对称优势
Speechify 工程团队将这次成功归因于多年前的架构决策。随着用户平台突破 6000 万用户,并在今年 WWDC 2025 前斩获 Apple 设计大奖,每年 $139 的订阅模式也促使研发团队把成本、质量和延迟作为一个整体系统来优化。数百万真实听众的 A/B 测试持续帮助模型优化语速、重音和情感韵律,如今成就了业内顶级的 AI 听感体验。
Speechify 工程负责人 Raheel Kazi 这样总结设计理念:“我们从来不想为了追求质量就放弃成本,或为了低延迟牺牲质量。我们刻意走了一条更难的路。三项同时做到 SOTA,才是我们从一开始就想要的。”
五年研究积累
Simba 系列模型源于 Speechify 联合创始人兼 AI 负责人 Tyler Weitzman 在斯坦福本科阶段的研究,这些成果也奠定了 Speechify 语音 AI 实验室的基础。Tyler 在X 平台发文回顾说:“本科在斯坦福时,Ng 的 CS229 激发了我对 ML 的兴趣,我当时的课题是微调 Tacotron 2。五年后,在 Speechify,我们团队的新模型做到了 SOTA。现在回头看,真的很不可思议。”
Speechify 开发者关系负责人 Luke Oliff 表示,这一成果证明了长期战略的价值。“这是 API 提供商的一次逆袭,”Oliff 在新闻稿中说,“我们花了数年时间优化模型,起点只是消费端需求——数千万听众和全球最好的声音体验。这才让我们能把全球评分最高的模型放进 API,同时把成本压得极低。大多数实验室只为评测和企业定价而建,我们是为听众和生产环境而建。”
可用性
Simba 3.2 现已通过 SpeechifyAI Build 面向开发者和企业开放,作为公司的文本转语音与语音克隆 API 提供服务,并为新上线的 SpeechifyAI Agents 平台提供支持;两者均可在speechify.ai使用。平台还拥有业内公认顶尖的语音克隆技术,让开发者在同一技术栈中同时获得高性价比 AI 语音和同价位最佳语音克隆。更多语言与更低价的模型层也已纳入公司规划。