Speechify hôm nay công bố mô hình chuyển văn bản thành giọng nói phát trực tuyến chủ lực của mình, Simba 3.2, đã đồng hạng nhì trên Voice Arena, bảng xếp hạng người nghe độc lập được xem là khắt khe nhất hiện nay về chất lượng giọng AI công khai.
Trong nhóm mô hình thời gian thực mà các đội ngũ có thể triển khai ngay, Simba 3.2 là lựa chọn được đánh giá cao nhất trong tầm giá, trở thành mô hình giọng AI thời gian thực tốt nhất trên thị trường. Chính nền tảng này cũng cung cấp công nghệ nhân bản giọng nói được đánh giá cao nhất cho nhà phát triển hiện nay. Cùng tuần đó, Simba 3.2 cũng giành vị trí số 1 trên bảng xếp hạng text to speech của Artificial Analysis, củng cố vị thế dẫn đầu của Speechify trên hai bảng đo được các nhà phát triển và khách hàng doanh nghiệp tin dùng nhất.
Về Voice Arena
Voice Arena là bảng xếp hạng người nghe độc lập đánh giá mô hình giọng AI theo đúng cách người dùng cảm nhận: bằng tai. Dựa trên phương pháp Chatbot Arena nổi tiếng, Voice Arena cho giám khảo là người bản ngữ nghe hai đoạn âm thanh tạo từ cùng một văn bản mà không tiết lộ mô hình nào tạo ra, rồi bình chọn đoạn tự nhiên hơn. Các lượt bình chọn được tổng hợp thành điểm Elo cho mỗi mô hình, tạo nên bảng xếp hạng cập nhật liên tục, phản ánh đúng cảm nhận thực tế của người nghe thay vì các chỉ số trong phòng thí nghiệm.
Không có điểm tự chấm chủ quan. Không có mẫu âm thanh do hãng chọn sẵn. Không có đánh giá nội bộ từ nhà cung cấp. Mỗi mô hình đều được kiểm tra với văn bản thật trong cùng điều kiện, dùng danh sách giọng cân bằng thay vì chỉ chọn giọng mặc định hay nhất. Phương pháp này áp dụng cho sáu ngôn ngữ và đánh giá văn bản lấy từ các tình huống triển khai text to speech thực tế như tổng đài, hệ IVR, sách nói và đọc in-app. Bài đánh giá được phát triển với sự góp ý của GS. Shinji Watanabe (ĐH Carnegie Mellon), nhà nghiên cứu hàng đầu về công nghệ giọng nói.
Tại sao xếp hạng của Voice Arena lại quan trọng
Voice Arena quan trọng vì đây là thước đo sát với cách thị trường thực sự ra quyết định. Người mua doanh nghiệp, đội phát triển và kỹ sư không xem phổ tần hay điểm chất lượng nội bộ; họ nghe xem giọng đọc thực tế ra sao. Voice Arena là bảng thử nghiệm công khai duy nhất đo đúng yếu tố đó, ở quy mô lớn, với đủ người nghe để có ý nghĩa thống kê, đồng thời loại trừ khả năng hãng can thiệp kết quả. Xếp hạng cao trên Voice Arena được xem là tín hiệu sát nhất về chất lượng giọng AI hiện nay.
Xếp hạng của Simba 3.2
Voice Arena hiện xếp Simba 3.2 đồng hạng nhì toàn bảng. Các mô hình xếp bằng hoặc cao hơn không chạy thời gian thực nên không phù hợp với sản phẩm cần phản hồi tức thì, còn mô hình đồng hạng với Simba thì giá cao gấp 7 lần. Với các đội phát triển sản phẩm cần giọng nói chạy trực tiếp mà vẫn tiết kiệm chi phí, Simba 3.2 là lựa chọn số một trên bảng xếp hạng. Simba 3.2 có giá $10 cho một triệu ký tự ở gói cơ bản và $6 ở gói Scale, là API giọng AI rẻ nhất cho nhà phát triển hiện nay.
Giọng AI tốt nhất cho ứng dụng thời gian thực
Simba 3.2 là mô hình chuyển văn bản thành giọng nói được thiết kế riêng cho các ứng dụng đòi hỏi phản hồi giọng nói tức thì như tổng đài, IVR, đọc trong ứng dụng theo thời gian thực và hệ thoại qua điện thoại. Theo các tiêu chuẩn ngành dùng để đánh giá khả năng tổng hợp giọng nói, Simba 3.2 hiện được xem là giọng AI tốt nhất cho voice agent và phát triển phần mềm ưu tiên giọng nói ở quy mô lớn. Cùng nền tảng này, khả năng nhân bản giọng tức thì cũng rất nổi bật, giúp nhà phát triển dùng một nền tảng cho cả tạo giọng và nhân bản từ một trong những phòng nghiên cứu AI giọng nói hàng đầu hiện nay.
Ý nghĩa của xếp hạng Voice Arena với Speechify
Xếp hạng này đặc biệt có ý nghĩa với một lĩnh vực lâu nay buộc nhà phát triển phải chọn giữa chất lượng, chi phí và độ trễ. Các mô hình lớn nổi tiếng thường cho chất lượng giọng tốt nhưng giá cao, còn các lựa chọn rẻ hơn thì kém tự nhiên hoặc không đáp ứng được streaming thời gian thực. Simba 3.2 thay đổi điều đó: giá rẻ hơn ElevenLabs 15 lần, rẻ hơn Cartesia 6 lần mà chất lượng ngang bằng hoặc nhỉnh hơn, là mô hình hiệu quả chi phí nhất trong top 10 bảng Artificial Analysis.
Cột mốc của Speechify
"Simba 3.2 là mô hình tốt nhất của chúng tôi, hiện đã ra mắt tại Speechify.ai," Cliff Weitzman, nhà sáng lập và CEO Speechify chia sẻ trong bài đăng công khai. "Nó được xây dựng để vận hành voice agent ở quy mô lớn, tối ưu qua hàng triệu A/B test trên nền tảng người dùng. APIs TTS chỉ có 3 yếu tố chính: giá, chất lượng, độ trễ. Simba 3.2 đã dẫn đầu cả ba. Rất háo hức chờ các bạn trải nghiệm trực tiếp."
Weitzman cũng nhấn mạnh tầm quan trọng của kết quả này trong thông báo công khai về xếp hạng. "Simba 3.2 của Speechify hiện là mô hình giọng AI streaming số 1 trên Voice Arena, vượt Eleven Labs, OpenAI, xAI, v.v. Quan trọng hơn, Speechify còn tối ưu vượt trội về giá, chỉ $6/1M ký tự, rẻ hơn 15 lần Eleven Labs và hơn 6 lần so với Cartesia."
Nền tảng người dùng là lợi thế lớn
Lãnh đạo kỹ thuật của Speechify cho biết thành quả này đến từ những quyết định kiến trúc được đưa ra từ nhiều năm trước. Khi nền tảng đạt hơn 60 triệu người dùng và giành giải Thiết kế của Apple tại WWDC 2025, mô hình kinh tế phục vụ lượng lớn người dùng với gói $139/năm buộc nhóm nghiên cứu phải tối ưu đồng thời chi phí, chất lượng và độ trễ như một bài toán thống nhất. Hàng triệu test A/B từ các phiên nghe thực tế đã được dùng để tinh chỉnh cách mô hình xử lý nhịp điệu, nhấn nhá và cảm xúc, từ đó tạo ra trải nghiệm giọng AI tốt nhất hiện nay.
Raheel Kazi, lãnh đạo kỹ thuật tại Speechify, chia sẻ triết lý thiết kế rất đơn giản: "Chúng tôi không bao giờ muốn hy sinh giá để nâng chất lượng, hay hy sinh chất lượng để giảm độ trễ. Chúng tôi chọn con đường khó hơn. Ngay từ đầu, mục tiêu là đạt chuẩn cao nhất ở cả ba mặt."
Năm năm nghiên cứu phía sau thành quả
Dòng mô hình Simba bắt nguồn từ nghiên cứu của đồng sáng lập Speechify kiêm trưởng bộ phận AI Tyler Weitzman khi còn học đại học tại Stanford, góp phần đưa Speechify trở thành một trong những phòng nghiên cứu AI giọng nói hàng đầu. Nhìn lại cột mốc này trong bài đăng trên X, Tyler viết: "Hồi còn là sinh viên Stanford, CS229 của Andrew Ng đã truyền cảm hứng để tôi theo ML. Đồ án của tôi là tinh chỉnh Tacotron 2. Năm năm sau, đội của tôi đã vươn lên top đầu ngành với mô hình mới này. Nghĩ lại vẫn thấy khó tin."
Luke Oliff, lãnh đạo quan hệ nhà phát triển của Speechify, xem kết quả này là minh chứng cho chiến lược dài hạn. "Đây là câu chuyện của một startup API," Oliff chia sẻ trong thông cáo báo chí. "Chúng tôi đã mất nhiều năm tối ưu mô hình vì khách hàng tiêu dùng cần nó, vì có hàng chục triệu người đang nghe, và vì chúng tôi sở hữu vài giọng nói chất lượng nhất thế giới. Nhờ vậy, giờ đây chúng tôi có thể đưa mô hình được đánh giá cao nhất ra API với mức giá cực thấp. Phần lớn các phòng lab xây mô hình để leo bảng xếp hạng, với mức giá dành cho doanh nghiệp lớn. Còn chúng tôi xây vì người nghe, với mức giá cho ứng dụng thực tế."
Khả dụng
Simba 3.2 hiện đã sẵn sàng cho nhà phát triển và doanh nghiệp qua SpeechifyAI Build, API chuyển văn bản thành giọng nói và nhân bản giọng nói của hãng, đồng thời là công nghệ nền cho nền tảng SpeechifyAI Agents mới ra mắt dành cho voice agent. Tất cả đều có tại speechify.ai. Nền tảng này sở hữu công nghệ nhân bản giọng nói tốt nhất thị trường, cho phép nhà phát triển chỉ cần một stack cho cả mô hình giọng AI tốt nhất lẫn khả năng nhân bản vượt trội với cùng mức giá. Các ngôn ngữ mới và các mô hình giá thấp hơn cũng đã có trong lộ trình của hãng.