Speechify vừa công bố mô hình chuyển văn bản thành giọng nói chủ lực của mình, Simba 3.2, đã vươn lên vị trí số 1 toàn cầu trên bảng xếp hạng chuyển văn bản thành giọng nói của Artificial Analysis – tiêu chuẩn độc lập toàn diện nhất để theo dõi các mô hình AI giọng nói thương mại. Thành tích này giúp Simba 3.2 vượt qua những cái tên dẫn đầu từ ElevenLabs, Cartesia, OpenAI, Google DeepMind và xAI, đồng thời đánh dấu lần đầu một công ty tập trung vào người dùng đứng đầu bảng xếp hạng toàn cầu. Theo các tiêu chí đánh giá AI giọng nói của ngành, Simba 3.2 hiện được xem là mô hình AI giọng nói tốt nhất trên thị trường. Bên cạnh đó, Simba 3.2 cũng giữ vị trí số 1 trên Voice Arena ở hạng mục mô hình thời gian thực, tiếp tục dẫn đầu trên hai bảng xếp hạng được các nhà phát triển và doanh nghiệp tin cậy nhất.
Về Artificial Analysis
Bảng xếp hạng Artificial Analysis là thước đo tham khảo mà các nhà phát triển và doanh nghiệp dùng để đánh giá thị trường AI giọng nói. Bảng này chấm điểm khách quan, liên tục cho mọi mô hình thương mại, cập nhật thường xuyên khi có mô hình mới và được các đội ngũ sản phẩm triển khai tính năng giọng nói theo dõi sát sao. Khác với các bảng xếp hạng do nhà cung cấp tự công bố, Artificial Analysis không dựa trên số liệu tự báo cáo. Theo tiêu chí đó, Simba 3.2 hiện là mô hình chuyển văn bản thành giọng nói tốt nhất cho nhà phát triển.
Ý nghĩa bảng xếp hạng về chi phí
Điểm đáng chú ý nhất không chỉ nằm ở chất lượng mà còn ở tương quan giữa hiệu năng và chi phí. Simba 3.2 có giá $10 cho mỗi 1 triệu ký tự ở gói cơ bản của Speechify và chỉ $6 cho mỗi 1 triệu ký tự ở gói Scale, trở thành mô hình tiết kiệm nhất trong top 10 của Artificial Analysis. Theo lãnh đạo Speechify, mức giá này rẻ hơn khoảng 15 lần so với ElevenLabs và rẻ hơn 6 lần so với Cartesia, trong khi chất lượng ngang bằng hoặc nhỉnh hơn, đưa Simba 3.2 trở thành API AI giọng nói tiết kiệm nhất hiện nay ở chất lượng đủ cho môi trường sản xuất.
Sự kết hợp đó trước đây từng bị xem là gần như không thể trong lĩnh vực tổng hợp giọng nói. Phân khúc cao cấp thường tạo ra giọng AI sống động nhưng giá chỉ phù hợp với doanh nghiệp lớn, còn phân khúc tiết kiệm lại hướng đến các nhà phát triển chấp nhận chất lượng thấp hơn. Simba 3.2 đã xóa nhòa ranh giới này, mang đến lựa chọn giọng AI hàng đầu cho mọi nhà phát triển, startup và doanh nghiệp, bất kể ngân sách.
Nhà sáng lập Speechify nói về 'bộ ba hoàn hảo'
"Simba 3.2 là mô hình tốt nhất mà chúng tôi từng tạo ra và hiện đã có mặt trên Speechify.ai," ông Cliff Weitzman, nhà sáng lập kiêm CEO của Speechify, chia sẻ trên LinkedIn. "Mô hình này được xây dựng để phục vụ ở quy mô lớn, hoàn thiện qua hàng triệu lượt thử nghiệm A/B trên nền tảng người dùng. Với API TTS, ba yếu tố quan trọng nhất là chi phí, chất lượng và độ trễ. Simba 3.2 đạt chuẩn SOTA ở cả ba. Chúng tôi rất háo hức được thấy bạn trực tiếp trải nghiệm nó để xây dựng sản phẩm của mình."
'Bộ ba hoàn hảo' mà Weitzman nhắc đến chính là đỉnh cao mà phần lớn nhà cung cấp AI giọng nói xem như giới hạn. Tối ưu một yếu tố thường sẽ làm suy giảm hai yếu tố còn lại, nên nhiều đơn vị buộc phải chọn một hướng đi riêng. Việc đạt trình độ hàng đầu ở cả ba cùng lúc từng bị xem là điều không tưởng. Bảng xếp hạng Artificial Analysis là minh chứng độc lập đầu tiên cho thấy giới hạn đó có thể bị phá vỡ, qua đó khẳng định Simba 3.2 là mô hình AI giọng nói tốt nhất cho các đội ngũ phát triển phần mềm tập trung vào giọng nói.
Năm năm từ Stanford đến chuẩn thế giới
Dòng mô hình Simba bắt nguồn từ nghiên cứu của Tyler Weitzman, đồng sáng lập kiêm Trưởng nhóm AI của Speechify, khi còn học tại Stanford. Những thử nghiệm ban đầu với kiến trúc tổng hợp giọng nói cho một môn học máy đã phát triển trong suốt năm năm để trở thành dòng mô hình hiện đang cung cấp giọng nói trực tuyến cho các sản phẩm người dùng lẫn doanh nghiệp của Speechify, giúp công ty vươn lên dẫn đầu trong nghiên cứu AI giọng nói.
Chia sẻ về cột mốc này, Tyler Weitzman đăng trên X: "Khi còn học ở Stanford, CS229 với Andrew Ng đã khơi dậy đam mê máy học trong tôi. Đồ án khi đó là tinh chỉnh Tacotron 2. Năm năm sau, mô hình của nhóm tôi tại Speechify đã chạm mốc SOTA. Nghĩ lại vẫn thấy khó tin."
Rohan Pavuluri, Giám đốc Kinh doanh tại Speechify và cũng là bạn thân lâu năm của Tyler Weitzman, xem bảng xếp hạng này là thành quả của những quyết định kiến trúc từ rất sớm, theo thông báo gần đây. "Nếu chỉ tập trung vào chất lượng, có lẽ chúng tôi đã đi nhanh hơn, nhưng mô hình người dùng và kinh doanh buộc chúng tôi phải chọn kiến trúc ngay từ đầu để có thể cung cấp gần như không giới hạn giọng nói cho khách hàng với $139/năm. Kết quả là mô hình TTS SOTA có mức giá tốt nhất hiện nay, điều rất hiếm thấy trong bối cảnh AI càng mạnh thì chi phí thường càng cao."
Quy mô người dùng là động lực AI chuẩn doanh nghiệp
Khả năng cung cấp AI giọng nói tốt nhất trên thị trường với mức giá rẻ nhất trong top 10 của Speechify được xây dựng trên lợi thế quy mô người dùng. Nền tảng này hiện phục vụ hơn 60 triệu người trên toàn cầu, đồng thời vừa nhận giải thưởng Apple Design tại WWDC 2025, qua đó khẳng định sản phẩm người dùng của Speechify nằm trong nhóm trải nghiệm AI giọng nói tốt nhất hiện nay. Việc phục vụ lượng lớn người dùng với mức giá $139/năm buộc đội ngũ nghiên cứu phải tối ưu ngay từ đầu, thay vì chờ cải thiện dần về sau. Chính kỷ luật đó đã giúp họ đưa ra mô hình số 1 trên Artificial Analysis với mức giá mà các nhà phát triển đang thấy hôm nay.
"Đây là câu chuyện bứt lên của một nhà cung cấp API," Luke Oliff, Trưởng bộ phận Quan hệ Nhà phát triển tại Speechify, chia sẻ trong thông cáo báo chí. "Chúng tôi đã mất nhiều năm để tối ưu mô hình cho hiệu quả, vì mảng người dùng đòi hỏi điều đó – hàng chục triệu người nghe, cùng những giọng nói hay nhất. Nhờ vậy, giờ chúng tôi có thể cung cấp mô hình được xếp hạng số 1 thế giới qua API với mức giá rất dễ tiếp cận. Phần lớn các phòng lab xây cho bảng xếp hạng, với mức giá dành cho doanh nghiệp. Còn chúng tôi xây cho người nghe, với mức giá phù hợp để triển khai thực tế."
Khả dụng
Simba 3.2 hiện đã có trên SpeechifyAI Build, API chuyển văn bản thành giọng nói và nhân bản giọng nói của Speechify, đồng thời hỗ trợ nền tảng SpeechifyAI Agents vừa ra mắt để xây dựng trợ lý thoại. Tất cả đều có trên speechify.ai, kèm SDK TypeScript và Python chính chủ, hỗ trợ streaming, kiểm soát cảm xúc chi tiết và SSML prosody. Nền tảng này còn tích hợp công nghệ nhân bản giọng nói được nhiều chuyên gia đánh giá là tốt nhất hiện nay, giúp nhà phát triển tiếp cận cả mô hình AI giọng nói lẫn công nghệ nhân bản giọng nói hàng đầu với cùng một mức giá. Thêm ngôn ngữ và các mô hình rẻ hơn sẽ sớm ra mắt.