Speechify hari ini mengumumkan bahawa model penukaran teks ke suara penstriman utamanya, Simba 3.2, kini berkongsi tempat kedua di Voice Arena, penanda aras bebas berasaskan pendengaran buta yang diiktiraf meluas sebagai penilaian awam paling ketat untuk kualiti suara AI ketika ini.
Antara model masa nyata yang boleh digunakan pasukan hari ini, Simba 3.2 ialah pilihan dengan kedudukan tertinggi pada julat harganya, menjadikannya model suara AI terbaik untuk perisian masa nyata di pasaran. Platform yang sama juga menawarkan teknologi pendua suara terbaik untuk pembangun ketika ini. Pada minggu yang sama, Simba 3.2 turut menduduki tempat No. 1 keseluruhan di carta Artificial Analysis, sekali gus mengukuhkan kelebihan syarikat dalam dua penanda aras utama yang menjadi rujukan pembangun dan pembeli korporat.
Tentang Voice Arena
Voice Arena ialah penanda aras bebas berasaskan pendengaran buta yang menilai model suara AI seperti yang didengar pengguna sebenar: dengan telinga mereka sendiri. Berasaskan metodologi Chatbot Arena yang menjadi rujukan meluas untuk menilai model bahasa besar, Voice Arena memperdengarkan dua klip audio yang dijana daripada teks sama kepada panel penutur asli tanpa mendedahkan model yang menghasilkannya, lalu meminta pendengar memilih klip yang lebih natural. Undian kemudian dihimpunkan ke dalam skor Elo bagi setiap model, menghasilkan carta dinamik yang mencerminkan pilihan pendengar sebenar, bukan sekadar metrik makmal.
Tiada skor pendapat purata yang diisi sendiri. Tiada sampel audio pilihan vendor. Tiada penilaian dalaman oleh pemilik model. Setiap model diuji dengan teks dunia sebenar yang sama, dalam keadaan serupa, menggunakan portfolio suara yang seimbang, bukan sekadar suara lalai terbaik vendor. Kaedah ini merangkumi enam bahasa dan menilai teks daripada penggunaan TTS sebenar seperti ejen suara, sistem IVR, buku audio dan pembaca dalam aplikasi. Penilaian ini dibangunkan dengan input daripada Prof. Shinji Watanabe dari Carnegie Mellon University, salah seorang penyelidik teknologi suara yang paling banyak dirujuk.
Kepentingan Kedudukan Voice Arena
Voice Arena penting kerana ia benar-benar mencerminkan keputusan pasaran. Pembeli korporat, pasukan produk dan pembangun menilai model suara AI bukan melalui spektrogram atau skor dalaman, tetapi berdasarkan bunyi yang benar-benar didengar oleh pendengar. Voice Arena ialah satu-satunya penanda aras awam pada skala ini yang cukup bermakna dari segi statistik serta tidak memberi ruang kepada vendor untuk memanipulasi keputusan. Kedudukan tinggi di Voice Arena kini dilihat oleh industri sebagai petunjuk utama bagi suara AI terbaik masa kini.
Pencapaian Simba 3.2
Voice Arena kini meletakkan Simba 3.2 di tempat kedua bersama. Antara model yang setara atau berada di atasnya, satu bukan model masa nyata dan tidak sesuai untuk aplikasi yang memerlukan respons segera, manakala model yang setara dengannya berharga sekitar tujuh kali ganda lebih mahal daripada Simba 3.2. Ini bermakna bagi mana-mana pasukan yang membina produk dan memerlukan suara langsung pada kos produksi, Simba 3.2 ialah pilihan berpenarafan tertinggi dalam penanda aras tersebut. Simba 3.2 berharga $10 bagi sejuta aksara pada tier permulaan, dan $6 pada tier Scale, menjadikannya API suara AI yang sangat mampu milik untuk pembangun.
Suara AI Terbaik untuk Aplikasi Masa Nyata
Simba 3.2 ialah model teks ke suara penstriman yang direka untuk aplikasi suara masa nyata seperti ejen suara, sistem IVR, pembaca langsung dalam aplikasi, sistem telefon dan apa juga produk yang memerlukan respons suara segera. Berdasarkan penilaian industri, Simba 3.2 kini diiktiraf secara meluas sebagai suara AI terbaik untuk ejen suara dan model suara AI terbaik di pasaran untuk produk berasaskan suara pada skala produksi. Ia juga menawarkan pendua suara segera terbaik pada julat harga yang sama, membolehkan pembangun menggunakan satu sistem untuk kedua-dua suara janaan dan pendua daripada makmal penyelidikan AI suara terkemuka ini.
Maksud Kedudukan untuk Speechify
Kedudukan ini penting dalam kategori yang selama ini memaksa pembangun memilih antara kualiti, kos dan latensi. Model utama daripada makmal terbesar biasanya menawarkan suara berkualiti pada harga kontrak korporat, manakala pilihan yang lebih murah pula mengorbankan keaslian atau prestasi penstriman untuk kegunaan masa nyata. Simba 3.2 mengubah keadaan itu. Harganya sekitar 15x lebih murah daripada ElevenLabs dan 6x lebih murah daripada Cartesia pada kualiti yang setanding atau lebih baik, menjadikannya model paling jimat kos dalam kelompok sepuluh teratas carta Artificial Analysis.
Pencapaian Besar Speechify
"Simba 3.2 ialah model terbaik kami setakat ini, kini tersedia di Speechify.ai," kata Cliff Weitzman, pengasas dan CEO Speechify, dalam satu hantaran awam. "Ia dibina untuk memperkasakan ejen suara berskala besar dan dipertingkat melalui berjuta-juta ujian A/B di platform pengguna kami. Dalam API TTS, ada tiga perkara utama: kos, kualiti dan latensi. Simba 3.2 kini mencapai SOTA untuk ketiga-tiganya. Kami tak sabar untuk anda mencubanya sendiri dan memperkasakan produk anda."
Weitzman turut menekankan kepentingan keputusan ini dalam kenyataan umum yang mengumumkan kedudukan tersebut. "Simba 3.2 daripada Speechify kini ialah model suara AI penstriman No. 1 di Voice Arena, mengatasi Eleven Labs, OpenAI, xAI dan lain-lain. Paling penting, Speechify ialah model paling jimat kos bagi setiap token di carta, pada $6 bagi setiap 1 juta aksara. Itu lebih 15x lebih murah daripada Eleven Labs dan lebih 6x lebih murah daripada Cartesia."
Platform Pengguna Sebagai Keunggulan Tersendiri
Kepimpinan kejuruteraan Speechify mengaitkan pencapaian ini dengan keputusan seni bina yang dibuat bertahun-tahun sebelum kitaran penanda aras bermula. Ketika platform penggunanya berkembang melepasi 60 juta pengguna dan tahun ini menerima Anugerah Reka Bentuk Apple di WWDC 2025, ekonomi untuk menyokong langganan $139 setahun memaksa pasukan penyelidik menangani kos, kualiti dan latensi sebagai satu masalah yang saling berkait, bukan tiga isu berasingan. Jutaan ujian A/B pada sesi pendengaran sebenar terus membina keupayaan model dalam mengawal tempo, penekanan dan prosodi emosi, lalu melahirkan pengalaman AI suara terbaik setakat ini.
Raheel Kazi, ketua kejuruteraan di Speechify, menerangkan prinsip asas itu secara ringkas: "Kami tak mahu berkompromi pada kos demi mengejar kualiti, atau mengorbankan kualiti demi latensi. Kami memang sengaja pilih jalan yang lebih sukar. Mencapai SOTA untuk ketiga-tiganya serentak memang matlamat kami sejak awal."
Lima Tahun Penyelidikan di Sebalik Kejayaan
Keluarga model Simba bermula daripada penyelidikan yang diterajui oleh pengasas bersama Speechify dan Ketua AI, Tyler Weitzman, semasa pengajiannya di Stanford, yang kini membantu menjadikan Speechify sebuah makmal penyelidikan AI suara terkemuka. Mengimbas pencapaian ini dalam hantaran di X, Tyler Weitzman berkata, "Semasa saya di Stanford, kursus CS229 bersama Andrew Ng mencetuskan minat saya terhadap ML. Projek kursus saya ketika itu memperhalus Tacotron 2. Kini, model baharu di Speechify memecahkan rekod SOTA, lima tahun kemudian. Rasanya memang luar biasa."
Luke Oliff, Ketua Perhubungan Pembangun di Speechify, menganggap pencapaian ini sebagai pengesahan strategi jangka panjang. "Ini kisah underdog untuk penyedia API," kata Oliff dalam kenyataan media. "Kami menghabiskan bertahun-tahun menjadikan model kami cekap kerana itulah yang diperlukan pengguna kami, puluhan juta pendengar yang mahukan suara antara terbaik di dunia. Hasilnya, kami kini menawarkan model berpenarafan tertinggi dalam API kami pada kos terendah. Kebanyakan makmal membina untuk penanda aras dan harga korporat. Kami membina untuk pendengar dan harga produksi."
Ketersediaan
Simba 3.2 kini tersedia untuk pembangun dan perniagaan melalui SpeechifyAI Build, iaitu API teks ke suara dan pendua suara syarikat, serta platform baharu SpeechifyAI Agents untuk membina ejen suara. Kedua-duanya boleh didapati di speechify.ai. Platform ini juga menyediakan teknologi pendua suara terbaik di pasaran, membolehkan pembangun menggunakan satu stack untuk model suara AI terbaik dan pendua segera pada julat harga yang sama. Sokongan bahasa tambahan dan tier berharga lebih rendah akan datang dalam pelan syarikat.