Dua penanda aras yang tidak dijalankan oleh Speechify mengukur masa ke audio pertama untuk model SpeechifyAI Simba 3.2 pada September 2026. Coval merekodkan median 106 ms sepanjang tempoh 24 jam hingga 24 Sep 2026. Voice Arena pula merekodkan 123 ms di papan US English pada hari yang sama, iaitu median terendah daripada 14 model yang diuji. Artikel ini menerangkan apa yang diukur, mengapa masa ke audio pertama ialah angka kelewatan yang paling wajar untuk dibandingkan, serta cara mengukurnya terus daripada kod anda sendiri.
Angka-angka ini
Dua bacaan bebas ini lebih tinggi daripada ukuran dalaman kami kerana ia mengambil kira rangkaian antara pelayan ujian dengan pelayan kami, serta sebarang senyap pada permulaan audio. Setiap satu ialah bacaan penanda aras pada tarikh tersebut. Kedua-dua papan penanda aras ini sentiasa dikemas kini — semak terus di sana untuk keputusan terkini.
Papan US English Voice Arena, 24 Sep 2026
Sumber: Voice Arena, dirujuk pada 24 Sep 2026. Papan ini menguji 14 model; enam model terpantas dipaparkan di sini.
Mengapa masa ke audio pertama ialah angka yang wajar dibandingkan
Apabila ejen suara membalas atau aplikasi membacakan teks, pengguna menunggu dari saat teks dihantar sehinggalah mereka mendengar audio. Tempoh inilah yang dipanggil masa ke audio pertama.
- Masa ke bait pertama boleh nampak lebih pantas daripada pengalaman sebenar pengguna.
- Penstriman boleh bermula dengan senyap, dan pengguna tidak mendengar apa-apa sehingga sampel audio pertama tiba. Masa ke audio pertama turut mengambil kira bahagian senyap itu.
- Masa penjanaan penuh ialah tempoh menunggu hingga bait terakhir.
- Ini hanya penting jika anda menyimpan fail, bukan apabila orang mendengar audio yang sedang distrim.
- Perbualan mempunyai ruang masa yang sangat singkat.
- Biasanya seseorang menjawab dalam beberapa ratus milisaat. Ejen suara perlu menjalankan pengecaman suara, model bahasa dan sintesis dalam sela masa ini, jadi setiap milisaat yang digunakan untuk suara akan mengurangkan ruang untuk komponen lain.
Bagaimana Simba 3.2 menjadi lebih pantas tanpa model yang lebih kecil
Dalam data Coval, median harian Simba 3.2 turun daripada 379 ms pada 13 Sep 2026 kepada 116 ms pada 18 Sep 2026, iaitu penurunan kira-kira 70% dalam tempoh lima hari.
Model tidak diubah. Parameter asal dikekalkan, tanpa penyulingan, kuantisasi atau varian "turbo" yang dipotong. Peningkatan kelajuan datang daripada laluan penyampaian model:
- Binaan penyampaian baharu pada kelas GPU yang berbeza, dengan pengoptimuman peringkat rendah dalam tindanan inferens supaya audio boleh dihantar lebih awal.
- Semakan langganan, hak akses dan kadar kini diselesaikan melalui cache, bukan carian masa nyata sebelum bait pertama dihantar.
- Gerbang API dijalankan dalam rantau yang sama dengan GPU, dengan sambungan yang sentiasa aktif antara permintaan.
- Kira-kira 100 ms senyap di awal audio kini sudah tiada. Ukuran bahagian senyap Coval untuk Simba 3.2 turun daripada 102 ms (14 Sep) kepada 13 ms.
Kualitinya kekal tinggi. Di Artificial Analysis text-to-speech leaderboard, Simba 3.2 mencatat Elo 1,237 (±14) pada 23 Sep 2026, tersenarai dalam lima teratas daripada 92 suara merentas pelbagai penyedia; semua model yang mendapat skor lebih tinggi adalah lebih mahal.
Cara mendapatkan kelewatan paling rendah dalam aplikasi anda
- Strim audio.
- Guna
- POST /v1/audio/stream
- untuk audio yang dimainkan sambil dijana.
- POST /v1/audio/speech
- hanya memberi respons selepas keseluruhan klip selesai dijana.
- Pilih Simba 3.2.
- Tetapkan
- model
- kepada
- simba-3.2
- untuk Bahasa Inggeris. Jika
- model
- tidak dinyatakan, API akan menggunakan
- simba-3.0
- .
- Guna semula satu sambungan.
- Cipta satu klien HTTP, buka sambungan ketika aplikasi dimulakan dan kekalkannya untuk semua permintaan, supaya anda tidak perlu melakukan carian DNS serta urusan TCP dan TLS setiap kali.
- Hantar ayat sebaik sahaja tersedia.
- Jika ada model bahasa di hadapan, hantar setiap ayat penuh sebaik sahaja ia terbentuk dan mainkan strim mengikut turutan.
- Pilih format mengikut pemain anda.
- audio/pcm
- pada 24 kHz tidak memerlukan pengekodan semula. Guna MP3 atau Ogg Opus jika keutamaan anda ialah lebar jalur.
- Jalankan berhampiran API.
- API beroperasi dari US East, jadi pelayan yang paling hampir dengan rantau itu akan meminimumkan masa rangkaian.
Mahukan projek yang dibina dengan LiveKit Agents? Panduan ini menunjukkan cara membina ejen suara dengan plugin Speechify, yang menstrim setiap ayat sebaik sahaja ditulis oleh model bahasa. Rasional di sebalik setiap langkah berserta kodnya tersedia dalam dokumentasi kelewatan.
Ukur sendiri
Ukur masa untuk ketibaan chunk pertama respons penstriman dari lokasi tempat kod anda berjalan. Untuk mendapatkan angka yang adil:
- Abaikan satu atau dua permintaan pertama. Permintaan ini termasuk masa untuk membuka sambungan.
- Ubah teks antara permintaan, seperti trafik sebenar anda.
- Hantar permintaan secara bersiri, bukan serentak.
- Ambil sekurang-kurangnya 20 permintaan dan laporkan median (p50) serta p90, bukan purata atau satu catatan terbaik sahaja.
- Ukur dengan PCM. Untuk Ogg, bait pertama ialah pengepala, bukan audio.
Setiap respons penstriman membawa pengepala Server-Timing dengan nilai ttfb yang menunjukkan bahagian masa menunggu di pihak kami, jadi selebihnya datang daripada rangkaian dan sistem anda sendiri. Dokumentasi kelewatan mengandungi skrip Python dan TypeScript untuk tujuan ini.
Soalan lazim
Model SpeechifyAI Simba 3.2 menulis bait audio pertama dalam median 56 ms, dan 102 ms untuk p90, pada trafik produksi di US East pada 15 Sep 2026. Penanda aras bebas pula merekodkan masa median ke audio pertama sebanyak 106 ms (Coval, 24 jam hingga 24 Sep 2026) dan 123 ms (Voice Arena, 24 Sep 2026), termasuk rangkaian serta sebarang senyap pada awal audio.
Di papan US English Voice Arena pada 24 Sep 2026, SpeechifyAI Simba 3.2 mencatat median masa ke audio pertama terendah antara 14 model yang diuji: 123 ms, mengatasi Inworld Realtime TTS 2 Research Preview pada 168.5 ms. Penanda aras ini sentiasa dikemas kini, jadi semak tarikh ranking sebelum anda bergantung padanya.
Ya. POST /v1/audio/stream menghantar audio melalui HTTP sebaik sahaja ia dijana, dalam format PCM, MP3, Ogg Opus atau AAC. PCM mempunyai kelewatan paling rendah kerana tidak memerlukan pengekodan tambahan.
Tidak. SpeechifyAI ialah API pembangun milik Speechify, dan dibilkan berasingan daripada aplikasi pembaca Speechify. Langganan Reader tidak meliputi penggunaan API. Pelan API ditawarkan secara bulanan tanpa komitmen tahunan: pelan percuma dengan 500,000 aksara sebulan tanpa kad, Starter pada $10 sebulan dengan tambahan $10 bagi setiap 1M aksara, Pro $99 dengan $8, dan Scale $499 dengan $6.
Cuba Simba 3.2 di SpeechifyAI: cipta kunci API percuma dan bandingkan masa permintaan pertama anda dengan angka di atas.

