Dua tolok ukur independen yang tidak dijalankan oleh Speechify mengukur waktu ke audio pertama model SpeechifyAI Simba 3.2 pada September 2026. Coval mencatat median 106 ms selama 24 jam hingga 24 Sep 2026. Voice Arena mencatat 123 ms di papan US English pada hari yang sama, median terendah dari 14 model yang diukur. Artikel ini menjelaskan apa yang diukur oleh angka-angka tersebut, mengapa waktu ke audio pertama adalah metrik latensi yang paling relevan untuk dibandingkan, dan cara mengukurnya lewat kode Anda sendiri.
Angka-angkanya
Dua pengukuran independen tersebut lebih tinggi daripada pengukuran internal kami sendiri karena turut menghitung latensi jaringan antara runner mereka dan server kami, serta jeda hening di awal audio. Setiap angka adalah hasil pembacaan tolok ukur pada tanggal tersebut. Kedua papan berjalan terus, jadi cek langsung untuk data terbaru.
Papan Voice Arena US English, 24 Sep 2026
Sumber: Voice Arena, dibaca pada 24 Sep 2026. Papan ini mencatat waktu 14 model; enam yang tercepat ditampilkan di sini.
Mengapa waktu ke audio pertama penting untuk dibandingkan
Saat agen suara membalas atau aplikasi membacakan teks, pendengar menunggu sejak teks dikirim hingga suara mulai terdengar. Waktu tunggu itulah yang disebut waktu ke audio pertama.
- Time to first byte bisa terlihat lebih baik daripada yang benar-benar didengar pendengar.
- Streaming bisa dimulai dengan hening, sehingga pendengar belum mendengar apa pun sampai sampel audio pertama diputar. Waktu ke audio pertama menghitung jeda hening tersebut.
- Total generation time adalah waktu tunggu sampai byte terakhir.
- Ini penting saat menyimpan file, bukan ketika seseorang mendengarkan lewat streaming.
- Percakapan membutuhkan respons cepat.
- Orang biasanya merespons dalam hitungan beberapa ratus milidetik. Agen suara harus menuntaskan pengenalan ucapan, model bahasa, dan sintesis suara dalam jeda itu, jadi setiap milidetik memengaruhi sisa pipeline.
Bagaimana Simba 3.2 menjadi lebih cepat tanpa mengecilkan model
Menurut data Coval, median harian Simba 3.2 turun dari 379 ms pada 13 Sep 2026 menjadi 116 ms pada 18 Sep 2026, turun sekitar 70% hanya dalam lima hari.
Modelnya tidak berubah. Bobot tetap sama, tanpa distillation, tanpa quantization, dan tanpa varian "turbo". Percepatan berasal dari jalur serving di sekitar model:
- Build serving baru pada kelas GPU yang berbeda, dengan optimasi pada stack inferensi untuk mempercepat keluaran audio.
- Pengecekan paket, entitlement, dan rate limit menggunakan cache, bukan lookup live sebelum byte pertama dikirim.
- API gateway berjalan di region yang sama dengan GPU, dengan koneksi yang tetap aktif antarpermintaan.
- Sekitar 100 ms jeda hening di awal kini hilang. Pengukuran leading silence Coval untuk Simba 3.2 turun dari 102 ms (14 Sep) menjadi 13 ms.
Kualitas tetap terjaga. Di Artificial Analysis text-to-speech leaderboard, Simba 3.2 meraih Elo 1.237 (±14) pada 23 Sep 2026, masuk lima besar dari 92 suara provider, dan semua model di atasnya berbiaya lebih mahal.
Cara mendapatkan latensi terendah untuk aplikasi Anda
- Gunakan streaming.
- Panggil
- POST /v1/audio/stream
- untuk audio yang bisa diputar sambil dibuat.
- POST /v1/audio/speech
- baru merespons setelah klip selesai dibuat.
- Pilih Simba 3.2.
- Setel
- model
- ke
- simba-3.2
- untuk bahasa Inggris. Jika
- model
- tidak diisi, API akan memakai
- simba-3.0
- .
- Gunakan satu koneksi HTTP.
- Buat satu klien HTTP, buka koneksi saat startup, lalu gunakan untuk semua permintaan agar tidak perlu DNS lookup maupun handshake TCP/TLS setiap kali.
- Kirim per kalimat begitu tersedia.
- Jika Anda memakai model bahasa di depan, kirim setiap kalimat lengkap segera setelah siap, lalu putar streaming-nya secara berurutan.
- Pilih format yang dibutuhkan pemutar Anda.
- audio/pcm
- pada 24 kHz tidak memerlukan encoding. Gunakan MP3 atau Ogg Opus jika bandwidth lebih penting.
- Jalankan sedekat mungkin dengan API.
- API dilayani dari US East, jadi server di dalam atau sekitar US East akan lebih cepat dari sisi jaringan.
Membangun di atas LiveKit Agents? Panduan ini menunjukkan cara membangun agen suara dengan plugin Speechify yang men-stream tiap kalimat begitu model bahasa menghasilkan output. Penjelasan tiap langkah dan kodenya ada di dokumentasi latensi.
Ukur sendiri
Waktu chunk pertama dari respons streaming diukur dari lokasi tempat kode Anda dijalankan. Agar hasilnya adil:
- Abaikan satu atau dua permintaan pertama; biasanya itu mencakup waktu pembukaan koneksi.
- Gunakan variasi teks antarpermintaan agar sesuai dengan lalu lintas sebenarnya.
- Kirim permintaan satu per satu, bukan secara paralel.
- Ambil setidaknya 20 permintaan, lalu laporkan nilai median (p50) dan p90, bukan rata-rata atau hanya percobaan terbaik.
- Ukur dengan PCM. Pada Ogg, byte pertama berisi header, bukan audio.
Setiap respons streaming menyertakan header Server-Timing dengan nilai ttfb sebagai bagian waktu tunggu dari sisi kami; sisanya berasal dari jaringan dan stack Anda sendiri. Dokumentasi latensi berisi skrip Python dan TypeScript untuk keperluan ini.
Pertanyaan yang sering diajukan
Model Simba 3.2 dari SpeechifyAI menulis byte audio pertamanya dalam 56 ms (median) dan 102 ms (p90) pada lalu lintas produksi di US East per 15 Sep 2026. Tolok ukur independen mencatat median 106 ms (Coval, 24 jam hingga 24 Sep 2026) dan 123 ms (Voice Arena, 24 Sep 2026), termasuk latensi jaringan mereka dan jeda hening di awal audio.
Di papan Voice Arena US English (24 Sep 2026), Simba 3.2 dari SpeechifyAI mencatat median waktu ke audio pertama terendah dari 14 model, yaitu 123 ms, unggul atas Inworld Realtime TTS 2 Research Preview di 168,5 ms. Tolok ukur ini terus diperbarui, jadi cek tanggal ranking terbaru sebelum menggunakannya.
Ya. POST /v1/audio/stream mengirimkan audio lewat HTTP seiring proses pembuatannya, baik dalam format PCM, MP3, Ogg Opus, maupun AAC. PCM memiliki latensi terendah karena tidak memerlukan encoding.
Tidak. SpeechifyAI adalah API developer milik Speechify yang ditagihkan terpisah dari aplikasi pembaca Speechify, dan langganan Reader tidak mencakup penggunaan API. Paket API ditagih bulanan tanpa komitmen tahunan: paket gratis 500.000 karakter/bulan tanpa kartu, lalu Starter seharga $10/bulan (tambahan $10/1M karakter), Pro $99/bulan ($8/1M karakter), dan Scale $499/bulan ($6/1M karakter).
Coba Simba 3.2 di SpeechifyAI: buat API key gratis dan bandingkan waktu permintaan pertama Anda dengan angka-angka di atas.

