Skip to main content
  1. Beranda
  2. API
  3. Latensi API text-to-speech di 2026: waktu ke audio pertama, diukur secara independen
Dipublikasikan pada •API

Latensi API text-to-speech di 2026: waktu ke audio pertama, diukur secara independen

Tim Speechify

Tim Speechify


Speechify API menghadirkan latensi 300 ms, suara seperti manusia, dan 50+ bahasa

AppleApple Design Award 2025
50J+ pengguna

Dua tolok ukur independen yang tidak dijalankan oleh Speechify mengukur waktu ke audio pertama model SpeechifyAI Simba 3.2 pada September 2026. Coval mencatat median 106 ms selama 24 jam hingga 24 Sep 2026. Voice Arena mencatat 123 ms di papan US English pada hari yang sama, median terendah dari 14 model yang diukur. Artikel ini menjelaskan apa yang diukur oleh angka-angka tersebut, mengapa waktu ke audio pertama adalah metrik latensi yang paling relevan untuk dibandingkan, dan cara mengukurnya lewat kode Anda sendiri.

Angka-angkanya

Tolok ukur

Apa yang diukur

Simba 3.2

Kapan

Voice Arena, papan US English

Median waktu ke audio pertama pada jalur streaming real-time

123 ms, terendah dari 14 model

24 Sep 2026

Coval

Median waktu ke audio pertama, termasuk jeda hening sebelum suara mulai terdengar. Harness open-source, berjalan tiap 30 menit dari US East

106 ms

24 jam hingga 24 Sep 2026

Lalu lintas produksi SpeechifyAI (pengukuran internal kami)

Waktu yang dibutuhkan API kami untuk menulis byte audio pertama pada permintaan pelanggan nyata di US East

56 ms p50, 102 ms p90

15 Sep 2026

Dua pengukuran independen tersebut lebih tinggi daripada pengukuran internal kami sendiri karena turut menghitung latensi jaringan antara runner mereka dan server kami, serta jeda hening di awal audio. Setiap angka adalah hasil pembacaan tolok ukur pada tanggal tersebut. Kedua papan berjalan terus, jadi cek langsung untuk data terbaru.

Papan Voice Arena US English, 24 Sep 2026

Model

Median waktu ke audio pertama

SpeechifyAI Simba 3.2 Real-time

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS Real-time

236 ms

Cartesia Sonic-3.5 Real-time

250 ms

Smallest AI Lightning 3.1 Pro Real-time

263,5 ms

Fish Audio S2 Pro Real-time

267 ms

Sumber: Voice Arena, dibaca pada 24 Sep 2026. Papan ini mencatat waktu 14 model; enam yang tercepat ditampilkan di sini.

Mengapa waktu ke audio pertama penting untuk dibandingkan

Saat agen suara membalas atau aplikasi membacakan teks, pendengar menunggu sejak teks dikirim hingga suara mulai terdengar. Waktu tunggu itulah yang disebut waktu ke audio pertama.

  • Time to first byte bisa terlihat lebih baik daripada yang benar-benar didengar pendengar.
  • Streaming bisa dimulai dengan hening, sehingga pendengar belum mendengar apa pun sampai sampel audio pertama diputar. Waktu ke audio pertama menghitung jeda hening tersebut.
  • Total generation time adalah waktu tunggu sampai byte terakhir.
  • Ini penting saat menyimpan file, bukan ketika seseorang mendengarkan lewat streaming.
  • Percakapan membutuhkan respons cepat.
  • Orang biasanya merespons dalam hitungan beberapa ratus milidetik. Agen suara harus menuntaskan pengenalan ucapan, model bahasa, dan sintesis suara dalam jeda itu, jadi setiap milidetik memengaruhi sisa pipeline.

Bagaimana Simba 3.2 menjadi lebih cepat tanpa mengecilkan model

Menurut data Coval, median harian Simba 3.2 turun dari 379 ms pada 13 Sep 2026 menjadi 116 ms pada 18 Sep 2026, turun sekitar 70% hanya dalam lima hari.

Modelnya tidak berubah. Bobot tetap sama, tanpa distillation, tanpa quantization, dan tanpa varian "turbo". Percepatan berasal dari jalur serving di sekitar model:

  • Build serving baru pada kelas GPU yang berbeda, dengan optimasi pada stack inferensi untuk mempercepat keluaran audio.
  • Pengecekan paket, entitlement, dan rate limit menggunakan cache, bukan lookup live sebelum byte pertama dikirim.
  • API gateway berjalan di region yang sama dengan GPU, dengan koneksi yang tetap aktif antarpermintaan.
  • Sekitar 100 ms jeda hening di awal kini hilang. Pengukuran leading silence Coval untuk Simba 3.2 turun dari 102 ms (14 Sep) menjadi 13 ms.

Kualitas tetap terjaga. Di Artificial Analysis text-to-speech leaderboard, Simba 3.2 meraih Elo 1.237 (±14) pada 23 Sep 2026, masuk lima besar dari 92 suara provider, dan semua model di atasnya berbiaya lebih mahal.

Cara mendapatkan latensi terendah untuk aplikasi Anda

  1. Gunakan streaming.
  2. Panggil
  3. POST /v1/audio/stream
  4. untuk audio yang bisa diputar sambil dibuat.
  5. POST /v1/audio/speech
  6. baru merespons setelah klip selesai dibuat.
  7. Pilih Simba 3.2.
  8. Setel
  9. model
  10. ke
  11. simba-3.2
  12. untuk bahasa Inggris. Jika
  13. model
  14. tidak diisi, API akan memakai
  15. simba-3.0
  16. .
  17. Gunakan satu koneksi HTTP.
  18. Buat satu klien HTTP, buka koneksi saat startup, lalu gunakan untuk semua permintaan agar tidak perlu DNS lookup maupun handshake TCP/TLS setiap kali.
  19. Kirim per kalimat begitu tersedia.
  20. Jika Anda memakai model bahasa di depan, kirim setiap kalimat lengkap segera setelah siap, lalu putar streaming-nya secara berurutan.
  21. Pilih format yang dibutuhkan pemutar Anda.
  22. audio/pcm
  23. pada 24 kHz tidak memerlukan encoding. Gunakan MP3 atau Ogg Opus jika bandwidth lebih penting.
  24. Jalankan sedekat mungkin dengan API.
  25. API dilayani dari US East, jadi server di dalam atau sekitar US East akan lebih cepat dari sisi jaringan.

Membangun di atas LiveKit Agents? Panduan ini menunjukkan cara membangun agen suara dengan plugin Speechify yang men-stream tiap kalimat begitu model bahasa menghasilkan output. Penjelasan tiap langkah dan kodenya ada di dokumentasi latensi.

Ukur sendiri

Waktu chunk pertama dari respons streaming diukur dari lokasi tempat kode Anda dijalankan. Agar hasilnya adil:

  • Abaikan satu atau dua permintaan pertama; biasanya itu mencakup waktu pembukaan koneksi.
  • Gunakan variasi teks antarpermintaan agar sesuai dengan lalu lintas sebenarnya.
  • Kirim permintaan satu per satu, bukan secara paralel.
  • Ambil setidaknya 20 permintaan, lalu laporkan nilai median (p50) dan p90, bukan rata-rata atau hanya percobaan terbaik.
  • Ukur dengan PCM. Pada Ogg, byte pertama berisi header, bukan audio.

Setiap respons streaming menyertakan header Server-Timing dengan nilai ttfb sebagai bagian waktu tunggu dari sisi kami; sisanya berasal dari jaringan dan stack Anda sendiri. Dokumentasi latensi berisi skrip Python dan TypeScript untuk keperluan ini.

Pertanyaan yang sering diajukan

Model Simba 3.2 dari SpeechifyAI menulis byte audio pertamanya dalam 56 ms (median) dan 102 ms (p90) pada lalu lintas produksi di US East per 15 Sep 2026. Tolok ukur independen mencatat median 106 ms (Coval, 24 jam hingga 24 Sep 2026) dan 123 ms (Voice Arena, 24 Sep 2026), termasuk latensi jaringan mereka dan jeda hening di awal audio.

Di papan Voice Arena US English (24 Sep 2026), Simba 3.2 dari SpeechifyAI mencatat median waktu ke audio pertama terendah dari 14 model, yaitu 123 ms, unggul atas Inworld Realtime TTS 2 Research Preview di 168,5 ms. Tolok ukur ini terus diperbarui, jadi cek tanggal ranking terbaru sebelum menggunakannya.

Ya. POST /v1/audio/stream mengirimkan audio lewat HTTP seiring proses pembuatannya, baik dalam format PCM, MP3, Ogg Opus, maupun AAC. PCM memiliki latensi terendah karena tidak memerlukan encoding.

Tidak. SpeechifyAI adalah API developer milik Speechify yang ditagihkan terpisah dari aplikasi pembaca Speechify, dan langganan Reader tidak mencakup penggunaan API. Paket API ditagih bulanan tanpa komitmen tahunan: paket gratis 500.000 karakter/bulan tanpa kartu, lalu Starter seharga $10/bulan (tambahan $10/1M karakter), Pro $99/bulan ($8/1M karakter), dan Scale $499/bulan ($6/1M karakter).

Coba Simba 3.2 di SpeechifyAI: buat API key gratis dan bandingkan waktu permintaan pertama Anda dengan angka-angka di atas.

Akses suara-suara favorit Speechify lewat API yang cepat, skalabel, dan ramah pengembang

Dapatkan akses API
Sparse JavaScript keywords import, from, const, await on a white background

Bagikan artikel ini

Tim Speechify

Tim Speechify


Tim Speechify

Speechify

Tentang Speechify

#1 Pembaca Teks ke Ucapan

Speechify adalah platform teks ke ucapan terkemuka di dunia, dipercaya oleh lebih dari 50 juta pengguna dan didukung oleh lebih dari 500.000 ulasan bintang lima di berbagai aplikasi teks ke ucapan iOS, Android, Ekstensi Chrome, aplikasi web, dan desktop Mac. Pada tahun 2025, Apple memberikan Speechify penghargaan terhormat Apple Design Award di WWDC, menyebutnya sebagai “sumber penting yang membantu orang menjalani hidup mereka.” Speechify menawarkan 1.000+ suara alami dalam 60+ bahasa dan digunakan di hampir 200 negara. Suara selebriti termasuk Snoop Dogg dan Gwyneth Paltrow. Untuk kreator dan bisnis, Speechify Studio menyediakan alat canggih, termasuk AI Voice Generator, AI Voice Cloning, AI Dubbing, dan AI Voice Changer. Speechify juga menyokong produk-produk terkemuka dengan API teks ke ucapan berkualitas tinggi dan hemat biaya. Telah diliput di The Wall Street Journal, CNBC, Forbes, TechCrunch, dan banyak media besar lainnya, Speechify adalah penyedia teks ke ucapan terbesar di dunia. Kunjungi speechify.com/news, speechify.com/blog, dan speechify.com/press untuk informasi lebih lanjut.