Speechify menawarkan beberapa model text-to-speech. Memilih yang tepat berarti menyeimbangkan latensi, cakupan bahasa, dan kualitas suara. Panduan ini mencocokkan tiap model dengan kebutuhan yang paling sesuai, sehingga Anda bisa memilih tanpa harus mencoba semuanya.
Artikel model di speechify.ai membahas tiap rilisan lebih mendalam. Pengumuman Simba 3.2 menjelaskan mengapa model ini kini direkomendasikan.
Untuk panduan memulai API text-to-speech Speechify, lihat panduan quickstart kami.
Ingin membangun sendiri? API text-to-speech dan voice cloning dari Speechify tersedia di speechify.ai, dengan dokumentasi dan kunci gratis di docs.speechify.ai.
Model apa saja yang ditawarkan Speechify?
Ada tiga keluarga model.
- Simba 3.2
- : model yang direkomendasikan untuk bahasa Inggris. Native untuk streaming, waktu ke audio pertama paling cepat, dengan suara bahasa Inggris yang sudah dikurasi. Cocok untuk penggunaan interaktif.
- Simba 3.0
- : default API saat ini. Native untuk streaming dan multibahasa: Inggris, Jerman, Spanyol, Prancis, Italia, dan Portugis Brasil. Latensinya sedikit lebih tinggi daripada 3.2, tetapi cakupannya lebih luas.
- Model lama (
- simba-english
- ,
- simba-multilingual
- ): pasangan Simba 1.6. Sudah dipensiunkan dari API versi 2026-09-21 dan akan dimatikan pada 2026-11-21. Gunakan hanya jika integrasi lama masih membutuhkan suara atau bahasa tertentu, dan rencanakan migrasi dari sekarang.
Model mana yang paling cepat?
Simba 3.2. Model ini dirancang untuk streaming, jadi audio pertama tiba paling cepat. Untuk asisten suara berbahasa Inggris, inilah pilihan default yang tepat.
Simba 3.0 hampir setara, tetapi ada overhead multibahasa. Model lama paling lambat dan sebaiknya tidak lagi digunakan jika memungkinkan.
Model mana yang mendukung bahasa terbanyak?
Simba 3.0. Model ini secara resmi mendukung bahasa Inggris, Jerman, Spanyol (Spanyol dan Meksiko), Prancis, Italia, serta Portugis Brasil. Gunakan parameter language pada POST /v1/audio/speech untuk memilih locale, dan Anda akan mendapatkan suara native untuk bahasa tersebut. Model lama simba-multilingual mendukung lebih dari 30 locale, tetapi sudah dipensiunkan sejak API versi 2026-09-21 dan akan dimatikan pada 2026-11-21.
Jika produk Anda hanya mendukung satu bahasa, Simba 3.2 unggul dalam kecepatan dan kualitas. Jika mendukung banyak bahasa, Simba 3.0 menawarkan cakupan terluas saat ini.
Baca selengkapnya tentang dukungan bahasa di dokumentasi kami.
Model mana yang terdengar paling natural?
Kualitas meningkat seiring generasi model. Simba 3.2 unggul dalam kenaturalannya untuk bahasa Inggris. Simba 3.0 juga tetap kompetitif di semua bahasa yang didukungnya. Model lama terdengar paling robotik.
Untuk suara yang langsung didengar pelanggan, pilih Simba 3.2 atau Simba 3.0.
Bagaimana cara melihat daftar suara yang tersedia?
Gunakan GET /v1/voices. Filter berdasarkan tipe, locale, gender, dan model untuk menemukan suara sebelum melakukan sintesis. Artikel suara dan model di speechify.ai menampilkan contoh responsnya.
Streaming atau batch?
Kedua model Simba 3 mendukung streaming. Gunakan POST /v1/audio/stream untuk playback langsung, POST /v1/audio/stream/with-timestamps untuk audio live dengan timestamp dan penyelarasan kata, dan POST /v1/audio/speech untuk satu file. Pilihan model tidak bergantung pada mode pengiriman.
FAQ
Model TTS Speechify mana yang direkomendasikan?
Simba 3.2. Ini adalah pilihan default untuk pekerjaan baru: native untuk streaming, paling cepat menghasilkan audio pertama, dan menawarkan kualitas terbaik untuk bahasa Inggris.
Simba 3.2 untuk bahasa Inggris: native untuk streaming, paling cepat menghasilkan audio pertama, dan kualitas terbaik untuk bahasa Inggris. Jika permintaan API tidak menyertakan model, defaultnya adalah Simba 3.0, jadi tetapkan model: "simba-3.2" secara eksplisit untuk menggunakannya.
Ya. Simba 3.0 menerima parameter bahasa dan menyediakan suara native di banyak locale. Simba 3.2 berfokus pada bahasa Inggris yang sudah dikurasi.
Ya. Simba 3.0 menerima parameter bahasa dan menyediakan suara native dalam bahasa Inggris serta enam locale Eropa. Simba 3.2 hanya berfokus pada bahasa Inggris yang sudah dikurasi.
Hanya jika integrasi lama masih membutuhkan suara tertentu. Jika tidak, beralihlah ke Simba 3.2 atau Simba 3.0.
Hanya selama integrasi lama masih membutuhkan suara tertentu. Model ini sudah dipensiunkan sejak API versi 2026-09-21 dan akan dimatikan pada 2026-11-21, jadi migrasikan ke Simba 3.2 atau Simba 3.0 sebelum tanggal tersebut.
Pilih Simba 3.2 untuk waktu tercepat ke byte pertama. Gunakan output streaming untuk penggunaan live.

