Speechify menawarkan pilihan model text-to-speech (TTS) yang ringkas. Menentukan model yang tepat berarti menyeimbangkan latensi, cakupan bahasa, dan kualitas suara. Panduan ini memetakan tiap model ke kebutuhan yang sesuai, sehingga Anda bisa memilih tanpa harus mencoba semuanya.
Setiap perilisan model dibahas lebih mendalam di speechify.ai. Pengumuman Simba 3.2 menjelaskan mengapa model ini kini menjadi rekomendasi utama.
Untuk mulai menggunakan API text-to-speech Speechify, lihat panduan cepat kami.
Model apa saja yang ditawarkan Speechify?
Dua model utama, ditambah dua model lama yang akan dihentikan.
- Simba 3.2
- : model yang direkomendasikan untuk bahasa Inggris. Mendukung streaming, waktu ke byte pertama paling cepat, dan pilihan suara bahasa Inggris yang terkurasi. Ideal untuk penggunaan interaktif.
- Simba 3.0
- : default API saat ini. Mendukung streaming dan bersifat multibahasa: Inggris, Jerman, Spanyol, Prancis, Italia, serta Portugis Brasil. Latensinya sedikit lebih tinggi daripada 3.2, tetapi mendukung lebih banyak bahasa.
- Model lama (
- simba-english
- ,
- simba-multilingual
- ): pasangan Simba 1.6. Tidak lagi didukung mulai API versi 2026-09-21 dan dinonaktifkan pada 2026-11-21. Gunakan hanya jika integrasi lama Anda masih memerlukan suara atau bahasa tertentu, dan rencanakan migrasi dari sekarang.
Model mana yang paling cepat?
Simba 3.2. Model ini dirancang khusus untuk streaming, sehingga audio pertama diputar paling cepat. Untuk voice agent berbahasa Inggris, inilah pilihan default yang paling tepat.
Simba 3.0 hampir setara, tetapi membawa overhead untuk dukungan multibahasa. Model lama adalah yang paling lambat dan sebaiknya diganti jika memungkinkan.
Model mana yang mendukung bahasa paling banyak?
Simba 3.0. Secara resmi mendukung bahasa Inggris, Jerman, Spanyol (Spanyol dan Meksiko), Prancis, Italia, dan Portugis Brasil. Tambahkan parameter language pada POST /v1/audio/speech untuk memilih locale, lalu Anda akan mendapatkan suara native di tiap bahasa. Model lama simba-multilingual mendukung lebih dari 30 bahasa, tetapi dihentikan mulai API versi 2026-09-21 dan dinonaktifkan pada 2026-11-21.
Jika produk Anda hanya menggunakan satu bahasa, Simba 3.2 unggul dalam kecepatan dan kualitas. Jika Anda mendukung beberapa bahasa, Simba 3.0 saat ini menjadi pilihan dengan cakupan terbaik.
Baca selengkapnya tentang dukungan bahasa di dokumentasi kami.
Model mana yang terdengar paling alami?
Kualitas suara mengikuti generasi modelnya. Simba 3.2 unggul dalam kealamian suara bahasa Inggris. Simba 3.0 memberikan kualitas yang baik di semua bahasa yang didukungnya. Model lama paling kaku dan terdengar paling mekanis.
Untuk suara yang digunakan langsung ke pelanggan, prioritaskan Simba 3.2 atau Simba 3.0.
Bagaimana cara melihat semua suara yang tersedia?
Gunakan GET /v1/voices. Filter berdasarkan tipe, bahasa, gender, dan model untuk menemukan suara yang sesuai sebelum melakukan sintesis. Artikel tentang suara dan model di speechify.ai juga menampilkan bentuk responsnya.
Streaming atau batch?
Kedua model Simba 3 mendukung streaming. Gunakan POST /v1/audio/stream untuk pemutaran langsung, POST /v1/audio/stream/with-timestamps untuk audio langsung beserta penanda waktu per kata, dan POST /v1/audio/speech untuk menghasilkan satu file audio. Pilihan model tidak bergantung pada metode pengirimannya.
FAQ
Model TTS Speechify mana yang direkomendasikan?
Simba 3.2. Ini adalah pilihan default untuk proyek baru: mendukung streaming, menghasilkan audio paling cepat, dan memberi kualitas terbaik untuk bahasa Inggris.
Model mana yang menjadi default API?
Simba 3.0. Jika permintaan tidak menetapkan model, API akan menggunakan Simba 3.0. Tetapkan model: "simba-3.2" secara eksplisit untuk memakai 3.2 dalam bahasa Inggris.
Apakah Speechify TTS mendukung banyak bahasa?
Ya. Simba 3.0 menerima parameter language dan menghasilkan suara native untuk Inggris, Jerman, Spanyol (Spanyol dan Meksiko), Prancis, Italia, serta Portugis Brasil. Simba 3.2 berfokus pada pilihan suara bahasa Inggris yang terkurasi.
Haruskah saya tetap memakai model lama?
Hanya jika integrasi yang Anda miliki saat ini memang bergantung pada suara versi lama tertentu. simba-english dan simba-multilingual dihentikan mulai API versi 2026-09-21 dan dinonaktifkan pada 2026-11-21, jadi migrasikan ke Simba 3.2 atau Simba 3.0 sebelum tenggat tersebut.
Model mana yang sebaiknya digunakan untuk voice agent?
Pilih Simba 3.2 untuk waktu ke byte pertama yang paling cepat, lalu gunakan streaming output untuk kebutuhan real-time.

