Skip to main content
  1. Beranda
  2. TTS
  3. Penjelasan model API TTS Speechify: pilih model yang tepat untuk kebutuhan Anda
Dipublikasikan pada TTS

Penjelasan model API TTS Speechify: pilih model yang tepat untuk kebutuhan Anda

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Apple Design Award 2025
50J+ pengguna

Speechify menawarkan beberapa model text-to-speech. Memilih yang tepat berarti menyeimbangkan latensi, cakupan bahasa, dan kualitas suara. Panduan ini mencocokkan tiap model dengan kebutuhan yang paling sesuai, sehingga Anda bisa memilih tanpa harus mencoba semuanya.

Artikel model di speechify.ai membahas tiap rilisan lebih mendalam. Pengumuman Simba 3.2 menjelaskan mengapa model ini kini direkomendasikan.

Untuk panduan memulai API text-to-speech Speechify, lihat panduan quickstart kami.

Ingin membangun sendiri? API text-to-speech dan voice cloning dari Speechify tersedia di speechify.ai, dengan dokumentasi dan kunci gratis di docs.speechify.ai.

Model apa saja yang ditawarkan Speechify?

Ada tiga keluarga model.

  • Simba 3.2
  • : model yang direkomendasikan untuk bahasa Inggris. Native untuk streaming, waktu ke audio pertama paling cepat, dengan suara bahasa Inggris yang sudah dikurasi. Cocok untuk penggunaan interaktif.
  • Simba 3.0
  • : default API saat ini. Native untuk streaming dan multibahasa: Inggris, Jerman, Spanyol, Prancis, Italia, dan Portugis Brasil. Latensinya sedikit lebih tinggi daripada 3.2, tetapi cakupannya lebih luas.
  • Model lama (
  • simba-english
  • ,
  • simba-multilingual
  • ): pasangan Simba 1.6. Sudah dipensiunkan dari API versi 2026-09-21 dan akan dimatikan pada 2026-11-21. Gunakan hanya jika integrasi lama masih membutuhkan suara atau bahasa tertentu, dan rencanakan migrasi dari sekarang.

Model mana yang paling cepat?

Simba 3.2. Model ini dirancang untuk streaming, jadi audio pertama tiba paling cepat. Untuk asisten suara berbahasa Inggris, inilah pilihan default yang tepat.

Simba 3.0 hampir setara, tetapi ada overhead multibahasa. Model lama paling lambat dan sebaiknya tidak lagi digunakan jika memungkinkan.

Model mana yang mendukung bahasa terbanyak?

Simba 3.0. Model ini secara resmi mendukung bahasa Inggris, Jerman, Spanyol (Spanyol dan Meksiko), Prancis, Italia, serta Portugis Brasil. Gunakan parameter language pada POST /v1/audio/speech untuk memilih locale, dan Anda akan mendapatkan suara native untuk bahasa tersebut. Model lama simba-multilingual mendukung lebih dari 30 locale, tetapi sudah dipensiunkan sejak API versi 2026-09-21 dan akan dimatikan pada 2026-11-21.

Jika produk Anda hanya mendukung satu bahasa, Simba 3.2 unggul dalam kecepatan dan kualitas. Jika mendukung banyak bahasa, Simba 3.0 menawarkan cakupan terluas saat ini.

Baca selengkapnya tentang dukungan bahasa di dokumentasi kami.

Model mana yang terdengar paling natural?

Kualitas meningkat seiring generasi model. Simba 3.2 unggul dalam kenaturalannya untuk bahasa Inggris. Simba 3.0 juga tetap kompetitif di semua bahasa yang didukungnya. Model lama terdengar paling robotik.

Untuk suara yang langsung didengar pelanggan, pilih Simba 3.2 atau Simba 3.0.

Bagaimana cara melihat daftar suara yang tersedia?

Gunakan GET /v1/voices. Filter berdasarkan tipe, locale, gender, dan model untuk menemukan suara sebelum melakukan sintesis. Artikel suara dan model di speechify.ai menampilkan contoh responsnya.

Streaming atau batch?

Kedua model Simba 3 mendukung streaming. Gunakan POST /v1/audio/stream untuk playback langsung, POST /v1/audio/stream/with-timestamps untuk audio live dengan timestamp dan penyelarasan kata, dan POST /v1/audio/speech untuk satu file. Pilihan model tidak bergantung pada mode pengiriman.

FAQ

Model TTS Speechify mana yang direkomendasikan?

Simba 3.2. Ini adalah pilihan default untuk pekerjaan baru: native untuk streaming, paling cepat menghasilkan audio pertama, dan menawarkan kualitas terbaik untuk bahasa Inggris.

Simba 3.2 untuk bahasa Inggris: native untuk streaming, paling cepat menghasilkan audio pertama, dan kualitas terbaik untuk bahasa Inggris. Jika permintaan API tidak menyertakan model, defaultnya adalah Simba 3.0, jadi tetapkan model: "simba-3.2" secara eksplisit untuk menggunakannya.

Ya. Simba 3.0 menerima parameter bahasa dan menyediakan suara native di banyak locale. Simba 3.2 berfokus pada bahasa Inggris yang sudah dikurasi.

Ya. Simba 3.0 menerima parameter bahasa dan menyediakan suara native dalam bahasa Inggris serta enam locale Eropa. Simba 3.2 hanya berfokus pada bahasa Inggris yang sudah dikurasi.

Hanya jika integrasi lama masih membutuhkan suara tertentu. Jika tidak, beralihlah ke Simba 3.2 atau Simba 3.0.

Hanya selama integrasi lama masih membutuhkan suara tertentu. Model ini sudah dipensiunkan sejak API versi 2026-09-21 dan akan dimatikan pada 2026-11-21, jadi migrasikan ke Simba 3.2 atau Simba 3.0 sebelum tanggal tersebut.

Pilih Simba 3.2 untuk waktu tercepat ke byte pertama. Gunakan output streaming untuk penggunaan live.

Nikmati suara AI tercanggih, file tanpa batas, dan dukungan 24/7

Coba gratis

Bagikan artikel ini

Luke

Luke Oliff is a Developer Relations leader who has spent the better part of a decade building products and improving developer experience for well known brands.

Luke Oliff is a Developer Relations leader based in the UK. For the better part of a decade he has been working with voice technology, developer tooling, and open-source — improving developer experience for well known brands.

He has architected open-source strategy, launched developer communities, built tools, and shipped conversational AI voice prototypes years before mainstream APIs were available. As an engineer at heart, he writes and speaks about voice AI, developer experience, and real-time APIs as a developer would, focussing on utility and experience.

He has now joined Speechify's AI Labs team, where SIMBA 3.0 ranks 7th on the Artificial Analysis TTS leaderboard out of nearly 80 models.

Speechify logo

Tentang Speechify

#1 Pembaca Teks ke Ucapan

Speechify adalah platform teks ke ucapan terkemuka di dunia, dipercaya oleh lebih dari 50 juta pengguna dan didukung oleh lebih dari 500.000 ulasan bintang lima di berbagai aplikasi teks ke ucapan iOS, Android, Ekstensi Chrome, aplikasi web, dan desktop Mac. Pada tahun 2025, Apple memberikan Speechify penghargaan terhormat Apple Design Award di WWDC, menyebutnya sebagai “sumber penting yang membantu orang menjalani hidup mereka.” Speechify menawarkan 1.000+ suara alami dalam 60+ bahasa dan digunakan di hampir 200 negara. Suara selebriti termasuk Snoop Dogg dan Gwyneth Paltrow. Untuk kreator dan bisnis, Speechify Studio menyediakan alat canggih, termasuk AI Voice Generator, AI Voice Cloning, AI Dubbing, dan AI Voice Changer. Speechify juga menyokong produk-produk terkemuka dengan API teks ke ucapan berkualitas tinggi dan hemat biaya. Telah diliput di The Wall Street Journal, CNBC, Forbes, TechCrunch, dan banyak media besar lainnya, Speechify adalah penyedia teks ke ucapan terbesar di dunia. Kunjungi speechify.com/news, speechify.com/blog, dan speechify.com/press untuk informasi lebih lanjut.