Skip to main content
  1. Laman Utama
  2. API
  3. Bagaimana API Teks ke Ucapan Speechify Menyokong 13 Emosi
Dikemas kini pada •API

Bagaimana API Teks ke Ucapan Speechify Menyokong 13 Emosi

Cliff Weitzman

CEO/Pengasas Speechify

API Speechify menawarkan kependaman 300ms, suara berkualiti seperti manusia, dan 50+ bahasa

AppleAnugerah Reka Bentuk Apple 2025
50J+ Pengguna

Mengapa Emosi Menjadi Sempadan Baharu dalam Sintesis Ucapan

Nak bina sendiri? API teks-ke-ucapan dan klon suara Speechify tersedia di speechify.ai, dengan dokumentasi dan kunci percuma di docs.speechify.ai.

TTS moden sudah lama menyelesaikan isu kefahaman audio. Blizzard Challenge, penanda aras tahunan sejak 2005, melaporkan bahawa menjelang 2021, ucapan sintetik sukar dibezakan daripada ucapan semula jadi dari segi kefahaman dan juga tahap keasliannya (Perrotin et al., 2024). Jadi, bidang ini terus bergerak ke hadapan. Persoalan yang lebih menarik sekarang bukan lagi boleh difahami atau tidak, tetapi adakah suara itu menyampaikan maksud dengan tepat. Kini, Speechify bukan sekadar menawarkan teks ke ucapan, tetapi juga teks ke ucapan beremosi.

Speechify Menawarkan Teks ke Ucapan Beremosi

Pilihan emosi Speechify merangkumi Marah, Ceria, Sedih, Takut, Santai, Cemas, Terkejut, Tenang, Tegas, Bertenaga, Mesra, Langsung dan Cerah. Set ini dipilih untuk meliputi julat nada yang biasa digunakan oleh pencerita, pelakon atau penyampai dalam satu projek. Contohnya, video penerangan produk boleh bermula dengan nada Cerah, diikuti Tenang untuk bahagian teknikal, dan diakhiri dengan Mesra. Watak dalam permainan pula boleh bertukar daripada Tegas kepada Takut dalam dua baris dialog.

Cara Menggunakan Emosi dalam AI Voice Generator Speechify

AI Voice Generator tersedia dalam Speechify Studio dan menjadi alat utama pencipta kandungan untuk voiceover, video pemasaran, audiobook dan segmen podcast. Anda hanya perlu tampal skrip, pilih suara, kemudian terapkan gaya emosi pada keseluruhan klip atau bahagian tertentu. Oleh sebab emosi boleh diterapkan pada bahagian terpilih, voiceover yang sama boleh bermula dengan Ceria, menyampaikan nilai dengan Tegas, dan berakhir dengan Mesra tanpa perlu menukar suara.

Berikut beberapa aliran kerja yang benar-benar mendapat manfaat daripada fungsi ini:

Video pemasaran yang disunting dalam CapCut biasanya memerlukan dua atau tiga perubahan nada, contohnya untuk tumpuan, janji, dan seruan tindakan. Tanpa perlu tiga rakaman berasingan, satu voiceover dengan emosi yang berubah mengikut baris sudah memadai. Untuk audiobook dan naratif fiksyen, dialog watak boleh menampilkan pelbagai emosi tanpa memerlukan ramai pembaca suara. Bagi video penerangan pula, suara Tenang lebih jelas untuk membaca bahagian yang sukar berbanding cuba kekal "bersemangat" sepanjang masa.

Menggunakan Emosi dalam API Speechify

Bagi pembangun, kesemua 13 emosi tersedia dalam Speechify API melalui tag SSML <speechify:style>. Bungkus teks yang mahu digayakan, nyatakan emosinya, dan API akan memulangkan audio dengan emosi tersebut untuk segmen berkenaan. Dengan cara ini, pembantu maya boleh kedengaran Tegas ketika mengesahkan pembayaran dan Mesra ketika menyambut pengguna, tanpa perlu menukar suara di tengah sesi.

Platform pembelajaran digital menggunakan mekanisme yang sama untuk maklum balas kuiz: Ceria untuk jawapan yang betul, Langsung untuk pembetulan, dan Tenang untuk petunjuk. Enjin cerita interaktif pula boleh menandakan emosi bagi setiap dialog watak melalui API, membolehkan satu suara tiruan membawakan keseluruhan watak.

AI Voice Generator Speechify vs API Speechify: Mana Satu Yang Sesuai

Kegunaan

AI Voice Generator (Studio)

API

Voiceover, pemasaran, audiobook

Ya, editor visual, emosi bagi bahagian terpilih

Boleh, tetapi mungkin berlebihan

Suara dalam produk untuk aplikasi, pembantu, pembelajaran digital

Kurang sesuai

Ya, dengan tag SSML <speechify:style>

Format

Antara muka web

REST API

Paling sesuai apabila

Anda menghasilkan fail audio akhir

Anda menjana audio atas permintaan dalam produk sendiri

Di Mana Suara Beremosi Mengubah Apa Yang Anda Boleh Hasilkan

Fungsi TTS beremosi ialah pelengkap penting untuk kandungan kreatif. Satu suara ala selebriti yang membacakan keseluruhan audiobook, watak animasi yang menyampaikan suka duka, atau intro podcast yang tepat pada nadanya—semuanya sukar dicapai dengan sintesis tanpa ekspresi. Kini, semua itu menjadi lebih berkesan kerana emosi dibawa oleh suara itu sendiri, bukan sekadar bergantung pada arahan dalam skrip. Bagi pencipta kandungan yang sudah menggunakan suara selebriti dan watak Speechify, gaya emosi membezakan suara yang sekadar meniru daripada suara yang benar-benar hidup.

Adakah Ekspresi Emosi Sebenar Meningkatkan Kefahaman?

Ya, dan hal ini terbukti di luar dunia AI juga. Dalam kajian 2022 terhadap pelajar berusia 11–13 tahun dan kajian ulangan pada 2025, Dylman dan Champoux-Larsson mendapati pendengar menjawab lebih banyak soalan kandungan dengan betul apabila maklumat dibaca dengan nada emosi positif berbanding nada neutral (Dylman et al., 2025). Peningkatan kefahaman ini signifikan dan konsisten untuk ingatan serta-merta mahupun tertunda. Untuk kandungan pendidikan, tutorial produk, dan audio berdurasi panjang yang memerlukan pengekalan maklumat, suara dengan emosi yang sesuai sememangnya membantu kefahaman.

Soalan Lazim

Apa itu teks ke ucapan beremosi?

Ini ialah ucapan sintetik yang membawa nada emosi tertentu (contohnya ceria atau sedih) sambil mengekalkan perkataan asal, jadi ayat yang sama boleh didengar dengan pelbagai ekspresi. Dengan Speechify, anda boleh memilih emosi setiap kali membuat seleksi.

Berapa banyak emosi yang disokong Speechify?

Tiga belas: Marah, Ceria, Sedih, Takut, Santai, Cemas, Terkejut, Tenang, Tegas, Bertenaga, Mesra, Langsung dan Cerah. Semuanya tersedia dalam AI Voice Generator dan Speechify API.

Di mana saya kawal emosi dalam AI Voice Generator?

Dalam Speechify Studio, selepas anda memasukkan skrip, kawalan emosi akan muncul di sebelah pilihan suara. Gunakannya untuk seluruh klip atau hanya pada bahagian terpilih, kemudian jana semula audio.

Bagaimana saya guna emosi dalam API Speechify?

Bungkus teks dalam tag SSML <speechify:style> dan letakkan nama emosi sebagai nilai atribut. API akan memulangkan audio dengan emosi itu hanya pada bahagian yang ditandakan.

Boleh saya gabungkan beberapa emosi dalam satu voiceover?

Boleh. Emosi boleh diterapkan mengikut bahagian terpilih dalam Speechify Studio atau mengikut span SSML dalam API, membolehkan satu voiceover menukar nada dari satu baris ke baris seterusnya tanpa perlu menukar suara.

Adakah suara beremosi kedengaran senatural suara neutral?

Sangat hampir. Model TTS beremosi terkini mencapai purata skor 3.94/5.0 untuk tahap ekspresif dan 3.98/5.0 untuk tahap keasliannya, hampir setanding pada kedua-dua aspek.

Adakah ekspresi emosi betul-betul membantu pendengar ingat kandungan?

Penyelidikan terhadap penceramah manusia menunjukkan jawapannya ya. Prosodi positif meningkatkan daya ingatan terhadap fakta dalam situasi terkawal. Prinsip yang sama digunakan dalam voiceover AI yang diarahkan dengan baik.

Boleh saya guna suara beremosi untuk voiceover komersial?

Pelesenan Speechify membenarkan penggunaan komersial untuk voiceover yang dijana, termasuk gaya emosi. Sila semak pelan anda untuk mengetahui had panjang output.

Adakah emosi berfungsi dengan suara klon atau selebriti?

Ya. Gaya emosi diterapkan pada suara asas dalam Speechify, jadi suara klon boleh membawakan kesemua 13 emosi tanpa perlu rakaman berasingan untuk setiap satu.

Apa beza emosi dengan hanya melaras kelajuan atau nada suara?

Emosi mengubah prosodi secara menyeluruh—termasuk jeda, tekanan, lengkung intonasi dan tenaga suara. Sebab itulah suara "marah" tidak kedengaran sekadar lebih laju atau lebih tinggi nadanya berbanding versi neutral.


Akses suara-suara kegemaran Speechify melalui API yang pantas, boleh diskalakan, dan mesra pembangun

Dapatkan Akses API
Sparse JavaScript keywords import, from, const, await on a white background

Kongsi Artikel Ini

Cliff Weitzman

CEO/Pengasas Speechify

Cliff Weitzman ialah pejuang hak disleksia serta CEO dan pengasas Speechify, aplikasi teks ke ucapan #1 di dunia dengan lebih 100,000 ulasan 5 bintang dan menduduki tempat pertama di App Store dalam kategori Berita & Majalah. Pada tahun 2017, Weitzman tersenarai dalam Forbes 30 Under 30 atas usahanya menjadikan internet lebih mesra untuk individu dengan keperluan pembelajaran. Cliff Weitzman pernah dipaparkan di EdSurge, Inc., PC Mag, Entrepreneur, Mashable dan pelbagai saluran media utama yang lain.

Speechify

Tentang Speechify

Pembaca Teks ke Ucapan #1

Speechify ialah platform teks ke ucapan terkemuka dunia, dipercayai oleh lebih 50 juta pengguna dan disokong oleh lebih daripada 500,000 ulasan lima bintang merentasi aplikasi teks ke ucapannya iOS, Android, Pemalam Chrome, aplikasi web, dan aplikasi desktop Mac. Pada tahun 2025, Apple telah menganugerahkan Speechify dengan Anugerah Reka Bentuk Apple yang berprestij di WWDC, menyifatkannya sebagai “sumber penting yang membantu orang menjalani hidup mereka.” Speechify menawarkan lebih 1,000 suara semula jadi dalam lebih 60 bahasa dan digunakan di hampir 200 negara. Suara selebriti termasuk Snoop Dogg dan Gwyneth Paltrow. Untuk pencipta dan perniagaan, Speechify Studio menyediakan alat canggih termasuk Penjana Suara AI, Penduaan Suara AI, Alih Suara AI, dan Penukar Suara AI. Speechify juga memacu produk terkemuka dengan API teks ke ucapan berkualiti tinggi dan kos efektif. Pernah dipaparkan dalam The Wall Street Journal, CNBC, Forbes, TechCrunch, dan media utama lain, Speechify ialah penyedia teks ke ucapan terbesar di dunia. Lawati speechify.com/news, speechify.com/blog, dan speechify.com/press untuk maklumat lanjut.