Skip to main content
  1. หน้าแรก
  2. API
  3. ทุกเรื่องที่ควรรู้เกี่ยวกับ Google Cloud Text-to-Speech API
Updated on API

ทุกเรื่องที่ควรรู้เกี่ยวกับ Google Cloud Text-to-Speech API

Cliff Weitzman

ซีอีโอ/ผู้ก่อตั้ง Speechify

Speechify API ให้บริการด้วยความเร็ว 300ms 
เสียงคุณภาพระดับมนุษย์ และรองรับกว่า 50 ภาษา

รางวัล Apple Design Award 2025
ผู้ใช้งานกว่า 50 ล้านคน

Google Cloud Text-to-Speech API แปลงข้อความเป็นเสียงผ่าน HTTP request โดยคิดค่าบริการตามระดับเสียง เริ่มต้นที่ $4 ต่อ 1 ล้านตัวอักษร (Standard, WaveNet) ไปจนถึง $16 (Neural2) และ $30 (Chirp 3 HD) ครอบคลุมเสียงมากกว่า 380 เสียงในกว่า 75 ภาษา และรองรับการสตรีม หากคุณต้องการเสียงคุณภาพสูงขึ้นในราคาที่คุ้มกว่า SpeechifyAI อยู่อันดับ 1 บน Artificial Analysis TTS leaderboard ในราคา $6 ถึง $10 ต่อ 1 ล้านตัวอักษร

กำลังสร้างเองอยู่ใช่ไหม? Speechify API สำหรับ text-to-speech และการโคลนเสียงพร้อมใช้งานที่ speechify.ai พร้อมเอกสารและคีย์ฟรีที่ docs.speechify.ai

Google Text-to-Speech API ทำอะไรได้บ้าง

Google Cloud Text-to-Speech คือ API สำหรับการสังเคราะห์เสียงพูด เพียงส่งข้อความ (หรือ SSML) พร้อมข้อมูลเสียงและการตั้งค่าเสียง ระบบก็จะส่งไฟล์หรือสตรีมเสียงกลับมาให้ ในฐานะที่เป็นส่วนหนึ่งของ Google Cloud จึงเชื่อมต่อกับโปรเจกต์บน GCP ได้โดยตรง และใช้ IAM ระบบคิดค่าบริการ และ client libraries ชุดเดียวกับบริการอื่น ๆ นักพัฒนามักนำไปใช้กับ IVR, ฟีเจอร์การเข้าถึงบนเว็บไซต์, การพากย์สื่อ และผลิตภัณฑ์ที่ทำงานบน Google Cloud

ระดับเสียงของ Google TTS และราคาในปี 2026

Google คิดค่าบริการตามประเภทเสียงต่อ 1 ล้านตัวอักษร โดยระดับที่สูงขึ้นจะให้เสียงที่เป็นธรรมชาติมากขึ้นและมีราคาสูงขึ้น:

ระดับเสียง

ราคาต่อ 1M ตัวอักษร

ใช้ฟรี (ต่อเดือน)

หมายเหตุ

Standard

$4

4M ตัวอักษร

ระดับพื้นฐาน เสียงค่อนข้างเป็นหุ่นยนต์

WaveNet

$4

4M ตัวอักษร

Neural คุณภาพโดยรวมดี

Neural2

$16

1M ตัวอักษร

Neural คุณภาพสูง

Chirp 3: HD

$30

1M ตัวอักษร

เสียงรุ่นใหม่ล่าสุด คมชัดระดับ HD

Studio

$160

1M ตัวอักษร

เหมาะกับงานพากย์ยาวคุณภาพพรีเมียม

ค่าบริการเป็นแบบจ่ายตามการใช้งานเมื่อพ้นโควต้าฟรี โดยโควต้าฟรีเหมาะสำหรับการทดลองและจะรีเซ็ตทุกเดือน ดังนั้นควรวางแผนจากปริมาณการใช้งานจริง ไม่ใช่ดูแค่ช่วงทดลอง

วิธีเรียกใช้ Google TTS API

  1. สร้างโปรเจกต์ Google Cloud และเปิดใช้งาน Text-to-Speech API
  2. ยืนยันตัวตนด้วย service account key หรือ Application Default Credentials
  3. เรียก
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. ผ่าน REST หรือ gRPC หรือใช้ client libraries (Python, Node, Java, Go)
  6. ส่ง
  7. input
  8. (ข้อความหรือ SSML),
  9. voice
  10. (รหัสภาษา+ชื่อเสียง) และ
  11. audioConfig
  12. (ชนิดไฟล์ ความเร็ว ระดับเสียง) แล้วจะได้เสียงแบบ base64 กลับมา

นี่คือขั้นตอนมาตรฐานของ GCP: เหมาะถ้าคุณใช้งาน Google Cloud อยู่แล้ว แต่ถ้าไม่ได้ใช้อยู่เดิมก็อาจรู้สึกว่าซับซ้อนขึ้น

เมื่อใดควรพิจารณาทางเลือกอื่น

Google TTS เป็นตัวเลือกที่เสถียรและมีการรองรับอย่างกว้างขวาง โดยเฉพาะบน GCP แต่มี 2 ปัจจัยหลักที่อาจทำให้หลายทีมเริ่มมองหาทางเลือกอื่น

  • คุณภาพเสียงเมื่อเทียบกับราคา
  • ระดับเสียงที่ดีที่สุดของ Google (Chirp 3 HD ราคา $30, Studio $160) มีราคาสูง และในการจัดอันดับอิสระก็ยังมีโมเดลอื่นที่ได้คะแนนสูงกว่า บน
  • Artificial Analysis TTS leaderboard
  • (กรกฎาคม 2026) Simba 3.2 ของ SpeechifyAI อยู่อันดับ 1 เหนือ Google DeepMind
  • เอเจนต์เสียงแบบเรียลไทม์
  • สำหรับ
  • voice agent
  • ที่โต้ตอบได้ คุณยังต้องใช้ speech-to-text และ LLM ด้วย หากประกอบเข้ากับ Google TTS ก็ต้องคอยจัดการทั้งค่าใช้จ่ายและความหน่วงจาก 3 บริการ

SpeechifyAI ทางเลือกแทน Google TTS

  • คุณภาพจากการจัดอันดับอิสระสูงกว่า
  • Simba 3.2
  • อยู่อันดับ 1 ใน Artificial Analysis TTS leaderboard (กรกฎาคม 2026) และอยู่อันดับ 2 ร่วมใน Voice Arena เหนือ Google DeepMind, ElevenLabs, OpenAI
  • ราคาต่ำกว่าแต่คุณภาพสูง
  • $6 ต่อ 1 ล้านตัวอักษร ถูกกว่าระดับ Neural2 ($16) และ Chirp 3 HD ($30) ของ Google ขณะที่คุณภาพเสียงดีกว่า
  • ความหน่วง ~300ms รองรับ 30+ ภาษา และ 1,500+ เสียง
  • พร้อมสตรีมมิ่งสำหรับแอปแบบเรียลไทม์
  • เอเจนต์เสียงในแพ็กเกจเดียว
  • หากต้องการ STT + LLM + TTS, SpeechifyAI มี API เดียว ราคา $0.068–0.075 ต่อนาที โดยไม่มีค่าใช้จ่ายแฝง

SpeechifyAI คือแพลตฟอร์มสำหรับนักพัฒนาของ Speechify ที่แยกจากแอป Speechify สำหรับผู้บริโภค

เริ่มต้นใช้งาน

ลองเทียบกับ Google ได้ด้วยโค้ดเพียงไม่กี่บรรทัด: รับคีย์ฟรีของ SpeechifyAI ได้ที่ speechify.ai สูงสุด 50,000 ตัวอักษรต่อเดือน และติดตั้ง SDK ด้วย pip install speechify-api หรือ npm install @speechify/api

เข้าถึงเสียงที่ผู้ใช้ชื่นชอบของ Speechify ผ่าน API ที่รวดเร็ว ขยายได้ และเป็นมิตรกับนักพัฒนา

ขอสิทธิ์การใช้งาน API

แชร์บทความนี้

Cliff Weitzman

ซีอีโอ/ผู้ก่อตั้ง Speechify

คลิฟฟ์ ไวท์ซ์แมน เป็นผู้ขับเคลื่อนสิทธิผู้มีภาวะดิสเล็กเซีย และดำรงตำแหน่งซีอีโอและผู้ก่อตั้ง Speechify แอปแปลงข้อความเป็นเสียงอันดับ 1 ของโลก ที่กวาดรีวิว 5 ดาวกว่า 100,000 รายการ และเคยครองอันดับ 1 ใน App Store หมวดข่าวสารและนิตยสาร ในปี 2017 ไวท์ซ์แมนติดโผ Forbes 30 Under 30 จากผลงานผลักดันให้โลกออนไลน์เข้าถึงได้มากขึ้นสำหรับผู้มีความบกพร่องทางการเรียนรู้ ผลงานของคลิฟฟ์ ไวท์ซ์แมนถูกกล่าวถึงในสื่อชั้นนำอย่าง EdSurge, Inc., PC Mag, Entrepreneur, Mashable และอีกมากมาย

Speechify logo

เกี่ยวกับ Speechify

#1 โปรแกรมอ่านข้อความเป็นเสียง

Speechify เป็นแพลตฟอร์ม แปลงข้อความเป็นเสียง ชั้นนำของโลกที่มีผู้ใช้งานกว่า 50 ล้านคน และได้รับรีวิวระดับ 5 ดาวมากกว่า 500,000 รีวิวในแอปพลิเคชัน iOS, Android, Chrome Extension, เว็บแอป และ แอปบน Mac ในปี 2025 Apple ได้มอบรางวัล Apple Design Award อันทรงเกียรติให้กับ Speechify ในงาน WWDC โดยกล่าวว่าเป็น “ทรัพยากรสำคัญที่ช่วยให้ผู้คนใช้ชีวิตได้ง่ายขึ้น” Speechify มีเสียงธรรมชาติกว่า 1,000 เสียงใน 60+ ภาษา และมีผู้ใช้งานในเกือบ 200 ประเทศ เสียงคนดังที่มีให้เลือกใช้งาน เช่น Snoop Dogg, Mr. Beast และ Gwyneth Paltrow สำหรับผู้สร้างสรรค์และธุรกิจ Speechify Studio มีเครื่องมือขั้นสูง เช่น AI Voice Generator, AI Voice Cloning, AI Dubbing และ AI Voice Changer Speechify ยังสนับสนุนผลิตภัณฑ์ชั้นนำด้วย Text to Speech API ที่มีคุณภาพสูงและคุ้มค่า นอกจากนี้ยังได้รับการนำเสนอใน The Wall Street Journal, CNBC, Forbes, TechCrunch และสื่อชั้นนำอื่น ๆ Speechify เป็นผู้ให้บริการแปลงข้อความเป็นเสียงที่ใหญ่ที่สุดในโลก เยี่ยมชม speechify.com/news, speechify.com/blog และ speechify.com/press เพื่อเรียนรู้เพิ่มเติม