1. หน้าหลัก
  2. API
  3. ทุกเรื่องที่ควรรู้เกี่ยวกับ Google Cloud Text to Speech API
Updated on API

ทุกเรื่องที่ควรรู้เกี่ยวกับ Google Cloud Text to Speech API

Cliff Weitzman

Cliff Weitzman

ซีอีโอ/ผู้ก่อตั้ง Speechify

Speechify API ให้บริการด้วยความเร็ว 300ms 
เสียงคุณภาพระดับมนุษย์ และรองรับกว่า 50 ภาษา

apple logoรางวัล Apple Design Award 2025
ผู้ใช้งานกว่า 50 ล้านคน

Google Cloud Text-to-Speech API แปลงข้อความเป็นเสียงผ่าน HTTP request โดยมีหลายระดับเสียงให้เลือก ราคาเริ่มต้นที่ $4 ต่อ 1 ล้านตัวอักษร (Standard และ WaveNet), $16 (Neural2) และ $30 (Chirp 3 HD) ครอบคลุมกว่า 380 เสียง ใน 75+ ภาษา พร้อมรองรับการสตรีม หากต้องการคุณภาพเสียงจากการจัดอันดับอิสระที่ดีกว่าในราคาย่อมเยากว่า SpeechifyAI ได้อันดับ 1 จาก Artificial Analysis TTS leaderboard ราคา $6–$10 ต่อ 1 ล้านตัวอักษร

Google Cloud Text to Speech API

Google Text-to-Speech API คืออะไร

Google Cloud Text-to-Speech คือ API สำหรับสังเคราะห์เสียง เพียงส่งข้อความ (หรือ SSML) พร้อมข้อมูลเสียงและการตั้งค่าเสียง ระบบก็จะส่งสตรีมหรือไฟล์เสียงกลับมาให้ ใช้งานร่วมกับ Google Cloud ได้โดยตรง จัดการสิทธิ์ การชำระเงิน และไคลเอนต์ไลบรารีได้เหมือนบริการอื่นๆ เหมาะกับ IVR, ฟีเจอร์การเข้าถึง, การพากย์สื่อ หรือโปรเจ็กต์บน Google Cloud

ระดับเสียงและราคา Google TTS ปี 2026

Google คิดค่าบริการตามประเภทเสียงต่อ 1 ล้านตัวอักษร โดยระดับที่สูงขึ้นจะให้เสียงสมจริงขึ้นและมีราคาสูงขึ้น:

ระดับเสียง

ราคาต่อ 1M ตัวอักษร

ใช้ฟรีต่อเดือน

หมายเหตุ

Standard

$4

4M ตัวอักษร

ระดับพื้นฐาน เสียงค่อนข้างเป็นหุ่นยนต์

WaveNet

$4

4M ตัวอักษร

เสียง AI คุณภาพดี

Neural2

$16

1M ตัวอักษร

เสียง AI คุณภาพสูง

Chirp 3: HD

$30

1M ตัวอักษร

เสียงความละเอียดสูงรุ่นล่าสุด

Studio

$160

1M ตัวอักษร

เหมาะสำหรับงานพากย์เสียงยาวระดับพรีเมียม

หลังใช้โควตาฟรีครบแล้ว ระบบจะคิดค่าบริการตามการใช้งานจริง โควตานี้เหมาะสำหรับทดลองใช้งานหรือเริ่มต้น และจะรีเซ็ตทุกเดือน คุณจึงควรวางแผนตามปริมาณใช้งานจริง

วิธีใช้งาน Google TTS API

  1. สร้างโปรเจ็กต์ Google Cloud และเปิดใช้งาน Text-to-Speech API
  2. ยืนยันตัวตนด้วย service account key หรือ Application Default Credentials
  3. เรียก
  4. texttospeech.googleapis.com/v1/text:synthesize
  5. ผ่าน REST หรือ gRPC หรือใช้ client libraries อย่าง Python, Node, Java หรือ Go
  6. ระบุ
  7. input
  8. (ข้อความหรือ SSML),
  9. voice
  10. (รหัสภาษากับชื่อเสียง) และ
  11. audioConfig
  12. (รูปแบบไฟล์เสียง, ความเร็วการพูด, โทนเสียง) โดยผลลัพธ์จะเป็น audio แบบ base64

ขั้นตอนโดยรวมคล้ายการใช้งาน GCP ทั่วไป จึงสะดวกมากหากคุณใช้ Google Cloud อยู่แล้ว แต่ถ้าไม่ได้ใช้ อาจมีขั้นตอนและภาระในการตั้งค่าเพิ่มขึ้นเล็กน้อย

เมื่อใดควรมองหาทางเลือกอื่น

Google TTS เป็นตัวเลือกที่แข็งแกร่งและรองรับการใช้งานได้หลากหลาย โดยเฉพาะสำหรับทีมที่ใช้งาน GCP อยู่แล้ว แต่มี 2 เหตุผลหลักที่หลายทีมอาจมองหาผู้ให้บริการรายอื่น:

  • คุณภาพเสียงเทียบกับราคา.
  • ระดับเสียงที่ดีที่สุดของ Google (Chirp 3 HD ราคา $30, Studio $160) มีราคาค่อนข้างสูง และการจัดอันดับอิสระก็ยังให้คะแนนผู้ให้บริการรายอื่นสูงกว่า โดยใน
  • Artificial Analysis TTS leaderboard
  • (กรกฎาคม 2026) SpeechifyAI’s Simba 3.2 ได้อันดับ 1 เหนือ Google DeepMind
  • เอเจนต์เสียงแบบโต้ตอบเรียลไทม์.
  • หากต้องการ
  • voice agent
  • ที่สนทนาได้ คุณจะต้องนำ speech-to-text และ LLM มาเชื่อมกับ Google TTS ซึ่งทำให้มีทั้งต้นทุนแยก 3 บริการและความหน่วงเพิ่มขึ้น

SpeechifyAI ทางเลือกแทน Google TTS

  • คุณภาพจากการจัดอันดับอิสระสูงกว่า.
  • Simba 3.2
  • ได้อันดับ 1 ใน Artificial Analysis TTS (กรกฎาคม 2026) และครองอันดับ 2 ร่วมใน Voice Arena เหนือ Google DeepMind, ElevenLabs และ OpenAI
  • ราคาต่ำกว่าที่คุณภาพใกล้เคียงกัน.
  • เพียง $6 ต่อ 1 ล้านตัวอักษร ถูกกว่า Neural2 ($16) และ Chirp 3 HD ($30) ของ Google พร้อมคุณภาพเสียงที่ดีกว่า
  • ดีเลย์ ~300ms, รองรับ 30+ ภาษา, 1,500+ เสียง
  • พร้อมสตรีมมิ่งจริงสำหรับแอปแบบเรียลไทม์
  • มาพร้อม voice agent.
  • หากต้องการ STT+LLM+TTS SpeechifyAI มี API เดียวให้ใช้งาน ราคา $0.068–$0.075 ต่อนาที โดยไม่มีค่าใช้จ่ายส่งผ่านเพิ่มเติม

SpeechifyAI คือแพลตฟอร์มสำหรับนักพัฒนาของ Speechify ซึ่งแตกต่างจากแอป Speechify สำหรับผู้ใช้ทั่วไป

เริ่มต้นใช้งาน

หากต้องการลองเทียบกับ Google เริ่มได้ในไม่กี่ขั้นตอน: ขอรับ SpeechifyAI API Key ฟรีที่ speechify.ai ใช้งานได้ 50,000 ตัวอักษรต่อเดือน แล้วติดตั้ง SDK ด้วย pip install speechify-api หรือ npm install @speechify/api

เข้าถึงเสียงที่ผู้ใช้ชื่นชอบของ Speechify ผ่าน API ที่รวดเร็ว ขยายได้ และเป็นมิตรกับนักพัฒนา

ขอสิทธิ์การใช้งาน API
api access banner

แชร์บทความนี้

Cliff Weitzman

Cliff Weitzman

ซีอีโอ/ผู้ก่อตั้ง Speechify

คลิฟฟ์ ไวท์ซ์แมน เป็นผู้ขับเคลื่อนสิทธิผู้มีภาวะดิสเล็กเซีย และดำรงตำแหน่งซีอีโอและผู้ก่อตั้ง Speechify แอปแปลงข้อความเป็นเสียงอันดับ 1 ของโลก ที่กวาดรีวิว 5 ดาวกว่า 100,000 รายการ และเคยครองอันดับ 1 ใน App Store หมวดข่าวสารและนิตยสาร ในปี 2017 ไวท์ซ์แมนติดโผ Forbes 30 Under 30 จากผลงานผลักดันให้โลกออนไลน์เข้าถึงได้มากขึ้นสำหรับผู้มีความบกพร่องทางการเรียนรู้ ผลงานของคลิฟฟ์ ไวท์ซ์แมนถูกกล่าวถึงในสื่อชั้นนำอย่าง EdSurge, Inc., PC Mag, Entrepreneur, Mashable และอีกมากมาย

speechify logo

เกี่ยวกับ Speechify

#1 โปรแกรมอ่านข้อความเป็นเสียง

Speechify เป็นแพลตฟอร์ม แปลงข้อความเป็นเสียง ชั้นนำของโลกที่มีผู้ใช้งานกว่า 50 ล้านคน และได้รับรีวิวระดับ 5 ดาวมากกว่า 500,000 รีวิวในแอปพลิเคชัน iOS, Android, Chrome Extension, เว็บแอป และ แอปบน Mac ในปี 2025 Apple ได้มอบรางวัล Apple Design Award อันทรงเกียรติให้กับ Speechify ในงาน WWDC โดยกล่าวว่าเป็น “ทรัพยากรสำคัญที่ช่วยให้ผู้คนใช้ชีวิตได้ง่ายขึ้น” Speechify มีเสียงธรรมชาติกว่า 1,000 เสียงใน 60+ ภาษา และมีผู้ใช้งานในเกือบ 200 ประเทศ เสียงคนดังที่มีให้เลือกใช้งาน เช่น Snoop Dogg, Mr. Beast และ Gwyneth Paltrow สำหรับผู้สร้างสรรค์และธุรกิจ Speechify Studio มีเครื่องมือขั้นสูง เช่น AI Voice Generator, AI Voice Cloning, AI Dubbing และ AI Voice Changer Speechify ยังสนับสนุนผลิตภัณฑ์ชั้นนำด้วย Text to Speech API ที่มีคุณภาพสูงและคุ้มค่า นอกจากนี้ยังได้รับการนำเสนอใน The Wall Street Journal, CNBC, Forbes, TechCrunch และสื่อชั้นนำอื่น ๆ Speechify เป็นผู้ให้บริการแปลงข้อความเป็นเสียงที่ใหญ่ที่สุดในโลก เยี่ยมชม speechify.com/news, speechify.com/blog และ speechify.com/press เพื่อเรียนรู้เพิ่มเติม