Skip to main content
  1. Trang chủ
  2. API
  3. Độ trễ API Text-to-Speech năm 2026: thời gian đến âm thanh đầu tiên, đo lường độc lập
Published on •API

Độ trễ API Text-to-Speech năm 2026: thời gian đến âm thanh đầu tiên, đo lường độc lập

Nhóm Speechify

Nhóm Speechify


Speechify API cho độ trễ chỉ 300ms, giọng đọc tự nhiên như người thật, hỗ trợ hơn 50 ngôn ngữ

AppleGiải Thiết Kế Apple 2025
50 triệu+ người dùng

Hai bài kiểm định độc lập, không do Speechify thực hiện, đã đo thời gian đến âm thanh đầu tiên của mô hình SpeechifyAI Simba 3.2 vào tháng 9/2026. Coval ghi nhận mức trung vị 106 ms trong 24 giờ tính đến 24/09/2026. Voice Arena ghi nhận 123 ms trên bảng US English cùng ngày, thấp nhất trong 14 mô hình được so sánh. Bài viết này giải thích các con số đó đo lường điều gì, vì sao thời gian đến âm thanh đầu tiên là chỉ số độ trễ nên so sánh và cách bạn có thể tự đo từ mã nguồn của mình.

Các con số

Bài kiểm định

Đo lường gì

Simba 3.2

Thời điểm

Voice Arena, bảng US English

Thời gian trung vị đến âm thanh đầu tiên khi phát trực tuyến

123 ms, thấp nhất trong 14 mô hình được đo

24/09/2026

Coval

Thời gian trung vị đến âm thanh đầu tiên, bao gồm cả khoảng im lặng ở đầu trước mẫu âm thanh đầu tiên. Công cụ mã nguồn mở, chạy mỗi 30 phút từ US East

106 ms

24 giờ tính đến 24/09/2026

Lưu lượng thực tế của SpeechifyAI (tự đo)

Thời gian API ghi byte âm thanh đầu tiên trên các yêu cầu của khách hàng tại US East

56 ms p50, 102 ms p90

15/09/2026

Hai chỉ số đo độc lập cao hơn số liệu tự đo vì chúng bao gồm cả độ trễ mạng giữa hệ thống kiểm định và máy chủ của chúng tôi, cũng như khoảng im lặng ở đầu âm thanh. Mỗi con số phản ánh đúng thời điểm đo tương ứng. Cả hai bảng đều được cập nhật liên tục, vì vậy hãy kiểm tra để xem số liệu mới nhất hôm nay.

Bảng US English của Voice Arena, 24/09/2026

Mô hình

Thời gian trung vị đến âm thanh đầu tiên

SpeechifyAI Simba 3.2 thời gian thực

123 ms

Inworld Realtime TTS 2 Research Preview

168,5 ms

Gradium TTS thời gian thực

236 ms

Cartesia Sonic-3.5 thời gian thực

250 ms

Smallest AI Lightning 3.1 Pro thời gian thực

263,5 ms

Fish Audio S2 Pro thời gian thực

267 ms

Nguồn: Voice Arena, truy cập ngày 24/09/2026. Bảng đã đo 14 mô hình và hiển thị 6 kết quả nhanh nhất.

Vì sao thời gian đến âm thanh đầu tiên là chỉ số nên so sánh

Khi một agent thoại trả lời hoặc ứng dụng đọc văn bản, người nghe phải chờ từ lúc văn bản được gửi đi đến khi thực sự nghe thấy âm thanh. Khoảng thời gian đó được gọi là thời gian đến âm thanh đầu tiên.

  • Thời gian đến byte đầu tiên thường thấp hơn trải nghiệm thực tế của người nghe.
  • Luồng âm thanh có thể bắt đầu bằng một khoảng lặng, nên người nghe vẫn chưa nghe thấy gì cho đến khi xuất hiện mẫu âm thanh đầu tiên. Thời gian đến âm thanh đầu tiên tính luôn cả phần im lặng này.
  • Tổng thời gian sinh là thời gian chờ đến byte cuối cùng.
  • Chỉ số này quan trọng khi bạn cần lưu file, nhưng không phản ánh trải nghiệm phát trực tiếp cho người nghe.
  • Đối thoại cần phản hồi nhanh.
  • Trong hội thoại, con người thường phản hồi trong vài trăm mili giây. Agent thoại phải nhận diện lời nói, tạo phản hồi ngôn ngữ và sinh giọng nói trong khoảng thời gian rất ngắn đó, nên mỗi mili giây chờ phát giọng đều làm giảm phần thời gian còn lại của toàn bộ pipeline.

Làm thế nào Simba 3.2 tăng tốc mà không cần rút gọn mô hình

Trong dữ liệu của Coval, mức trung vị hằng ngày của Simba 3.2 đã giảm từ 379 ms (13/09/2026) xuống còn 116 ms (18/09/2026), tức giảm khoảng 70% chỉ trong năm ngày.

Bản thân mô hình không thay đổi: trọng số được giữ nguyên, không rút gọn, không lượng tử hóa và không có biến thể "turbo" nhẹ hơn. Mức giảm độ trễ đến từ đường phục vụ xung quanh mô hình:

  • Bản dựng phục vụ mới chạy trên GPU khác, với các tối ưu tầng thấp trong quá trình suy luận giúp âm thanh rời hệ thống sớm hơn.
  • Việc kiểm tra gói cước, quyền truy cập và giới hạn tốc độ được lấy từ cache thay vì tra cứu đồng bộ trước khi gửi byte đầu tiên.
  • Cổng API chạy cùng khu vực với GPU, đồng thời các kết nối luôn được giữ ấm giữa các yêu cầu.
  • Khoảng 100 ms im lặng ở đầu đã biến mất. Theo chỉ số im lặng đầu riêng của Coval, Simba 3.2 giảm từ 102 ms (14/09) xuống còn 13 ms.

Chất lượng vẫn được giữ vững. Trên bảng xếp hạng Text-to-Speech của Artificial Analysis, Simba 3.2 đạt Elo 1.237 (±14) vào ngày 23/09/2026, nằm trong top 5 trên tổng số 92 giọng của các nhà cung cấp, và những mô hình xếp trên đều có chi phí cao hơn.

Làm thế nào để đạt độ trễ thấp nhất cho ứng dụng của bạn

  1. Phát trực tuyến.
  2. Gọi
  3. POST /v1/audio/stream
  4. cho mọi âm thanh cần phát ngay khi đang được tạo.
  5. POST /v1/audio/speech
  6. chỉ phản hồi khi toàn bộ đoạn âm thanh đã sẵn sàng.
  7. Chỉ định Simba 3.2.
  8. Đặt
  9. model
  10. là
  11. simba-3.2
  12. cho tiếng Anh. Nếu bỏ qua
  13. model
  14. , API sẽ dùng
  15. simba-3.0
  16. .
  17. Tái sử dụng kết nối.
  18. Tạo một HTTP client, mở kết nối ngay từ lúc khởi động và dùng lại cho mọi yêu cầu để loại bỏ chi phí DNS cũng như bắt tay TCP và TLS.
  19. Gửi ngay khi câu hoàn chỉnh.
  20. Nếu phía trước là mô hình ngôn ngữ, hãy gửi từng câu hoàn chỉnh ngay khi có thể và phát tuần tự các luồng tương ứng.
  21. Chọn đúng định dạng mà trình phát cần.
  22. audio/pcm
  23. ở 24 kHz không cần mã hóa lại. Hãy chọn MP3 hoặc Ogg Opus nếu bạn cần tiết kiệm băng thông.
  24. Chạy gần API.
  25. API được phục vụ từ US East, nên đặt máy chủ trong hoặc gần US East sẽ giúp giảm độ trễ mạng.

Dùng LiveKit Agents? Hướng dẫn này sẽ giúp bạn xây dựng agent thoại dùng plugin Speechify, phát từng câu ngay khi mô hình ngôn ngữ sinh ra. Nếu muốn xem đầy đủ lý do, từng bước triển khai và mã mẫu, hãy đọc tài liệu về độ trễ.

Tự đo chỉ số này

Hãy đo thời gian nhận được đoạn đầu tiên từ phản hồi phát trực tuyến ngay tại nơi mã của bạn đang chạy. Để có số liệu khách quan:

  • Bỏ qua 1-2 yêu cầu đầu tiên vì lúc này kết nối vẫn đang được thiết lập.
  • Đa dạng hóa nội dung văn bản giữa các yêu cầu, giống với lưu lượng thực tế.
  • Gửi các yêu cầu theo tuần tự, không chạy song song.
  • Thực hiện ít nhất 20 yêu cầu, rồi báo cáo trung vị (p50) và p90; không dùng giá trị trung bình hoặc một kết quả tốt nhất đơn lẻ.
  • Đo ở định dạng PCM. Với Ogg, các byte đầu tiên là header chứ chưa phải âm thanh.

Mỗi phản hồi phát trực tuyến đều có header Server-Timing với giá trị ttfb thể hiện phần độ trễ từ phía chúng tôi; phần còn lại thuộc về mạng và mã của bạn. Tài liệu về độ trễ đã có sẵn script Python và TypeScript để đo chỉ số này.

Câu hỏi thường gặp

Mô hình Simba 3.2 của SpeechifyAI ghi nhận byte âm thanh đầu tiên ở mức trung vị 56 ms và p90 là 102 ms trên lưu lượng thực tế tại US East vào ngày 15/09/2026. Các bài kiểm định độc lập đo thời gian trung vị đến âm thanh đầu tiên ở mức 106 ms (Coval, 24 giờ tính đến 24/09/2026) và 123 ms (Voice Arena, 24/09/2026), bao gồm cả mạng và khoảng im lặng đầu âm thanh.

Trên bảng US English của Voice Arena ngày 24/09/2026, SpeechifyAI Simba 3.2 có thời gian trung vị đến âm thanh đầu tiên thấp nhất trong 14 mô hình: 123 ms, xếp trên Inworld Realtime TTS 2 Research Preview với 168,5 ms. Bảng được cập nhật liên tục, vì vậy hãy kiểm tra ngày xếp hạng trước khi dùng làm mốc tham chiếu.

Có. POST /v1/audio/stream phát âm thanh qua HTTP theo từng phần khi đang được tạo, hỗ trợ PCM, MP3, Ogg Opus và AAC. PCM có độ trễ thấp nhất vì không cần mã hóa thêm.

Không. SpeechifyAI là API dành cho lập trình viên và được tính phí riêng với ứng dụng đọc Speechify; gói Reader không bao gồm quyền dùng API. Gói API tính theo tháng, không bắt buộc theo năm: miễn phí 500.000 ký tự/tháng không cần thẻ; tiếp theo là Starter $10/tháng (vượt mức tính $10 cho mỗi 1 triệu ký tự), Pro $99/tháng ($8), và Scale $499/tháng ($6).

Hãy thử Simba 3.2 trên SpeechifyAI: tạo API key miễn phí và tự đo yêu cầu đầu tiên để so sánh với các số liệu ở trên.

Truy cập các giọng đọc yêu thích của Speechify qua API tốc độ cao, dễ mở rộng và thân thiện với lập trình viên

Nhận quyền truy cập API
Sparse JavaScript keywords import, from, const, await on a white background

Chia sẻ bài viết này

Nhóm Speechify

Nhóm Speechify


Nhóm Speechify

Speechify

Về Speechify

Nền tảng chuyển văn bản thành giọng nói số 1 thế giới

Speechify là nền tảng chuyển văn bản thành giọng nói hàng đầu thế giới, được hơn 50 triệu người tin dùng và nhận hơn 500.000 đánh giá 5 sao trên các ứng dụng chuyển văn bản thành giọng nói của mình trên iOS, Android, Tiện ích mở rộng Chrome, ứng dụng web và ứng dụng Mac desktop. Năm 2025, Apple đã trao tặng cho Speechify giải thưởng danh giá Apple Design Award tại WWDC, nhận định đây là “một tài nguyên quan trọng giúp mọi người sống tốt hơn.” Speechify cung cấp hơn 1.000 giọng đọc tự nhiên bằng hơn 60 ngôn ngữ và được sử dụng tại gần 200 quốc gia. Các giọng đọc của người nổi tiếng bao gồm Snoop Dogg và Gwyneth Paltrow. Đối với người sáng tạo nội dung và doanh nghiệp, Speechify Studio mang đến các công cụ nâng cao như Trình tạo giọng nói AI, Nhân bản giọng nói AI, Lồng tiếng AI và Trình đổi giọng AI. Speechify còn cung cấp giải pháp chuyển văn bản sang giọng nói chất lượng cao, tiết kiệm chi phí thông qua API chuyển văn bản thành giọng nói cho các sản phẩm hàng đầu. Được xuất hiện trên The Wall Street Journal, CNBC, Forbes, TechCrunch và nhiều trang tin tức lớn khác, Speechify hiện là nhà cung cấp giải pháp chuyển văn bản sang giọng nói lớn nhất thế giới. Truy cập speechify.com/news, speechify.com/blog và speechify.com/press để tìm hiểu thêm.