Hai bài kiểm định độc lập, không do Speechify thực hiện, đã đo thời gian đến âm thanh đầu tiên của mô hình SpeechifyAI Simba 3.2 vào tháng 9/2026. Coval ghi nhận mức trung vị 106 ms trong 24 giờ tính đến 24/09/2026. Voice Arena ghi nhận 123 ms trên bảng US English cùng ngày, thấp nhất trong 14 mô hình được so sánh. Bài viết này giải thích các con số đó đo lường điều gì, vì sao thời gian đến âm thanh đầu tiên là chỉ số độ trễ nên so sánh và cách bạn có thể tự đo từ mã nguồn của mình.
Các con số
Hai chỉ số đo độc lập cao hơn số liệu tự đo vì chúng bao gồm cả độ trễ mạng giữa hệ thống kiểm định và máy chủ của chúng tôi, cũng như khoảng im lặng ở đầu âm thanh. Mỗi con số phản ánh đúng thời điểm đo tương ứng. Cả hai bảng đều được cập nhật liên tục, vì vậy hãy kiểm tra để xem số liệu mới nhất hôm nay.
Bảng US English của Voice Arena, 24/09/2026
Nguồn: Voice Arena, truy cập ngày 24/09/2026. Bảng đã đo 14 mô hình và hiển thị 6 kết quả nhanh nhất.
Vì sao thời gian đến âm thanh đầu tiên là chỉ số nên so sánh
Khi một agent thoại trả lời hoặc ứng dụng đọc văn bản, người nghe phải chờ từ lúc văn bản được gửi đi đến khi thực sự nghe thấy âm thanh. Khoảng thời gian đó được gọi là thời gian đến âm thanh đầu tiên.
- Thời gian đến byte đầu tiên thường thấp hơn trải nghiệm thực tế của người nghe.
- Luồng âm thanh có thể bắt đầu bằng một khoảng lặng, nên người nghe vẫn chưa nghe thấy gì cho đến khi xuất hiện mẫu âm thanh đầu tiên. Thời gian đến âm thanh đầu tiên tính luôn cả phần im lặng này.
- Tổng thời gian sinh là thời gian chờ đến byte cuối cùng.
- Chỉ số này quan trọng khi bạn cần lưu file, nhưng không phản ánh trải nghiệm phát trực tiếp cho người nghe.
- Đối thoại cần phản hồi nhanh.
- Trong hội thoại, con người thường phản hồi trong vài trăm mili giây. Agent thoại phải nhận diện lời nói, tạo phản hồi ngôn ngữ và sinh giọng nói trong khoảng thời gian rất ngắn đó, nên mỗi mili giây chờ phát giọng đều làm giảm phần thời gian còn lại của toàn bộ pipeline.
Làm thế nào Simba 3.2 tăng tốc mà không cần rút gọn mô hình
Trong dữ liệu của Coval, mức trung vị hằng ngày của Simba 3.2 đã giảm từ 379 ms (13/09/2026) xuống còn 116 ms (18/09/2026), tức giảm khoảng 70% chỉ trong năm ngày.
Bản thân mô hình không thay đổi: trọng số được giữ nguyên, không rút gọn, không lượng tử hóa và không có biến thể "turbo" nhẹ hơn. Mức giảm độ trễ đến từ đường phục vụ xung quanh mô hình:
- Bản dựng phục vụ mới chạy trên GPU khác, với các tối ưu tầng thấp trong quá trình suy luận giúp âm thanh rời hệ thống sớm hơn.
- Việc kiểm tra gói cước, quyền truy cập và giới hạn tốc độ được lấy từ cache thay vì tra cứu đồng bộ trước khi gửi byte đầu tiên.
- Cổng API chạy cùng khu vực với GPU, đồng thời các kết nối luôn được giữ ấm giữa các yêu cầu.
- Khoảng 100 ms im lặng ở đầu đã biến mất. Theo chỉ số im lặng đầu riêng của Coval, Simba 3.2 giảm từ 102 ms (14/09) xuống còn 13 ms.
Chất lượng vẫn được giữ vững. Trên bảng xếp hạng Text-to-Speech của Artificial Analysis, Simba 3.2 đạt Elo 1.237 (±14) vào ngày 23/09/2026, nằm trong top 5 trên tổng số 92 giọng của các nhà cung cấp, và những mô hình xếp trên đều có chi phí cao hơn.
Làm thế nào để đạt độ trễ thấp nhất cho ứng dụng của bạn
- Phát trực tuyến.
- Gọi
- POST /v1/audio/stream
- cho mọi âm thanh cần phát ngay khi đang được tạo.
- POST /v1/audio/speech
- chỉ phản hồi khi toàn bộ đoạn âm thanh đã sẵn sàng.
- Chỉ định Simba 3.2.
- Đặt
- model
- là
- simba-3.2
- cho tiếng Anh. Nếu bỏ qua
- model
- , API sẽ dùng
- simba-3.0
- .
- Tái sử dụng kết nối.
- Tạo một HTTP client, mở kết nối ngay từ lúc khởi động và dùng lại cho mọi yêu cầu để loại bỏ chi phí DNS cũng như bắt tay TCP và TLS.
- Gửi ngay khi câu hoàn chỉnh.
- Nếu phía trước là mô hình ngôn ngữ, hãy gửi từng câu hoàn chỉnh ngay khi có thể và phát tuần tự các luồng tương ứng.
- Chọn đúng định dạng mà trình phát cần.
- audio/pcm
- ở 24 kHz không cần mã hóa lại. Hãy chọn MP3 hoặc Ogg Opus nếu bạn cần tiết kiệm băng thông.
- Chạy gần API.
- API được phục vụ từ US East, nên đặt máy chủ trong hoặc gần US East sẽ giúp giảm độ trễ mạng.
Dùng LiveKit Agents? Hướng dẫn này sẽ giúp bạn xây dựng agent thoại dùng plugin Speechify, phát từng câu ngay khi mô hình ngôn ngữ sinh ra. Nếu muốn xem đầy đủ lý do, từng bước triển khai và mã mẫu, hãy đọc tài liệu về độ trễ.
Tự đo chỉ số này
Hãy đo thời gian nhận được đoạn đầu tiên từ phản hồi phát trực tuyến ngay tại nơi mã của bạn đang chạy. Để có số liệu khách quan:
- Bỏ qua 1-2 yêu cầu đầu tiên vì lúc này kết nối vẫn đang được thiết lập.
- Đa dạng hóa nội dung văn bản giữa các yêu cầu, giống với lưu lượng thực tế.
- Gửi các yêu cầu theo tuần tự, không chạy song song.
- Thực hiện ít nhất 20 yêu cầu, rồi báo cáo trung vị (p50) và p90; không dùng giá trị trung bình hoặc một kết quả tốt nhất đơn lẻ.
- Đo ở định dạng PCM. Với Ogg, các byte đầu tiên là header chứ chưa phải âm thanh.
Mỗi phản hồi phát trực tuyến đều có header Server-Timing với giá trị ttfb thể hiện phần độ trễ từ phía chúng tôi; phần còn lại thuộc về mạng và mã của bạn. Tài liệu về độ trễ đã có sẵn script Python và TypeScript để đo chỉ số này.
Câu hỏi thường gặp
Mô hình Simba 3.2 của SpeechifyAI ghi nhận byte âm thanh đầu tiên ở mức trung vị 56 ms và p90 là 102 ms trên lưu lượng thực tế tại US East vào ngày 15/09/2026. Các bài kiểm định độc lập đo thời gian trung vị đến âm thanh đầu tiên ở mức 106 ms (Coval, 24 giờ tính đến 24/09/2026) và 123 ms (Voice Arena, 24/09/2026), bao gồm cả mạng và khoảng im lặng đầu âm thanh.
Trên bảng US English của Voice Arena ngày 24/09/2026, SpeechifyAI Simba 3.2 có thời gian trung vị đến âm thanh đầu tiên thấp nhất trong 14 mô hình: 123 ms, xếp trên Inworld Realtime TTS 2 Research Preview với 168,5 ms. Bảng được cập nhật liên tục, vì vậy hãy kiểm tra ngày xếp hạng trước khi dùng làm mốc tham chiếu.
Có. POST /v1/audio/stream phát âm thanh qua HTTP theo từng phần khi đang được tạo, hỗ trợ PCM, MP3, Ogg Opus và AAC. PCM có độ trễ thấp nhất vì không cần mã hóa thêm.
Không. SpeechifyAI là API dành cho lập trình viên và được tính phí riêng với ứng dụng đọc Speechify; gói Reader không bao gồm quyền dùng API. Gói API tính theo tháng, không bắt buộc theo năm: miễn phí 500.000 ký tự/tháng không cần thẻ; tiếp theo là Starter $10/tháng (vượt mức tính $10 cho mỗi 1 triệu ký tự), Pro $99/tháng ($8), và Scale $499/tháng ($6).
Hãy thử Simba 3.2 trên SpeechifyAI: tạo API key miễn phí và tự đo yêu cầu đầu tiên để so sánh với các số liệu ở trên.

