Speechify가 직접 운영하지 않는 두 벤치마크가 2026년 9월 SpeechifyAI Simba 3.2 모델의 첫 오디오까지 걸리는 시간을 측정했습니다. Coval은 2026년 9월 24일까지 24시간 동안 중간값 106ms를 기록했고, Voice Arena는 같은 날 US English 보드에서 123ms를 기록해 측정된 14개 모델 중 가장 낮았습니다. 이 글에서는 이 수치가 무엇을 뜻하는지, 왜 첫 오디오까지의 시간이 비교해야 할 지연 지표인지, 그리고 이를 직접 측정하는 방법을 설명합니다.
수치 한눈에 보기
두 독립 벤치마크 수치가 자체 측정값보다 높게 나온 이유는, 벤치마크 서버와 Speechify 서버 사이의 네트워크 구간과 오디오 시작 전 무음까지 포함되기 때문입니다. 각 수치는 해당 날짜의 결과이며, 벤치마크 보드는 계속 업데이트되므로 오늘 기준 수치는 각 사이트에서 확인하세요.
Voice Arena US English 보드, 2026년 9월 24일
출처: Voice Arena, 2026년 9월 24일 기준. 보드에서는 14개 모델의 속도를 측정했으며, 여기에는 상위 6개 모델만 표시했습니다.
첫 오디오까지의 시간이 중요한 이유
음성 에이전트가 응답하거나 앱이 텍스트를 읽어줄 때, 사용자는 텍스트를 보낸 순간부터 실제 소리가 들릴 때까지 기다리게 됩니다. 이 대기 시간이 바로 첫 오디오까지의 시간입니다.
- 최초 바이트까지의 시간보다 실제 청취 대기 시간이 더 길 수 있습니다.
- 스트림이 무음으로 시작하면, 사용자는 실제로 들리는 오디오 샘플이 나올 때까지 기다려야 합니다. 첫 오디오까지의 시간은 이 무음 구간도 포함합니다.
- 전체 생성 시간은 마지막 바이트까지 걸리는 시간입니다.
- 이는 파일 저장에는 중요하지만, 오디오를 실시간으로 스트리밍해 들을 때는 핵심 지표가 아닙니다.
- 대화에서는 빠른 응답이 중요합니다.
- 사람들은 보통 몇백 밀리초 안에 서로 반응합니다. 음성 에이전트는 음성 인식, 언어 모델, 음성 합성 과정을 그 짧은 시간 안에 처리해야 하므로, 음성 합성에 쓰이는 매 밀리초가 전체 파이프라인에 영향을 줍니다.
Simba 3.2가 모델 크기 변화 없이 빨라진 이유
Coval 데이터에 따르면 Simba 3.2의 일간 중간값은 2026년 9월 13일 379ms에서 9월 18일 116ms로, 5일 만에 약 70% 줄었습니다.
모델 자체는 바뀌지 않았습니다. 같은 가중치를 유지한 채 디스틸레이션, 양자화, 경량 "터보" 버전 없이 운영됐습니다. 시간 단축은 모델 주변의 서빙 경로를 최적화한 결과였습니다.
- 새로운 GPU 등급용 서빙 빌드와 인퍼런스 스택의 저수준 최적화로 오디오 전송이 더 빨라졌습니다.
- 플랜, 권한, 사용량 제한 확인을 실시간 조회 대신 캐시에서 처리해 최초 바이트까지의 지연을 줄였습니다.
- API 게이트웨이를 GPU와 같은 리전에 두고, 요청마다 연결을 재사용하도록 했습니다.
- 약 100ms에 이르던 시작 무음 구간을 제거했습니다. 실제로 Coval 기준 Simba 3.2의 선행 무음은 9월 14일 102ms에서 13ms로 줄었습니다.
품질도 그대로 유지됐습니다. Artificial Analysis 텍스트 투 스피치 순위에서 Simba 3.2는 2026년 9월 23일 Elo 점수 1,237(±14)로 92개 공급자 음성 중 상위 5위에 올랐고, 이보다 높은 평가를 받은 모든 모델은 더 높은 비용이 듭니다.
내 앱에서 지연 시간을 최소화하는 방법
- 스트리밍을 사용하세요.
- 실시간 재생이 필요한 경우
- POST /v1/audio/stream
- 을 호출하세요.
- POST /v1/audio/speech
- 는 전체 오디오가 준비된 뒤에야 응답합니다.
- Simba 3.2를 지정하세요.
- 영어 텍스트라면
- model
- 을
- simba-3.2
- 로 설정하세요. 생략하면
- simba-3.0
- 이 사용됩니다.
- 연결을 재사용하세요.
- HTTP 클라이언트를 하나만 만들어 시작 시 연결을 열어두고 모든 요청에 계속 쓰면 DNS 조회나 TCP/TLS 핸드셰이크 시간을 줄일 수 있습니다.
- 문장 단위로 바로 전송하세요.
- 앞단에 언어 모델이 있다면, 문장이 완성되는 즉시 개별 스트림으로 보내고 도착하는 순서대로 재생하세요.
- 플레이어에 맞는 포맷을 고르세요.
- audio/pcm
- (24kHz)은 인코딩 없이 바로 재생할 수 있습니다. 대역폭이 중요하다면 MP3 또는 Ogg Opus를 사용하세요.
- API와 가까운 위치에서 실행하세요.
- API는 미국 동부에서 제공되므로, 해당 지역이나 인근 서버를 사용하면 네트워크 지연을 최소화할 수 있습니다.
LiveKit Agents로 개발 중이신가요? 이 안내서에서는 Speechify 플러그인을 사용해 언어 모델이 문장을 생성하는 즉시 각 문장을 스트리밍하는 음성 에이전트를 만드는 방법을 다룹니다. 단계별 설명과 코드 예시는 지연 시간 문서에서 확인할 수 있습니다.
직접 측정하는 방법
직접 작성한 코드에서 스트리밍 응답의 첫 번째 청크까지 걸리는 시간을 측정하세요. 공정한 수치를 얻으려면 아래 가이드를 따르세요.
- 처음 1~2회의 요청은 제외하세요. 연결 초기화 시간이 포함되기 때문입니다.
- 요청마다 텍스트 내용을 다양하게 바꿔 실제 트래픽과 비슷하게 맞추세요.
- 요청은 동시에 보내지 말고 순차적으로 처리하세요.
- 최소 20회 요청한 뒤 중간값(p50)과 p90을 기록하세요. 평균이나 최고값이 아닙니다.
- PCM 포맷으로 측정하세요. Ogg는 첫 바이트가 헤더라 실제 오디오가 아닙니다.
각 스트리밍 응답에는 Server-Timing 헤더가 포함되며, 여기의 ttfb 값이 Speechify 측 처리 시간입니다. 그 밖의 시간은 네트워크와 사용자 환경의 영향을 받습니다. 지연 시간 문서에서 Python과 TypeScript 예제 스크립트를 참고하세요.
자주 묻는 질문
SpeechifyAI Simba 3.2 모델은 2026년 9월 15일 미국 동부 실제 트래픽 기준으로 첫 오디오 바이트까지의 중간값이 56ms였고, p90은 102ms였습니다. 독립 벤치마크에서는 2026년 9월 24일까지 24시간 동안 Coval 기준 106ms, Voice Arena 기준 123ms로 측정됐으며, 이 값에는 네트워크와 오디오 시작 전 무음도 포함됩니다.
Voice Arena US English 보드 기준(2026년 9월 24일), SpeechifyAI Simba 3.2가 측정된 14개 모델 중 첫 오디오까지의 중간값이 123ms로 가장 짧았습니다. 2위는 Inworld Realtime TTS 2 리서치 프리뷰로 168.5ms였습니다. 벤치마크는 계속 갱신되므로 순위를 볼 때는 날짜를 함께 확인하세요.
네. POST /v1/audio/stream을 통해 오디오가 생성되는 동시에 HTTP로 PCM, MP3, Ogg Opus, AAC 형식으로 전송됩니다. PCM 형식은 별도 가공 없이 바로 재생할 수 있어 지연 시간이 가장 짧습니다.
아니요. SpeechifyAI는 Speechify의 개발자용 API로, Speechify Reader 앱과는 별도로 과금됩니다. 앱 구독(Reader)과 API 사용은 각각 따로 청구되며, API 플랜은 연간 약정 없이 월 단위로 이용할 수 있습니다. 무료 플랜은 월 50만 자까지 신용카드 없이 사용할 수 있고, Starter는 월 $10($10/100만 자 추가), Pro는 $99($8/100만 자), Scale은 $499($6/100만 자)입니다.
SpeechifyAI에서 Simba 3.2를 직접 사용해 보세요. 무료 API 키를 만들고 위 수치와 비교해 보실 수 있습니다.

