Speechifyが運営していない2つのベンチマークで、2026年9月にSpeechifyAIのSimba 3.2モデルの最初の音声までの時間が計測されました。Covalでは2026年9月24日までの24時間で中央値106msを記録。Voice Arenaでは同日、US英語ボードで123msを記録し、計測対象14モデル中最速でした。本記事では、これらの数値が意味すること、なぜ最初の音声までの時間が比較すべきレイテンシ指標なのか、そしてご自身のコードでの測定方法を説明します。
数値の内訳
2つの独立測定値が自社測定値より大きいのは、ネットワーク経路や音声冒頭の無音を含んでいるためです。いずれも当日の各ベンチマークで計測された値です。両ボードとも公開かつ継続的に再実行されているため、最新の数値は公式サイトをご確認ください。
Voice Arena US英語ボード 2026年9月24日
出典:Voice Arena(2026年9月24日取得)。計14モデルを測定し、上位6モデルを掲載しています。
なぜ「最初の音声までの時間」を比較すべきなのか
音声エージェントが応答したり、アプリがテキストを読み上げたりする際、リスナーが待つのはテキスト送信から実際に音が聞こえるまでの時間です。これが、最初の音声までの時間です。
- 最初のバイトまでの時間は、実際に聞こえる体験と一致しないことがあります。 ストリームが無音から始まる場合、リスナーは最初の可聴サンプルが出るまで何も聞こえません。最初の音声までの時間は、この無音も含めてカウントします。
- 生成完了までの全体時間は、最後のバイトまでの時間です。 ファイル保存では重要ですが、ストリーミング再生ではリスナーは途中から聞き始められるため、意味合いが異なります。
- 会話のテンポには、使える時間が数百ミリ秒しかありません。 音声エージェントは、その短い時間で音声認識・言語モデル・音声合成をすべて処理する必要があります。発話開始までの数ミリ秒の遅れでも、他の処理に使える時間を圧迫します。
Simba 3.2がモデルはそのままで高速化した理由
Covalのデータによると、Simba 3.2の1日中央値は2026年9月13日の379msから、18日には116msまで下がり、約70%改善しました。
モデル自体は変更していません。同じ重みを使い、蒸留も量子化も「ターボ」バリアント化も行っていません。短縮できたのは、モデル周辺の配信経路を改善したためです。
- 新しいGPUクラス向けのサービングビルドにより、推論スタックを最適化し、音声配信の開始を前倒し。
- プラン・利用権限・レート制限のチェックをライブ参照からキャッシュ参照に切り替え、最初のバイト前の遅延を削減。
- APIゲートウェイをGPUと同じリージョンで稼働させ、接続をリクエスト間で維持。
- 約100ms分の無音を削除。Covalの先頭無音の測定値も、9/14の102msから13msまで改善。
品質は維持しています。Artificial Analysis テキスト読み上げリーダーボードでは、Simba 3.2は2026年9月23日時点でElo 1,237(±14)を記録し、全92プロバイダー中で上位5位以内に入っています。これを上回るモデルは、いずれも高価格帯です。
アプリでレイテンシを最小限に抑える方法
- ストリーミング再生を使う。POST /v1/audio/streamは生成中に順次再生できます。POST /v1/audio/speechはクリップ全体の生成完了後にのみ応答します。
- Simba 3.2を指定する。 英語ではmodelにsimba-3.2を指定してください。省略時はsimba-3.0が使われます。
- 接続を再利用する。 単一のHTTPクライアントで起動時に接続し、その後もリクエストごとに使い回すことで、DNSやTCP/TLSハンドシェイクの遅延を減らせます。
- 文ごとに送信する。 言語モデルの出力を各文ごとにすぐ送信し、順次再生します。
- 再生形式を最適化する。 audio/pcm(24kHz)はエンコード不要で、最も低レイテンシです。帯域を優先するならMP3やOgg Opusが適しています。
- APIに地理的に近いサーバーを使う。 APIはUS Eastで提供されているため、同地域のサーバーが最短経路になります。
LiveKit Agentsをお使いですか?こちらのガイドでは、Speechifyプラグインを使って、言語モデルの出力を文単位でストリーミングする音声エージェントの構築例を紹介しています。手順ごとの理由やコードは、レイテンシ解説でご覧いただけます。
自分でレイテンシを測る方法
ストリーミング応答の最初のチャンクが、ご自身のコードに返ってくるまでの時間を計測します。正確な値を得るには、次の点に注意してください。
- 最初の1~2回のリクエストは除外する。これらには接続開始時間が含まれます。
- リクエストごとにテキストを変え、実際のトラフィックに近い条件にする。
- リクエストは連続で送信し、並列実行はしない。
- 少なくとも20回は計測し、中央値(p50)とp90を報告する。平均値や最速値だけで判断しない。
- 計測はPCMで行う。Oggでは先頭バイトがヘッダーで、音声そのものではありません。
各ストリーミング応答にはServer-Timingヘッダーが付いており、ttfbの値で当社側の処理時間を確認できます。残りはネットワークやご自身のスタックによる時間です。レイテンシ解説には、PythonとTypeScript向けのスクリプト例もあります。
よくあるご質問
SpeechifyAI Simba 3.2モデルは、2026年9月15日時点でUS East本番トラフィックにおいて、中央値56ms・p90 102msで音声出力を開始しました。独立ベンチマークでは、2026年9月24日までのCovalで中央値106ms、Voice Arenaで123msと計測されており、いずれもネットワークや冒頭の無音を含みます。
2026年9月24日のVoice Arena US英語ボードでは、SpeechifyAI Simba 3.2が14モデル中最速となる中央値123msを記録し、Inworld Realtime TTS 2 Research Preview(168.5ms)を上回りました。ランキングは随時更新されるため、利用時は日付をご確認ください。
はい。POST /v1/audio/streamは、生成しながらPCM・MP3・Ogg Opus・AAC形式でHTTP配信します。PCMはエンコード不要のため、最も低レイテンシです。
いいえ。SpeechifyAIはSpeechifyの開発者向けAPIで、Speechifyリーディングアプリとは別料金です。ReaderプランにはAPI利用は含まれません。APIプランは年契約不要の月額制で、無料(最大50万文字/月・カード不要)、Starter(10ドル/月・超過1M文字ごとに10ドル)、Pro(99ドル/月・超過8ドル)、Scale(499ドル/月・超過6ドル)です。
Simba 3.2をSpeechifyAIでぜひお試しください。無料のAPIキーを作成すれば、上記のベンチマーク値と比較しながらご自身でも計測できます。

