Skip to main content
  1. ホーム
  2. API
  3. 2026年のテキスト読み上げAPIレイテンシ:独立測定による最初の音声までの時間
Published on •API

2026年のテキスト読み上げAPIレイテンシ:独立測定による最初の音声までの時間

Speechifyチーム

Speechify チーム


Speechify APIは300msの 
低遅延、人間の声のような自然さ、 
50以上の言語に対応

Apple2025年 Apple デザインアワード受賞
5,000万以上のユーザー

Speechifyが運営していない2つのベンチマークで、2026年9月にSpeechifyAIのSimba 3.2モデルの最初の音声までの時間が計測されました。Covalでは2026年9月24日までの24時間で中央値106msを記録。Voice Arenaでは同日、US英語ボードで123msを記録し、計測対象14モデル中最速でした。本記事では、これらの数値が意味すること、なぜ最初の音声までの時間が比較すべきレイテンシ指標なのか、そしてご自身のコードでの測定方法を説明します。

数値の内訳

ベンチマーク

測定内容

Simba 3.2

測定時期

Voice Arena US英語ボード

リアルタイムストリーミング経路における最初の音声までの中央値

123ms(計測対象14モデル中最速)

2026年9月24日

Coval

最初の可聴サンプル前の無音も含めた、最初の音声までの中央値。オープンソースのハーネスを使い、米国東部から30分ごとに実行。

106ms

2026年9月24日までの24時間

SpeechifyAI本番トラフィック(自社測定)

US Eastの本番リクエストで、APIが最初の音声バイトを書き込むまでの時間

56ms(p50)、102ms(p90)

2026年9月15日

2つの独立測定値が自社測定値より大きいのは、ネットワーク経路や音声冒頭の無音を含んでいるためです。いずれも当日の各ベンチマークで計測された値です。両ボードとも公開かつ継続的に再実行されているため、最新の数値は公式サイトをご確認ください。

Voice Arena US英語ボード 2026年9月24日

モデル

最初の音声までの中央値

SpeechifyAI Simba 3.2 リアルタイム

123ms

Inworld Realtime TTS 2 Research Preview

168.5ms

Gradium TTS リアルタイム

236ms

Cartesia Sonic-3.5 リアルタイム

250ms

Smallest AI Lightning 3.1 Pro リアルタイム

263.5ms

Fish Audio S2 Pro リアルタイム

267ms

出典:Voice Arena(2026年9月24日取得)。計14モデルを測定し、上位6モデルを掲載しています。

なぜ「最初の音声までの時間」を比較すべきなのか

音声エージェントが応答したり、アプリがテキストを読み上げたりする際、リスナーが待つのはテキスト送信から実際に音が聞こえるまでの時間です。これが、最初の音声までの時間です。

  • 最初のバイトまでの時間は、実際に聞こえる体験と一致しないことがあります。 ストリームが無音から始まる場合、リスナーは最初の可聴サンプルが出るまで何も聞こえません。最初の音声までの時間は、この無音も含めてカウントします。
  • 生成完了までの全体時間は、最後のバイトまでの時間です。 ファイル保存では重要ですが、ストリーミング再生ではリスナーは途中から聞き始められるため、意味合いが異なります。
  • 会話のテンポには、使える時間が数百ミリ秒しかありません。 音声エージェントは、その短い時間で音声認識・言語モデル・音声合成をすべて処理する必要があります。発話開始までの数ミリ秒の遅れでも、他の処理に使える時間を圧迫します。

Simba 3.2がモデルはそのままで高速化した理由

Covalのデータによると、Simba 3.2の1日中央値は2026年9月13日の379msから、18日には116msまで下がり、約70%改善しました。

モデル自体は変更していません。同じ重みを使い、蒸留も量子化も「ターボ」バリアント化も行っていません。短縮できたのは、モデル周辺の配信経路を改善したためです。

  • 新しいGPUクラス向けのサービングビルドにより、推論スタックを最適化し、音声配信の開始を前倒し。
  • プラン・利用権限・レート制限のチェックをライブ参照からキャッシュ参照に切り替え、最初のバイト前の遅延を削減。
  • APIゲートウェイをGPUと同じリージョンで稼働させ、接続をリクエスト間で維持。
  • 約100ms分の無音を削除。Covalの先頭無音の測定値も、9/14の102msから13msまで改善。

品質は維持しています。Artificial Analysis テキスト読み上げリーダーボードでは、Simba 3.2は2026年9月23日時点でElo 1,237(±14)を記録し、全92プロバイダー中で上位5位以内に入っています。これを上回るモデルは、いずれも高価格帯です。

アプリでレイテンシを最小限に抑える方法

  1. ストリーミング再生を使う。POST /v1/audio/streamは生成中に順次再生できます。POST /v1/audio/speechはクリップ全体の生成完了後にのみ応答します。
  2. Simba 3.2を指定する。 英語ではmodelにsimba-3.2を指定してください。省略時はsimba-3.0が使われます。
  3. 接続を再利用する。 単一のHTTPクライアントで起動時に接続し、その後もリクエストごとに使い回すことで、DNSやTCP/TLSハンドシェイクの遅延を減らせます。
  4. 文ごとに送信する。 言語モデルの出力を各文ごとにすぐ送信し、順次再生します。
  5. 再生形式を最適化する。 audio/pcm(24kHz)はエンコード不要で、最も低レイテンシです。帯域を優先するならMP3やOgg Opusが適しています。
  6. APIに地理的に近いサーバーを使う。 APIはUS Eastで提供されているため、同地域のサーバーが最短経路になります。

LiveKit Agentsをお使いですか?こちらのガイドでは、Speechifyプラグインを使って、言語モデルの出力を文単位でストリーミングする音声エージェントの構築例を紹介しています。手順ごとの理由やコードは、レイテンシ解説でご覧いただけます。

自分でレイテンシを測る方法

ストリーミング応答の最初のチャンクが、ご自身のコードに返ってくるまでの時間を計測します。正確な値を得るには、次の点に注意してください。

  • 最初の1~2回のリクエストは除外する。これらには接続開始時間が含まれます。
  • リクエストごとにテキストを変え、実際のトラフィックに近い条件にする。
  • リクエストは連続で送信し、並列実行はしない。
  • 少なくとも20回は計測し、中央値(p50)とp90を報告する。平均値や最速値だけで判断しない。
  • 計測はPCMで行う。Oggでは先頭バイトがヘッダーで、音声そのものではありません。

各ストリーミング応答にはServer-Timingヘッダーが付いており、ttfbの値で当社側の処理時間を確認できます。残りはネットワークやご自身のスタックによる時間です。レイテンシ解説には、PythonとTypeScript向けのスクリプト例もあります。

よくあるご質問

SpeechifyAI Simba 3.2モデルは、2026年9月15日時点でUS East本番トラフィックにおいて、中央値56ms・p90 102msで音声出力を開始しました。独立ベンチマークでは、2026年9月24日までのCovalで中央値106ms、Voice Arenaで123msと計測されており、いずれもネットワークや冒頭の無音を含みます。

2026年9月24日のVoice Arena US英語ボードでは、SpeechifyAI Simba 3.2が14モデル中最速となる中央値123msを記録し、Inworld Realtime TTS 2 Research Preview(168.5ms)を上回りました。ランキングは随時更新されるため、利用時は日付をご確認ください。

はい。POST /v1/audio/streamは、生成しながらPCM・MP3・Ogg Opus・AAC形式でHTTP配信します。PCMはエンコード不要のため、最も低レイテンシです。

いいえ。SpeechifyAIはSpeechifyの開発者向けAPIで、Speechifyリーディングアプリとは別料金です。ReaderプランにはAPI利用は含まれません。APIプランは年契約不要の月額制で、無料(最大50万文字/月・カード不要)、Starter(10ドル/月・超過1M文字ごとに10ドル)、Pro(99ドル/月・超過8ドル)、Scale(499ドル/月・超過6ドル)です。

Simba 3.2をSpeechifyAIでぜひお試しください。無料のAPIキーを作成すれば、上記のベンチマーク値と比較しながらご自身でも計測できます。

Speechify自慢の音声を、API経由で高速・スケーラブルかつ開発者フレンドリーにご利用いただけます

APIアクセスを取得
Sparse JavaScript keywords import, from, const, await on a white background

この記事をシェアする

Speechifyチーム

Speechify チーム


Speechify チーム

Speechify

Speechifyについて

No.1 テキスト読み上げリーダー

Speechify は、世界をリードする テキスト読み上げ プラットフォームであり、5,000万を超えるユーザーに利用され、iOSiOS、Android、Chrome拡張機能、Webアプリ、そしてMacデスクトップアプリで50万件以上の5つ星レビューを獲得しています。2025年には、Appleから権威あるApple デザインアワードをWWDCで受賞し、「人々の暮らしを支える重要なリソース」と評されました。Speechifyは、60言語以上・1,000以上の自然な音声を提供し、ほぼ200か国で利用されています。有名人の音声にはSnoop Doggやグウィネス・パルトロウなども含まれます。クリエイターや企業向けに、Speechify Studio では高度なツールを提供し、AIボイスジェネレーター、AIボイスクローン、AI吹き替え、そしてAIボイスチェンジャーも利用できます。また、Speechifyは高品質でコストパフォーマンスに優れたテキスト読み上げAPIで、主要なプロダクトも支えています。これまでにウォール・ストリート・ジャーナル、CNBC、Forbes、TechCrunchなどの主要メディアにも取り上げられています。Speechifyは世界最大のテキスト読み上げプロバイダーです。詳しくはspeechify.com/news、speechify.com/blog、speechify.com/pressをご覧ください。