レイテンシ (Latency)

技術用語
約1分で読めます

ユーザーがAIにリクエストを送信した時点から、最初の応答が画面に表示されるか、または結果全体が完了するまでにかかる所要時間です。

別名
response timeinference speed

詳しい説明

AIツールの性能を決定する核心的な指標であり、特にLLM(大規模言語モデル)では、最初の文字が出力される「TTFT(Time To First Token)」と、1秒あたりの生成速度である「TPS(Tokens Per Second)」に区分されます。2026年現在、GroqのようなLPUベースのハードウェアは500〜800 TPS以上の速度を記録しており、リアルタイム音声AIは自然な対話のために300ms以下のレイテンシを目指しています。ネットワーク環境、モデルのパラメータサイズ、サーバーハードウェアの最適化レベルによって決定されます。

AIツール選定において重要な理由

レイテンシはユーザー体験(UX)に直結します。リアルタイムの相談チャットボットや音声アシスタントの場合、レイテンシが1秒を超えると会話の流れが途切れ、信頼性が急激に低下します。一方、大量のレポート要約やコード生成ツールでは、全体的な処理速度(TPS)の方が重要になります。ビジネスの目的に応じて、「反応速度」と「処理容量」のどちらを優先するかを決定する必要があります。

選定時のチェックリスト

  • リアルタイムチャットアプリ:TTFTが500ms以内であることを確認してください。
  • 音声AIサービス:エンドツーエンド(E2E)遅延時間が300〜600msの間であることを確認してください。
  • 大量のデータ処理:個々の反応速度よりも、全体の完了時間(スループット)が短い(処理能力が高い)ツールを選択してください。
  • オフライン環境が必要な場合:インターネット接続の遅延がないオンデバイス(On-device)AIモデルを検討してください。

性能の例

2026年5月現在、GPT-4oは平均460ms前後のTTFTを示しており、一般的なチャットに適しています。一方、超高速推論の専門エンジンであるGroqのLlama 3ベースのAPIは800 TPSを上回り、複雑なエージェントワークフローでも遅延のないリアルタイムフィードバックを提供します。

関連用語

推論性能 (Inference Performance)オンデバイスAI (On-device AI)