推論性能 (Inference Performance)

技術用語
約1分で読めます

AIモデルがユーザーの入力を受け取って結果を生成する速度と効率性のことで、主に最初のトークン生成時間(TTFT)と1秒あたりのトークン数(TPS)で測定されます。

別名
tokens per secondthroughput

詳しい説明

トレーニングを終えたAIモデルが、実際のサービス環境でデータを処理するリアルタイムの実行能力を意味します。大規模言語モデル(LLM)においては、ユーザーが体感する応答遅延時間(Latency)と、システムが一度に処理できるデータ量(Throughput)が鍵となります。最近では、推論時に演算量を増やして性能を高める「推論時間スケーリング(Inference-time Scaling)」技術が導入されており、単なる速度を超えて、コストに対する出力品質を決定づける重要なツール選定基準となっています。

ツール選定において重要な理由

推論性能は、ユーザー体験(UX)と運営コスト(OPEX)に直結します。応答が遅ければユーザー離脱率が高まり、効率の低いツールはサービス拡張時のサーバー費用を指数関数的に増加させます。特にリアルタイムチャットやAPI連携サービスを構築する際、最も優先して考慮すべきハードウェアおよびソフトウェアの指標です。

確認すべき点

  • TTFT(最初のトークン生成時間):ユーザーが応答を待つ最初の待機時間(0.2〜0.5秒以内を推奨)
  • TPS(1秒あたりのトークン生成数):回答全体が完成する速度(ユーザーの読書速度より速いかを確認)
  • コスト効率:100万トークンあたりに発生する課金料金に対する処理速度の適切性
  • 同時接続処理能力:ユーザー急増時にも一定の応答速度を維持できるか否か

例

カスタマーサポート用チャットボットを作成する際、応答品質が同等であれば、ユーザーに「待たされている」という印象を与えないようにTTFTが短いモデルを選択すべきです。一方、大量のドキュメントを要約するバックエンド処理であれば、TTFTよりも全体のスループット(Throughput)が高いモデルやAPIプロバイダーを選択する方が、コスト面で有利になります。

関連用語

レイテンシ (Latency)量子化