プロンプトキャッシング
用語名をコピー
AI概念約1分で読めます
繰り返されるプロンプトの前半部分をキャッシュに保存・再利用し、応答コストと遅延を削減するLLM最適化手法です。
別名
Prompt Cachingプロンプトキャッシュコンテキストキャッシング
詳しい説明
プロンプトキャッシング(Prompt Caching)は、複数のリクエストで同様に繰り返されるプロンプトの前半部分(システム指示文、長文ドキュメント、例など)をキャッシュに保存して再利用することで、毎回処理するコストと遅延を削減する技術です。長い共通のコンテキストを繰り返し送信するチャットボット、エージェント、ドキュメントのQ&Aなどで高い効果を発揮します。キャッシュされた部分は処理コストが大幅に割引され、応答速度も向上します。通常、キャッシュは短時間保持されます。OpenAI、Anthropic、Googleなどがサポートしており、コストに敏感なサービスや、同じ大容量コンテキストを繰り返し利用するサービスで導入効果が顕著です。
ツール選定において重要な理由
同じ長いコンテキスト(システム指示文、マニュアルなど)を繰り返し送信するサービスであれば、プロンプトキャッシングによってコストと応答速度が大きく変化します。ツールやAPIがキャッシングをサポートしているか、何をどのようにキャッシュするかを制御できるか、キャッシュの保持時間や割引率がどのようになっているかが、運用コストを左右します。
ツールを選ぶ際に確認すべき点
- プロンプトキャッシングをサポートし、キャッシュ対象を指定できるか
- キャッシュヒット時のコスト割引率と遅延削減が明確であるか
- キャッシュ保持時間が利用パターンに適しているか
- キャッシュされた機密データの保管・アクセス制御ポリシーが安全であるか
実際の適用例
数十ページの製品マニュアルを質問のたびに送信するカスタマーサポートチャットボットでは、マニュアル部分をキャッシュすることで、2回目以降의質問からその部分の処理コストが大幅に削減され、応答も早くなります。質問ごとに変わるユーザーメッセージのみを新しく処理すればよいためです。
関連用語
トークン最適化 (Token Optimization)
LLMが処理するデータ単位であるトークンの使用量を戦略的に管理することで、API呼び出しコストを削減し、モデルの初期応答時間(TTFT)および全体の推論パフォーマンスを向上させる最適化プロセスです。
コンテキストウィンドウAIモデルが1回のリクエスト(プロンプト)で同時に処理および記憶できるデータ(トークン)の最大範囲です。モデルの「短期記憶」であり、作業スペースの大きさを意味します。
LLM数十億以上のパラメータを通じて膨大なデータを学習した人工知能モデルです。自然言語の理解や生成だけでなく、複雑な推論、要約、コード作成など多様な知的タスクを実行し、現代の生成AIサービスのコアエンジンとしての役割を果たしています。
レイテンシ (Latency)ユーザーがAIにリクエストを送信した時点から、最初の応答が画面に表示されるか、または結果全体が完了するまでにかかる所要時間です。