プロンプトキャッシング

AI概念
約1分で読めます

繰り返されるプロンプトの前半部分をキャッシュに保存・再利用し、応答コストと遅延を削減するLLM最適化手法です。

別名
Prompt Cachingプロンプトキャッシュコンテキストキャッシング

詳しい説明

プロンプトキャッシング(Prompt Caching)は、複数のリクエストで同様に繰り返されるプロンプトの前半部分(システム指示文、長文ドキュメント、例など)をキャッシュに保存して再利用することで、毎回処理するコストと遅延を削減する技術です。長い共通のコンテキストを繰り返し送信するチャットボット、エージェント、ドキュメントのQ&Aなどで高い効果を発揮します。キャッシュされた部分は処理コストが大幅に割引され、応答速度も向上します。通常、キャッシュは短時間保持されます。OpenAI、Anthropic、Googleなどがサポートしており、コストに敏感なサービスや、同じ大容量コンテキストを繰り返し利用するサービスで導入効果が顕著です。

ツール選定において重要な理由

同じ長いコンテキスト(システム指示文、マニュアルなど)を繰り返し送信するサービスであれば、プロンプトキャッシングによってコストと応答速度が大きく変化します。ツールやAPIがキャッシングをサポートしているか、何をどのようにキャッシュするかを制御できるか、キャッシュの保持時間や割引率がどのようになっているかが、運用コストを左右します。

ツールを選ぶ際に確認すべき点

  • プロンプトキャッシングをサポートし、キャッシュ対象を指定できるか
  • キャッシュヒット時のコスト割引率と遅延削減が明確であるか
  • キャッシュ保持時間が利用パターンに適しているか
  • キャッシュされた機密データの保管・アクセス制御ポリシーが安全であるか

実際の適用例

数十ページの製品マニュアルを質問のたびに送信するカスタマーサポートチャットボットでは、マニュアル部分をキャッシュすることで、2回目以降의質問からその部分の処理コストが大幅に削減され、応答も早くなります。質問ごとに変わるユーザーメッセージのみを新しく処理すればよいためです。

関連用語

トークン最適化 (Token Optimization)コンテキストウィンドウLLMレイテンシ (Latency)