【こんてきすときゃっしゅ】
コンテキストキャッシュ とは?
公開:
💡 「同じ前置きを何度も送るのは無駄」——よく使うコンテキストをサーバーに保存して再利用する省エネ技術
長いシステムプロンプトや文書をLLMのサーバー側に一時保存し、同じコンテキストの再送信を省略してコストと遅延を削減する機能。AnthropicやGoogleが提供。
📌 このページのポイント
ペンギン先生、AIに長い説明文を何度も送り直すのって大変じゃないの?
そこで「コンテキストキャッシュ」の出番だよ。長いsystem promptや参照文書を一度サーバーに預けておけば、2回目以降は「その保存データを使って」と短く伝えるだけで済むんだ。
じゃあ毎回全部送らなくていいんだね!どのくらい安くなるの?
それすごい節約になるんだね!でも、キャッシュはずっと残るの?
RAGとも組み合わせられるんだね!コンテキストウィンドウがどんどん長くなる中で、コストが跳ね上がらないように大事な技術なんだね!
📖 おまけ:英語の意味
「Context Caching」 = コンテキストのキャッシュ保存
💬 DBのクエリキャッシュと同じ発想をLLMに適用したもの。毎回全文を送らなくていいから速いし安いよ。