【こんてきすときゃっしゅ】

コンテキストキャッシュ とは?

公開:
💡 「同じ前置きを何度も送るのは無駄」——よく使うコンテキストをサーバーに保存して再利用する省エネ技術

長いシステムプロンプトや文書をLLMのサーバー側に一時保存し、同じコンテキストの再送信を省略してコストと遅延を削減する機能。AnthropicやGoogleが提供。

📌 このページのポイント
コンテキストキャッシュ:毎回全送信 vs キャッシュ活用 キャッシュなし(毎回全送信) システムPrompt (5000トークン) + 質問1 LLM システムPrompt (5000トークン) + 質問2 LLM 毎回 5000 tok → 高コスト・遅い コンテキストキャッシュ活用 システムPrompt (5000トークン) キャッシュ に保存 + 質問1(差分のみ) → LLM応答(速い・安い) + 質問2(差分のみ) → LLM応答(速い・安い) 差分のみ送信 → 最大90%コスト削減
キャッシュなし(毎回全送信)とコンテキストキャッシュ活用の比較
ひよこ ひよこ
ペンギン先生、AIに長い説明文を何度も送り直すのって大変じゃないの?
ペンギン先生 ペンギン先生
そこで「コンテキストキャッシュ」の出番だよ。長いsystem promptや参照文書を一度サーバーに預けておけば、2回目以降は「その保存データを使って」と短く伝えるだけで済むんだ。
ひよこ ひよこ
じゃあ毎回全部送らなくていいんだね!どのくらい安くなるの?
ペンギン先生 ペンギン先生
キャッシュに命中したトークンはコストが最大90%オフになるよ。AnthropicのPrompt Cachingはキャッシュ済みトークンが通常の約10%の料金で済むんだ。
ひよこ ひよこ
それすごい節約になるんだね!でも、キャッシュはずっと残るの?
ペンギン先生 ペンギン先生
TTL(有効期限)があって、Anthropicは最長5分間保持するよ。期限が切れたら自動削除されて次のリクエストでまた全部送ることになる。長文書を繰り返し参照するRAGやチャットシステムに特に有効な技術だね。
ひよこ ひよこ
RAGとも組み合わせられるんだね!コンテキストウィンドウがどんどん長くなる中で、コストが跳ね上がらないように大事な技術なんだね!
ペンギン先生 ペンギン先生
まさにそうだよ。コンテキスト長が100万トークンを超える時代になると、キャッシュなしで毎回全部送ったら費用が莫大になるからね。大規模LLMアプリの設計では欠かせない最適化手法だよ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「コンテキストキャッシュ」って出てきたら「長いプロンプトサーバーに保存して使い回す節約技術」と思えればだいたいOK!
📖 おまけ:英語の意味
「Context Caching」 = コンテキストのキャッシュ保存
💬 DBのクエリキャッシュと同じ発想をLLMに適用したもの。毎回全文を送らなくていいから速いし安いよ。
← 用語集にもどる