【プロンプトあっしゅく】

プロンプト圧縮 とは?

公開:
💡 長い説明書を要点メモに変えて、AIに渡す小型化マシン

長いコンテキストをトークン数を抑えながら重要な情報だけに絞り込む技術。APIコストの削減と推論速度の向上が主な目的で、LLMLinguaなどのツールが代表的。

📌 このページのポイント
プロンプト圧縮:不要トークンを削ってコスト削減 元のプロンプト 多トークン 圧縮エンジン LLMLingua等 圧縮後 少トークン LLM →回答 重要度スコアで自動判定 低重要度トークンを削除 コスト削減 & 推論高速化
低重要度トークンを削除して圧縮することでコストと速度を改善するイメージ
ひよこ ひよこ
コンテキストウィンドウが大きくなったのに、まだ圧縮が必要なの?
ペンギン先生 ペンギン先生
コンテキストが長くなるほどAPIコストも増えるし、推論も遅くなるんだよ。無駄なトークンを省けば同じ精度をずっと安く出せるんだ。
ひよこ ひよこ
どうやって「無駄なトークン」を見つけるの?
ペンギン先生 ペンギン先生
LLMLinguaみたいな小型モデルがトークンごとに「情報量スコア」を計算して、低いものを削除するんだよ。文全体の意味を保ちながら間引くイメージだね。
ひよこ ひよこ
削りすぎて意味が変わっちゃったりしない?
ペンギン先生 ペンギン先生
そこが技術の肝で、重要なキーワードや論理構造は残すように設計されてるんだ。実験では元の20%まで圧縮しても精度がほぼ変わらないケースもあるよ。
ひよこ ひよこ
RAGで長い文書を渡すときに使うと効果的なんだね!
ペンギン先生 ペンギン先生
そう! 取得した文書チャンクをLLMに渡す前に圧縮するパイプラインが定番だよ。コストが下がるとRAGを大規模に使いやすくなるんだよ。
ひよこ ひよこ
プロンプトキャッシングと組み合わせたらもっと節約できそうだね!
ペンギン先生 ペンギン先生
相性は良いんだけど、圧縮でトークンが変わるとキャッシュヒットしにくくなることもあるんだよ。設計時に両方のトレードオフを考える必要があるね。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
プロンプト圧縮」って出てきたら「プロンプトの無駄を削ってトークンを節約する技術」と思えればだいたいOK!
📖 おまけ:英語の意味
「Prompt Compression」 = プロンプト圧縮
💬 Prompt(プロンプト)+ Compression(圧縮)そのままの名前だよ。テキストの圧縮・解凍の考え方をAIへの入力に適用したんだよ
← 用語集にもどる