【えるえるえむあっしゅく】
LLM圧縮 とは?
最終更新:
💡 言語モデルを軽くして、必要な資源を減らす技術
大規模言語モデルの保存量や実行時の資源を減らすための技術群。量子化、枝刈り、知識蒸留などがある。出力品質や速度への影響は、手法、モデル、実行環境によって異なる。
📌 このページのポイント
ファイルをzipにすれば、軽く動くの?
どんな方法があるの?
小さくなれば速くなるよね?
圧縮すればスマホでも元と同じように使える?
使えるかはモデルの大きさ、端末のメモリ、対応する実行ソフト、扱う文章の長さなどによるよ。知識蒸留も教師の能力を丸ごとコピーするわけではない。元と同じ条件で用途ごとの品質を確認し、どの端末でも性能を保って動く、とは決めつけないでね。
まとめ:ざっくりこれだけ覚えればOK!
「LLM圧縮」って出てきたら「言語モデルを軽くして、必要な資源を減らす技術」と思えばだいたいOK!
📖 おまけ:英語の意味
「LLM Compression」 = 大規模言語モデルの圧縮
💬 LLMはLarge Language Modelの略、Compressionは圧縮。モデルの保存や実行に必要な資源を減らす技術をまとめて表すよ。