【ろらりょうしか】
LoRA量子化 とは?
公開:
💡 重い本を圧縮して、必要なメモだけ書き込むファインチューニング術
📌 このページのポイント
ペンギン先生、「QLoRA」って聞いたけど、LoRAと何が違うの?
量子化ってモデルを軽くする技術だよね。それで学習しても大丈夫なの?
VRAMがどのくらい節約できるの?
70Bモデルをフルファインチューニングしようとすると、通常は数百GBのVRAMが必要でA100などのハイエンドGPUが何枚も必要だよ。でもQLoRAなら1枚のRTX 3090(24GB)でも動かせるケースがあるんだ。消費VRAMが10分の1以下になることも珍しくないんだよ。
じゃあ個人でも大きいモデルをファインチューニングできるってこと?
そう!これがQLoRAが革命的だといわれた理由だよ。2023年の発表時は「70Bモデルを家庭用GPUでファインチューニングできる」と話題になったんだ。医療・法律・社内ドキュメントなど特定ドメインへの適用を低コストで試せるようになったんだね。
デメリットや注意点はある?
まとめ:ざっくりこれだけ覚えればOK!
「QLoRA」って出てきたら「少ないVRAMで大きいモデルをカスタム学習する手法」と思えればだいたいOK!
📖 おまけ:英語の意味
「Quantized Low-Rank Adaptation」 = 量子化された低ランク適応
💬 「Quantized(量子化された)」+「LoRA(Low-Rank Adaptation)」を組み合わせた略語で、2023年にUW(ワシントン大学)のDettmersらが発表した論文名がそのまま通称になっているんだよ