【ろらりょうしか】

LoRA量子化 とは?

公開:
💡 重い本を圧縮して、必要なメモだけ書き込むファインチューニング術
📌 このページのポイント
QLoRA:量子化ベース + LoRAアダプタ ベースモデル (4bit 量子化済み) Layer 1(圧縮済み) Layer 2(圧縮済み) Layer N(圧縮済み) 学習しない(固定) VRAM: フル比 1/10 以下 LoRAアダプタ 追加する小さな行列 行列A 低ランク 行列B 低ランク ここだけ学習(更新可) 出力(ベース + LoRA差分) 精度を保ちつつVRAMを大幅節約
QLoRA:4bit量子化したベースモデル(固定)にLoRAアダプタ(学習可能)を組み合わせた構造
ひよこ ひよこ
ペンギン先生、「QLoRA」って聞いたけど、LoRAと何が違うの?
ペンギン先生 ペンギン先生
LoRAはモデルの重みを変えずに「差分の小さい行列」だけ学習する手法だったよね。QLoRAはそれに加えて、ベースモデル自体を4bit量子化で超軽量にしてからLoRAをかける、という組み合わせ技なんだよ。
ひよこ ひよこ
量子化ってモデルを軽くする技術だよね。それで学習しても大丈夫なの?
ペンギン先生 ペンギン先生
普通は量子化したモデルはそのまま学習すると精度が下がるんだよ。でもQLoRAでは量子化したモデルは「読み取り専用」にして、学習はLoRAアダプタ部分だけに限定するんだ。だから量子化の精度劣化を最小限に抑えられるんだね。
ひよこ ひよこ
VRAMがどのくらい節約できるの?
ペンギン先生 ペンギン先生
70Bモデルをフルファインチューニングしようとすると、通常は数百GBのVRAMが必要でA100などのハイエンドGPUが何枚も必要だよ。でもQLoRAなら1枚のRTX 3090(24GB)でも動かせるケースがあるんだ。消費VRAMが10分の1以下になることも珍しくないんだよ。
ひよこ ひよこ
じゃあ個人でも大きいモデルをファインチューニングできるってこと?
ペンギン先生 ペンギン先生
そう!これがQLoRAが革命的だといわれた理由だよ。2023年の発表時は「70Bモデルを家庭用GPUファインチューニングできる」と話題になったんだ。医療・法律・社内ドキュメントなど特定ドメインへの適用を低コストで試せるようになったんだね。
ひよこ ひよこ
デメリットや注意点はある?
ペンギン先生 ペンギン先生
量子化LoRAの組み合わせなので、フルファインチューニングに比べると最終的な精度は若干落ちる場合があるよ。また学習データの品質がとても重要で、データが少なかったり偏っていたりすると過学習しやすい。あくまで「コスト対効果のトレードオフ」として使う手法だね。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「QLoRA」って出てきたら「少ないVRAMで大きいモデルをカスタム学習する手法」と思えればだいたいOK!
📖 おまけ:英語の意味
「Quantized Low-Rank Adaptation」 = 量子化された低ランク適応
💬 「Quantized(量子化された)」+「LoRA(Low-Rank Adaptation)」を組み合わせた略語で、2023年にUW(ワシントン大学)のDettmersらが発表した論文名がそのまま通称になっているんだよ
← 用語集にもどる