【きゅーろーら】

QLoRA とは?

公開:
💡 「70BモデルをノートPC1台で学習」——量子化とLoRAを合わせた省エネファインチューニング革命

量子化(Quantization)とLoRAを組み合わせた効率的なファインチューニング手法。4bitに量子化したモデルにLoRAアダプタを適用し、コンシューマGPUで大型LLMをファインチューニングできる。

📌 このページのポイント
QLoRA:通常ファインチューニング vs QLoRA 通常ファインチューニング 全パラメータ (32bit浮動小数) すべて更新 70B モデル例 VRAM 140GB+ 必要 A100 x 複数台が必要 QLoRA 量子化済み モデル重み (4bit 凍結) LoRA アダプタ (学習対象) VRAM 24GB コンシューマGPU 1枚でOK
通常ファインチューニング(全パラメータ更新・大VRAM)とQLoRA(量子化+アダプタのみ更新・小VRAM)の比較
ひよこ ひよこ
ペンギン先生、大きなAIモデルを自分でカスタム学習させるには、すごく高いGPUが必要なの?
ペンギン先生 ペンギン先生
普通のフルファインチューニングだとそうなんだけど、「QLoRA」を使えばコンシューマ向けのGPU1枚でも70億〜650億パラメータの大型モデルを学習できるんだよ。
ひよこ ひよこ
そんなに節約できるの?どういう仕組みなの?
ペンギン先生 ペンギン先生
2つの技術を組み合わせているんだ。まず「量子化」でモデルの重みを32bitから4bitに圧縮してメモリを75%以上削減。次に「LoRA」で全パラメータを更新せず、小さなアダプタ行列だけを学習するんだよ。
ひよこ ひよこ
圧縮してから少ないパラメータだけ学習するんだね!精度は落ちないの?
ペンギン先生 ペンギン先生
驚くことに、フルファインチューニングとほぼ同等の精度が出るんだ。量子化後の重みは推論専用で固定して、学習可能なLoRAアダプタだけ浮動小数点で保持するのがポイントだよ。
ひよこ ひよこ
なるほど、うまく分けてるんだね!Hugging Faceで使えるって気軽に試せそうだね!
ペンギン先生 ペンギン先生
そうだよ。PEFTとbitsandbytesライブラリを入れれば数行のコードで始められるんだ。2023年の登場で「個人でも大型LLMファインチューニングできる」という常識が一気に広まった革命的な技術だよ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
QLoRA」って出てきたら「量子化+LoRAで省メモリ・高速ファインチューニング」と思えればだいたいOK!
📖 おまけ:英語の意味
「Quantized LoRA」 = 量子化されたLoRA
💬 2023年にワシントン大学のDettmers らが発表。個人レベルで大型LLMのファインチューニングを可能にした画期的な論文だよ。
← 用語集にもどる