【いんすとらくしょんちゅーにんぐ】
インストラクションチューニング とは?
最終更新:
💡 指示と回答の例で、応答のしかたを追加学習
指示と望ましい回答の例を使い、言語モデルを追加学習する手法。要約や質問応答など、指示に沿う応答を改善することを目指す。プロンプト入力だけで利用する方法とは異なり、モデルのパラメータを更新する。
📌 このページのポイント
- 指示・入力・回答などを組み合わせた例でモデルを追加学習する
- 教師ありファインチューニングの一種として行われる
- 未学習の指示への対応を改善する狙いがあるが、効果はモデルとデータによる
- 人の好みを使うRLHFとは役割が異なり、併用される場合もある
インストラクションチューニングって何?
「この文章を要約して」といった指示と、望ましい回答の例を使って言語モデルを追加学習することだよ。指示に合う応答のしかたを学ばせる、教師ありファインチューニングの一種なんだ。
学習前のモデルは指示に答えられないの?
指示を入力するのと何が違うの?
RLHFと同じこと?
これで必ず正しい答えになる?
保証はできないよ。データの品質やモデルによって効果が変わり、追加学習したモデルでも事実と違う内容や偏った応答は残り得る。使いたい課題で評価し、回答の正しさを別に確認しよう。
まとめ:ざっくりこれだけ覚えればOK!
「インストラクションチューニング」って出てきたら「AIに指示の従い方を教える特訓」と思えればだいたいOK!
📖 おまけ:英語の意味
「Instruction Tuning」 = 指示に合わせた調整
💬 Instructionは「指示」、Tuningは「調整」。指示に沿った回答の例で追加学習するイメージだよ