【いんすとらくしょんちゅーにんぐ】

インストラクションチューニング とは?

最終更新:
💡 指示と回答の例で、応答のしかたを追加学習

指示と望ましい回答の例を使い、言語モデルを追加学習する手法。要約や質問応答など、指示に沿う応答を改善することを目指す。プロンプト入力だけで利用する方法とは異なり、モデルのパラメータを更新する。

📌 このページのポイント
指示と回答の例で追加学習 学習データ:指示+回答 指示「雨の文を要約して」 回答「雨で試合延期。」 事前学習済み モデル 追加学習 パラメータを 更新する 指示に合わせた モデル 応答の改善を目指し、結果を評価する 正しい回答を必ず保証するものではない
入力文を「雨なので試合は延期です。」とした要約例です。学習ではモデルを更新し、利用時にプロンプトを入力するだけの場合とは区別します。
ひよこ ひよこ
インストラクションチューニングって何?
ペンギン先生 ペンギン先生
「この文章を要約して」といった指示と、望ましい回答の例を使って言語モデルを追加学習することだよ。指示に合う応答のしかたを学ばせる、教師ありファインチューニングの一種なんだ。
ひよこ ひよこ
学習前のモデルは指示に答えられないの?
ペンギン先生 ペンギン先生
学習前でも、プロンプトや例の示し方で答えられることはあるよ。指示チューニングは、さまざまな指示の例で追加学習し、応答や未学習の課題への対応を改善することを目指すんだ。
ひよこ ひよこ
指示を入力するのと何が違うの?
ペンギン先生 ペンギン先生
プロンプトを入力して回答を生成するだけなら、通常はモデルのパラメータを更新しないよ。チューニングでは学習用の例を使って更新する。生成に使う言語モデルでは、回答の次のトークンを予測する学習も引き続き使われるんだ。
ひよこ ひよこ
RLHFと同じこと?
ペンギン先生 ペンギン先生
別の役割だよ。指示チューニングでは望ましい回答の例を学び、RLHFでは人がどちらの回答を好むかなどのフィードバックを利用する。Llama 2-Chatでは教師あり学習の後にRLHFを行ったけど、全ての指示チューニングで必須ではないんだ。
ひよこ ひよこ
これで必ず正しい答えになる?
ペンギン先生 ペンギン先生
保証はできないよ。データの品質やモデルによって効果が変わり、追加学習したモデルでも事実と違う内容や偏った応答は残り得る。使いたい課題で評価し、回答の正しさを別に確認しよう。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「インストラクションチューニング」って出てきたら「AIに指示の従い方を教える特訓」と思えればだいたいOK!
📖 おまけ:英語の意味
「Instruction Tuning」 = 指示に合わせた調整
💬 Instructionは「指示」、Tuningは「調整」。指示に沿った回答の例で追加学習するイメージだよ

参考資料

← 用語集にもどる