【きょうかがくしゅう】

強化学習 とは?

最終更新:
💡 試して、結果を見て、次の行動を学ぶAI

エージェントが環境で行動し、その結果の報酬などを手がかりに、将来を含む報酬の合計が大きくなる行動方針を学ぶ機械学習の手法。ゲームやロボット制御、言語モデルの調整などに使われる。

📌 このページのポイント
強化学習:行動と結果を行き来するエージェント環境行動する観察した結果 + 報酬経験から、次の行動方針を学ぶよ
エージェントと環境のやり取り。目先だけでなく将来を含む報酬を考え、行動方針を学習します。
ひよこ ひよこ
強化学習ではAIはどうやって学ぶの?
ペンギン先生 ペンギン先生
行動する主体をエージェント、相手となる世界を環境と呼ぶよ。ゲームならAIが画面を観察して操作し、その結果や得点を受け取る。この経験を使って、次にどう行動するかという方針を学ぶんだ。
ひよこ ひよこ
今すぐ得点が増える行動を選べばいいの?
ペンギン先生 ペンギン先生
目先の得点だけではないよ。例えば今は得点しなくても、準備をすれば後で大きく得点できるかもしれない。強化学習では将来を含めた報酬の合計が平均的に大きくなる方針を目指すんだ。
ひよこ ひよこ
報酬って、ご褒美をあげること?
ペンギン先生 ペンギン先生
イメージは近いけれど、AIが受け取るのは数値だよ。正にも負にもできる。数値が大きいことと、人間にとって本当に良い結果になることは別なので、何を評価するかを設計する必要があるんだ。
ひよこ ひよこ
教師あり学習みたいなデータは要らないの?
ペンギン先生 ペンギン先生
各場面の正解の行動を直接教えることが中心ではない、という違いだよ。経験データは使うし、人のお手本や教師あり学習を組み合わせる場合もある。「データを使わずに学ぶ」という意味ではないんだ。
ひよこ ひよこ
文章を作るAIにも使うの?
ペンギン先生 ペンギン先生
人間の評価を利用するRLHFがあるよ。InstructGPTの論文では、まず人のお手本で教師あり学習を行い、回答の比較評価から報酬モデルを学習し、その報酬を使って言語モデルを強化学習している。人間の好みに近づけるための方法の1つだね。
ひよこ ひよこ
試し続ければ必ずうまくなる?
ペンギン先生 ペンギン先生
そうとは限らないよ。探索や学習方法、報酬の設計などが影響する。例えば架空のロボットに「動いた距離」だけで報酬を与えると、目的地へ進まず同じ場所を往復しても得点できてしまう。目的に合う行動になっているかも確認することが大切だよ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「強化学習」って出てきたら「行動の結果を手がかりに、報酬が増える行動を学ぶ方法」と思えばだいたいOK!
📖 おまけ:英語の意味
「Reinforcement Learning」 = 強化学習
💬 行動の結果として得られる報酬などを手がかりに、行動方針を学習する方法だよ。

参考資料

← 用語集にもどる