【きょうかがくしゅう】
強化学習 とは?
最終更新:
💡 試して、結果を見て、次の行動を学ぶAI
エージェントが環境で行動し、その結果の報酬などを手がかりに、将来を含む報酬の合計が大きくなる行動方針を学ぶ機械学習の手法。ゲームやロボット制御、言語モデルの調整などに使われる。
📌 このページのポイント
- エージェントが環境を観察し、行動し、結果と報酬を受け取る
- 目先の報酬だけでなく、将来を含めた報酬の合計を考える
- 教師あり学習と組み合わせたり、過去の経験データを使ったりすることもある
- 報酬が目的をうまく表しているかが重要。学習の成功は保証されない
強化学習ではAIはどうやって学ぶの?
行動する主体をエージェント、相手となる世界を環境と呼ぶよ。ゲームならAIが画面を観察して操作し、その結果や得点を受け取る。この経験を使って、次にどう行動するかという方針を学ぶんだ。
今すぐ得点が増える行動を選べばいいの?
目先の得点だけではないよ。例えば今は得点しなくても、準備をすれば後で大きく得点できるかもしれない。強化学習では将来を含めた報酬の合計が平均的に大きくなる方針を目指すんだ。
報酬って、ご褒美をあげること?
イメージは近いけれど、AIが受け取るのは数値だよ。正にも負にもできる。数値が大きいことと、人間にとって本当に良い結果になることは別なので、何を評価するかを設計する必要があるんだ。
教師あり学習みたいなデータは要らないの?
各場面の正解の行動を直接教えることが中心ではない、という違いだよ。経験データは使うし、人のお手本や教師あり学習を組み合わせる場合もある。「データを使わずに学ぶ」という意味ではないんだ。
文章を作るAIにも使うの?
試し続ければ必ずうまくなる?
そうとは限らないよ。探索や学習方法、報酬の設計などが影響する。例えば架空のロボットに「動いた距離」だけで報酬を与えると、目的地へ進まず同じ場所を往復しても得点できてしまう。目的に合う行動になっているかも確認することが大切だよ。
まとめ:ざっくりこれだけ覚えればOK!
「強化学習」って出てきたら「行動の結果を手がかりに、報酬が増える行動を学ぶ方法」と思えばだいたいOK!
📖 おまけ:英語の意味
「Reinforcement Learning」 = 強化学習
💬 行動の結果として得られる報酬などを手がかりに、行動方針を学習する方法だよ。