【じこせんれん】
自己洗練(AI) とは?
公開:
💡 「もう一回見直そう」を自動でやり続けるAIの自己添削
📌 このページのポイント
ペンギン先生、自己洗練ってAIが自分で反省するってこと?
いいイメージだよ!まずAIが答えを出して、次に「この答えのどこが悪いか」を自分で批評して、批評をもとに改善した答えを出す——これを繰り返す仕組みだよ。
批評って、どんなことを指摘するの?
「論理が飛んでいる」「事実が不正確」「もっと簡潔にできる」など、タスクによって評価軸を変えるよ。書かせた評価コメント自体もLLMが生成するんだ。
ずっと繰り返してたら終わらなくなりそう…
RLHFとはどう違うの?
RLHFは人間のフィードバックを使って「学習し直す」手法だよ。自己洗練は学習は一切せず、推論のときだけ動的に品質を上げるのが違いだね。データも計算コストも少なくて済むよ。
どんなタスクに向いてるの?
文章の編集・コードのバグ修正・数学の証明など、「正しい基準がはっきりある」タスクほど効果が大きいよ。あいまいな創作より、客観的に評価できる問題の方が洗練しやすいんだ。
まとめ:ざっくりこれだけ覚えればOK!
「自己洗練」って出てきたら「AIが自分の答えを見直して書き直す仕組み」と思えればだいたいOK!
📖 おまけ:英語の意味
「Self-Refinement」 = 自己洗練・自己改善
💬 金属の「精錬(refinement)」から来ていて、粗い出力を繰り返し磨いて純度を上げるイメージで名付けられたよ