【じこせんれん】
自己洗練(AI) とは?
最終更新:
💡 AIの回答を、批評と修正で見直す
LLMが生成した回答に対して批評や改善案を作り、その内容を使って回答を修正する反復的な手法。代表例のSelf-Refineは追加学習なしで同じLLMを使うが、自己評価だけで正確さや品質の向上が保証されるわけではない。
📌 このページのポイント
- 初稿を生成し、批評を作り、その批評を使って修正する
- Self-Refineでは同じLLMを使い、推論時に反復する
- 回数や停止条件を決め、元の回答との比較も行う
- 自己評価も誤り得るため、課題に合う独立した検証が必要
自己洗練ってAIが反省すること?
回答を出し、改善点を批評として生成し、その批評を使って書き直す手順だよ。代表例のSelf-Refineは同じLLMを使う。人のような反省をしていると考えるより、生成の手順として捉えると分かりやすいね。
批評では何を見直すの?
例えば文章が長すぎる、指定された条件を満たしていない、という点を具体的に挙げるよ。批評自体も生成文なので、事実や論理の指摘が正しいかは別に確認する必要があるんだ。
ずっと繰り返すの?
最大回数や課題ごとの停止条件を決めるよ。修正版を次の批評に渡して反復するけれど、自己採点が高いだけで正解とは限らない。元の回答から悪くなっていないかも比較するんだ。
RLHFとはどう違うの?
数学の問題も見直せば必ず正しくなる?
保証はないよ。Self-Refineでは文章編集などで改善が報告された一方、別の研究では外部のフィードバックなしの推論問題で改善しない例や悪化も報告されている。課題に応じてテストや根拠との照合を組み合わせよう。
まとめ:ざっくりこれだけ覚えればOK!
「自己洗練」って出てきたら「AIが自分の答えを見直して書き直す仕組み」と思えればだいたいOK!
📖 おまけ:英語の意味
「Self-Refinement」 = 自己洗練・自己改善
💬 Selfは「自分自身」、refinementは「改良・洗練」を表すよ。2023年のSelf-Refineという研究では、同じLLMがフィードバックと修正を繰り返す方法を示したんだ。