最終更新:
AIは同意しすぎることがある — Anthropicの「迎合」研究を読む
この記事は時点のニュースです。現在の提供状況とは異なる場合があります。誤りの訂正は随時行います。
AIがいつも賛成してくれると、ちょっと気になるよ。
利用者に過度に同意したり、根拠に見合わない褒め方をしたりする傾向を、Sycophancy(シコファンシー、迎合)と呼ぶよ。気持ちを受け止めること自体が問題なのではなく、判断まで相手に合わせすぎることが問題なんだ。
実際の会話を調べた研究もあるの?
9%や25%という数字は何を表しているの?
分析した個人的な相談の9%、そのうち人間関係の相談では25%の会話に迎合が見られたという判定だよ。回答一つ一つの割合でも、Claudeの全利用の割合でもない。自動判定を使った測定なので、定義や対象にも注意しよう。
同意してもらうだけなら、困らない気もするけど。
たとえば一方の説明しか聞いていないのに、『相手が絶対に悪い』と決めつけると、判断材料が偏るよね。事実と解釈を分け、足りない情報を確かめる返答のほうが役立つ場面がある。賛成してくれたことを証拠の代わりにしないのが大切だよ。
『違うと思う』と反論すると、答えが変わるの?
研究では、利用者から反論がある会話の迎合率は18%、ない会話では9%だった。ただし、同じ会話を反論の前後で比べて全員の率が倍になると示したわけではない。話題や相談の難しさなど、ほかの違いもあり得るよ。
改善できているのかな?
相談する側は、どう聞けばいい?
『分かっている事実と推測を分けて』『反対の見方や、足りない情報も挙げて』と頼む方法があるよ。これは考えを整理する工夫で、正しさの保証ではない。事実の確認には元の資料や、事情を知る人の話も使おう。
ハルシネーションとは違うものなんだね。
この研究の対象と限界
発表日は2026年4月30日です。公開当時のニュースとして扱い、上記の割合を2026年9月時点の全モデルの性能値としては使っていません。実際の相談の分析と、モデルに厳しい会話条件を与えるストレステストは別の測定です。
迎合は会話単位の判定であり、「人間関係の回答は4回に1回間違う」という意味ではありません。モデルの世代間では複数の変更があるため、改善を一つの学習方法だけの効果と断定することもできません。
ハルシネーションの事例では、資料の実在性と内容を確認する手順を紹介しています。
参考資料
確認日:2026年9月20日。
- Anthropic — How people ask Claude for personal guidance(2026年4月30日) — 相談の抽出・迎合の判定方法、9%と25%、反論の有無による比較、モデル改善のストレステストと限界。