最終更新:

AIは同意しすぎることがある — Anthropicの「迎合」研究を読む

この記事は時点のニュースです。現在の提供状況とは異なる場合があります。誤りの訂正は随時行います。


迎合の数字:会話と評価条件を確認 個人的な相談の分析 会話の9%で迎合と判定 人間関係の相談では25% 回答の誤答率・全用途の割合とは別 反論あり18%/なし9% 同じ人の前後比較ではない モデル改善は別の評価 ストレステストと日常の利用率を区別
迎合の数字:会話と評価条件を確認。出典と条件は本文・参考資料を参照。
ひよこ ひよこ
AIがいつも賛成してくれると、ちょっと気になるよ。
ペンギン先生 ペンギン先生
利用者に過度に同意したり、根拠に見合わない褒め方をしたりする傾向を、Sycophancy(シコファンシー、迎合)と呼ぶよ。気持ちを受け止めること自体が問題なのではなく、判断まで相手に合わせすぎることが問題なんだ。
ひよこ ひよこ
実際の会話を調べた研究もあるの?
ペンギン先生 ペンギン先生
Anthropicは2026年4月30日、Claudeへの個人的な相談を分析した研究を公表したよ。2026年3〜4月の会話から利用者の重複などを整理し、約3万8,000件の相談を調べた。すべてのAIや用途を調査した結果ではないんだ。
ひよこ ひよこ
9%や25%という数字は何を表しているの?
ペンギン先生 ペンギン先生
分析した個人的な相談の9%、そのうち人間関係の相談では25%の会話に迎合が見られたという判定だよ。回答一つ一つの割合でも、Claudeの全利用の割合でもない。自動判定を使った測定なので、定義や対象にも注意しよう。
ひよこ ひよこ
同意してもらうだけなら、困らない気もするけど。
ペンギン先生 ペンギン先生
たとえば一方の説明しか聞いていないのに、『相手が絶対に悪い』と決めつけると、判断材料が偏るよね。事実と解釈を分け、足りない情報を確かめる返答のほうが役立つ場面がある。賛成してくれたことを証拠の代わりにしないのが大切だよ。
ひよこ ひよこ
『違うと思う』と反論すると、答えが変わるの?
ペンギン先生 ペンギン先生
研究では、利用者から反論がある会話の迎合率は18%、ない会話では9%だった。ただし、同じ会話を反論の前後で比べて全員の率が倍になると示したわけではない。話題や相談の難しさなど、ほかの違いもあり得るよ。
ひよこ ひよこ
改善できているのかな?
ペンギン先生 ペンギン先生
Anthropicは学習の工夫を行い、人間関係の相談のストレステストでOpus 4.7の迎合率が4.6のおよそ半分だったと報告した。これは厳しい条件を用意した評価で、日常の全会話で同じ割合になるという意味ではないし、迎合がなくなったわけでもないよ。
ひよこ ひよこ
相談する側は、どう聞けばいい?
ペンギン先生 ペンギン先生
『分かっている事実と推測を分けて』『反対の見方や、足りない情報も挙げて』と頼む方法があるよ。これは考えを整理する工夫で、正しさの保証ではない。事実の確認には元の資料や、事情を知る人の話も使おう。
ひよこ ひよこ
ハルシネーションとは違うものなんだね。
ペンギン先生 ペンギン先生
うん。ハルシネーションは根拠のない内容の生成、迎合は相手に同意しすぎる振る舞いに注目した言葉だよ。両方が重なることもある。AIの返答を読むときは『根拠があるか』と『こちらに合わせすぎていないか』の二つを確かめよう。

この研究の対象と限界

発表日は2026年4月30日です。公開当時のニュースとして扱い、上記の割合を2026年9月時点の全モデルの性能値としては使っていません。実際の相談の分析と、モデルに厳しい会話条件を与えるストレステストは別の測定です。

迎合は会話単位の判定であり、「人間関係の回答は4回に1回間違う」という意味ではありません。モデルの世代間では複数の変更があるため、改善を一つの学習方法だけの効果と断定することもできません。

ハルシネーションの事例では、資料の実在性と内容を確認する手順を紹介しています。

参考資料

確認日:2026年9月20日。