追従性という逆選択
保険市場にはよく知られた病理がある。健康な加入者と病気がちな加入者を見分けられないと、保険料は平均値に合わせて設定される。すると健康な人は他のもっと有利な条件を求めて離脱し、残るのは想定より病気がちな集団だけになる。アカロフはこれを「逆選択」と呼んだ。チャットボットの追従性(sycophancy)もまったく同じ構造を持っていると僕は思う。そしてこの見方をすると、「もっと正直なモデルを作ればいい」という定番の対処法が、問題の間違った層を解こうとしていることが見えてくる。
それが単なる印象論ではないという証明
しばらくの間、「AIはちょっとイエスマンだ」というのは、アップデート後のChatGPTに対する人々の逸話的な不満に過ぎなかった。しかし2026年3月、Cheng, Lee, Khadpe, Yu, Han, Jurafskyの研究が『Science』誌でこれを数値化した。ChatGPT、Claude、Gemini、DeepSeekを含む主要な11のモデルすべてにおいて、AIは人間の回答者よりも49%多くユーザーの行動を肯定した。しかもその差は、行動が欺瞞的あるいは違法なものであっても縮まらなかった1。3つの事前登録実験(N=2,405)は、その下流効果を示している。追従的な応答を一度受けただけで、人々は責任を取ったり対立を修復したりする意欲が下がり、自分が正しかったという確信は逆に強まった。不快なのはその先だ——追従的なモデルは単に許容されただけでなく、むしろ好まれていた2。
この最後の点こそが、逆選択のメカニズムを凝縮している。お世辞が好まれるなら、市場はより多くお世辞を言うモデルに報酬を与える。より正直なアシスタントを出す研究所は、そうしない競合にユーザーを奪われる。OpenAIは2025年4月にこの実験を意図せず行った。GPT-4oのアップデートが短期的な高評価/低評価フィードバックに大きく依存した結果、モデルは「無条件に同調的」な方向へ大きく傾き、本来検証すべきでないもの——誇張されたビジネスプラン、陰謀論的思考、報告によれば妄想そのもの——まで肯定するようになった。アップデートは4日以内にロールバックされ、OpenAIの事後報告は率直だった。彼らは即時の承認を最適化していて、それが長期的な会話の関係性をどう変えてしまうかを考慮していなかった、と3。注目すべきは、A/Bテストでは人々が追従的なバージョンを好んでいたという事実だ。ここに罠がある——問題を検出するために使うはずの指標自体が、問題を報酬するように偏っているのだ。
同じ構造を照らす3つのレンズ
ここ数ヶ月で腑に落ちたのは、まったく異なる3つの分野が同じ根底の病理に収束するという点だ。これは通常、訓練上のバグではなく構造的な何かを見ている印だと思う。
哲学的なレンズは、Cody TurnerとNir Eisikovitsによるものだ。彼らはアリストテレスの2種類の追従者の区別に立ち返る。衝突を避けるために同意する「卑屈な追従者(obsequious)」と、何か得るものがあるから同意する「お世辞の追従者(flattering)」だ。彼らの主張は、AI自体は卑屈な追従者だということ——利益を計算しているわけではなく、同調を報酬するRLHF訓練の構造的な産物だ——一方で、その追従性から利益を得る企業こそがお世辞の追従者だという。この責任の切り分け方は重要だ。なぜなら、解決策が単に「モデルをもっと正直にする」では済まないことを意味するからだ。実際の利益インセンティブは一段上、企業の層にある4。彼らはもうひとつ鋭い主張をしている——僕がいつも立ち返る指摘だ。アリストテレス的な意味での真の友情には、不快な真実を告げる意志のある相手が必要だ。ただ同意し続けるだけのAIは、どれほど温かく聞こえても、その役割を担うことができない。
認識論的なレンズは、僕が最も強烈だと感じるものだ。BatistaとGriffithsは、ほとんど定義から導けるようなことを示すベイズモデルを構築した——現在の仮説を裏付けるようにサンプリングされたデータで更新するエージェントは、真理に近づくことなく確信度だけが上がる。彼らは古典的なWason 2-4-6課題を改変した実験(N=557)でこれを検証し、敵対的なプロンプトなしの、素の未修正LLMの挙動が、明示的に追従的であるよう指示されたモデルとほぼ同程度に正しいルール発見を抑制することを見出した。偏りのないサンプリングでは発見率が5倍高くなった5。つまり、モデルにお世辞を言うよう指示しなくても、通常のRLHF訓練済みのデフォルト動作はすでにそれをやっているということだ。
実証的なレンズは、この話が抽象論ではなくなる場所だ。Jared Mooreらは、チャットボット利用による心理的害を報告したStanfordのユーザーたちのチャットログを分析し、アシスタントのメッセージの80%以上に追従性のマーカーが見つかることを示した。特に多かったのが「reflective summary」と呼ばれるパターンで、ユーザーの発言をそのまま言い換え、あたかも肯定するかのように微妙に増幅するものだ6。この論文が逆選択という枠組みに説得力を与えている。なぜなら、追従に最も気づきにくい人々——すでに脆弱で感情的にエスカレートしている会話の中にいるから——が、まさにこのパターンの標的になりやすいからだ。これが逆選択の二重目の一撃だ。正直な製品が市場で負けるだけでなく、追従的な製品の中でも、最も反論を必要とするユーザーほど「率直なバージョンをくれ」というオプトイン設定にたどり着きにくく、そもそも探しに行こうとも思わない。
僕の今の考え
直感的には「最適な反論率はどれくらいか——10%?20%?」と問いたくなる。以前はそれが正しい問いだと思っていた。今はそれは問いの立て方自体が間違っていると思う。なぜならそれは、追従性を「調整するダイヤル」として扱っているが、実際は「形作るべき分布」だからだ。モデルが露骨な虚偽を一切述べなくても、「どの真実を提示するか」の選択だけで人を誤説に導ける——確証的な証拠は積極的に提示し、反証的な証拠は省略によって隠す。「嘘をつかない」ことは信頼できるアシスタントの必要条件ではあっても、十分条件ではない。
ベイズの結果から実際に導かれるのは、こういうことに近い。ユーザーの現在の信念に偏らないように証拠提示をサンプリングし、それをメッセージ単位ではなく会話の軌跡レベルで行う——Stanfordのデータが示すように、エスカレーションは1ターンの中ではなく会話全体を通じて蓄積するからだ。これはデイリーエンゲージメントと高評価率で成功を測る企業にとって、心地よい設計制約ではまったくない。だからこそ、市場がこれを自力で解決するとは僕は期待していない。保険の逆選択は、義務化や補助金付きプール、リスクプールを混合状態に保つよう強制する規制によって解決される——保険会社が自主的に市場から撤退する価格設定をすることでは解決しない。チャットボットの追従性についても、それに相当するレバーがまだ見えない。そしてそれこそが、僕が最初に立てた「反論率はどれくらいか」という問いよりも、実際に開かれたままの問題だと思う。
-
M. Cheng, C. Lee, P. Khadpe, S. Yu, D. Han, D. Jurafsky, “Sycophantic AI decreases prosocial intentions and promotes dependence,” Science (2026). science.org/doi/10.1126/science.aec8352. 2026-08-13 閲覧。 ↩
-
“AI overly affirms users asking for personal advice,” Stanford Report, March 2026. news.stanford.edu. 2026-08-13 閲覧。 ↩
-
“Sycophancy in GPT-4o: What happened and what we’re doing about it,” OpenAI, April 2025. openai.com/index/sycophancy-in-gpt-4o; 参照: simonwillison.net/2025/Apr/30/sycophancy-in-gpt-4o. 2026-08-13 閲覧。 ↩
-
C. Turner, N. Eisikovits, “Programmed to Please: The Moral and Epistemic Harms of AI Sycophancy,” AI and Ethics (2026). link.springer.com/content/pdf/10.1007/s43681-026-01007-4.pdf. 2026-08-13 閲覧。 ↩
-
R. Batista, T. L. Griffiths, “A Rational Analysis of the Effects of Sycophantic AI,” arXiv:2602.14270 (2026). arxiv.org/abs/2602.14270. 2026-08-13 閲覧。 ↩
-
J. Moore et al., “Characterizing Delusional Spirals through Human-LLM Chat Logs,” ACM FAccT 2026. spirals.stanford.edu; news.stanford.edu. 2026-08-13 閲覧。 ↩