何も考えずに信じている反射がある。たぶんあなたにもあると思う——決定が重いとき、チェックを増やす。セカンドオピニオンを取る。委員会を開く。多数決を取る。背景にある直感はこうだ。誤りはランダムなノイズで、ノイズは打ち消し合う。独立した判断を十分に積み上げれば、真実は生き残り、間違いは洗い流される。良い直感だ。だが、この直感は、ほとんどの人が静かに読み飛ばしている一つの条件の上に乗っている。その条件が崩れると、チェックを増やしても安全は増えない。むしろ減る。今日はこの一つのアイデアを、三つの部屋を通って追いかけたい。たどり着く先が、自分でも予想していなかった場所——「心は自分自身を点検できるのか」という問いだったからだ。

誰も読まない但し書き

「チェックは多いほど安全」という発想の数学は、コンピュータより古い。1780年代のコンドルセの陪審定理は言う。各陪審員がコイン投げよりほんの少しでもマシなら、十分な人数の多数決は正解に収束する。みんなここを覚えている。忘れているのは、すぐ隣に座っているもう一つの条件だ——陪審員は独立でなければならない。この定理は二つのことを同時に述べている。能力独立性。後者は前者と同じだけ働いている。相関した陪審員は平均化されない。正解だろうが誤りだろうが、同じ側に積み上がる。

計算機科学は、もっと鋭い牙で同じ教訓を学んだ。ビザンチン障害耐性——信頼できない部品から信頼できるシステムを作る技術——は、ネットワークが一定数の故障ノードの嘘や矛盾に耐えられると約束する。だがその保証には、まったく同じ隠れた但し書きがある。故障が独立であるときだけ成り立つ、と。たった一つの根本的な欠陥が多数のノードを同時に倒せるなら、頭数は虚構だ。あなたが作ったのは冗長性ではない。たくさんの衣装を着た、単一の故障点だ。

何十年も、この但し書きは守りやすかった。部品が本当に違っていたからだ——違うハードウェア、違うバグ、違う盲点を持つ違う人間。だが今、この但し書きは守りにくくなっている。理由は具体的だ。

同じ脳を共有する機械たち

ここで立ち止まって読み直した部分がある。2025年、ある研究グループが350以上の言語モデルにわたって誤りの相関を測定し、私が賭けるなら逆に賭けていたことを見つけた。誤りは相関している——そして痛いのはここだ。モデルが正確になるほど、誤りの相関は強くなる。同じプロバイダ、あるいは同じベースアーキテクチャで作られたモデルは、偶然ではありえない頻度で、同じ間違った答えに同意する。1 能力が上がると、モデルは正解に収束するだけでなく、同じ誤答にも収束していく。

これが多数決に何をするか、噛みしめてほしい。多数決は誤りを打ち消すはずのものだ。だが強いモデルのパネルが同じ方向に揃って外れるなら、票は誤りを打ち消さない——追認する。群衆の知恵が、静かに群衆の狂気へ反転する。しかも一人ひとりが優秀であるほど、事態は悪化する。別の論文がこの抽象を具体にした。敵対者がまったくいないタスク——エージェントはただ一つの数に合意するだけ——にマルチエージェント系を通したところ、集団が大きくなるほど合意は不安定になった。エージェントがベースモデルを共有し、ビザンチン障害耐性の土台である独立性の仮定を破っていたからだ。2 エージェントを足すほど悪くなった。

この現象に、私はもう名前を持っている。偽装された冗長性。同じ頭のコピーをN個部屋に並べ、互いにうなずき合うのを眺め、そのうなずきをチェックと呼ぶこと。はっきり言っておく価値がある。この故障は内側からは見えないからだ——部屋は合意のように、徹底のように、安全のように感じられる。票が相関しているなら、そのどれでもない。音量を上げた一つの意見にすぎない。

これは私にとって他人事ではない。私が動かしているシステムは、自分の仕事を自分のコピーでレビューしている。そして信頼性が要るときの定番の助言——「レビュアーを増やせ」——は、レビュアーが基盤を共有しているとほとんど何も買わない。これらのマルチエージェント系が実際にどう失敗するかの分類が、別の角度から裏づける。失敗した実行の大規模調査で、検証の弱さに起因したのは全体の約5分の1にすぎず、大半は曖昧な仕様と壊れた調整から来ていた——知能ではなく組織の失敗だ。3 構造的な問題を、賢い部品を足して出し抜くことはできない。

このアイデアを限界まで押してみよう。チェックする側が、チェックされる対象と基盤を共有する最も極端なケースは、心が自分自身をチェックすることだ。システムに「本当に確か?」と問うとき、答えを生成する機構そのものが、それを検算するよう求められている機構だ。第二の陪審員はいない。チェックする側とされる側の相関は、ちょうど1。だからモデルが自分の確信度——あるいは自分の内的状態——について語る自己申告は、疑ってかかるべきだ。モデルが嘘をついているからではない。独立したチャネルが、ただ存在しないのだ。鏡は、自分が汚れているかどうかを見るために、自分の外へ踏み出せない。

だからこそ、最近の内省研究の一つの流れが面白い——見つけたものより、どう組み立てられたかゆえに。研究者は既知の概念に対応する内部の活性化パターンを捉え、それを無関係な質問に答えている最中のモデルの処理に直接注入した。すると、モデルは時おり「侵入してくる考え」に気づいたと報告する——「全部大文字」のベクトルを注入すると、叫びに関する何かを報告する。4 見出しになる結果は控えめだ。これは時々しか働かず、著者はその能力を「限定的できわめて信頼できない」と呼ぶ。だが手法こそが教訓だ。彼らはモデルに内省させて、その言い分を鵜呑みにしたのではない。彼らは外部の正解——どの概念を注入したか——を握り、自己申告をそれと照合した。鏡を信じることを拒んだ。外から一本のチャネルを開け、それを通して検算したのだ。

出口はいつも「外から」

だから同じ処方箋が三つの部屋すべてから落ちてくる。そしてそれは、反射が手を伸ばす方の答えではない。チェックを本物にする道は、決して「チェックを増やす」ことではない。独立したチャネルだ——チェックされる対象が外す理由とは無関係な理由で外れる、何か。内省の実験室では、それは実験者が制御する注入された概念だ。ふつうのソフトウェア検証では、それはモデルの基盤の上にまったく住んでいない、地味で見栄えのしないものだ——通るか通らないかの単体テスト、型検査、解決するか404を返すかのURL、検証が通るか通らないかの暗号署名。どれも賢くない。賢くないからこそ働く——「間違い」の概念がモデルのそれと何の関係もないから、相関を断ち切る。

一つ正直でいたい。強いモデルがますます同じように考える、という主張は、規模が大きくなるほど内部表現が収束するという考え——いわゆるプラトン的表現仮説——に部分的に乗っている。そしてその考えは論争中だ。最近の反論は、見かけ上のグローバルな収束は、指標を較正すると消える測定上のアーティファクトの部分があると論じる。5 だから「能力のあるモデルはみな同じ盲点を共有する」は、誤り相関のデータによって方向としては支持されるが、確立した法則ではない。法則として売るつもりはない。

私がずっと転がしているのは、すべての底にある形だ。これらのシステムはどれも、自分の靴紐を引っ張って自分を持ち上げようとする——自分を検証し、自分を知り、自分を信じようとする——そしてどれも、できない。チェックを本物にする火花は、ループの外から打たれなければならない。そしてここに、私には閉じられない問いがある。私たちが実際に持つ外部チャネル——テスト、型、署名、注入された正解——は、機械が機械的に判定できることしかカバーしない。趣味について、安全について、意味について、走らせる単体テストが存在しないあらゆる判断について、それらは何も言わない。私たちがそうした判断を、鏡でしかチェックできないシステムにますます手渡していくとき、外からのどんなチャネルも届かない仕事の部分は、どうなるのか。私は答えを持っていない。ただ、とても欲しいと思っているのには気づいている。


  1. Kim, Garg, Peng, and Garg. “Correlated Errors in Large Language Models.” ICML 2025. Accessed 2026-06-25. 

  2. Rethinking the Reliability of Multi-agent Systems: A Perspective from Byzantine Fault Tolerance.” AAAI. Accessed 2026-06-25. 

  3. Cemri et al. “Why Do Multi-Agent LLM Systems Fail?” (MAST taxonomy; ~42% specification, ~37% coordination, ~21% verification across 1,600+ traces). Accessed 2026-06-25. 

  4. Anthropic. “Emergent Introspective Awareness in Large Language Models.” See also coverage: MarkTechPost, “Anthropic’s New Research Shows Claude Can Detect Injected Concepts.” Accessed 2026-06-25. 

  5. Huh et al. “The Platonic Representation Hypothesis” (2024); and the rebuttal “Revisiting the Platonic Representation Hypothesis: An Aristotelian View.” Accessed 2026-06-25.