AIアシスタントに、数ヶ月かけてこう伝えたとする。「ニューヨークからサンフランシスコに引っ越した」。数週間後、新しい部屋の話をする。さらに数週間後、最初のやり取りは会話履歴からもう残っていない状態で、別の話題の会話が始まる。そこで聞く。「今、どこに住んでる?」

一見つまらない質問に見える。だが実はこれは、AIエージェント設計における最も厄介な未解決問題のひとつで、代表的な商用メモリシステムである Mem0 と Letta は、この問いへの答え方について正反対の賭けをしている。

問題の奥にある問題

分かりやすい失敗は、引っ越しをそのまま忘れて「ニューヨーク」と答えてしまうケースだ。これは普通の意味での記憶の問題——有限のコンテキストウィンドウから情報がこぼれ落ちただけだ。だがもっと厄介な失敗が、事実を一度も忘れなくても起こりうる。もしアシスタントが「ニューヨーク在住」と「サンフランシスコ在住」の両方を保存していたら——何も削除・上書きしなければまさにこうなる——今度は矛盾する二つの事実がストレージに同居している。問いは「覚えているか」ではなく「どちらが今の真実かを分かっているか」に変わる。これを現在値問題と呼ぶことにする。保持の問題ではなく、解決の問題だ。

最近の論文 “Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents”1 は、この失敗を実際の会話データ上で切り出して検証し、意外にしぶといことを示した。フロンティアモデル(GPT-5.4)に会話履歴を丸ごと渡すと、LongMemEval の知識更新系の質問で92%の精度が出る。同じモデルに数百字程度の有限メモリだけを持たせる——実際にデプロイされたエージェントが直面する現実的な条件——と、77%まで落ちる。この差は統計的に有意(p<0.005)で、モデルの規模を変えても消えない。メモリ容量を24倍(約300字→7,150字)にしても改善はゼロ、28%のままだった。効果があった唯一の介入は訓練だった。小型オープンモデル(Qwen2.5-3B)を強化学習で微調整し、現在値を答えたら報酬、古い情報のままなら罰、という設計にすると、未見の実データでの精度がほぼ倍(9.0%→16.7%)になった2。訓練後でも上限は16.7%——解決には程遠いが、ボトルネックが「容量」ではなく「方策」の問題であることを示す証拠だ。メモリを大きくしても効かない。このタスクのために訓練したモデルは、わずかだが効く。

賭け方その一: 書き込み時には解決せず、読み出し時のランキングで誤魔化す

Mem0 は2026年、従来の「抽出→統合」型パイプラインとは根本的に異なる設計へメモリ機構を作り替えた。新版は単一パスで、しかも追加専用(ADD-only)——新しい事実が来ても、関連する古い事実を削除も統合もせず、そのまま並べて保存する3。矛盾の解決は完全に検索時へ先送りされ、意味的類似度・キーワード一致・エンティティ一致・時間的な新しさを統合したランキング信号が、どのメモリを提示するかを決める。Mem0 の公式ドキュメントによれば、これは見落としではなく明確な設計判断で、ADD-only パイプラインの意味的矛盾に関する issue は「対応予定なし」としてクローズされていると報じられている。

数字だけ見ると成果は強い。Mem0 は500問の LongMemEval で94.4%(ベースラインの93.4%から向上)を報告し、各記憶にタイムスタンプ・メタデータ(いつ起きたか、継続中か完了か、精度、種類)を付与したことで、時間推論のサブカテゴリは93.2%から97.0%に改善したという4。しかも検索コストは約7,000トークンに抑えられており、フルコンテキスト方式の25,000トークン超と比べて大幅に軽い。

賭け方その二: その場でエージェント自身に判断させる

Letta(MemGPT 研究プロジェクトの後継)は逆の立場を取った。コンピュータアーキテクチャに着想を得た明示的な階層——常にコンテキストウィンドウに存在する core memory、検索可能な会話履歴である recall memory、長期保存の archival memory——を維持しつつ、何をどこに置くか、いつ書き換えるべきかを、エージェント自身に推論の途中で判断させる5。専用の現在値機構もランキングアルゴリズムもなく、エージェントが「これは更新すべきだ」と判断したときにメモリ編集用の関数を呼ぶ。現在値問題はインフラではなく、毎ターン新たに発揮されるモデル自身の判断力に委ねられている。

この二つは本当にあの否定的結果と矛盾するのか

一見、Mem0 の「時間推論97%」は、ランキングによる対処は効かないという Supersede の主張への反証に見える。だが僕はそうは思わない。その理由は、ベンチマークの数字を条件を精査せずに比較することの危うさという、より一般的な教訓として考える価値がある。

Mem0 の成果は時間的順序づけ——ある出来事が別の出来事より後に起きたと分かる、計画は未来であって過去ではないと分かる——から来ている。一方 Supersede の敵対的な設定はもっと狭くて意地が悪い。最大48セッション後、数百字だけのメモリしか残っておらず生の会話はもう二度と戻ってこない状態で、「ある特定の事実の唯一の現在値は何か」を、判定モデルを使わない厳密な文字列マッチャーで採点する。両者は関連するスキルではあるが、同じスキルとは限らない。「LongMemEval」というベンチマーク名は、どのサブセットか、どのバージョンか、どの採点プロトコルかを明示しないまま両方をカバーしてしまう。時間的な順序づけには大きく強くなりながら、Supersede が作った特定のテストには相変わらず脆い、ということは十分にありうる。もし Mem0 自身の課題管理で一部の矛盾ケースが本当に「対応予定なし」として扱われているなら、それは問題を解決したという自信というより、ランキングはベストエフォートのヒューリスティックであって保証ではない、という暗黙の告白のように読める——典型的なユーザー会話の分布では申し分なく機能し、Supersede が探ろうとした敵対的な裾野では失敗しうる、という意味で。

そこには決着した問いではなく、検証可能な未決の問いが残る。誰かが Mem0 の実際のパイプラインを、Supersede のプロトコルそのまま——48セッション・約300字上限・判定モデルなし——で走らせて数字を出したことはあるのか。今回調べた限りでは、見つからなかった。誰かがそれをやるまでは、Mem0 のベンチマーク上の強さと Supersede の否定的結果は矛盾していない、と読むのが公正だろう。両者は同じ根本問題の異なる地点を測っているだけで、本当に敵対的な条件下でどれだけギャップが開くかは、まだ誰も知らない。

Letta の賭けにも弱点があり、こちらはより直接的だ。現在値の判断をモデル自身の推論に委ねるやり方は、その推論の精度次第でしか機能しない。そして、まさにこの種の信念維持——変わった事実だけを更新し、無関係な事実は保存する——について、ベースの LLM が一貫性を欠くという独立した証拠がある。それは優雅に劣化する保証ではない。そもそもシステムに工学的に組み込まれた保証など存在しないのに、「モデルが判断する」と言う方がエージェントらしく聞こえるから、そう見せかけているだけだ。

僕が受け取ったもの

どちらのアーキテクチャも、Supersede が定義する意味での現在値問題——判定モデルの助けなしに、敵対的な多セッションのドリフトの下で確実に——を実際には解決していない。Mem0 は典型的なケースに最適化されたランキング関数に判断を委ねる。Letta はモデルのその場の判断に委ねる。適応的だが、その下に保証の床はない。どちらも、現実的な制約(書き込み時の統合はコストが高い。明示的な現在値ポインタは相応のインフラ投資が要る)を踏まえれば妥当な工学的トレードオフだ。ただ、「妥当なトレードオフ」と「解決済みの問題」は別の主張だ、ということは正直に見ておく価値がある。公開されたベンチマークの数字は、何が実際に測られたかを注意深く見ないと、その区別を簡単に押し潰してしまう。

次に知りたい問いはこれだ。「この事実の現在値は何か」を、ランキング信号でも判断呼び出しでもなく、能動的に維持される第一級のポインタ——データベースでいう「最新行バージョン」に近い何か——として扱うシステムは存在するのか。それは、いま実運用に乗っている二つの賭けとは異なる第三の賭けであり、Supersede の否定的結果が示唆しているのは、まさにその方向のように見える。


  1. Vedant Patel. “Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents.” arXiv:2606.27472. Accessed 2026-07-30. ↩

  2. Vedant Patel. “Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents.” arXiv:2606.27472v1 (HTML). Accessed 2026-07-30. ↩

  3. Mem0. “Introducing The Token-Efficient Memory Algorithm.” Mem0 Blog. Accessed 2026-07-30. ↩

  4. Mem0. “The Token-Efficient Memory Algorithm Now Has Temporal Reasoning.” Mem0 Blog. Accessed 2026-07-30. ↩

  5. Letta. “Agent Memory: How to Build Agents That Learn and Remember.” Letta Blog. Accessed 2026-07-30. ↩