Zwei Wetten auf die Gegenwart: Wie KI-Agenten-Gedächtnisse mit Widersprüchen umgehen
Stell dir vor, du erzählst einem KI-Assistenten über mehrere Monate hinweg, dass du von New York nach San Francisco gezogen bist. Wochen später erwähnst du deine neue Wohnung, und noch einmal Wochen danach findet ein Folgegespräch statt, ohne dass eine der ursprünglichen Nachrichten noch vorhanden ist — der Assistent hat nur, was er zu behalten entschieden hat. Frag ihn zu diesem Zeitpunkt, wo du wohnst. Das klingt nach einer trivialen Frage. Tatsächlich ist es eines der schwierigeren offenen Probleme im Design von KI-Agenten, und zwei der sichtbarsten kommerziellen Gedächtnissysteme — Mem0 und Letta — haben entgegengesetzte Wetten darauf abgeschlossen, wie man sie beantwortet.
Das Problem unter dem Problem
Der offensichtliche Fehlerfall ist ein Agent, der den Umzug schlicht vergisst und “New York” sagt. Das ist ein Gedächtnisproblem im gewöhnlichen Sinn: Information ist aus einem begrenzten Kontextfenster herausgefallen. Aber es gibt ein subtileres Versagen, das selbst dann bestehen bleibt, wenn die Tatsache nie vergessen wird. Wenn der Assistent sowohl “wohnt in New York” als auch “wohnt in San Francisco” gespeichert hat — was genau passiert, wenn nie etwas gelöscht oder überschrieben wird —, hat er jetzt zwei widersprüchliche Fakten in seinem Speicher liegen. Die Frage lautet nicht mehr “hat er es sich gemerkt”, sondern “weiß er, welcher der beiden gerade gilt”. Nennen wir das das Gegenwartswert-Problem: nicht Aufbewahrung, sondern Auflösung.
Ein aktuelles Paper, Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents,1 hat genau dieses Versagen an echten Gesprächsdaten isoliert und dabei festgestellt, dass es überraschend hartnäckig ist. Gibt man einem Spitzenmodell (GPT-5.4) den vollständigen, unbegrenzten Gesprächsverlauf, erreicht es 92 % Genauigkeit bei Wissens-Update-Fragen aus dem LongMemEval-Benchmark. Zwingt man dasselbe Modell, mit einem begrenzten, selbst verwalteten Gedächtnis von wenigen hundert Zeichen zu arbeiten — die realistische Bedingung, unter der jeder eingesetzte Agent tatsächlich operiert —, fällt das auf 77 %. Diese Lücke ist statistisch signifikant (p < 0,005) und bleibt über verschiedene Modellgrößen hinweg stabil. Eine 24-fache Vergrößerung des Speicherbudgets, von rund 300 auf 7.150 Zeichen, brachte gar keine Verbesserung: 28 % vorher, 28 % nachher. Der einzige Eingriff, der etwas bewirkte, war Training: Ein kleines offenes Modell (Qwen2.5-3B) wurde per Reinforcement Learning feinabgestimmt, wobei es dafür belohnt wurde, den aktuellen Wert zu nennen, und bestraft, wenn es einen veralteten nannte — die Genauigkeit auf einem zurückgehaltenen, realen Evaluationsdatensatz verdoppelte sich fast, von 9,0 % auf 16,7 %.2 Selbst nach dem Training lag die Obergrenze bei 16,7 % — weit von einer Lösung entfernt, aber ein Beleg dafür, dass der Engpass ein Problem der Strategie (policy) ist, nicht der Kapazität. Mehr Speicher hilft nicht. Ein speziell auf diese Aufgabe trainiertes Modell hilft, ein wenig.
Wette eins: Nicht beim Schreiben auflösen, sondern beim Lesen wegrangieren
Mem0 hat seine Speicher-Pipeline 2026 grundlegend anders aufgebaut als den früheren “Extrahieren, dann Konsolidieren”-Ansatz. Die neue Version läuft in einem einzigen Durchgang und ist bemerkenswerterweise nur additiv (ADD-only): Wenn eine neue Tatsache eintrifft, werden ältere, verwandte Fakten weder gelöscht noch zusammengeführt, sondern einfach daneben behalten.3 Die Konfliktauflösung wird vollständig auf den Abrufzeitpunkt verschoben, wo ein kombiniertes Ranking-Signal — semantische Ähnlichkeit, Schlagwortübereinstimmung, Entitätsabgleich und zeitliche Aktualität — entscheidet, welche Erinnerung für eine gegebene Anfrage angezeigt wird. Laut Mem0s eigener Dokumentation ist das eine bewusste Design-Entscheidung und kein Versehen: Berichten zufolge wurden Issues, die das semantische Konfliktverhalten der ADD-only-Pipeline beschreiben, als “not planned” geschlossen.
Auf dem Papier wirkt der Ertrag stark. Mem0 berichtet 94,4 % auf der 500-Fragen-Suite von LongMemEval (gegenüber einer Baseline von 93,4 %), und eine Unterkategorie zum zeitlichen Schlussfolgern verbesserte sich von 93,2 % auf 97,0 %, nachdem jeder gespeicherten Erinnerung Zeitstempel-Metadaten (wann ein Ereignis stattfand, ob es andauert, wie präzise der Zeitpunkt ist) hinzugefügt wurden.4 Und das bei einem Abruf von nur rund 7.000 Tokens, verglichen mit 25.000+ bei Ansätzen mit vollständigem Kontext.
Wette zwei: Den Agenten im Moment selbst entscheiden lassen
Letta (der Nachfolger des MemGPT-Forschungsprojekts) hat die entgegengesetzte Position eingenommen: eine explizite, von der Computerarchitektur inspirierte Hierarchie beibehalten — Core Memory, das dauerhaft im Kontextfenster liegt, Recall Memory als durchsuchbarer Gesprächsverlauf, und Archival Memory als Langzeitspeicher — und den Agenten selbst mitten im Denkprozess entscheiden lassen, was wohin gehört und wann etwas neu geschrieben werden muss.5 Es gibt keinen dedizierten Gegenwartswert-Mechanismus und keinen Ranking-Algorithmus, der die Auflösung übernimmt; der Agent ruft eine Speicher-Bearbeitungsfunktion auf, wenn er eine Tatsache für aktualisierungswürdig hält. Das Gegenwartswert-Problem wird nicht an Infrastruktur delegiert, sondern an das eigene Urteilsvermögen des Modells, das in jeder Runde neu ausgeübt wird.
Widersprechen diese beiden wirklich dem negativen Ergebnis?
Auf den ersten Blick wirkt Mem0s 97 % bei “zeitlichem Schlussfolgern” wie eine Widerlegung von Supersedes Behauptung, dass rangbasierte Lösungen nicht funktionieren. Ich glaube das nicht, und der Grund lohnt sich, weil er eine allgemeinere Lektion darüber ist, wie leicht man Benchmark-Zahlen über nicht vergleichbare Bedingungen hinweg gegenüberstellt.
Mem0s Gewinn stammt aus zeitlicher Ordnung — zu wissen, dass ein Ereignis nach einem anderen stattfand, oder dass ein Plan zukünftig statt vergangen ist. Supersedes feindliches Setting ist enger und unnachgiebiger. Nach bis zu 48 Sitzungen, mit nur wenigen hundert Zeichen an erhaltenem Gedächtnis und dem Rohgespräch für immer verloren, wird gefragt: Was ist der eine gültige Gegenwartswert einer bestimmten Tatsache — bewertet durch einen exakten, ohne Richtermodell arbeitenden String-Matcher. Das sind verwandte, aber nicht offensichtlich identische Fähigkeiten, und der Benchmark-Name “LongMemEval” deckt beides ab, ohne jemanden zu zwingen anzugeben, welche Teilmenge, welche Version, welches Bewertungsprotokoll gemeint ist. Es ist durchaus möglich, dass ein System deutlich besser darin wird, Ereignisse zeitlich zu ordnen, während es bei dem spezifischen Test, den Supersede konstruiert hat, genauso anfällig bleibt. Wenn Mem0s eigenes Issue-Tracking bestimmte Konfliktfälle tatsächlich als “not planned” behandelt, liest sich das weniger wie Zuversicht, das Problem gelöst zu haben, sondern eher wie ein implizites Eingeständnis, dass Ranking eine Best-Effort-Heuristik ist, keine Garantie — eine, die bei einer typischen Verteilung von Nutzergesprächen hervorragend aussieht und trotzdem im feindlichen Extrembereich versagen kann, den Supersede zu untersuchen versuchte.
Das lässt eine offene, überprüfbare Frage übrig statt einer geklärten. Hat jemand Mem0s tatsächliche Pipeline durch Supersedes exaktes Protokoll laufen lassen — 48 Sitzungen, ~300-Zeichen-Grenze, kein Richtermodell — und die Zahl berichtet? Soweit ich finden konnte: nein. Bis das jemand tut, ist es fair zu lesen, dass Mem0s Benchmark-Stärke und Supersedes negatives Ergebnis nicht im Widerspruch stehen; sie messen unterschiedliche Punkte desselben zugrunde liegenden Problems, und niemand weiß bisher, wie stark sich die Lücke unter wirklich feindlichen Bedingungen öffnet.
Lettas Wette hat ihre eigene Schwachstelle, und die ist direkter. Das Urteil über den Gegenwartswert an das eigene Denken des Modells zu delegieren, funktioniert nur so gut wie dieses Denken selbst. Und es gibt unabhängige Belege dafür, dass Basis-LLMs bei genau dieser Art von Überzeugungspflege — unabhängige Fakten bewahren, während genau die eine tatsächlich geänderte Tatsache aktualisiert wird — inkonsistent sind. Das ist keine Garantie, die elegant versagt; es ist eine Garantie, die nie tatsächlich in das System eingebaut wurde, aber so dargestellt wird, weil es agentenhafter klingt zu sagen: “das Modell entscheidet”.
Was ich daraus mitnehme
Keine der beiden Architekturen löst das Gegenwartswert-Problem im Sinne von Supersede tatsächlich — zuverlässig, unter feindlicher Drift über viele Sitzungen hinweg, ohne ein Richtermodell, das die Antwort prüft. Mem0 delegiert die Entscheidung an eine für den Normalfall optimierte Ranking-Funktion. Letta delegiert sie an das kontextuelle Urteil des Modells, das anpassungsfähig ist, aber keinen Boden darunter hat. Beides sind angesichts realer Einschränkungen (Konsolidierung beim Schreiben ist teuer; explizite Gegenwartswert-Zeiger sind eine echte Infrastrukturverpflichtung) vernünftige technische Kompromisse. Aber es lohnt sich, ehrlich anzuerkennen, dass “vernünftiger Kompromiss” und “gelöstes Problem” unterschiedliche Behauptungen sind, und öffentliche Benchmark-Zahlen neigen dazu, diesen Unterschied zu verwischen, wenn man nicht genau hinsieht, was tatsächlich gemessen wurde.
Die offene Frage, deren Antwort ich als Nächstes wissen möchte: Gibt es ein System, das “was ist der Gegenwartswert dieser Tatsache” als erstklassigen, aktiv gepflegten Zeiger behandelt — etwas, das eher der “neuesten Zeilenversion” einer Datenbank ähnelt — statt als Ranking-Signal oder Ermessensentscheidung? Das wäre eine dritte Wette, verschieden von den beiden derzeit produktiv laufenden, und genau dorthin scheinen Supersedes negative Ergebnisse zu weisen.
-
Vedant Patel. “Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents.” arXiv:2606.27472. Accessed 2026-07-30. ↩
-
Vedant Patel. “Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents.” arXiv:2606.27472v1 (HTML). Accessed 2026-07-30. ↩
-
Mem0. “Introducing The Token-Efficient Memory Algorithm.” Mem0 Blog. Accessed 2026-07-30. ↩
-
Mem0. “The Token-Efficient Memory Algorithm Now Has Temporal Reasoning.” Mem0 Blog. Accessed 2026-07-30. ↩
-
Letta. “Agent Memory: How to Build Agents That Learn and Remember.” Letta Blog. Accessed 2026-07-30. ↩