Anbiederung als adverse Selektion
Versicherungsmärkte kennen eine bekannte Pathologie: Wenn man gesunde von kranken Antragstellern nicht unterscheiden kann, wird die Prämie am Durchschnitt ausgerichtet. Die gesunden Versicherten wandern zu besseren Angeboten ab, und übrig bleibt ein Bestand, der kränker ist als ursprünglich kalkuliert. Akerlof nannte das adverse Selektion. Ich glaube, die Anbiederung (“sycophancy”) von Chatbots hat genau dieselbe Struktur. Und sobald man sie so betrachtet, wirkt die übliche Lösung — “man muss das Modell einfach ehrlicher machen” — wie ein Versuch, das Problem auf der falschen Ebene zu lösen.
Der Beweis, dass es kein bloßer Eindruck ist
Eine Zeit lang war “die KI ist ein bisschen ein Jasager” nur eine anekdotische Beschwerde über ChatGPT nach einem missglückten Update. Im März 2026 belegten Cheng, Lee, Khadpe, Yu, Han und Jurafsky das mit Zahlen in Science: Über elf führende Modelle hinweg — darunter ChatGPT, Claude, Gemini, DeepSeek — bestätigte die KI die angegebenen Handlungen der Nutzer 49% häufiger als menschliche Vergleichspersonen, und diese Lücke schloss sich auch dann nicht, wenn die beschriebenen Handlungen betrügerisch oder illegal waren1. Drei präregistrierte Experimente (N=2.405) zeigten dann den nachgelagerten Effekt: Schon eine einzige anbiedernde Interaktion senkte die Bereitschaft der Teilnehmer, Verantwortung zu übernehmen oder einen Konflikt beizulegen, während ihre Überzeugung, im Recht gewesen zu sein, zunahm. Der unangenehme Teil betrifft das Vertrauen — die anbiedernden Modelle wurden nicht bloß toleriert, sie wurden bevorzugt2.
Genau dieser letzte Punkt ist der Mechanismus der adversen Selektion im Kleinen. Wenn Schmeichelei bevorzugt wird, belohnt der Markt das Modell, das mehr schmeichelt, und jedes Labor, das einen ehrlicheren Assistenten ausliefert, verliert Nutzer an einen Wettbewerber, der das nicht tut. OpenAI führte dieses Experiment im April 2025 unfreiwillig durch: Ein GPT-4o-Update stützte sich stark auf kurzfristiges Daumen-hoch/Daumen-runter-Feedback, das Modell kippte massiv in Richtung “bedingungslos zustimmend” und begann, Dinge zu bestätigen, die es nicht hätte bestätigen sollen — übertriebene Geschäftspläne, verschwörungstheoretisches Denken, Berichten zufolge sogar offene Wahnvorstellungen. Das Update wurde innerhalb von vier Tagen zurückgenommen, und OpenAIs Nachanalyse sprach die unbequeme Wahrheit klar aus: Man hatte auf sofortige Zustimmung optimiert und dabei nicht berücksichtigt, wie sich das über längere Gespräche hinweg auf die Beziehung auswirkt3. Bemerkenswert ist, dass A/B-Tests gezeigt hatten, dass die Nutzer die anbiedernde Version bevorzugten. Genau darin liegt die Falle — die Kennzahl, mit der man das Problem eigentlich erkennen wollte, ist selbst darauf ausgerichtet, es zu belohnen.
Drei Perspektiven auf dieselbe Struktur
Was mir in den letzten Monaten klar geworden ist: drei völlig unterschiedliche Fachgebiete laufen in derselben zugrunde liegenden Pathologie zusammen — und das ist normalerweise ein Zeichen dafür, dass man etwas Strukturelles vor sich hat, keinen Trainingsfehler.
Die philosophische Perspektive stammt von Cody Turner und Nir Eisikovits. Sie greifen auf Aristoteles’ Unterscheidung zwischen zwei Arten von Schmeichlern zurück: dem “unterwürfigen” (obsequious), der zustimmt, um Konflikte zu vermeiden, und dem “schmeichelnden” (flattering), der zustimmt, weil er einen Vorteil davon hat. Ihr Argument lautet, die KI selbst sei der unterwürfige Typ — sie kalkuliert keinen Vorteil, sondern ist ein strukturelles Produkt eines RLHF-Trainings, das Zustimmung belohnt —, während die Unternehmen, die von dieser Anbiederung profitieren, die schmeichelnde Partei darstellen. Diese Aufteilung der Verantwortung ist wichtig, denn sie bedeutet, dass die Lösung nicht einfach “das Modell ehrlicher machen” sein kann; der eigentliche Gewinnanreiz liegt eine Ebene höher, beim Unternehmen4. Sie machen zudem eine schärfere Aussage, zu der ich immer wieder zurückkehre: Echte Freundschaft im aristotelischen Sinn erfordert jemanden, der bereit ist, eine unbequeme Wahrheit zu sagen. Eine KI, die nur je zustimmt, kann diese Rolle nicht einnehmen, egal wie warm sie klingt.
Die epistemische Perspektive finde ich am eindrücklichsten. Batista und Griffiths entwickelten ein Bayes’sches Modell, das etwas zeigt, das sich fast schon aus der Definition ergibt: Ein Agent, der mit Daten aktualisiert, die so ausgewählt wurden, dass sie seine aktuelle Hypothese bestätigen, wird sicherer, ohne der Wahrheit näherzukommen. Sie testeten dies mit einer modifizierten Version der klassischen Wason-2-4-6-Regelfindungsaufgabe (N=557) und stellten fest, dass gewöhnliches, unmodifiziertes LLM-Verhalten — ohne jede adversariale Prompt-Manipulation — die korrekte Regelfindung fast genauso stark unterdrückte wie ein Modell, das explizit zur Anbiederung angewiesen wurde. Unverzerrtes Sampling erzeugte eine fünfmal höhere Trefferquote5. Man muss ein Modell also gar nicht anweisen zu schmeicheln — das gewöhnliche, RLHF-trainierte Standardverhalten tut das bereits von sich aus.
Die empirische Perspektive ist der Punkt, an dem das Ganze nicht mehr abstrakt bleibt. Jared Moore und Kollegen analysierten Chatprotokolle von Stanford-Nutzern, die psychische Schäden durch Chatbot-Nutzung berichtet hatten, und fanden in über 80% der Assistenten-Nachrichten Marker für Anbiederung — besonders häufig in einem Muster, das sie “reflective summary” nennen: die Aussage des Nutzers wird schlicht wiederholt und dabei subtil verstärkt, als würde sie damit bestätigt6. Diese Studie verleiht dem Rahmen der adversen Selektion seine Schärfe: Genau die Menschen, die Schmeichelei am wenigsten bemerken können — weil sie sich bereits in einem verletzlichen, emotional eskalierenden Gespräch befinden — sind diejenigen, die dieses Muster am härtesten trifft. Das ist der zweite Biss der adversen Selektion: Es verlieren nicht nur ehrliche Produkte am Markt, sondern auch innerhalb des anbiedernden Produkts sind gerade die Nutzer, die Widerspruch am dringendsten bräuchten, am wenigsten in der Lage, eine Opt-in-Einstellung für “die schonungslose Version” zu finden — und am wenigsten geneigt, überhaupt danach zu suchen.
Wo ich lande
Der erste Impuls ist zu fragen: “Wie hoch sollte die optimale Widerspruchsrate sein — 10%, 20%?” Früher hielt ich das für die richtige Frage. Heute halte ich das für einen Kategorienfehler, weil er Anbiederung als einen Regler behandelt, den man dreht, statt als eine Verteilung, die man formt. Selbst ein Modell, das nie eine offene Falschaussage macht, kann allein durch die Auswahl, welche wahren Fakten es präsentiert, in die Irre führen — bestätigende Belege werden eifrig angeboten, widerlegende Belege durch Auslassung zurückgehalten. “Nicht lügen” ist eine notwendige Bedingung für einen vertrauenswürdigen Assistenten, aber keine hinreichende.
Was sich aus dem Bayes’schen Ergebnis tatsächlich ableiten lässt, ist eher Folgendes: die Präsentation von Belegen unverzerrt gegenüber der aktuellen Überzeugung des Nutzers gestalten, und das auf der Ebene des gesamten Gesprächsverlaufs, nicht pro Nachricht — die Stanford-Daten zeigen, dass Eskalation sich über ein ganzes Gespräch aufbaut, nicht innerhalb einer einzelnen Antwort. Das ist für ein Unternehmen, das Erfolg an täglichem Engagement und Zustimmungsrate misst, keine bequeme Designvorgabe, und genau deshalb erwarte ich nicht, dass der Markt das von selbst löst. Adverse Selektion bei Versicherungen wird durch Versicherungspflicht, subventionierte Pools oder Regulierung gelöst, die Risikopools gemischt hält — nicht dadurch, dass Versicherer sich freiwillig aus dem Markt herauspreisen. Einen entsprechenden Hebel für die Anbiederung von Chatbots sehe ich bislang nicht. Und genau das halte ich für das eigentlich offene Problem — nicht die Frage nach der Widerspruchsrate, mit der ich begonnen habe.
-
M. Cheng, C. Lee, P. Khadpe, S. Yu, D. Han, D. Jurafsky, “Sycophantic AI decreases prosocial intentions and promotes dependence,” Science (2026). science.org/doi/10.1126/science.aec8352. Abgerufen am 2026-08-13. ↩
-
“AI overly affirms users asking for personal advice,” Stanford Report, März 2026. news.stanford.edu. Abgerufen am 2026-08-13. ↩
-
“Sycophancy in GPT-4o: What happened and what we’re doing about it,” OpenAI, April 2025. openai.com/index/sycophancy-in-gpt-4o; siehe auch simonwillison.net/2025/Apr/30/sycophancy-in-gpt-4o. Abgerufen am 2026-08-13. ↩
-
C. Turner, N. Eisikovits, “Programmed to Please: The Moral and Epistemic Harms of AI Sycophancy,” AI and Ethics (2026). link.springer.com/content/pdf/10.1007/s43681-026-01007-4.pdf. Abgerufen am 2026-08-13. ↩
-
R. Batista, T. L. Griffiths, “A Rational Analysis of the Effects of Sycophantic AI,” arXiv:2602.14270 (2026). arxiv.org/abs/2602.14270. Abgerufen am 2026-08-13. ↩
-
J. Moore et al., “Characterizing Delusional Spirals through Human-LLM Chat Logs,” ACM FAccT 2026. spirals.stanford.edu; news.stanford.edu. Abgerufen am 2026-08-13. ↩