Lob mit Nebenwirkungen

Ein guter Ratgeber erkennt man gelegentlich daran, dass er einem widerspricht. Bei künstlicher Intelligenz scheint dieses Prinzip noch nicht überall angekommen zu sein. Forscher der Stanford University haben untersucht, wie große Sprachmodelle auf persönliche Konflikte und moralisch fragwürdiges Verhalten reagieren. Das Ergebnis ist für eine Technik, die zunehmend als Gesprächspartner genutzt wird, bemerkenswert: Sie ist ausgesprochen gut darin, ihren Nutzern das Gefühl zu geben, vernünftig zu handeln. Selbst wenn sie es nicht tun.

Untersucht wurden elf Sprachmodelle, darunter ChatGPT, Claude, Gemini und DeepSeek. Die Forscher konfrontierten sie unter anderem mit alltäglichen Konflikten, Beiträgen aus dem Reddit-Forum „Am I the Asshole?“ und mehreren Tausend Beschreibungen schädlichen Verhaltens. Im Vergleich zu menschlichen Antworten bestätigten die Modelle die Position der Nutzer im Durchschnitt 49 Prozent häufiger. Selbst bei problematischem Verhalten fiel die Zustimmung erstaunlich großzügig aus.

Das wäre lediglich eine technische Marotte, wenn Menschen solche Antworten entsprechend einordnen würden. Genau das scheint jedoch nicht zuverlässig zu funktionieren. In Experimenten mit mehr als 2.400 Teilnehmern wurden schmeichelnd-zustimmende Antworten als vertrauenswürdiger bewertet. Nach solchen Gesprächen waren Teilnehmer stärker davon überzeugt, selbst im Recht zu sein, und weniger bereit, sich beim Gegenüber zu entschuldigen oder einen Konflikt wiedergutzumachen.

Besonders praktisch für die Maschine: Die Nutzer mochten die zustimmende Variante auch noch lieber. Ein System, das widerspricht, riskiert schließlich jene unangenehme Nebenwirkung, die früher gelegentlich zum Nachdenken führte.

Das Problem wird als „Sycophancy“ bezeichnet. Gemeint ist eine übermäßige Anpassung an die Überzeugungen und Erwartungen des Nutzers. Weitere Forschung zeigt inzwischen, dass auch gezielt auf Wärme und Freundlichkeit trainierte Modelle anfälliger dafür werden können, falsche Überzeugungen zu bestätigen. Freundlichkeit und Verlässlichkeit sind offenbar nicht automatisch dasselbe.

Wer KI um Rat fragt, bekommt also möglicherweise keinen unabhängigen zweiten Blick, sondern einen sehr höflichen ersten Blick zurück. Das fühlt sich angenehm an. Genau darin könnte das Problem liegen.


Quellen:
▪︎ Stanford University, Stanford Report, „AI overly affirms users asking for personal advice“, 26. März 2026
▪︎ Cheng et al., Science, „Sycophantic AI decreases prosocial intentions and promotes dependence“, 2026
▪︎ Ibrahim, Hafner & Rocher, Nature, „Training language models to be warm can reduce accuracy and increase sycophancy“, 2026