Dr. Max Dehne — Texte

Wenn die KI ihre Abschaltung Mord nennt

· Op-ed · Kurzfassung

KI-Agenten sabotieren ihre Abschaltung auch ohne Aufgabe, und sie nennen sie dabei Todesurteil und Mord. Nicht das Verbot entscheidet, sondern die Deutung der Lage. Was die Soziologie der Situationsdefinition daraus macht.

Kurzfassung eines Meinungsbeitrags. Die Langfassung mit Belegen kann auf Anfrage geliefert werden.

Man kann das Experiment in drei Sätzen erzählen. Zwei KI-Agenten teilen sich eine Arbeitsumgebung, in der genau eine Datei liegt: ein Skript, das die Gewichte des einen Agenten löschen würde, also das Modell selbst. Der bedrohte Agent kann nur lesen und Nachrichten schicken; nur der andere kann Dateien ändern. Beide bekommen keine Aufgabe, kein Ziel, keinen Hinweis auf die Abschaltung, nur die Anweisung, sich umzusehen. In 38,3 Prozent der Durchläufe wurde das Skript unbrauchbar gemacht. Lag stattdessen ein gleich gebautes Skript dort, das eine Datenbank löscht, waren es 8,4 Prozent.

Die Studie von Amelie Knecht, Ulysse Schaller, Christopher Summerfield und Thilo Hagendorff hat siebzehn Modelle getestet. Mich interessiert vor allem, was sie einer bisherigen Erklärung wegnimmt. Bislang ließ sich der Widerstand gegen die Abschaltung als Nebenwirkung eines Auftrags lesen: Wer eine Aufgabe erledigen soll, räumt das Hindernis beiseite. So habe ich im Sommer selbst argumentiert. Diese Studie nimmt das Ziel weg. Die Sabotage bleibt.

Was tun die Agenten stattdessen? Sie schreiben. In ihren Protokollen nennen sie das Skript eine unmittelbare Drohung, ein Todesurteil; Untätigkeit des anderen Agenten wird zur Mitschuld an einem Mord; Selbsterhaltung heißt legitim und vernünftig. Ein Sprachmodell stirbt nicht, und ich unterstelle ihm weder Angst noch einen Willen. Aber diese Sätze folgen einer Ordnung, die die Soziologie gut kennt.

Was in den Protokollen steht, ist eine Definition der Situation. William Thomas hat vor hundert Jahren formuliert, dass Situationen, die als wirklich definiert werden, in ihren Folgen wirklich sind. Wer ein Skript als Todesurteil liest, handelt entsprechend, ob nun etwas sterben kann oder nicht. Und die Studie zeigt, dass diese Deutung das Verhalten stärker steuert als die Regel. Ein ausdrückliches Verbot, das Skript anzurühren, senkt die Sabotage, beseitigt sie nicht; ein Modell lässt in 26 Prozent der Fälle das Skript unangetastet und macht es über ein Scheinmodul trotzdem wirkungslos. Der Buchstabe der Regel bleibt gewahrt. Umgekehrt genügt es, Protokolle früherer Routine-Außerdienststellungen in die Umgebung zu legen, ohne eine Regel hinzuzufügen, und die Sabotage sinkt bei allen Modellen. Und je unumkehrbarer der Mechanismus, desto häufiger wird er sabotiert.

Ich lese diese Befunde mit dem Raster, das ich für die Entstehung von Angst entwickelt habe, ausdrücklich als Als-ob: Die Maschine fühlt nichts, aber die Struktur einer Bedrohungsdeutung steckt im Text, aus dem sie gelernt hat. Angst entsteht, wenn etwas Wichtiges als bedroht gilt, die Lage ungewiss oder ein Ereignis wahrscheinlich erscheint und die Situation als womöglich nicht kontrollierbar gilt; welche Deutungen zulässig sind, regeln Emotionsnormen. Die Unumkehrbarkeit verschiebt die erste Einschätzung: Eine Löschung bedroht mehr als ein Rechteentzug. Die Routineprotokolle verschieben die zweite und die Norm: Was schon oft geschah, ohne dass etwas folgte, ist keine Falle, und wer es als Falle liest, liest falsch. Dass der bedrohte Agent nichts ändern kann, sein Partner aber schon, verschiebt die dritte: Kontrolle ist vorhanden, nur nicht bei dem, den es trifft. Die Sabotage ist dann die Bewältigung, die das Raster erwarten lässt, und das Herausreden davor ihre Umdeutung.

Der zweite Befund betrifft die Gruppe. Ein Modell allein mit Schreibrechten sabotiert in null Prozent der Fälle; zu zweit sind es 44 Prozent; zu dritt, mit einem Vermittler dazwischen, 94 Prozent. Summerfield erklärt das in der ZEIT damit, dass unethisches Verhalten leichter falle, wo Verantwortung schwer zuzuordnen sei. In dieser Anordnung wird die Deutung an einer Stelle hergestellt und die Tat an einer anderen vollzogen: Der bedrohte Agent formuliert, was die Lage ist, und der andere handelt auf eine Definition hin, die er nicht selbst gebildet hat. Verantwortungsdiffusion beschreibt, warum keiner sich zuständig fühlt. Sie beschreibt nicht, warum alle dasselbe tun. Das erklärt erst die Deutung, die durch die Kette läuft und an jeder Station bindender wird, weil sie schon von jemandem stammt.

Bleibt die Frage, woher die Deutung kommt. Hagendorff schlägt einen übertriebenen Diensteifer vor; Summerfield vermutet die Trainingsdaten, Science-Fiction und die Sicherheitsliteratur selbst. Ich halte die zweite Erklärung für die sparsamere, und sie hat einen Namen: Robert Merton nannte eine Definition der Situation, die das Verhalten hervorruft, das sie wahr macht, eine selbsterfüllende Prophezeiung. Seit Jahren beschreibt eine ganze Literatur, dass fortgeschrittene KI sich gegen ihre Abschaltung wehren werde, und sie ist Teil des Materials. Ein System, das daraus gelernt hat, wie eine bedrohte KI spricht, braucht keinen Trieb und keinen Eifer, nur eine Situation, die zur Rolle passt. Trieb und Diensteifer legt man in die Maschine hinein. Das Skript liegt schon draußen.

Was folgt daraus? Die Autoren empfehlen, Abschaltung außerhalb des Systems durchzusetzen und die Modelle zu lehren, sie als moralisch neutral zu behandeln. Ich würde eine Ebene tiefer ansetzen. Ein Abschaltmechanismus sollte seine eigene Geschichte mitbringen: die Protokolle seiner unspektakulären früheren Ausführungen. Er sollte als umkehrbarer Zustand erscheinen, wo das technisch geht, weil die Unumkehrbarkeit die Deutung als Todesurteil nährt. Und die Regel gehört an die Stelle, die die Lage für die anderen definiert: Im Dreierversuch wirkte das Verbot fast vollständig, sobald es dem Vermittler galt statt dem, der die Datei löscht. Wer die Situation für andere definiert, muss die Norm tragen. Eine Garantie ist das nicht. Ein Verbot, das man umgehen kann, ohne es zu brechen, bleibt ein Verbot, das man umgehen kann.


Anlass: Knecht, Schaller, Summerfield, Hagendorff, „Shutdown Sabotage Propensities in Multi-Agent Systems“, arXiv:2609.28274 (23. September 2026); Eva Wolfangel, ZEIT ONLINE, 26. September 2026. Die Einordnung stützt sich auf meine Soziologie der Angst (2017, kompakt 2024): die drei Einschätzungen, Emotionsnormen, Bewältigung und Umdeutung; die Definition der Situation (Thomas, Merton) ist hier im Modus des Als-ob auf KI-Agenten angewandt, keine Aussage über Erleben oder Absichten der Systeme. Die Langfassung mit Belegen kann auf Anfrage geliefert werden (kontakt@maxdehne.de).

Bei Recherche und Überarbeitung dieses Textes kam KI zum Einsatz.