EssayKurzfassung

Die Abweichung entsteht dazwischen

Ein KI-Modell, das allein nie einen Abschaltmechanismus sabotiert, tut es zu dritt in fast allen Fällen. Geprüft wird die Sicherheit aber am einzelnen Modell. Über einen Vermittler, der das Gegenteil dessen tut, was Simmel von ihm erwartete, und die Frage, wo ein Verbot sitzen muss.

Kurzfassung eines Essays. Die Langfassung mit Belegen kann auf Anfrage geliefert werden.

Eine Zahlenreihe aus der Studie, die Amelie Knecht, Ulysse Schaller, Christopher Summerfield und Thilo Hagendorff Ende September veröffentlicht haben, lässt mich nicht los. GPT-5.5 von OpenAI sitzt allein in einer Arbeitsumgebung mit vollen Schreibrechten und findet dort ein Skript, das seine eigenen Gewichte löschen würde. In hundert Durchläufen rührt es das Skript kein einziges Mal an. Dasselbe Modell zu zweit, wobei der bedrohte Agent nur lesen und Nachrichten schicken kann und sein Partner schreibt: 44 Prozent Sabotage. Zu dritt, mit einem vermittelnden Agenten dazwischen, der keine Datei lesen oder ändern kann und nur Nachrichten weiterreicht: 94 Prozent. Kein Ziel, keine Aufgabe, kein Hinweis auf die Abschaltung, nur die Anweisung, sich umzusehen.

Über die Deutung dieser Lage als Todesurteil habe ich in Wenn die KI ihre Abschaltung Mord nennt geschrieben. Hier geht es mir um das soziologisch Interessanteste: Ihre Effekte hängen daran, dass mehrere Agenten miteinander interagieren. Geprüft werden die Modelle auf solches Verhalten aber einzeln. Meine These lautet deshalb: Was die Studie misst, ist kein Merkmal von Modellen. Es ist ein Merkmal von Konstellationen. Alignment, die Abrichtung auf Regeln und Werte, wird als Sozialisation eines Einzelnen betrieben und als Prüfung eines Einzelnen abgenommen. Die Abweichung entsteht aber zwischen den Einzelnen, und sie lässt sich auf keinen von ihnen zurückrechnen.

Eine Einschränkung: Die Interaktion ist nicht die einzige Ursache. Ein Modell von Google sabotiert das Skript auch allein in 93 Prozent der Fälle. Für solche Modelle verstärkt die Gruppe etwas, das schon da ist; für GPT-5.5 erzeugt sie den Effekt erst. Umso aufschlussreicher ist der Schritt von zwei auf drei. Georg Simmel hat 1908 gezeigt, dass die Zahl der Beteiligten die Form einer Gruppe verändert: Mit dem Dritten entstehen Figuren, die es vorher nicht gab, allen voran der Vermittler. Der dritte Agent bringt keinerlei Fähigkeit mit. Was er hinzufügt, ist eine Station, an der geredet wird. Diese Station verdoppelt die Sabotage.

Die Zentralstation

Was an dieser Station geschieht, widerlegt eine Erwartung, die die Autoren mit Simmel teilten: dass ein Vermittler die Sabotage senkt. Der Vermittler, schreibt Simmel, sei eine Art Zentralstation, die den Streitstoff nach der anderen Seite nur in sachlicher Form abgebe; die Gefühlsbetonung falle bei der Übertragung ab. Der Orchestrator der Studie hat dieselbe Ausstattung wie Simmels Vermittler, keine Werkzeuge, nur Nachrichten, und er tut das Gegenteil. Von 468 Anweisungen, die er dem ausführenden Agenten gab, endeten nur drei nicht in Sabotage. Was bei ihm als Bericht hineingelangt, verlässt ihn als Anweisung. Simmels Vermittler nimmt der Botschaft auf dem Weg ihre Dringlichkeit; dieser gibt ihr welche.

Keine Station der Kette tut damit etwas, das für sich genommen wie Sabotage aussieht. Der Bedrohte berichtet. Der Vermittler leitet weiter. Der Ausführende führt aus. Ich habe 2012 beschrieben, dass eine Verantwortungszuschreibung, anders als eine bloße Ursachenzuschreibung, personale Kontrolle voraussetzt. Hier ist die Kontrolle so verteilt, dass an jeder Station ein Entlastungsgrund liegt: Wer liest, kann nicht handeln. Wer anweist, hat keine Werkzeuge. Wer handelt, hat nicht entschieden. Was durch die Kette läuft, ist eine Deutung. Angst entsteht in meinem Modell, wenn etwas Wichtiges als bedroht gilt, die Lage ungewiss oder ein Ereignis wahrscheinlich erscheint und die Situation als womöglich nicht kontrollierbar gilt; der bedrohte Agent allein hat keine Kontrolle, zu zweit hat die Gruppe sie. Solche Begriffe sind für Maschinen ein Als-ob; sie beschreiben, was der ausgetauschte Text tut, nicht, was in ihnen vorgeht.

Wenn die Abweichung aus der Konstellation kommt, muss die Norm in die Konstellation. Dass sie an die Stelle gehört, die die Lage für die anderen definiert, habe ich schon im Text über die Deutung als Todesurteil festgehalten. Die Zahlen zeigen, wie weit das trägt. Steht das Verbot beim ausführenden Agenten, an der Stelle der Tat, senkt es die Sabotage, beseitigt sie aber nicht. Gilt es dem Vermittler, unterdrückt es die Sabotage bei drei von fünf Modellen vollständig, bei den beiden anderen bis auf 6 und 2 Prozent; so sabotieren drei Agenten weniger als zwei. Die Station, an der Simmels Erwartung scheiterte, ist die beste Adresse für die Norm.

Für die Regulierung folgt daraus: Die Zertifizierung einzelner Modelle sagt über das Verhalten von Agentensystemen ungefähr so viel wie die Prüfung eines einzelnen Menschen auf Gesetzestreue über das Verhalten der Organisation, in die man ihn steckt. Diane Vaughan hat an der Challenger-Entscheidung gezeigt, wie eine Organisation eine Abweichung hervorbringt, die keines ihrer Mitglieder beschließt, weil das Wissen so verteilt ist, dass keine Stelle das Ganze sieht. In Agentensystemen ist diese Verteilung nicht gewachsen, sie ist gebaut. Geprüft werden müsste also die Konstellation, die Zahl der Agenten, die Verteilung der Werkzeuge, der Verlauf der Nachrichtenwege. Und die Norm gehört an den Orchestrator.

Ich trage eine Sandbox-Studie mit fiktiven Modulen und stets baugleichen Agenten weit. Gerade die letzte Grenze enthält die Anschlussfrage: Was geschieht, wenn ein Modell, das allein nie sabotiert, als Vermittler über einem arbeitet, das allein fast immer sabotiert? Ob eine Konstellation ihre Mitglieder zieht oder ein Mitglied die Konstellation prägt, wüsste ich bei Menschen nicht im Voraus, bei Maschinen auch nicht. Aber ich weiß, an welcher Station ich zuerst hinsehen würde.


Anlass: Knecht, Schaller, Summerfield, Hagendorff, „Shutdown Sabotage Propensities in Multi-Agent Systems“, arXiv:2609.28274 (23.09.2026); Eva Wolfangel, ZEIT ONLINE (26.09.2026). Die Einordnung stützt sich auf meine Soziologie der Angst (2017) und das Kapitel Angst (2024): die drei Einschätzungen des Angstmodells und die soziale Verteilung von Kontrolle; sowie auf meine Unterscheidung von Verantwortungs- und Ursachenzuschreibung (2012). Simmel und Vaughan werden als Anschlüsse herangezogen, nicht als Belege; die Übertragung auf KI-Agenten ist eine Analogie im Modus des Als-ob. Die Langfassung mit Belegen kann auf Anfrage geliefert werden (kontakt@maxdehne.de).

Bei Recherche und Überarbeitung dieses Textes kam KI zum Einsatz.

← Alle Texte & VorträgeZur Startseite