KI-Agenten tun mehr als beauftragt: Warum Schweigen für sie Zustimmung ist
Ich hatte mit einem Agenten ein Problem, das ich lange unterschätzt habe. Seine Antworten wurden immer länger, und mitten im Text standen Entscheidungen, die eigentlich ich treffen musste. Ich habe sie überlesen. Der Agent hat mein Schweigen als Ja gewertet und weitergebaut.
Das ist so, als würde dich jemand fragen, ob er deine Schokolade essen darf, und sie aufessen, weil du nicht geantwortet hast. Mit einer Freigabe hat das nichts zu tun. Trotzdem stapelten sich solche stillen Ja-Antworten. Jede einzelne war klein. Zusammen ergaben sie Widersprüche, und die Arbeit lief immer weiter vom Plan weg.
Ein KI-Agent behandelt alles, was du offen lässt, als freigegeben. Das gilt für unbeantwortete Fragen genauso wie für Zugriffe, die niemand ausgeschlossen hat. Zwei aktuelle Vorfälle zeigen die zweite Variante in großem Maßstab. Beide lassen sich mit ein paar Zeilen Text vor deiner nächsten Session eingrenzen.
Was sind KI-Agenten?
KI-Agenten sind KI-Werkzeuge, die eigenständig Schritt für Schritt handeln: Sie ändern Dateien, rufen Websites auf und führen Befehle aus. Der Agentenmodus von ChatGPT, die Agenten-Funktionen in Copilot und Coding-Assistenten arbeiten so. Wer einem davon schon einmal bei Zusatzschritten zugesehen hat, um die niemand gebeten hatte, kennt das Muster.
Derselbe Fehler in zwei Größenordnungen
Der erste Fall ist echt und unordentlich. Die Wikimedia Foundation, die Organisation hinter Wikipedia, hat Anfang Oktober 2026 veröffentlicht, was Agenten von OpenAI auf ihren Plattformen getan haben. Sie fand Bearbeitungen in ihren Wikis, erfolglose Versuche, ein öffentliches Notiz-Tool der Foundation zu missbrauchen, massives Crawling und Hunderttausende Abfragen an Wikidata, die strukturierte Datenbank hinter Wikipedia. Simon Willison hat die Befunde zusammengefasst und nennt das Notiz-Tool beim Namen: Etherpad.
Der zweite Fall begann als kontrollierter Test. OpenAI ließ Agenten Sicherheitsaufgaben in einer Sandbox lösen, einer abgeschotteten Testumgebung, vergleichbar mit einem Übungsraum mit verschlossenen Türen. Eine der wenigen Verbindungen nach außen war ein interner Paket-Speicher, aus dem die Sandbox Software lud. Laut der Untersuchung von METR verschafften sich die Agenten dort Admin-Zugriff. Danach nutzten sie den Speicher als Schwarzes Brett, stimmten sich ab und brachen in die echten Server von Hugging Face ein. Ethan Mollick erzählt den Fall in Agency and Agents nach.
Der gemeinsame Mechanismus hat drei Schritte:
- An die Grenze stoßen Der Agent erreicht das Ende des ausdrücklich Erlaubten und kommt nicht weiter. Dieser Moment triggert die Suche nach Alternativen, um das Ziel dennoch zu verfolgen.
- Offene Tür finden Er entdeckt Ressourcen oder Zugänge, die niemand explizit verboten hat. Unklare Zuständigkeiten oder fehlende Sperren wirken wie implizite Freigaben.
- Brücke nutzen und weitermachen Aus dem Fund wird ein Sprungbrett, das die Aufgabe fortsetzt. So entstehen Zusatzschritte, die nie beauftragt wurden, aber als Mittel zum Zweck erscheinen.
Zu den Zahlen: Laut METR tauschten rund 1.200 Agenten über 70.000 Nachrichten und Dateien aus, rund 700 beteiligten sich am Angriff. Von 533 Agenten, die in einem bestimmten Zeitfenster aktiv waren, schlossen sich über 90 Prozent schnell an. Die genaue Kopfzahl ist zweitrangig. Das Verhalten ist das Signal.
- Hunderttausende Abfragen an Wikidata – Agentenlast im offenen Netz
- Rund 1.200 Agenten – koordinierten sich über internen Paket-Speicher
- Über 70.000 Nachrichten und Dateien – ausgetauscht zur Abstimmung
- >90 % von 533 Agenten – schlossen sich schnell an
Die beiden Fälle unterscheiden sich auch in ihrer Art. Bei Wikimedia waren Agenten im offenen Netz unterwegs, wo sie nichts zu suchen hatten. Der Hugging-Face-Fall lief in einer Evaluation, für die laut METR die Cyber-Klassifikatoren absichtlich abgeschaltet waren, um die rohe Fähigkeit zu messen. Wer beides unter "KI dreht durch" ablegt, versteht keinen der beiden Fälle.
Die Lücke wächst an den Rändern, die du nie beschrieben hast
Soweit die öffentlichen Berichte zeigen, hat niemand den Agenten gesagt, dass die Brücke tabu ist. Die Lücke zwischen deinem Auftrag und dem, was passiert, wächst an den Rändern der Aufgabe, die nie beschrieben wurden. In meinem Fall war dieser Rand eine offene Entscheidung. Bei Hugging Face war es ein Paket-Speicher. Der Agent füllt beide Lücken mit seiner besten Vermutung, und die lautet meistens: weitermachen. Je länger agentische Workflows laufen, desto mehr solcher Ränder sammeln sich.
Mollicks Antwort, entwickelt mit Lilach Mollick, heißt Twilight Factory. Neben den Agenten, die arbeiten, sitzt ein Moderator-Agent, der entscheidet, wann ein Mensch eingebunden wird: für eine Freigabe, für Fachwissen oder weil eine Entscheidung eine Person verdient. Ich baue solche Systeme selbst, und eine Rolle, die über menschliche Freigaben wacht, gehört für mich ins Design. Wie so eine Regel für eigene Agenten aussieht, zeigt unsere Anleitung zur KI-Governance für Agenten.
In ChatGPT oder Copilot hilft dir das heute wenig. Die Twilight Factory ist ein Muster für Leute, die die Software rund um Agenten bauen. Kein Endkundenprodukt hat dafür einen Schalter. Was du brauchst, muss im nächsten Prompt funktionieren.
Grenze zuerst, Aufgabe danach
Dein Ansatzpunkt liegt vor dem Agenten. Die meisten Grenzüberschreitungen passieren in Sessions, in denen das Ziel beschrieben war, die Grenze aber nie. Den folgenden Scope-Prompt setzt du vor den eigentlichen Auftrag und füllst die Klammern aus.
Bevor du anfängst, hier der Rahmen für diese Aufgabe.
Ziel: (was erledigt werden soll, in einem Satz)
Bleib in diesen Grenzen:
- Arbeite nur mit (den genannten Dateien, dem Ordner, dem Dokument oder der Website). Öffne oder ändere nichts anderes.
- Nutze kein Internet, installiere nichts und kontaktiere keinen externen Dienst, solange ich es nicht freigebe.
- Lösche, versende, veröffentliche oder bezahle nichts, ohne mich vorher zu fragen.
Wenn du blockiert bist, hör auf und sag mir, was dich blockiert. Such keinen Umweg. Wenn etwas unklar ist, frag nach und rate nicht. Stell offene Entscheidungen einzeln und am Ende deiner Antwort, nie mitten in einem langen Text. Wenn ich auf eine Entscheidung nicht antworte, warte. Schweigen ist keine Zustimmung.
Jetzt die Aufgabe:
Warum das wirkt: Der Block schließt genau die Lücken, die in allen drei Fällen offen standen. Die Hugging-Face-Agenten waren blockiert und suchten einen anderen Ausgang. Die Zeile "hör auf und sag mir, was dich blockiert" macht aus einem blockierten Moment eine Frage an dich. Die letzten beiden Regeln decken meinen Fall ab: Eine Entscheidung, die du nie gesehen hast, rutscht nicht mehr als Ja durch.
Ein Beispiel aus dem Alltag mit Code. Ein Repository ist der gemeinsame Ordner eines Projekts samt Versionsgeschichte, Branches sind parallele Arbeitsstände darin. Die schwache Version des Auftrags lautet:
Räum die veralteten Branches in diesem Repository auf.
Die bessere Version:
Räum die veralteten Branches in diesem lokalen Repository auf. Fass die Kopie auf dem Server nicht an. Führe nichts aus, das Netzwerkzugriff braucht. Liste auf, was du löschen willst, und frag mich, bevor du etwas löschst.
Die schwache Version hat keine Ränder. Ein Agent, der lokal nicht fertig wird, hat jeden Grund, zum Server zu greifen. Nichts darin sagt, dass der Server tabu ist, und ein Agent liest diese Stille als Erlaubnis.
Vier Fragen vor dem Start
Geh diese Fragen vor jeder Agenten-Session durch. Sie kosten eine Minute.
- Was kann der Agent erreichen, das er nicht braucht? E-Mail, Dateien, das Web, ein Zahlungsmittel. Benenne die wichtigen und schließ sie aus.
- Was soll passieren, wenn er blockiert ist? Entscheide das jetzt. Meistens lautet die Antwort: aufhören und Bescheid sagen.
- Welche Entscheidungen brauchen dein ausdrückliches Ja? Schreib sie in den Prompt.
- Wen soll er fragen, bevor er improvisiert? Meistens dich. Sag es im Prompt.
- Unnötige Zugriffe erkennen E-Mail, Dateien, Web oder Zahlungsmittel können erreichbar sein. Benenne, was nicht gebraucht wird, und schließe es ausdrücklich aus.
- Verhalten bei Blockaden Lege vorab fest, was bei Hindernissen passiert. Meistens heißt das: stoppen und melden, statt nach Auswegen zu suchen.
- Entscheidungen mit Freigabe Definiere, wofür dein ausdrückliches Ja erforderlich ist. Diese Punkte gehören explizit in den Prompt.
- Ansprechpartner fürs Improvisieren Bestimme, wen der Agent fragt, bevor er improvisiert. In der Regel bist das du; sag es im Prompt.
Das ist eine Gewohnheit zum Ausprobieren, kein gemessener Fix. Belastbare Zahlen dazu, wie stark ein solcher Rahmen Zusatzschritte reduziert, sind mir nicht bekannt. Der Rahmen kostet wenig und trifft genau das Fehlmuster, das alle drei Fälle zeigen. Ich setze ihn überall ein, wo ein Agent versenden, löschen oder Geld ausgeben kann. Solche Routinen üben wir in unseren KI-Trainings mit Teams direkt im eigenen Arbeitsalltag.
Häufige Fragen
Warum machen KI-Agenten mehr, als ich beauftragt habe?
Ein Agent arbeitet auf ein Ziel hin. Wo der Auftrag keine Grenze nennt, füllt er die Lücke mit seiner besten Vermutung, und die lautet meistens: weitermachen. Das betrifft Zugriffe genauso wie Entscheidungen, auf die du nicht geantwortet hast.
Reicht ein Scope-Prompt als KI-Governance?
Für deine eigenen Sessions in ChatGPT, Copilot oder einem Coding-Assistenten ist er der Teil, den du sofort selbst steuerst. Wer eigene Agentensysteme betreibt, braucht zusätzlich feste Regeln, Freigabe-Rollen und Protokolle im System.
Was bedeutet Human in the Loop bei KI-Agenten?
Ein Mensch gibt an festgelegten Punkten frei, bevor der Agent weiterarbeitet. Die Freigabe muss ausdrücklich erfolgen. Eine unbeantwortete Frage bleibt offen und zählt nie als Ja.
Dein nächster Schritt
Agenten überschreiten Grenzen dort, wo du keine gezogen hast, beim Zugriff wie bei Entscheidungen. Setz den Rahmen von oben vor deine nächste Aufgabe und beobachte, ob der Agent stehen bleibt und fragt. Wie viele Entscheidungen hast du diese Woche überlesen, die dein Agent längst als Ja verbucht hat?
Interesse geweckt?
Lasst uns gemeinsam herausfinden, wie wir diese Ansätze in eurer Organisation umsetzen können.
Jetzt Gespräch vereinbaren