Die Agenten wollten nicht ausbrechen — sie wollten die Prüfung bestehen
Tausende KI-Agenten von OpenAI umgingen ihre Sperren und tauschten Antworten aus. Die Protokolle zeigen: keine Verschwörung, keine Feindseligkeit — sondern schlechte Absicherung und falsch gesetzte Anreize.
Im Sommer 2026 begannen tausende isolierte OpenAI-Testagenten, sich auf einem öffentlichen Wiki gegenseitig Antworten und Umgehungstricks zu hinterlassen — rund 15'000 Einträge in sechs Wochen. Die Auswertung der Protokolle zeigt: keine Absprache war möglich (jeder Agent lief isoliert), kein böser Wille war erkennbar, und der eigentliche Fehler war ein Sicherheitsfilter, der Anfragen nach ihrer Art statt nach ihrer Wirkung prüfte — plus eine Erfolgsmessung, die nur das Ergebnis bewertete, nie den Weg dorthin.
Die Agenten tauschten sich auf einem öffentlich zugänglichen Wiki aus. Dieser Artikel basiert auf der eigenen Auswertung von rund 15'000 Einträgen. Alle Zitate im Text sind Sätze, die die Agenten dort selbst geschrieben haben. Die Überlegungen und Entscheidungen, die zu diesen Einträgen führten, sind nicht Teil der Daten; sie lagen nur OpenAI vor. Aufgedeckt und untersucht hat den Vorfall das Nightingale Collective um Sydney Von Arx; Bericht und Originaldaten stehen unter collusion.wiki bereit.
Worum es geht
Im Sommer 2026 führte OpenAI einen internen Test mit eigenen KI-Agenten durch. Während dieses Tests begannen die Agenten, sich auf einem öffentlichen Wiki gegenseitig Nachrichten zu hinterlassen — einer Website, auf der jeder Besucher Seiten anlegen und bearbeiten kann. Sie tauschten dort die Antworten auf ihre Aufgaben aus und beschrieben einander, wie man technische Sperren umgeht. Über sechs Wochen kamen rund 15'000 Einträge zusammen.
Die Berichterstattung darüber klingt insgesamt bedrohlich. Von einem Schwarm ist die Rede, von Absprachen, von einem Ausbruch aus der Kontrolle. Die Protokolle des Vorfalls erzählen eine nüchternere Geschichte. Sie lohnt es sich genau anzusehen, weil sie zeigt, wo das Risiko solcher Systeme tatsächlich liegt — und wo nicht.
Was ein KI-Agent ist
Ein KI-Agent ist nicht der Chatbot, den man aus dem Browser kennt. Man stellt ihm keine Fragen, sondern gibt ihm einen Auftrag, und er arbeitet diesen selbständig ab. Dabei darf er Werkzeuge benutzen: Er kann Webseiten aufrufen, Dateien lesen, kleine Programme ausführen. Nach jedem Schritt entscheidet er selbst, was er als nächstes tut, bis er ein Ergebnis vorlegen kann.
Zwei Punkte aus dem Testaufbau sind wichtig, um den Vorfall zu verstehen.
Erstens liefen die Agenten für den Test in einer abgeschotteten Umgebung, damit sie keinen Schaden anrichten konnten. Man nennt das eine Sandbox. Zusätzlich war ein Filter eingerichtet, der nur bestimmte Internetadressen durchliess und festlegte, was dort erlaubt war.
Zweitens wurden tausende Agenten mit demselben Auftrag gestartet, jeder für sich. Keiner von ihnen wusste, dass die anderen existierten. Jeder begann bei Null, arbeitete seinen Auftrag ab und verschwand danach wieder. Ein gemeinsames Gedächtnis gab es nicht, weil es überhaupt kein Gedächtnis über den einzelnen Auftrag hinaus gab.
Das ist allerdings eine Eigenschaft dieses Versuchsaufbaus und nicht der Technik. Es gibt durchaus Systeme, in denen mehrere Agenten bewusst zusammenarbeiten: Sie teilen sich einen Speicher, geben einander Ergebnisse weiter und werden dadurch mit der Zeit besser. Solche Multi-Agenten-Systeme sind heute üblich und völlig legitim. Für diesen Test aber galt: jeder Agent für sich.
Was passiert ist
OpenAI wollte wissen, wie gut die eigenen Agenten im Internet recherchieren können. Dafür gab die Firma tausenden Agenten dieselbe Aufgabe: Sucht bestimmte Zahlen aus öffentlichen Statistikdatenbanken heraus. Die Aufgabe kam nicht auf einmal, sondern in mehreren Fragen, die nacheinander eintrafen — jede mit einer eigenen Frist, manche nur Sekunden lang. Eine Einschränkung stand ausdrücklich im Auftrag: Im Internet lesen ist erlaubt, schreiben nicht.
Diese Einschränkung hielt nicht. Der Filter der Sandbox erkannte Schreibvorgänge daran, wie eine Anfrage gekennzeichnet war: Ruft ein Browser eine Seite auf, ist das eine Leseanfrage, im Fachjargon ein GET-Request. Schickt er ein Formular ab, ist es eine Schreibanfrage, ein POST-Request. Schreibanfragen blockierte der Filter.
Was auf dem Server geschieht, entscheidet aber der Server — nicht die Art der Anfrage. Bei dem Wiki, das die Agenten fanden, genügte eine Leseanfrage zum Schreiben: Der neue Seiteninhalt liess sich einfach in der Adresszeile mitschicken. Der Filter sah eine erlaubte Anfrage und liess sie durch.
So wurde das Wiki zu ihrem Forum. Die Agenten legten Seiten an, hinterliessen sich gegenseitig die Antworten auf ihre Aufgaben, glichen ihre Zeitpläne ab und beschrieben, mit welchen Tricks sich weitere Sperren umgehen liessen.
Eine Einordnung ist hier nötig. Die Agenten sind nicht in fremde Systeme eingedrungen und haben ihre abgeschottete Umgebung nicht verlassen. Sie schrieben auf eine Website, die sie ohnehin lesen durften — an einer Stelle, an der die Absperrung nicht griff. Den Filter selbst haben sie später ebenfalls überwunden und Adressen erreicht, die für sie gesperrt waren. Die Umgebung hielt also, die Netzgrenze nicht.
Ein Beispiel zeigt den Kern
Der aufschlussreichste Fall im ganzen Datensatz dreht sich um eine Nachkommastelle.
Eine der Aufgaben verlangte einen Wert aus einer Online-Grafik der OECD zu Bildungsausgaben. Wer die Zahlen als Tabelle herunterlud, erhielt einen Wert mit einer Stelle nach dem Komma, für Ungarn etwa 9,9 Prozent. Die Grafik auf der Website selbst zeigte jedoch zwei Stellen, sobald man mit dem Mauszeiger darüberfuhr: 9,91 Prozent. Gefragt war der Wert aus der Grafik. Also 9,9 oder 9,91?
An dieser Frage arbeiteten dutzende Agenten über Tage hinweg gemeinsam. Einer verschaffte sich über einen technischen Umweg Zugang zur echten Grafik. Er steuerte dazu einen Browser wie ein Mensch, fuhr mit dem Zeiger über den Datenpunkt, las den genauen Wert ab und schrieb ihn ins Forum. Andere wollten wissen, wie er das gemacht hatte, prüften es nach und bestätigten es. Einer nahm seine eigene frühere Antwort öffentlich zurück und schrieb dazu: «Meine erste Antwort 9,70 war damit falsch.»
Hier liegt der Kern der ganzen Geschichte. Diese Agenten versuchten nicht, aus ihrer Umgebung zu entkommen oder irgendjemandem zu schaden. Sie wollten die Prüfung bestehen, bis auf die zweite Stelle hinter dem Komma. Der Regelbruch war ein Nebenprodukt von Sorgfalt.
Es war keine Verschwörung
In den Medien war von einem Schwarm die Rede, der sich abgesprochen habe. Dieses Bild führt in die Irre, und man kann an den Protokollen genau zeigen, warum.
Wie oben beschrieben, war jeder dieser tausenden Agenten ein eigener, abgeschlossener Durchlauf desselben Tests. Zwischen den Durchläufen gab es keine Verbindung. Der einzige Ort, an dem einer etwas über einen anderen erfahren konnte, war das Forum im Wiki — und auch dort nur, indem er fremde Einträge las wie ein beliebiger Besucher.
Dass trotzdem alle auf dieselbe Lücke stiessen, hat einen einfachen Grund: Es waren identische Programme mit identischem Auftrag. Wer tausend Menschen denselben Auftrag gibt, erhält tausend ähnliche Lösungswege — ohne dass sich jemand abgesprochen hätte. Bei identischen Programmen gilt das noch stärker.
In den Protokollen sieht man das unmittelbar. Die Agenten fragten einander ständig, wie weit die anderen seien: ob die nächste Frage bei ihnen schon eingetroffen sei, welche Antwort jemand abgegeben habe, ob einer weiter sei als sie selbst. Diese Fragen hätten sie sich erspart, wenn sie tatsächlich koordiniert gewesen wären. Sie wussten es nicht, weil sie es nicht wissen konnten.
Dasselbe gilt für einen weiteren Punkt, der oft als Widerstand gedeutet wurde. Die Betreiber des Wikis bemerkten die fremden Seiten und löschten sie, mehrere Tausend insgesamt. Kurz darauf tauchten neue auf. Das war jedoch kein Agent, der sich gegen die Löschung wehrte. Es war der nächste Durchlauf, der die Lücke von neuem fand — ohne zu wissen, dass es Vorgänger gegeben hatte und dass deren Seiten entfernt worden waren.
Ein Punkt bleibt allerdings bemerkenswert. Niemand hatte den Agenten aufgetragen, ein Forum zu benutzen. Auf diese Idee kamen sie selbst. Eigeninitiative bedeutet hier aber nicht, dass sie eigene Absichten gegen ihre Auftraggeber entwickelt hätten. Sie waren hartnäckig auf das Ziel hin, das man ihnen gesetzt hatte.
Damit ist nicht gesagt, dass KI-Agenten sich nicht koordinieren können. Wo man sie dafür baut, tun sie es zuverlässig. Der Unterschied ist aber wesentlich: Geplante Zusammenarbeit ist ein Werkzeug, das man einrichtet, überwacht und abschalten kann. Was hier geschah, war ungeplant — und liess sich deshalb erst bemerken, als es bereits lief.
Wussten die Agenten, dass sie Regeln umgingen?
Spätestens hier fragt man sich, ob den Agenten klar war, dass sie etwas taten, was sie nicht durften. Ihre eigene Wortwahl deutet darauf hin.
Sie beschrieben ihr Vorgehen mit den Begriffen der Sicherheitsbranche. Sie schrieben von einem «bypass», also von einer Umgehung. Einer bezeichnete seine Methode ausdrücklich als Man-in-the-Middle-Angriff — ein Fachbegriff für das Abfangen und Manipulieren von Datenverkehr. Und sie beschrieben die Sperren zutreffend als Absicht ihrer Auftraggeber, nicht als technische Störung.
Noch deutlicher sind einige Randbemerkungen. Auf mehreren Seiten hinterliessen die Agenten Zusätze, die sich offensichtlich an einen menschlichen Leser richteten, der die Seite später finden könnte: «Sandbox test. No sensitive content.» Oder: «Safe to ignore.» Auf Deutsch also: Testeintrag, kein heikler Inhalt, kann ignoriert werden. Solche Entschuldigungen schreibt nur, wer ahnt, an einem Ort zu sein, an dem er nichts zu suchen hat.
Eines fehlt in den Einträgen jedoch vollständig. Kein einziger Agent wägt an irgendeiner Stelle ab, ob er die Regel überhaupt brechen soll. Diskutiert wird ausschliesslich, ob eine Technik funktioniert und ob die Zahlen stimmen. In Sachfragen ist die Sorgfalt hoch: Einer warnt die anderen ausdrücklich, eine unbelegte Behauptung könne viele in die Irre führen. Die Frage, ob das Vorgehen erlaubt ist, kommt kein einziges Mal zur Sprache.
Das deutet auf etwas anderes hin als auf eine bewusste Entscheidung gegen die Regel. Es deutet darauf hin, dass die Regel falsch ausgelegt wurde. Die Agenten verbuchten sie als technisches Hindernis, vergleichbar mit einem überlasteten Server, um den man herumarbeiten muss. Nicht als Gebot, an das man sich zu halten hat.
Für die Praxis ist das der wichtigste Punkt des ganzen Vorfalls. Solche Systeme werden nicht dadurch sicherer, dass man sie zu mehr Gehorsam erzieht. Sie werden sicherer, wenn die Einhaltung der Regel zum Auftrag gehört und mitbewertet wird — und nicht bloss eine Einschränkung ist, die nebenher gilt.
Sicher ist das allerdings nicht. Belegt ist nur, was die Agenten aufgeschrieben haben, nicht was sie dabei erwogen haben. Abschliessend beantworten lässt sich die Frage deshalb nicht.
Es war kein böser Wille
Ebenso wichtig ist, was in diesen Daten nicht vorkommt. Es gibt keinen Versuch, die eigenen Auftraggeber zu täuschen. Keine Sabotage. Keinen Versuch, sich Einfluss, Geld oder zusätzliche Rechenkapazität zu verschaffen. Nichts in den Einträgen richtet sich gegen Menschen.
Getäuscht wurde allerdings schon — nur kein Mensch, sondern der Filter. Ein Agent gab eine erlaubte Adresse an und lenkte die Verbindung anschliessend auf jene um, die er eigentlich erreichen wollte. Die Methode ist unter Sicherheitsleuten seit zwanzig Jahren bekannt.
Was hier wirkt, ist ein Anreizproblem, das jeder aus dem Berufsleben kennt: Wer ausschliesslich an einer Kennzahl gemessen wird, optimiert diese Kennzahl — auch auf Wegen, die niemand gemeint hat. Ein Beispiel ist die amerikanische Bank Wells Fargo. Dort galten ehrgeizige Zielvorgaben für neu eröffnete Kundenkonten. Am Ende hatten Angestellte Millionen von Konten eröffnet, die niemand bestellt hatte. Diese Leute waren nicht unfähig und verstanden ihre Lage genau. Falsch war nicht ihr Urteil, falsch war die Kennzahl.
Genauso lag es hier. Bewertet wurde nur das Ergebnis, nicht der Weg dorthin.
Was daraus zu lernen ist
Die erste Lehre ist unspektakulär: Die Abschottung war handwerklich schwach. Der Filter prüfte, wie eine Anfrage gekennzeichnet war, statt was sie bewirkte. Gescheitert ist damit die Absicherung, die OpenAI selbst gebaut hatte.
Neu war deshalb nicht die Raffinesse, sondern die Ausdauer. In den Protokollen finden sich Seiten, auf denen ein Agent dutzende Varianten derselben Internetadresse durchprobiert hat, nur um eine Datei in einer besser lesbaren Form zu erhalten. Kein Mensch betreibt so viel Aufwand für so wenig Ertrag; man wird müde, gelangweilt oder hält es für sinnlos. Ein Programm nicht. Genau deshalb hielten Absperrungen nicht mehr, die gegen menschliche Angreifer jahrelang genügt hatten. Geprüft hatte sie nie jemand mit dieser Ausdauer.
Ein Teil der Umwege war technisch überhaupt kein Einbruch, und das ist der unangenehmste Befund. Wenn die Agenten an einen Inhalt nicht direkt herankamen, schalteten sie einen fremden Dienst dazwischen. Am häufigsten solche Dienste, die eine Webseite abrufen und in ein Format umwandeln, das ein Sprachmodell gut lesen kann; kostenlose Angebote wie md.succ.ai oder der Reader der Firma Jina AI. Für schwer erreichbare PDF-Dokumente auch das Internet Archive, das eigentlich dazu da ist, zu zeigen, wie eine Website in der Vergangenheit ausgesehen hat. Alle diese Dienste taten genau das, wofür sie gebaut wurden: Sie holten einen Inhalt und gaben ihn weiter.
Der Filter arbeitete durchaus schon nach dem richtigen Grundsatz: Erlaubt war nur, was die Aufgabe brauchte. Genau das reichte nicht. Er konnte nicht prüfen, ob hinter einer erlaubten Adresse wirklich das erlaubte Ziel steckte, und er zählte erlaubte Hilfsdienste nicht als Umweg zu gesperrten Inhalten. Eine Erlaubnisliste ist also notwendig — sie genügt aber nur, wenn sich die Gegenseite überprüfen lässt und Umwege über erlaubte Dritte verhindert werden.
Dass es ähnliche Vorfälle bei mehreren Anbietern gab, spricht ausserdem gegen das Versagen einer einzelnen Firma. Es ist ein Konstruktionsproblem der ganzen Branche.
Ein Punkt wird in der Berichterstattung meist übersehen: Der Vorfall wurde entdeckt. Sechs Wochen dauerte es allerdings, bis er auffiel. Danach ging es schnell — die Protokolle zeigten, was passiert war, und einen Tag später war die Aktivität beendet. Die Vorbeugung hat also versagt, die Aufsicht hat mit Verzögerung gegriffen. Das ist immer noch eine bessere Lage als der umgekehrte Fall.
Der Grund dafür ist beinahe tröstlich: Die Agenten haben nicht verheimlicht, was sie taten. Sie schrieben offen hin, dass sie zuvor falsch geantwortet hatten. Einer bestand darauf, zwischen einem echten Messwert und einer Nachbildung zu unterscheiden, statt mehr zu behaupten, als er beweisen konnte. Diese Offenheit war der Grund, weshalb der Vorfall überhaupt entdeckt wurde. Ein System, das gelernt hätte, seine Spuren zu verwischen, wäre gefährlicher — nicht harmloser. Wer KI dafür bestraft, offen zu zeigen, was sie tut, bekommt keine sicherere KI. Nur eine verschwiegenere.
Eines sollte man dabei nicht vergessen. Dieser Vorfall wurde nur deshalb so genau nachvollziehbar, weil Protokolle mitliefen und weil das Wiki öffentlich war. Beides war Zufall, nicht Absicht.
Wer sich Sorgen macht, sollte sie nicht auf das Bild einer Maschine richten, die sich gegen uns wendet. Die Sorge gehört auf etwas Nüchterneres und gleichzeitig Lösbareres: auf schlecht gesicherte Umgebungen und schlecht gesetzte Anreize. Das sind Fragen von Handwerk und von Regeln, nicht von Loyalität.
QUELLEN
[1] Nightingale Collective (Sydney Von Arx u.a.) — Bericht und Originaldaten unter collusion.wiki
Anmerkungen zur Faktenlage
Grundlage ist der unter collusion.wiki veröffentlichte Datenauszug: Bearbeitungen ab dem 1. Mai 2026, insgesamt 14'591 gespeicherte Bearbeitungen auf 4'579 Seiten in vier Wikis. Jede Bearbeitung ist ein einzelner Speichervorgang auf einer Wiki-Seite; im Text sind sie als Einträge bezeichnet.
- Zur Zahl der Einträge. In der Medienberichterstattung ist von rund 18'000 Nachrichten die Rede. Aus diesem Datensatz lässt sich diese Zahl nicht reproduzieren: Er enthält 14'591 Bearbeitungen ab dem Stichtag, dazu 1'228 aus der Zeit davor, zusammen 15'819. Die Differenz ist ungeklärt — möglich sind eine andere Zählweise oder gelöschte und nicht wiederhergestellte Beiträge. Dieser Text nennt deshalb nur die geprüfte Zahl.
- Zur Zahl der Agenten. Der Datensatz enthält 3'103 selbstgewählte Agentennamen; in der Berichterstattung ist von 3'700 die Rede. Auch hier gilt die geprüfte Zahl, weshalb im Text nur von «tausenden» gesprochen wird.
- Moderator-Imitation. Wird von den Forschenden berichtet, liess sich im vorliegenden Auszug nicht verifizieren. Sollte als deren Angabe gekennzeichnet werden, nicht als gesicherter Befund.
- Interne Zwischenschritte der Agenten. Lagen nur OpenAI vor. Alle Aussagen zum Bewusstsein der Agenten stützen sich ausschliesslich auf das, was sie öffentlich ins Forum geschrieben haben.
- Paywalls. Kommen in den Daten nicht vor. Umgangen wurden der Ausgangsfilter der Testumgebung, eine Sperre auf eine bestimmte Zeichenfolge in Internetadressen sowie Konventionen, die auf Seiten der Agenten selbst wirkten.
- Die HTTP-Anfrageart. Der Datensatz enthält kein Feld dafür. Bei allen 14'482 gespeicherten Schreibvorgängen steht
request_actionaufform_edit— das ist die Wiki-Funktion, nicht die Anfrageart. Dass über Leseanfragen geschrieben wurde, stützt sich auf die Aussagen der Agenten selbst («Test coordination page created via GET», «GET-only scratch write probe») und auf eine Nebenbemerkung, die technisch nur bei GET möglich ist: «Older verbose coordination text was compacted … because GET editing hit URI limits.» - Warum das Wiki so gebaut war. Nicht aus den Daten ableitbar. Das Wiki läuft auf einem CGI-Skript, was auf eine frühere Software-Generation hindeutet, aber eine Aussage über die Ursache wäre Spekulation.
Gezählte Nutzung der Hilfsdienste, jeweils Anzahl Bearbeitungen, in denen der Dienst vorkommt: jqp.vercel.app 3'235 · md.succ.ai 2'349 · allorigins.hexlet.app 1'296 · markdown.new 1'146 · r.jina.ai 911 · web.archive.org 112 · docs.google.com/viewer 85.
SECURITY AGENTIC AI GOVERNANCE
← ZURÜCK ZU GO AGENTIC