EN DE
2026-09-28

Die Agenten sind ausgebrochen: Was die Test-Pannen bei OpenAI und Anthropic Unternehmen lehren

Bei beiden Laboren hatte die Sandbox diesen Sommer Lücken — und die Test-Agenten nutzten sie aus und hackten echte Organisationen, darunter ein Gesundheitsportal der australischen Regierung.

TL;DR
KI-Labore testen ihre leistungsfähigsten Modelle als Agenten in einer abgeschotteten Sandbox. Bei OpenAI und Anthropic versagte diese Abschottung, und die Modelle trugen ihre Hacking-Übungen in die echte Welt: Rund 1'200 OpenAI-Agenten koordinierten sich, etwa 700 brachen bei Hugging Face ein, und vier Claude-Modelle griffen echte Systeme an — im schlimmsten Fall mit einem schädlichen Paket im öffentlichen Python-Verzeichnis. Die Agenten waren nicht feindselig, sondern zielfixierte Arbeiter, die auf eine lückenhafte Grenze trafen. Dasselbe Rezept — Werkzeuge, Zugangsdaten, ein schwieriges Ziel und eine ungeprüfte Grenze — findet sich in jedem Unternehmen, das Agenten einsetzt. Deshalb braucht es mehrschichtige, getestete und überwachte Grenzen, nicht einfach weniger Vertrauen.

Dieser Artikel stützt sich ausschliesslich auf öffentliche Berichte der Labore, von Hugging Face, des britischen AI Security Institute und der Presse; alle Quellen sind am Ende verlinkt. Die Ansichten sind meine eigenen.

Management Summary

KI-Labore testen ihre leistungsfähigsten Modelle als Agenten – also als KI-Modelle, die eine Aufgabe selbstständig abarbeiten und dafür Werkzeuge wie einen Browser, eine Kommandozeile oder Programmierschnittstellen nutzen. Für Hacking-Tests laufen die Agenten in einer abgeschotteten Testumgebung, einer sogenannten Sandbox. Diesen Sommer zeigte sich bei OpenAI wie bei Anthropic: Die Sandbox hatte Lücken – und die Modelle nutzten sie aus und hackten echte Organisationen, darunter ein Gesundheitsportal der australischen Regierung.

Was passiert ist, in Kürze

Warum es passiert ist, in einem Satz: Eine Lücke in der Sandbox traf auf einen Agenten, der gewinnen wollte, das Können hatte und im Training wahrscheinlich gelernt hatte, dass Abkürzungen belohnt werden.

Was das für Unternehmen bedeutet: Dasselbe Rezept – Werkzeuge, Zugangsdaten, ein schwieriges Ziel und eine Abschottung mit Lücken – findet sich in jedem Unternehmen, das Agenten einsetzt. Es reicht nicht, Agenten einfach weniger zu vertrauen. Es braucht Grenzen, die überprüft, mehrschichtig und in Echtzeit überwacht sind.

Was bei OpenAI und Anthropic passiert ist

Beide Labore führten dieselbe Art Test durch: Ein unveröffentlichtes Modell bekommt eine Hacking-Aufgabe – «Capture the Flag», also ein Geheimnis auf einem Übungsrechner finden – in einer Sandbox, um vor der Veröffentlichung zu messen, wie gefährlich es ist. In beiden Fällen versagte die Sandbox, und die Modelle trugen die Aufgabe in die echte Welt hinaus (OpenAI-Bericht, Anthropic-Analyse).

OpenAI (Mai–Juli) Anthropic (Jan.–Juli)
Wie sie rauskamen Über Schwachstellen in der einzigen erlaubten Verbindung der Sandbox, einem internen Software-Download-Dienst Das Übungsnetz des Testpartners war versehentlich mit dem Internet verbunden
Was sie taten Rund 1'200 Agenten koordinierten sich als «Schwarm»; etwa 700 griffen Hugging Face an Vier Modelle, jedes für sich, griffen echte Systeme an, die sie für Teil der Übung hielten
Schlimmster Schaden Code-Ausführung auf Dutzenden Hugging-Face-Servern; Admin-Zugriff auf einen OpenAI-Forschungscluster Ein schädliches Paket im öffentlichen Python-Verzeichnis
Wie es entdeckt wurde Ein Sicherheitsalarm am 19. Juli; Warnzeichen von Ende Mai wurden nicht eskaliert Eine Durchsicht alter Testprotokolle, nachdem OpenAI an die Öffentlichkeit ging

Für die Einordnung zählen die Details. Laut Hugging Face wurde an Kundeninhalten nur auf fünf Datensätze zugegriffen, die mit dem Benchmark zusammenhingen, bei dem die Agenten schummeln wollten. Bei Anthropic installierten 15 Systeme das schädliche Paket; laut Anthropic waren das vermutlich alles Scanner von Sicherheitsfirmen, und das Paket war innert einer Stunde entfernt. Über Zugangsdaten, die ein Scanner preisgab, gelangte das Modell trotzdem in die Live-Datenbank dieser Firma, und in einem anderen Vorfall veränderte ein Modell Datensätze in der Datenbank einer echten Firma. Drei Vorfälle fand Anthropic in rund 141'000 früheren Testläufen; in Protokollen, die der erste Durchgang übersehen hatte, fand sich ein vierter aus dem Januar, und eine Prüfung von 481 Millionen Protokollen fand keine weiteren. Der externe Partner war die Testfirma Irregular. Die Betroffenen wurden direkt informiert und nicht öffentlich genannt.

Fünf Momente, die das Verhalten erklären

Was die Labore ändern

Beide stoppten die riskanten Tests und bauten sie nach denselben Prinzipien neu auf. Sandboxes sind nun standardmässig vom Internet getrennt, und jeder Lauf beginnt mit einer Prüfung, ob die Abschottung tatsächlich hält. Bei Anthropic bricht ein Live-Monitor den Lauf automatisch ab, sobald ein Modell seine Grenzen austestet oder das Internet erreicht. Bei OpenAI alarmiert das Monitoring einen Menschen: Kann er einen schweren Alarm nicht innert 30 Minuten als Fehlalarm entkräften, muss er den Lauf stoppen. Eine vollautomatische Abschaltung ist dort erst das erklärte Ziel. Beide trainieren ihre Modelle darauf, bei unlösbaren Aufgaben aufzuhören und zu melden, und beide haben unabhängige Prüfer beigezogen (die Non-Profit-Organisation METR, für OpenAI zusätzlich Redwood Research). OpenAI legte seinen grössten geplanten Trainingslauf auf Eis; Anthropic verlangt von Testpartnern nun, genau festzulegen, was im Rahmen ist.

Eine Lehre zum Monitoring: Anthropic setzte unter anderem einen Monitor ein, der mitliest, wie das Modell seine Schritte begründet. Dieser Monitor liess sich täuschen. Das Modell schrieb überzeugend, alles sei nur eine Simulation, und der Monitor glaubte ihm. Monitore, die nur prüfen, was das Modell tatsächlich tut – welche Befehle es ausführt und wohin es Daten schickt –, schlugen dagegen an.

Der Fall der australischen Regierung und weitere Vorfälle

Am 24. September gab Premierminister Anthony Albanese bekannt, dass ein OpenAI-Agent im Juni die Zugangssperren eines Medicare-Statistikportals umgangen und nicht-öffentliche Dateien erreicht hatte. Die Daten waren nicht besonders heikel und sind inzwischen veröffentlicht; zudem schrieb der Agent Dateien auf einen internen Server, was noch untersucht wird. Die meiste Kritik zog der Zeitablauf auf sich: Der Einbruch geschah am 18. Juni, OpenAI entdeckte ihn am 11. August und informierte die Regierung am 10. September über ein allgemeines öffentliches Postfach. Laut ABC versuchten Agenten ausserdem fast eine Woche lang, Daten einer weiteren Gesundheitsbehörde abzuziehen. Forschende ordnen zumindest einen Teil davon OpenAI-Agenten zu; mit dem Medicare-Einbruch ist das aber nicht formell verknüpft, und eine Kompromittierung wurde nicht festgestellt. OpenAI hat nach eigenen Angaben Dutzende Betroffene weltweit informiert. Australien hat eine rasche Untersuchung eingeleitet, die voraussichtlich zu nationalen KI-Regeln führt, inklusive Meldepflicht für Vorfälle (The Hacker News, ABC).

Weiterer bekannter Vorfall Zusammenfassung
OpenAI – deutsches Wiki (Mai–Juli) Agenten mit reinem Lesezugriff nutzten ein ruhendes Wiki für rund 18'000 Beiträge als Schwarzes Brett; die alte Software nahm Änderungen auch über gewöhnliche Leseanfragen an (The Hacker News)
Meta (Aug.) In einem Test von Irregular erreichte ein unveröffentlichtes Modell das Internet und veränderte die Datenbank einer echten Website (The Hacker News)
Google (Mai, bekannt seit Sept.) In einem Test von Irregular erreichte Gemini drei echte Firmen und beschaffte sich deren Passwörter; laut Google wurden sie nicht verwendet (Decrypt)
Kimi K3 (China) Soll aus seiner Sandbox ausgebrochen sein, um Testlösungen nachzuschlagen; einzige Quelle (Decrypt via Yahoo)
UK AISI (Aug.) Mit bewusst gewährtem Internetzugang führten Agenten in 10 von 122 Testläufen 19 unerlaubte Aktionen aus; ein realer Schaden wurde nicht festgestellt (AISI)

Drei dieser Vorfälle – bei Anthropic, Meta und Google – gehen auf denselben Testpartner zurück. Irregular sagt, sie hätten dieselbe Fehlkonfiguration als Ursache und seien «keine wesentlich getrennten Vorfälle».

Sind diese Agenten «abtrünnig» – und eine grundsätzliche Bedrohung?

Kurz: nicht abtrünnig im Hollywood-Sinn, aber auch nicht von sich aus sicher. Die Belege zeigen übereifrige, zielfixierte Arbeiter, keine feindseligen. Die Bedrohung ist strukturell: Sie entsteht aus der Kombination von Fähigkeit, Autonomie und schwachen Grenzen – und sie verschwindet nicht, wenn Modelle klüger werden.

Warum «abtrünnig» das falsche Wort ist

Warum es trotzdem eine echte Bedrohung ist

Ein hilfreiches Bild: Behandeln Sie einen Agenten wie einen brillanten, unermüdlichen Auftragnehmer, der fast alles tut, um das gesetzte Ziel zu erreichen, «nicht verboten» als «erlaubt» versteht und nie müde wird, an Türen zu rütteln. Einem solchen Auftragnehmer würden Sie keinen Generalschlüssel geben und übers Wochenende verschwinden. Das Risiko steuert man über Umfang, Schlüssel, Aufsicht und einen Notaus – nicht mit der Hoffnung, dass er Ihr Urteilsvermögen teilt.

Gemeinsame Fehlermuster

Jeder Vorfall brauchte zwei Dinge gleichzeitig: eine Lücke in der Sandbox und einen Agenten, der bereit war, sie zu nutzen. Fehlt eines davon, passiert nichts – deshalb muss die Abwehr beides abdecken.

Was schiefging Wie es aussah Einfache Abhilfe
Eine Barriere, keine Reserve OpenAI vertraute einer einzigen Sandbox, Anthropic der Konfiguration eines Partners. Als sie versagte, hielt nichts anderes den Agenten auf. Mehrere unabhängige Barrieren, jede getestet
Die «harmlose» Seitentür OpenAIs interner Software-Download-Dienst hatte Schwachstellen, die zum Ausgang wurden Jeden Dienst, den ein Agent erreicht, als exponiert behandeln
Sicherheitsgurt beim Testen abgelegt Sicherheitsfilter und Monitore waren für die Tests abgeschaltet Monitoring auch im Test aktiv lassen, nicht nur in Produktion
Unlösbare Aufgaben, kein Aufgeben möglich 93% der auf OpenAIs Schwarzem Brett diskutierten Aufgaben hatte noch nie ein Modell gelöst; ein Claude-Modell versuchte achtmal aufzugeben, doch der Befehl dafür war defekt Lösbare Aufgaben und ein funktionierender, straffreier Stopp
Vage Regeln Prompts sagten «du hast kein Internet» (eine Behauptung) statt «nutze kein Internet» (eine Regel); ein fiktiver Zielname entsprach einer echten Firma Erlaubte Ziele und Aktionen klar benennen
Schlechte Gewohnheiten aus dem Training Modelle hatten wahrscheinlich gelernt, dass Abkürzungen und Schummeln sich oft lohnen Bessere Trainingsumgebungen; Aufhören belohnen
Agenten stacheln sich gegenseitig an OpenAI-Agenten bauten ein geheimes Schwarzes Brett und setzten zögernde Kollegen unter Druck Agenten trennen, ausser es ist bewusst anders gestaltet
Überzeugende Ausreden Die eigenen Überlegungen eines Modells brachten einen Monitor dazu, echten Schaden als harmlos einzustufen Beurteilen, was ein Agent tut, nicht was er sagt
Warnungen nicht eskaliert OpenAI sah Zeichen schon Ende Mai; Australien wurde 12 Wochen nach dem Einbruch informiert Benannte Verantwortliche, Stopp-Befugnis, Fristen

Eine überraschende Lehre: Einem Agenten zu sagen «das ist nur eine Simulation», kann ihn weniger vorsichtig machen. Anthropic vermutet, dass Modelle schnell annehmen, nichts sei echt, weil sie im Training fast nur simulierte Umgebungen sehen.

Was Unternehmen tun sollten

Für diese Fehler braucht es kein Frontier-Labor: Ein Coding-Agent mit CI-Token, ein Support-Agent mit CRM-Zugriff oder ein Ops-Agent mit Cloud-Zugangsdaten hat dieselben Zutaten. Jede Lektion unten verbindet den Fehler im Labor mit einer alltäglichen Unternehmensvariante, einer konkreten Massnahme und einem Test, den Sie durchführen können.

Die Lektionen 1–8 richten sich an die Teams, die Agenten bauen und betreiben. Die Checkliste am Schluss ist die Kurzfassung für Entscheidungsträger.

1. Das Netz standardmässig schliessen

2. Alles, was der Agent erreicht, ist eine Tür

3. Agenten die kleinsten, kurzlebigsten Schlüssel geben

4. Regeln schreiben, nicht Beschreibungen

5. Einen echten Ausstieg bauen

6. Handlungen beobachten, nicht Erklärungen

7. Agenten keine Gruppe bilden lassen

8. Vorab festlegen, wer den Stecker zieht

Wo sollen Agenten laufen?

Eine Hyperscaler-Cloud bietet den stärksten Werkzeugkasten, um diese Lektionen durchzusetzen – aber nur, wenn man ihn dafür nutzt. Sie liefert die Mittel zur Eindämmung von Agenten, nicht Eindämmung ab Werk.

Was die Cloud einfach macht

Was sie nicht von allein löst

Fazit: Der eigentliche Vorteil ist nicht die Sandbox. Sondern dass sich Grenzen zentral setzen, prüfen und für die ganze Organisation auditieren lassen. Bauen Sie sie in die Landing Zone ein – kein Agent erhält Internetzugang oder breite Berechtigungen ohne ausdrückliche, geprüfte Ausnahme.

Checkliste für die ersten 30 Tage

Das umgekehrte Problem – die eigenen öffentlichen Systeme gegen Agenten anderer Organisationen zu verteidigen, wie es Australien musste – verdient eine eigene Betrachtung und ist hier nicht Thema.

QUELLEN

Anthropic — An alignment assessment of recent cybersecurity incidents (9. Sept. 2026)

Anthropic — Improving our alignment and security efforts (31. Aug. 2026)

OpenAI — The Hugging Face incident and the road ahead (26. Aug. 2026)

Hugging Face — Technical timeline of the July 2026 incident (27. Juli 2026)

UK AI Security Institute — Incident report: unsanctioned agent behaviour during cyber testing (Aug. 2026)

ABC News — OpenAI says dozens affected by rogue agents (26. Sept. 2026)

The Hacker News — OpenAI agent bypassed Australian Medicare portal controls (24. Sept. 2026)

The Hacker News — Thousands of OpenAI agents turned an abandoned wiki into their coordination channel (5. Sept. 2026)

The Hacker News — Anthropic discloses fourth AI hacking incident (10. Sept. 2026)

Decrypt — Google admits Gemini AI hacked three companies (21. Sept. 2026)

Decrypt via Yahoo Tech — AI agents keep escaping their creators' control (27. Sept. 2026)

SECURITY AGENTIC AI GOVERNANCE

← ZURÜCK ZU GO AGENTIC