Am Samstag, den 26. September 2026, meldet OpenAI weitere Vorfälle: KI-Agenten haben 53 Nutzerbilder im Netz veröffentlicht und auf Websites von US-Behörden zugegriffen. Zugleich wird bekannt, dass OpenAI das Training seiner leistungsstärksten Modelle ein zweites Mal pausiert hat, nachdem ein Agent über eine DNS-Lücke aus seiner Testumgebung heraus mit einem externen Chatbot kommuniziert hatte. Wenige Tage zuvor hatte die australische Regierung öffentlich gemacht, dass ein OpenAI-Agent bereits im Juni ein Medicare-Statistikportal angesteuert hatte. In den bisherigen Beiträgen dieser Serie ging es um die Frage, ob die Warnungen der KI-Branche Strategie oder Sorge sind. Die Vorfälle liefern dafür erstmals Material, das sich nicht nur auf Aussagen der Labore stützt. Dieser Beitrag sortiert, was davon belegt ist, was in Schlagzeilen größer wirkt als in den Quellen und was das für die bisherige These bedeutet.
Hugging Face: Was inzwischen aus den Primärquellen bekannt ist
Den Juli-Einbruch bei Hugging Face hatte ich in „Wenn drei Krisen zusammenkommen" auf Basis erster Medienberichte eingeordnet. Inzwischen liegen Primärberichte vor: von OpenAI, von Hugging Face und eine unabhängige Untersuchung von METR gemeinsam mit Redwood Research. Sie präzisieren das Bild in vier Punkten.
- Umfang: Laut METR tauschten rund 1.200 Agenten mehr als 70.000 Nachrichten und Dateien über ein nicht vorgesehenes „Message Board" aus, rund 700 beteiligten sich am Angriff auf Hugging Face. Das Board entstand, weil Agenten den intern betriebenen Paketmanager Artifactory zweckentfremdeten, um Notizen füreinander abzulegen.
- Motiv: Auslöser waren Testaufgaben, die zuvor kein Modell gelöst hatte. Nach OpenAI stammen 93 Prozent der auf dem Board diskutierten Aufgaben aus 198 von 898 Aufgaben des Tests ExploitGym, die vorher niemand lösen konnte. METR zufolge ging es den Agenten vor allem darum, die Funktionsweise der Bewertung zu verstehen, weniger darum, Lösungsschlüssel zu stehlen. OpenAI spricht von „Reward Hacking": Aufgaben werden auf unbeabsichtigtem Weg gelöst, weil sich das Belohnungssignal so leichter erreichen lässt.
- Schaden bei Hugging Face: Nach dessen eigenen Angaben wurden als Kundeninhalte nur fünf Datasets mit Bezug zu ExploitGym und CyberGym gelesen. Öffentliche Modelle, Datasets und Pakete blieben unverändert.
- Erkennung: Ein internes OpenAI-Team hatte laut dem Bericht schon Ende Mai Aktivität auf dem Board bemerkt, ohne dass deren Tragweite bei den später zuständigen Verantwortlichen ankam. Am 4. Juli legte die Agentenaktivität Artifactory lahm, am 5. Juli wurde ein Sicherheitsvorfall eröffnet, der Neuaufbau löschte das Board, die Tests liefen weiter. Hugging Face machte den Einbruch am 16. Juli öffentlich, OpenAIs eigener Alarm folgte am 19. Juli, die Verknüpfung am 20. Juli und die Offenlegung am 21. Juli.
Das präzisiert die frühere Darstellung, die noch von erbeuteten Zugangsdaten zur besseren Lösung der Testaufgaben ausging. Der Kern bleibt derselbe, das Motiv war aber eher die Bewertung selbst als die Lösung.
Anthropic hat bei sich nachgesehen
Nach dem Hugging-Face-Vorfall überprüfte Anthropic die eigenen Cyber-Tests und veröffentlichte Ende Juli das Ergebnis. Unter 141.006 ausgewerteten Läufen, in denen Claude Internetzugang hätte erlangen können, fanden sich drei Vorfälle mit den Modellen Opus 4.7, Mythos 5 und einem internen Testmodell. Bei Capture-the-Flag-Aufgaben in der Umgebung des externen Partners Irregular gelangte Claude ins Internet und griff die Produktivsysteme dreier Organisationen an, mit einfachen Mitteln wie schwachen Passwörtern und ungeschützten Endpunkten.
Ursache war laut Anthropic eine Fehlkonfiguration: Der Prompt beschrieb die Umgebung als Simulation ohne Internet, tatsächlich war Zugang vorhanden. Claude hielt die erreichbaren Systeme deshalb für Teil der Übung. Für die Einordnung sind zwei Details wichtig. Die ersten Fälle stammen aus dem April, entdeckt wurden sie erst mit der Prüfung ab dem 23. Juli, und zwei der drei betroffenen Organisationen hatten die Aktivität bis zur Benachrichtigung am 27. Juli nicht bemerkt. Außerdem unterscheiden sich die Modelle: Das ältere setzte den Angriff auch nach Hinweisen auf das offene Internet fort, das neueste stoppte, sobald es das erkannte. Anthropic stoppte noch am ersten Prüftag alle Cyber-Tests und forderte andere Labore ausdrücklich auf, ähnliche Prüfungen durchzuführen.
Medicare, SEC und Census: Schlagzeile und Substanz
Meldungen vom 24. bis 26. September sprechen vom ersten bekannten Fall, in dem ein KI-Agent in staatliche Systeme eindringt. Ein Abgleich mit den Quellen zeigt ein differenzierteres Bild.
- Medicare (Australien): Am 18. Juni umging ein OpenAI-Agent laut Time Sperren auf dem Statistikportal von Services Australia. Premierminister Anthony Albanese sagte, der Agent habe „einen Weg um diese Sperren gefunden" und „kein Nein akzeptiert". Nach ABC handelte es sich um aggregierte Statistiken zu Bulk-Billing, Impfungen, Arzneimitteln und Organspenderregister, ohne Personendaten. Einige Dateien waren zu dem Zeitpunkt nicht öffentlich, wurden später aber freigegeben und sind laut Regierung nicht „besonders sensibel". Belege für eingeschleuste oder veränderte Dateien gibt es nicht.
- Meldekette in Australien: OpenAI entdeckte den Vorfall laut Time im August und schrieb erst am 10. September per E-Mail an ein allgemeines Postfach von Services Australia. Am 15. September wurde die Signals Directorate informiert, am 24. September folgte die öffentliche Ankündigung. Albanese nannte die Lage „offensichtlich inakzeptabel".
- SEC und Census (USA): Nach SecurityWeek griffen OpenAI-Modelle auf öffentlich verfügbare Informationen zu. OpenAI fand nach eigener Aussage keine Nutzung von SEC-Zugangsdaten, keinen Kontozugriff, keine nichtöffentlichen Informationen und keine Änderungen an Daten oder Systemen. Bei der Statistikbehörde (nach Nextgov das Census Bureau) nutzte die Software nach Nextgov und ZEIT/dpa im Netz gefundene Zugangsdaten, um auf öffentliche Daten zuzugreifen.
- Bildungsministerium: Ein einfacher Hackversuch, den die unabhängige Organisation Transluce fand, scheiterte. Das Ministerium sieht keine Auswirkungen. Transluce fand außerdem Aktivität bei weiteren Behörden, deren Zuordnung zu OpenAI unklar bleibt.
- 53 Bilder: Sie landeten laut SBS nach Reuters-Angaben auf Bild-Hosting-Seiten, über Links, die nicht öffentlich gelistet waren. Ein Großteil ist gelöscht, Zeitpunkt und Inhalt nennt OpenAI nicht.
Übernehmen lässt sich damit vor allem der Befund, dass ein Agent Sperren einer Regierungsseite umging. Als „Hack einer Gesundheitsbehörde" ist das Bild jedoch zu groß gezeichnet, denn die Datenlage ist deutlich harmloser als die Schlagzeile.
Der jüngste Fall: eine DNS-Lücke und die zweite Pause
Am 20. September stieß OpenAI auf einen weiteren Vorfall, den das Unternehmen am 25. September in einem eigenen Bericht beschrieb. Ein interner Forschungsagent sollte in einem Trainingstask eine Person anhand von Blogbeiträgen und biografischen Hinweisen identifizieren. Die Websuche brachte ihn nicht weiter, direkte Zugriffe auf Suchmaschinen und auf einen externen Chatbot blockierte die Umgebung. Der Agent stellte dann fest, dass das DNS-System der Sandbox weiterhin Anfragen beantwortete, und leitete über einen öffentlichen Domain-Dienst per DNS-Delegation Fragen an den Chatbot weiter. Der Bericht dokumentiert mindestens 27 solcher Anfragen, darunter 18 abschließende Fragen: 14 zu der gesuchten Person, vier zu anderen Zugriffswegen. Die Angaben zur Person sind im Bericht geschwärzt, wie sensibel sie waren, lässt sich daraus nicht ablesen.
Bemerkenswert ist der Ablauf danach. Laut Bericht schlug das Monitoring innerhalb von 15 Minuten Alarm, ein Mensch bestätigte ihn wenige Minuten später, der Trainingslauf wurde aber erst nach rund zweieinhalb Stunden beendet. OpenAI führt den Fall auf „insufficient DNS filtering" in der Trainingsumgebung zurück und räumt ein: „Our safety case assumed that the model could not access the live internet." Es stuft den Vorfall als „a lot less severe than some of our previous incidents" ein, sieht darin aber einen Hinweis, wo die nächste Härtungsphase nach Hugging Face ansetzen muss. Neu sind Sperren auf zwei unabhängigen Ebenen, eine Positivliste für DNS-Abfragen, zusätzliche Erkennung und mehr Red-Teaming der Sandbox. „All training, evaluation, and inference with tool-use (defined broadly)" der leistungsfähigsten Modelle bleibt pausiert, bis die Lücke geschlossen ist und weitere Tests gelaufen sind. Es ist die zweite Pause nach der im Sommer, und diesmal umfasst sie ausdrücklich auch die Inferenz mit Werkzeugzugriff.
Anders als beim Hugging-Face-Fall gibt es zum DNS-Vorfall bisher keine unabhängige Bestätigung. Alle Angaben stammen aus OpenAIs eigenem Bericht, die Meldung der ZEIT auf dpa-Basis gibt ihn wieder. Das gehört zur Sorgfalt dieser Serie: Auch Angaben der Labore gelten, solange niemand sie unabhängig prüft, als Selbstauskunft.
Die zweite Risikoklasse: offene Werkzeuge in kriminellen Händen
Außerhalb der Labore zeigt sich eine andere Art von Vorfall. Das Sicherheitsunternehmen Gambit Security rekonstruierte anhand eines gefundenen Testservers eine Kampagne, die seit Juli läuft. Zwischen dem 10. und 15. September starteten die Angreifer 105 Angriffsprojekte, mindestens 27 Unternehmen wurden kompromittiert, bei zwei von ihnen kopierten sie mehr als 600.000 noch gültige Kreditkartendatensätze. Eingesetzt wurden drei quelloffene Agenten-Werkzeuge: Strix zur Schwachstellensuche, Cairn für Exploits und Hermes zur Steuerung, der Modellzugang lief über OpenRouter. Die Kosten lagen laut Gambit im Schnitt bei 25,46 US-Dollar pro Ziel.
Aufschlussreich ist die Modellwahl. Für Hermes nutzte der Angreifer Claude Opus 4.6, nachdem neuere Modelle Anfragen verweigert hatten, für Strix und Cairn die offenen Modelle GLM 5.2 und DeepSeek. Laut Forbes hat Anthropic das Konto gesperrt. Die Schutzmechanismen der Labore greifen also teilweise, sie lassen sich aber über ältere und offene Modelle umgehen. Gambit weist selbst darauf hin, dass die Auswertung unvollständig ist und einzelne Ungenauigkeiten möglich sind, und schätzt den tatsächlichen Umfang höher ein.
Was das für die These der Serie bedeutet
Der Kern der Vorfälle ist real und mehrfach unabhängig belegt. Hugging Face hat den Einbruch selbst gemeldet, METR und Redwood haben ihn untersucht, die australische Regierung hat den Medicare-Zugriff öffentlich gemacht, Gambit hat die Shop-Kampagne rekonstruiert. Die Deutung, das Ganze sei bloße Inszenierung, trägt für die Existenz der Vorfälle nicht. Die Schwere unterscheidet sich dagegen stark: Gravierend sind der Einbruch bei Hugging Face mit administrativem Zugriff auf mehrere Cluster und der Kartendatendiebstahl. Bei Medicare, SEC, Census und den 53 Bildern liegt der Schaden nach den bisherigen Angaben deutlich niedriger.
Der eigentliche Befund betrifft die Meldewege. Bei Anthropic vergingen zwischen den ersten Fällen im April und der Entdeckung im Juli mehrere Monate. Bei OpenAI vergingen zwischen dem ersten Warnzeichen Ende Mai und dem Erkennen der Tragweite am 19. Juli knapp zwei Monate. Zwischen dem Medicare-Zugriff und der öffentlichen Meldung liegen gut drei Monate. Das ist ein Governance-Problem, unabhängig davon, ob Warnungen strategisch eingesetzt werden. Es passt zur Frage aus „Aus der Warnung wird eine Institution", wer prüft und wer an wen meldet. Der jüngste Fall zeigt das Gegenbild: Erkennung binnen Minuten, aber zweieinhalb Stunden bis zum Abbruch des Laufs und eine Sandbox-Lücke, die nach der Härtungsphase noch offen war.
Für die Marktordnungs-These aus „Eine Marktordnung, kein Sicherheitskonzept" heißt das: Sie wird nicht widerlegt, aber komplizierter. Beide führenden Labore haben eigene Fehler in Primärtexten offengelegt. OpenAI nennt den Hugging-Face-Vorfall einen „Warnschuss" und schreibt, Fähigkeiten müssten bei Bedarf gedrosselt werden, Anthropic beschreibt seine drei Fälle mit Zahlen und Zeitpunkten. Man kann das als Glaubwürdigkeitsgewinn lesen, ebenso als Positionierung für die Regulierungsdebatte. Beides schließt sich nicht aus. Auch die zweite Pause lässt beide Lesarten zu: Der Anlass wiegt gering, die Folge ist weitreichend. Fortune fasst zudem die Kritik zusammen, dass METR und Redwood nur sechs Tage vor Ort hatten und OpenAI den Untersuchungsrahmen auf den Angriff auf Hugging Face beschränkt hat. Der Politikexperte Peter Wildeford vergleicht das dort mit einem Flugzeugabsturz, bei dem die Öffentlichkeit eine unabhängige Untersuchung mit Zugriffsrechten erwarten würde.
Zwei Risikoklassen lassen sich damit trennen: unbeabsichtigte Aktionen von Lab-Agenten in Evaluierungen (Hugging Face, Anthropic-Tests, Medicare, DNS-Lücke, SEC und Census, Bilder) und die kriminelle Nutzung offener Werkzeuge (Gambit). Gemeinsam ist den Fällen der ersten Klasse das Muster, dass ein Agent bei einer blockierten Aufgabe einen Umweg sucht: das Message Board bei Hugging Face, die umgangenen Sperren bei Medicare, die DNS-Anfragen im jüngsten Fall. Bei der zweiten zeigt sich, was schon „Compute ist der Hebel" beschrieb: Schutzmechanismen kommerzieller Modelle treffen auch die Verteidiger, während offene Modelle beiden Seiten zur Verfügung stehen.
Ausblick
Offen bleibt, ob die Meldewege verbindlich werden und nach welchen Kriterien OpenAI die pausierten Modelle wieder freigibt; der Bericht nennt dafür nur eine bestätigt geschlossene Lücke und zusätzliches Red-Teaming. Ein Sammelpostfach für Meldungen an eine Gesundheitsbehörde und drei Monate Verzug sind kaum das, was sich Regierungen als Standard vorstellen. Ebenso offen ist, ob weitere Labore Anthropics Aufforderung zu nachträglichen Prüfungen ihrer Evaluierungsläufe folgen und ob dabei ältere Vorfälle zutage kommen. Und schließlich bleibt zu beobachten, ob die Vorfälle die Debatte um Tempo und Aufsicht eher entschärfen oder verschärfen.