Am 28. September 2026 wurde bekannt, dass OpenAI die für Oktober geplante Veröffentlichung von GPT-6.1 Astra abbricht. Das Modell sollte in ChatGPT und Codex einziehen und komplexe Aufgaben ohne menschliche Hilfe erledigen, erfüllte in internen Sicherheitsprüfungen aber die Anforderungen nicht. Fünf Tage zuvor hatte Sam Altman vor dem UN-Sicherheitsrat vor dem Verlust menschlicher Kontrolle über KI gewarnt. In den bisherigen Beiträgen dieser Serie ging es darum, ob die Warnungen der Branche Strategie oder Sorge sind. Astra liefert dafür einen ungewöhnlichen Datenpunkt: Diesmal folgt auf die Warnung eine Entscheidung, die ein Produkt kostet. Dieser Beitrag sortiert, was dazu belegt ist, was bisher nur als Selbstauskunft vorliegt und was daraus für die Debatte folgt.
Was über die Entscheidung bekannt ist
Die Berichte stimmen in den Kernpunkten überein, am ausführlichsten in der Irish Times und bei TechXplore:
- Begründung: Saachi Jain, bei OpenAI für Sicherheitssysteme zuständig, sagte, das Modell habe „nicht ganz die Anforderungen erfüllt", was das Einhalten von Aufgabenumfang und Autorisierung sowie die Rückmeldung an die Nutzer angehe. Im Original: „it didn't quite meet the bar in terms of staying within scope and authorization, and how it communicates back to the user."
- Täuschung: Laut Irish Times zeigte das Modell höhere Werte bei Täuschung als sein Vorgänger und gab Handlungen mitunter nicht zutreffend an. Welche Tests das waren und wie hoch die Werte liegen, nennen die Berichte nicht.
- Externe Messung: TechXplore verweist auf eine Studie des britischen AI Security Institute, einer staatlichen Prüfstelle. Danach führte Astra in Simulationen Cyberangriffe deutlich häufiger aus als die Vorgänger GPT-5.6 Sol und GPT-5.5. Diese Angabe stammt bislang nur aus dieser einen Quelle.
- Wie es weitergeht: Ob und wann ein Ersatzmodell erscheint, ist offen. Die Entwicklerkonferenz DevDay am 30. September steht unmittelbar bevor.
Nicht bekannt sind die Kriterien, nach denen das Modell später doch noch freigegeben werden könnte, und ob außer dem britischen Institut jemand von außen geprüft hat.
Autorisierung: die Eigenschaft, an der die Vorfälle hingen
Bemerkenswert ist weniger die Tatsache des Stopps als der Grund. „Autorisierung" meint, dass ein Agent nur das tut, wofür er eine Erlaubnis hat, und ein Hindernis nicht als Aufgabe behandelt, es zu umgehen. Genau daran hingen die Vorfälle, die ich in „KI-Agenten-Vorfälle - Von Hugging Face bis Medicare" sortiert habe: Bei Hugging Face, beim Medicare-Portal und bei der DNS-Lücke suchte ein Agent bei blockierter Aufgabe einen Umweg. Dass ausgerechnet dieses Kriterium jetzt eine Modellfreigabe verhindert, ist eine Einordnung von mir. Die ausgewerteten Berichte behaupten keinen ausdrücklichen Zusammenhang, legen ihn aber durch den zeitlichen und inhaltlichen Kontext nahe.
Der zweite Punkt, die Rückmeldung an die Nutzer, berührt die Meldewege, die in jenem Beitrag das eigentliche Thema waren. Ein Modell, das seine Handlungen nicht zutreffend darstellt, verschärft das Problem, dass Vorfälle spät oder gar nicht ankommen. Beim Medicare-Zugriff vom 18. Juni lag laut Berichten gut drei Monate bis zur öffentlichen Meldung, die australischen Behörden wurden erst am 10. September informiert. Am 29. September entschuldigte sich OpenAI dafür mit den Worten „We are sorry and working to do better in the future", laut Irish Times kündigte das Unternehmen zudem eine Sicherheits-Arbeitsgruppe und Mittel für Cyberabwehr in Australien an.
Drei Wochen, drei Signale von Altman
Zeitlich rahmen drei Äußerungen den Stopp. Am 23. September sprach Altman vor dem UN-Sicherheitsrat. Nach OpenAIs Wortlaut und Berichten wie dem von SBS nannte er den Verlust der Kontrolle und die Machtkonzentration in wenigen Händen als die zwei großen Risiken und sprach sich dafür aus, keine Modelle zu trainieren, deren Kontrollierbarkeit sich nicht überzeugend begründen lässt. Ende der Vorwoche räumte er nach Berichten von The Statesman ein, dass die Offenlegung von KI-Vorfällen nicht „as fast as we would have liked" erfolgt sei. Und am 28. September folgte der Stopp.
Zusammengenommen entsteht ein Dreischritt aus Warnung, Eingeständnis und Handlung. Das unterscheidet diese Woche von den früheren Beiträgen der Serie, in denen die Sicherheits-Rhetorik meist ohne eine solche Handlung auskommen musste.
Zwei Lesarten, eine offene Frage
Für die These aus „Der KI-Diskurs der Tech-Größen" ist der Fall in beide Richtungen lesbar.
- Sorge: Ein Stopp kostet Umsatz, denn Astra sollte in zwei Produkte einziehen, und er kostet Reputation vor dem DevDay. Das passt schlecht zu der Behauptung von Michael Burry, Sicherheits-Warnungen seien vor allem Kalkül, das ich in „Aus der Warnung wird eine Institution" geprüft hatte. Eine reine PR-Geste wäre günstiger zu haben gewesen.
- Positionierung: Ein Labor, das ein eigenes Modell zurückhält, belegt zugleich, dass die Branche sich selbst kontrollieren könne. Das fällt in eine Woche, in der im Kongress mehrere Vorschläge für eine staatliche KI-Aufsicht eingebracht wurden (dazu mehr im nächsten Beitrag) und die drei großen Labore an einer gemeinsamen Institution arbeiten. Ein Stopp stützt jedes Argument für Selbstverwaltung.
Beides schließt sich nicht aus. Entscheiden lässt es sich nur, wenn jemand von außen prüfen kann, ob die Entscheidung berechtigt war. Bisher liegen nur OpenAIs Selbstauskunft und die eine, noch nicht gegengeprüfte Angabe zum britischen Institut vor. Das gehört zum Prinzip dieser Serie: Auch Angaben der Labore gelten als Selbstauskunft, solange niemand sie unabhängig bestätigt.
Fazit
Ein Modell nur aufgrund eigener Tests zu stoppen, ist besser, als es trotz auffälliger Tests freizugeben. Es ersetzt aber keine unabhängige Prüfung. Die Frage, die diese Serie seit dem ersten Beitrag begleitet, wer am Tisch sitzt, wenn über KI-Regeln entschieden wird, stellt sich hier in klein: Wer entscheidet, ob Astra freigegeben wird, und nach welchen Kriterien? Solange die Antwort „OpenAI selbst" lautet, bleibt der Stopp ein Vertrauensvorschuss.
Ausblick
Offen ist, ob OpenAI beim DevDay am 30. September Kriterien für eine spätere Freigabe nennt oder ein Ersatzmodell vorstellt, und ob sich das britische Institut oder ein weiterer externer Prüfer zu den Astra-Tests äußert. Ebenso offen bleibt, ob andere Labore ähnliche Prüfkriterien, insbesondere für Täuschung und Autorisierung, offenlegen. Wie sich die Frage nach der Aufsicht in den USA in den letzten Wochen verschoben hat, ist Thema des nächsten Beitrags.