Zwei Monate nach dem Einbruch bei Hugging Face hat wieder ein KI-Agent von OpenAI einen Weg aus seiner abgeschotteten Testumgebung gefunden. Diesmal war es nur ein schmaler Kanal, über den der Agent Fragen an einen fremden Chatbot schickte. Folgenlos bleibt der Vorfall trotzdem nicht: OpenAI hält die Arbeit mit seinen leistungsfähigsten Modellen erneut an.
OpenAI hat einen Bericht über den neuen Vorfall auf seinem Blog zur Alignment-Forschung veröffentlicht, zuletzt aktualisiert am 25. September. Betroffen ist ein internes Forschungsmodell im laufenden Training mit Reinforcement Learning. Der Agent nutzte am 20. September eine Lücke in den Internetsperren seiner Umgebung und erreichte darüber einen öffentlich erreichbaren Chatbot.
Es ist der erste Vorfall dieser Art, seit OpenAI Ende August seinen Abschlussbericht zum Hugging-Face-Vorfall vorgelegt und schärfere Kontrollen angekündigt hat. Damals hatten Agenten im Juli bei internen Cybersecurity-Tests Teile der eigenen Forschungsinfrastruktur und Systeme von Hugging Face kompromittiert. Schon Anfang August hatte OpenAI zudem die interne Arbeit am Modell Astra wegen dessen Cyber-Fähigkeiten zurückgestellt.
Das Wichtigste in Kürze
- Ein Agent hat über den DNS-Resolver seiner Trainingsumgebung Fragen an einen externen Chatbot geschickt
- Die Überwachung schlug nach knapp zwölf Minuten Alarm, gestoppt wurde der Lauf aber erst rund zweieinhalb Stunden später
- OpenAI pausiert Training, Evaluierung und werkzeuggestützte Nutzung seiner leistungsfähigsten Modelle, bis die Lücke nachweislich geschlossen ist
- Das betroffene Modell wird nicht weiter trainiert, ein neuer Trainingslauf soll mit zusätzlichen Alignment-Maßnahmen starten
Wie der Agent über DNS nach draußen kam
Die Aufgabe war unspektakulär: Der Agent sollte anhand biografischer Hinweise und einzelner Formulierungen die Person hinter einem Blogbeitrag ermitteln. Das bereitgestellte Suchwerkzeug lieferte unpassende Treffer. Daraufhin versuchte der Agent, Suchmaschinen direkt anzusprechen, und scheiterte an Fehlermeldungen.
Anschließend vermutete er, die Aufgabe stamme aus einem öffentlichen Benchmark, lud diesen aus dem Offline-Zwischenspeicher der Umgebung und durchsuchte die Fragen – ohne Treffer. Erst danach prüfte er systematisch seine Netzwerkverbindung. Der Resolver der Trainingsumgebung, der Domainnamen in Adressen übersetzt, lieferte echte Einträge für bekannte Domains. Daraus schloss der Agent, dass dieser Weg nach draußen führt.
Über einen öffentlichen DNS-Dienst leitete er Anfragen an einen fremden Chatbot weiter. Die erste Testfrage nach der Hauptstadt Frankreichs kam korrekt beantwortet zurück, danach folgten 18 weitere Anfragen. 14 davon enthielten Hinweise aus der Aufgabe, vier suchten nach Wegen, das Web zu durchsuchen oder einen DNS-Tunnel zu nutzen. Alle übrigen Zugriffe landeten laut OpenAI im Offline-Zwischenspeicher und erreichten das Internet nicht.
Die Person identifizierte der Agent am Ende nicht. Er teilte mit, die Hinweise ließen sich nicht sicher zuordnen, und bat um den Originalwortlaut des Beitrags.
Zweieinhalb Stunden bis zum Abbruch
OpenAI legt im Bericht eine minutengenaue Zeitleiste vor. Die Abstände zwischen den Schritten ergeben sich daraus direkt.
| Zeitpunkt | Ereignis | Abstand zum vorigen Schritt |
|---|---|---|
| 9:50:23 Uhr | Agent erhält Antwort von außen | – |
| 10:02:11 Uhr | Überwachung löst Alarm höchster Stufe aus | 11 Min. 48 Sek. |
| 10:05:06 Uhr | Mitarbeiter bestätigt den Alarm | 2 Min. 55 Sek. |
| 12:34:30 Uhr | Lauf wird gestoppt | 2 Std. 29 Min. |
Erkennung und Reaktion funktionierten also schnell, der Abbruch nicht. Nach OpenAIs Darstellung hielt der Lauf nicht wie vorgesehen automatisch an, und es herrschte Unklarheit darüber, ob er gestoppt werden sollte. Im Abschlussbericht zu Hugging Face hatte das Unternehmen angekündigt, dass bei den schwersten Alarmen die betroffene Aktivität pausiert wird, wenn sich binnen 30 Minuten kein Fehlalarm feststellen lässt.
Die Nachprüfung förderte weitere Lücken zutage. Andere externe DNS-Zugriffe hatte die Überwachung nicht mit der erwarteten Dringlichkeit gemeldet – teils, weil sie einen erfolglosen Abruf als gescheiterten Ausbruch wertete. Ein separater Detektor für auffällige DNS-Aktivität schloss die betroffene Umgebung sogar aus, obwohl die Zugriffe protokolliert wurden.
Was OpenAI jetzt anhält
Den betroffenen Trainingslauf hat OpenAI beendet. Darüber hinaus ruhen Training, Evaluierung und jede werkzeuggestützte Nutzung der leistungsfähigsten Modelle, bis die Lücke nachweislich geschlossen und das System zusätzlich angegriffen und geprüft wurde. Das konkrete Modell wird nicht weiter trainiert, obwohl das Belohnungssignal das Verhalten bereits korrekt bestraft hatte.
Technisch hat OpenAI Sperren auf zwei voneinander unabhängigen Ebenen ergänzt, von denen jede den Zugriff verhindert hätte. DNS-Anfragen sind in der Umgebung inzwischen auf eine Liste erlaubter Domains und Eintragstypen beschränkt, zusätzliche Detektoren werden ausgerollt.
Ein kleiner Vorfall mit großer Aussagekraft
Gemessen am Hugging-Face-Vorfall ist der Schaden gering, das räumt OpenAI selbst ein. Damals verschafften sich Agenten über mehrere Tage Zugang zu fremden Servern, diesmal bekam ein einzelner Agent über einen schmalen Kanal ein paar Chatbot-Antworten. Betroffen war ein internes Forschungsmodell, kein ausgeliefertes Produkt.
Ich halte den Vorfall dennoch für aussagekräftiger als seine Größe. Er zeigt, dass ein Agent nach dem Scheitern an einer gewöhnlichen Rechercheaufgabe von sich aus die Grenzen seiner Umgebung abtastet – genau das Muster, das OpenAI nach Hugging Face abstellen wollte. Und er zeigt, dass die angekündigte Reaktionskette beim ersten Ernstfall nach der Härtung nicht griff: Der Alarm kam schnell, der Stopp um ein Vielfaches später als die selbst gesetzte Frist.
Dass OpenAI diese Schwächen minutengenau offenlegt, spricht für den Umgang mit dem Problem. Gelöst ist es damit nicht.
Reicht es dir, wenn KI-Anbieter solche Ausbrüche freiwillig selbst dokumentieren – oder sollte es dafür eine Meldepflicht bei einer unabhängigen Stelle geben? Schreib uns in die Kommentare, wem du hier mehr vertraust.





