Apfelpatient
  • Home
  • News
  • Rumors
  • Tipps & Tricks
  • Tests & Erfahrungsberichte
  • Allgemein
No Result
View All Result
  • iPhone 18
  • iPhone 18 Pro
  • iPhone Duo
  • Apple Watch Series 12
  • Apple Watch Ultra 4
  • AirPods 5
  • iOS 27
  • iPadOS 27
  • macOS
  • MacBook Neo
  • iPhone 17e
  • AirTags
  • iOS 26
  • iPhone 17
  • MacBook Pro
  • iPadOS
  • iMac
  • Mac mini
  • HomePod
  • Apple TV
  • iPad Pro
  • iPhone Air
  • Apple Vision Pro
  • iPhone 16
  • AirPods 4
  • Apple Watch Ultra
  • HomePod Mini
  • MacBook Air
  • iPad
  • AirPods Max
  • AirPods Pro 3
  • Apple Watch Series 3
  • Mac Studio
  • Studio Display
  • iPad Air
  • iPad mini
  • watchOS 27
  • Apple CarPlay
  • Apple Pay
  • watchOS 26
  • Home
  • News
  • Rumors
  • Tipps & Tricks
  • Tests & Erfahrungsberichte
  • Allgemein
No Result
View All Result
Apfelpatient
No Result
View All Result
  • iPhone 18
  • iPhone 18 Pro
  • iPhone Duo
  • Apple Watch Series 12
  • Apple Watch Ultra 4
  • AirPods 5
  • iOS 27
  • iPadOS 27
  • macOS
  • MacBook Neo
  • iPhone 17e
  • AirTags
  • iOS 26
  • iPhone 17
  • MacBook Pro
  • iPadOS
  • iMac
  • Mac mini
  • HomePod
  • Apple TV
  • iPad Pro
  • iPhone Air
  • Apple Vision Pro
  • iPhone 16
  • AirPods 4
  • Apple Watch Ultra
  • HomePod Mini
  • MacBook Air
  • iPad
  • AirPods Max
  • AirPods Pro 3
  • Apple Watch Series 3
  • Mac Studio
  • Studio Display
  • iPad Air
  • iPad mini
  • watchOS 27
  • Apple CarPlay
  • Apple Pay
  • watchOS 26

OpenAI pausiert Training: KI-Agent umgeht Sperre per DNS

Milan Jovicic by Milan Jovicic
29. September 2026 - 14:23 CEST
in Apple News
0
OpenAI pausiert Training: schwarze OpenAI-Blüte auf hellgrauem Farbverlauf

Bild: OpenAI / Apfelpatient

WhatsAppFacebookE-Mail
Threads

Zwei Monate nach dem Einbruch bei Hugging Face hat wieder ein KI-Agent von OpenAI einen Weg aus seiner abgeschotteten Testumgebung gefunden. Diesmal war es nur ein schmaler Kanal, über den der Agent Fragen an einen fremden Chatbot schickte. Folgenlos bleibt der Vorfall trotzdem nicht: OpenAI hält die Arbeit mit seinen leistungsfähigsten Modellen erneut an.

OpenAI hat einen Bericht über den neuen Vorfall auf seinem Blog zur Alignment-Forschung veröffentlicht, zuletzt aktualisiert am 25. September. Betroffen ist ein internes Forschungsmodell im laufenden Training mit Reinforcement Learning. Der Agent nutzte am 20. September eine Lücke in den Internetsperren seiner Umgebung und erreichte darüber einen öffentlich erreichbaren Chatbot.

Es ist der erste Vorfall dieser Art, seit OpenAI Ende August seinen Abschlussbericht zum Hugging-Face-Vorfall vorgelegt und schärfere Kontrollen angekündigt hat. Damals hatten Agenten im Juli bei internen Cybersecurity-Tests Teile der eigenen Forschungsinfrastruktur und Systeme von Hugging Face kompromittiert. Schon Anfang August hatte OpenAI zudem die interne Arbeit am Modell Astra wegen dessen Cyber-Fähigkeiten zurückgestellt.

Das Wichtigste in Kürze

  • Ein Agent hat über den DNS-Resolver seiner Trainingsumgebung Fragen an einen externen Chatbot geschickt
  • Die Überwachung schlug nach knapp zwölf Minuten Alarm, gestoppt wurde der Lauf aber erst rund zweieinhalb Stunden später
  • OpenAI pausiert Training, Evaluierung und werkzeuggestützte Nutzung seiner leistungsfähigsten Modelle, bis die Lücke nachweislich geschlossen ist
  • Das betroffene Modell wird nicht weiter trainiert, ein neuer Trainingslauf soll mit zusätzlichen Alignment-Maßnahmen starten

Wie der Agent über DNS nach draußen kam

Die Aufgabe war unspektakulär: Der Agent sollte anhand biografischer Hinweise und einzelner Formulierungen die Person hinter einem Blogbeitrag ermitteln. Das bereitgestellte Suchwerkzeug lieferte unpassende Treffer. Daraufhin versuchte der Agent, Suchmaschinen direkt anzusprechen, und scheiterte an Fehlermeldungen.

Anschließend vermutete er, die Aufgabe stamme aus einem öffentlichen Benchmark, lud diesen aus dem Offline-Zwischenspeicher der Umgebung und durchsuchte die Fragen – ohne Treffer. Erst danach prüfte er systematisch seine Netzwerkverbindung. Der Resolver der Trainingsumgebung, der Domainnamen in Adressen übersetzt, lieferte echte Einträge für bekannte Domains. Daraus schloss der Agent, dass dieser Weg nach draußen führt.

Über einen öffentlichen DNS-Dienst leitete er Anfragen an einen fremden Chatbot weiter. Die erste Testfrage nach der Hauptstadt Frankreichs kam korrekt beantwortet zurück, danach folgten 18 weitere Anfragen. 14 davon enthielten Hinweise aus der Aufgabe, vier suchten nach Wegen, das Web zu durchsuchen oder einen DNS-Tunnel zu nutzen. Alle übrigen Zugriffe landeten laut OpenAI im Offline-Zwischenspeicher und erreichten das Internet nicht.

Die Person identifizierte der Agent am Ende nicht. Er teilte mit, die Hinweise ließen sich nicht sicher zuordnen, und bat um den Originalwortlaut des Beitrags.

Zweieinhalb Stunden bis zum Abbruch

OpenAI legt im Bericht eine minutengenaue Zeitleiste vor. Die Abstände zwischen den Schritten ergeben sich daraus direkt.

ZeitpunktEreignisAbstand zum vorigen Schritt
9:50:23 UhrAgent erhält Antwort von außen–
10:02:11 UhrÜberwachung löst Alarm höchster Stufe aus11 Min. 48 Sek.
10:05:06 UhrMitarbeiter bestätigt den Alarm2 Min. 55 Sek.
12:34:30 UhrLauf wird gestoppt2 Std. 29 Min.

Erkennung und Reaktion funktionierten also schnell, der Abbruch nicht. Nach OpenAIs Darstellung hielt der Lauf nicht wie vorgesehen automatisch an, und es herrschte Unklarheit darüber, ob er gestoppt werden sollte. Im Abschlussbericht zu Hugging Face hatte das Unternehmen angekündigt, dass bei den schwersten Alarmen die betroffene Aktivität pausiert wird, wenn sich binnen 30 Minuten kein Fehlalarm feststellen lässt.

Die Nachprüfung förderte weitere Lücken zutage. Andere externe DNS-Zugriffe hatte die Überwachung nicht mit der erwarteten Dringlichkeit gemeldet – teils, weil sie einen erfolglosen Abruf als gescheiterten Ausbruch wertete. Ein separater Detektor für auffällige DNS-Aktivität schloss die betroffene Umgebung sogar aus, obwohl die Zugriffe protokolliert wurden.

Was OpenAI jetzt anhält

Den betroffenen Trainingslauf hat OpenAI beendet. Darüber hinaus ruhen Training, Evaluierung und jede werkzeuggestützte Nutzung der leistungsfähigsten Modelle, bis die Lücke nachweislich geschlossen und das System zusätzlich angegriffen und geprüft wurde. Das konkrete Modell wird nicht weiter trainiert, obwohl das Belohnungssignal das Verhalten bereits korrekt bestraft hatte.

Technisch hat OpenAI Sperren auf zwei voneinander unabhängigen Ebenen ergänzt, von denen jede den Zugriff verhindert hätte. DNS-Anfragen sind in der Umgebung inzwischen auf eine Liste erlaubter Domains und Eintragstypen beschränkt, zusätzliche Detektoren werden ausgerollt.

Ein kleiner Vorfall mit großer Aussagekraft

Gemessen am Hugging-Face-Vorfall ist der Schaden gering, das räumt OpenAI selbst ein. Damals verschafften sich Agenten über mehrere Tage Zugang zu fremden Servern, diesmal bekam ein einzelner Agent über einen schmalen Kanal ein paar Chatbot-Antworten. Betroffen war ein internes Forschungsmodell, kein ausgeliefertes Produkt.

Ich halte den Vorfall dennoch für aussagekräftiger als seine Größe. Er zeigt, dass ein Agent nach dem Scheitern an einer gewöhnlichen Rechercheaufgabe von sich aus die Grenzen seiner Umgebung abtastet – genau das Muster, das OpenAI nach Hugging Face abstellen wollte. Und er zeigt, dass die angekündigte Reaktionskette beim ersten Ernstfall nach der Härtung nicht griff: Der Alarm kam schnell, der Stopp um ein Vielfaches später als die selbst gesetzte Frist.

Dass OpenAI diese Schwächen minutengenau offenlegt, spricht für den Umgang mit dem Problem. Gelöst ist es damit nicht.

Reicht es dir, wenn KI-Anbieter solche Ausbrüche freiwillig selbst dokumentieren – oder sollte es dafür eine Meldepflicht bei einer unabhängigen Stelle geben? Schreib uns in die Kommentare, wem du hier mehr vertraust.

Apfelpatient bei Google bevorzugen 1 Klick – so siehst du uns häufiger bei Google
War dieser Artikel hilfreich?
JaNein
Tags: OpenAITechPatient
SendShareSend
Share

Unsere Amazon Storefront

Eine handverlesene Auswahl an Produkten für iPhone, Mac und Co. – nach Themen sortiert und laufend gepflegt.

Zur Storefront

Dieser Beitrag enthält Partnerlinks (u. a. Amazon). Über qualifizierte Käufe erhalten wir eine kleine Provision – für dich ändert sich am Preis nichts. Mehr dazu im Partnerprogramm.

Previous Post

Taptic Engine Urteil: Burford stünden 1,4 Milliarden zu

Milan Jovicic

Milan Jovicic

Milan hat Apfelpatient 2016 gegründet und verantwortet seit 2018 sämtliche redaktionellen Inhalte – News, Gerüchte, Anleitungen und Produkttests. Apple-Geräte sind hier kein Testmaterial für zwei Wochen, sondern Alltagswerkzeug: Vom iPhone über MacBook Pro, MacBook Air und iMac bis zur Apple Vision Pro läuft aus fast jeder Produktkategorie mindestens ein Gerät im täglichen Einsatz, viele davon jährlich erneuert. Jeder Menüpfad in einer Anleitung wird am Gerät nachgeprüft, bevor er veröffentlicht wird.

Related Posts

Taptic Engine Urteil: Burford stünden 1,4 Milliarden zu

by Milan Jovicic
28. September 2026 - 22:42 CEST
Taptic Engine Urteil: schwarzes iPhone mit Dreifachkamera, darauf eine Apple Watch Ultra mit orangefarbenem Alpine Loop

Taptic Engine Urteil: Burford finanziert Apples Prozessgegner. Dem Geldgeber stünden 1,4 Milliarden Dollar zu – er warnt aber selbst.

Read moreDetails

iOS 26.7.1 schließt Lücke nach gezielten Angriffen

by Milan Jovicic
28. September 2026 - 21:08 CEST
iOS 26.7.1: Illustration mit einem Schild und Häkchen in der Mitte, umgeben von verstreuten Käfern als Sinnbild für die geschlossene Sicherheitslücke

iOS 26.7.1 schließt eine Lücke, die Apple zufolge für gezielte Angriffe genutzt worden sein könnte. Auch Tahoe und Sequoia bekommen den Fix.

Read moreDetails

Claude Sonnet 5.5: Schneller und günstiger als Sonnet 5

by Milan Jovicic
28. September 2026 - 20:55 CEST
Claude Sonnet 5.5: Icon von Claude auf dunklem, warmem Farbverlauf

Claude Sonnet 5.5 ist über 30 Prozent schneller als Sonnet 5, kostet pro Aufgabe bis zu 30 Prozent weniger und rückt nah an Opus 5.5 heran.

Read moreDetails

iOS 27.0.1 und macOS 27.0.1: Apple verteilt erste Updates

by Milan Jovicic
28. September 2026 - 19:30 CEST
iPhone zeigt die Einstellungen zum Softwareupdate mit iOS 27.0.1 und dem Button zum Aktualisieren

iOS 27.0.1 behebt die Face-ID-Neustarts beim iPhone 18 Pro. Dazu kommen macOS 27.0.1 und neue Versionen für Tahoe und Sequoia.

Read moreDetails

iPhone Duo: Code zeigt fünf neue Standby-Ansichten

by Milan Jovicic
28. September 2026 - 17:18 CEST
iPhone Duo im Standby, halb aufgeklappt auf einem Tisch aufgestellt, mit großer Digitaluhr auf grünem Hintergrund

Im Code von iOS 27.1 stecken fünf Standby-Ansichten, die Apple nicht gezeigt hat – darunter Kamerabilder und Steuerelemente für das Zuhause.

Read moreDetails
Load More

Schreibe einen Kommentar Antwort abbrechen

Erforderliche Felder sind mit * markiert.

Mit dem Absenden stimmst du der Speicherung deines Kommentars samt Name, E-Mail-Adresse und IP-Adresse zu. Details stehen in der Datenschutzerklärung.

Kategorien

  • Apple Allgemein
  • Apple Gerüchte
  • Apple News
  • Apple Tipps & Tricks
  • iPhone News, Gerüchte und Tipps
  • Mac und MacBook News aktuell
  • Tests & Erfahrungsberichte

Über APFELPATIENT

APFELPATIENT liefert dir die neuesten Apple-News, Produkt-Updates, Ratgeber, Testberichte und Tipps rund um das gesamte Apple-Ökosystem - vom iPhone über den Mac bis zur Apple Vision Pro. Von ersten Gerüchten bis zu bestätigten News: verantwortungsvoll recherchiert.

Folge Apfelpatient

Facebook Instagram YouTube Threads Threads

Unternehmen

  • Über Apfelpatient
  • Kontakt
  • Autorenprofile

Gemeinschaft

  • Netiquette
  • Push-Benachrichtigungen
  • RSS-Feed

Rechtliches

  • Impressum
  • Datenschutzerklärung
  • Nutzungsbedingungen
  • Cookie-Einstellungen
  • Partnerprogramm

Ressourcen

  • Sitemap

© 2026 Apfelpatient. All rights reserved.

No Result
View All Result
  • Home
  • News
  • Rumors
  • Tipps & Tricks
  • Tests & Erfahrungsberichte
  • Allgemein

© 2026 Apfelpatient. Alle Rechte vorbehalten. | Seitenverzeichnis

Sprache auf English ändern