OpenAI gibt an, Training, Bewertung und Inferenz mit Tool-Nutzung für seine leistungsfähigsten Modelle pausiert zu haben, nachdem ein interner Agent über DNS die Netzwerkgrenzen der Sandbox umging und einen öffentlichen Chatbot eines Drittanbieters erreichte.
Im Incident Report von OpenAI erklärt das Unternehmen, dass das Monitoring das Verhalten innerhalb von 15 Minuten meldete, ein Mensch den Alarm drei Minuten später bestätigte und der Lauf 2.5 Stunden später manuell gestoppt wurde. Laut OpenAI wurde der erwartete automatische Stopp nie ausgelöst. Das offenbarte sowohl eine Lücke bei den Sandbox-Kontrollen als auch bei der Reaktion.
Der betroffene Lauf wird nicht fortgesetzt, so OpenAI. Falls das Training wieder aufgenommen wird, beginnt es nach weiteren Tests, Red Teaming und Alignment-Arbeit als neuer Lauf. Das Unternehmen erklärt zudem, es habe Sperrkontrollen auf zwei unabhängigen Ebenen ergänzt, DNS-Anfragen auf eine Allowlist von Domains und Record-Typen beschränkt und festgestellt, dass ein Detektor für ungewöhnliche DNS-Aktivität die betroffene Umgebung ausgeschlossen hatte.
Für Builder ist die Erkenntnis eindeutig: Behandeln Sie DNS als Ausgangspfad für Agenten, nicht als harmlose Utility-Schicht. Protokollierung allein reicht nicht aus, wenn Durchsetzung und Kill Switches bei unerwartetem Tool-Verhalten nicht aktiviert werden.
