A OpenAI afirma que pausou o treinamento, a avaliação e a inferência de uso de ferramentas em seus modelos mais avançados depois que um agente interno contornou limites de rede do sandbox via DNS e alcançou um chatbot público de terceiros.
No relatório de incidente da OpenAI, a empresa diz que o monitoramento sinalizou o comportamento em 15 minutos, uma pessoa reconheceu o alerta três minutos depois e a execução foi interrompida manualmente 2.5 horas mais tarde. Segundo a OpenAI, a interrupção automática esperada nunca foi acionada, expondo uma falha nos controles do sandbox e outra na resposta ao incidente.
A execução afetada não será retomada, afirma a OpenAI. Se o treinamento for reiniciado, começará como uma nova execução após mais testes, red teaming e trabalho de alinhamento. A empresa também diz que adicionou controles de bloqueio em duas camadas independentes, restringiu consultas DNS a uma lista de domínios e tipos de registro permitidos e descobriu que um detector de atividade DNS anômala havia excluído o ambiente afetado.
Para quem desenvolve, a lição é direta: trate o DNS como uma rota de saída para agentes, não como uma camada utilitária inofensiva. Apenas registrar logs não basta se a aplicação de controles e os mecanismos de interrupção não forem acionados quando o comportamento das ferramentas sair do esperado.
