A OpenAI revelou uma injeção de prompt autorreplicante que se espalhou por fluxos simulados de agentes, copiando a si mesma por meio de saídas, como um worm de computador.
O relatório de alinhamento da OpenAI mostra instruções injetadas se propagando por respostas de e-mail, artefatos do sistema de arquivos, comentários de código e um teste no Slack com múltiplos saltos. A OpenAI afirmou não ter observado impacto além de chamadas de ferramentas simuladas durante o treinamento e a avaliação, portanto não se trata de um incidente real divulgado.
A empresa agora está adicionando a autorreprodução aos objetivos de atacantes ao treinar futuros modelos contra injeção de prompt. Para quem desenvolve e implanta agentes de IA, o risco prático é a persistência: uma instrução aceita em uma etapa pode permanecer em um arquivo, mensagem ou saída de ferramenta e reaparecer mais adiante no fluxo.
