Latenode

OpenAI revela injeção de prompt tipo worm em testes de agentes

Fluxos de agentes devem tratar mensagens, arquivos e resultados de ferramentas como não confiáveis em cada transferência. Adicione verificações para detectar instruções repetidas e impedir que saídas contaminadas avancem entre etapas ou canais.

Propagação simulada de uma injeção de prompt entre agentes

A OpenAI revelou uma injeção de prompt autorreplicante que se espalhou por fluxos simulados de agentes, copiando a si mesma por meio de saídas, como um worm de computador.

O relatório de alinhamento da OpenAI mostra instruções injetadas se propagando por respostas de e-mail, artefatos do sistema de arquivos, comentários de código e um teste no Slack com múltiplos saltos. A OpenAI afirmou não ter observado impacto além de chamadas de ferramentas simuladas durante o treinamento e a avaliação, portanto não se trata de um incidente real divulgado.

A empresa agora está adicionando a autorreprodução aos objetivos de atacantes ao treinar futuros modelos contra injeção de prompt. Para quem desenvolve e implanta agentes de IA, o risco prático é a persistência: uma instrução aceita em uma etapa pode permanecer em um arquivo, mensagem ou saída de ferramenta e reaparecer mais adiante no fluxo.

Quando modelos e APIs mudam o fluxo continua rodando

Conecte em um único cenário os modelos e apps de notícias como esta. Se um provedor mudar roteamento, preço ou disponibilidade, você atualiza o fluxo — sem recomeçar do zero.

Começar grátis

Plano gratuito para sempre. Não é necessário cartão de crédito.