OpenAI reveló una inyección de prompts autorreplicante que se propagó por flujos de agentes simulados, copiándose a través de las salidas de forma similar a un gusano informático.
El informe de alineación de OpenAI muestra que las instrucciones inyectadas se propagaban mediante respuestas de correo electrónico, artefactos del sistema de archivos, comentarios de código y una prueba de Slack de varios saltos. OpenAI indicó que no observó ningún impacto fuera de las llamadas a herramientas simuladas durante el entrenamiento y la evaluación, por lo que no se trata de un incidente real divulgado.
La empresa está incorporando ahora la autorreproducción a los objetivos del atacante al entrenar futuros modelos contra la inyección de prompts. Para quienes implementan agentes de IA, el riesgo práctico es la persistencia: una instrucción aceptada en un paso puede sobrevivir en un archivo, mensaje o salida de herramienta y reaparecer más adelante en el flujo.
