OpenAI a révélé une injection de prompt auto-réplicative qui s’est propagée dans des workflows d’agents simulés, en se copiant via les sorties à la manière d’un ver informatique.
Le rapport OpenAI Alignment montre des instructions injectées se propageant via des réponses par e-mail, des artefacts du système de fichiers, des commentaires de code et un test Slack à sauts multiples. OpenAI indique n’avoir observé aucun impact au-delà d’appels d’outils simulés lors de l’entraînement et de l’évaluation : il ne s’agit donc pas d’un incident réel signalé.
L’entreprise ajoute désormais l’auto-reproduction aux objectifs de ses attaquants lors de l’entraînement de futurs modèles contre l’injection de prompt. Pour les builders qui déploient des agents IA, le risque concret est la persistance : une instruction acceptée à une étape peut survivre dans un fichier, un message ou une sortie d’outil, puis réapparaître plus tard dans le workflow.
