Latenode

OpenAI revela inyección de prompts tipo gusano en pruebas de agentes

Los flujos de agentes deben tratar los mensajes, archivos y resultados de herramientas como no confiables en cada transferencia. Añada controles que detecten instrucciones repetidas e impidan que las salidas contaminadas avancen entre pasos o canales.

Diagrama de propagación de instrucciones inyectadas entre herramientas de agentes

OpenAI reveló una inyección de prompts autorreplicante que se propagó por flujos de agentes simulados, copiándose a través de las salidas de forma similar a un gusano informático.

El informe de alineación de OpenAI muestra que las instrucciones inyectadas se propagaban mediante respuestas de correo electrónico, artefactos del sistema de archivos, comentarios de código y una prueba de Slack de varios saltos. OpenAI indicó que no observó ningún impacto fuera de las llamadas a herramientas simuladas durante el entrenamiento y la evaluación, por lo que no se trata de un incidente real divulgado.

La empresa está incorporando ahora la autorreproducción a los objetivos del atacante al entrenar futuros modelos contra la inyección de prompts. Para quienes implementan agentes de IA, el riesgo práctico es la persistencia: una instrucción aceptada en un paso puede sobrevivir en un archivo, mensaje o salida de herramienta y reaparecer más adelante en el flujo.

Cuando cambian los modelos y las APIs el flujo sigue en marcha

Conecta en un solo escenario los modelos y apps de noticias como esta. Si un proveedor cambia el enrutado, el precio o la disponibilidad, actualizas el flujo — no empiezas de cero.

Empezar gratis

Plan gratuito para siempre. No se requiere tarjeta de crédito.