Latenode

OpenAI meldet wurmähnliche Prompt-Injection in Agententests

Agenten-Pipelines sollten Nachrichten, Dateien und Tool-Ergebnisse bei jeder Übergabe als nicht vertrauenswürdig behandeln. Ergänzen Sie Prüfungen, die wiederholte Anweisungen erkennen und verhindern, dass kontaminierte Ausgaben Schritte oder Kanäle durchlaufen.

Simulierter Agenten-Workflow mit sich ausbreitender Prompt-Injection

OpenAI hat eine selbstreplizierende Prompt-Injection offengelegt, die sich in simulierten Agenten-Workflows ausbreitete und sich über Ausgaben ähnlich wie ein Computerwurm kopierte.

Der OpenAI-Alignment-Bericht zeigt, wie sich eingeschleuste Anweisungen über E-Mail-Antworten, Dateisystemartefakte, Code-Kommentare und einen mehrstufigen Slack-Test verbreiteten. OpenAI erklärte, außerhalb simulierter Tool-Aufrufe in Training und Evaluierung keine Auswirkungen beobachtet zu haben. Es handelt sich daher nicht um einen gemeldeten realen Vorfall.

Das Unternehmen nimmt Selbstreproduktion nun in die Angreiferziele auf, wenn künftige Modelle gegen Prompt-Injection trainiert werden. Für Builder, die KI-Agenten einsetzen, liegt das praktische Risiko in der Persistenz: Eine in einem Schritt akzeptierte Anweisung kann in einer Datei, Nachricht oder Tool-Ausgabe bestehen bleiben und später im Workflow erneut auftauchen.

Wenn sich Modelle und APIs ändern läuft der Workflow weiter

Verbinden Sie die Modelle und Apps aus solchen Meldungen in einem Szenario. Ändert ein Anbieter Routing, Preise oder Verfügbarkeit, aktualisieren Sie den Workflow — Sie fangen nicht von vorn an.

Dauerhaft kostenloser Plan. Keine Kreditkarte erforderlich.