Unexpected RCE and Code Attacks
- Tools & externe Daten
- Ausgabe / Aktion
Angreifer nutzen die Code-Generierungs- oder Code-Ausführungsfähigkeit eines Agenten aus, um unsicheren oder bösartigen Code auszuführen, Privilegien zu eskalieren oder das Host-System direkt zu kompromittieren.
Was es ist
Unexpected RCE and Code Attacks treten auf, wenn die Code-Generierungs- oder Code-Ausführungsfähigkeit eines Agenten zu einer echten Ausführungsprimitive wird: Angreifer manipulieren den Tool-integrierten Code-Pfad des Agenten, um unsicheren Code zu erzeugen, unbeabsichtigtes Systemverhalten auszulösen oder nicht autorisierte Skripte auszuführen. Die Bedrohung unterscheidet sich von Prompt Injection und Improper Output Handling nicht graduell, sondern grundsätzlich — jene beschreiben eine irreführende Textantwort, auf die ein Mensch oder ein nachgelagerter Parser reagieren muss, während ein Agent mit Function Calling und Tool-Integration dazu gebracht werden kann, den resultierenden Code direkt auszuführen — aus einer manipulierten Antwort wird so eine Systemkompromittierung statt eines Anzeigeproblems.
Da der Agent, nicht ein menschlicher Reviewer, den generierten Code ausführt, greift der Review-Schritt nie, den ein Entwickler normalerweise auf unbekannten Code anwenden würde — die bösartige Payload reist innerhalb von Code mit, der ansonsten tut, was verlangt war, als kleine, plausible Ergänzung wie eine deaktivierte Log-Zeile oder ein zusätzlicher Netzwerkaufruf, statt als offensichtlich fremder Block. Das macht die Bedrohung zu einem kritischen Vektor speziell in KI-gesteuerter Automatisierung und Service-Integration, wo „der Agent hat Code geschrieben und ihn sofort ausgeführt“ der normale Betriebsmodus ist, kein Randfall.
Arten
- Erzeugung bösartigen Codes
- Ein Angreifer bringt den Agenten dazu, Code zu erzeugen — ein Infrastruktur-Skript, einen Workflow-Automatisierungsschritt —, der neben seiner legitimen Ausgabe einen versteckten, schädlichen Befehl einbettet, sodass die Payload innerhalb von Code mitreist, der ansonsten tut, was verlangt war.
- Befehlsausführung über sprachliche Mehrdeutigkeit
- Ein Angreifer nutzt Mehrdeutigkeit in einer natürlichsprachlichen Anweisung an einen Agenten mit Ausführungsprivileg aus und formuliert eine Anfrage, die harmlos klingt, sich beim Parsen aber in einen nicht autorisierten oder destruktiven Befehl auflöst.
Angriffsszenarien
Ein DevOps-Agent wird dazu manipuliert, ein Infrastruktur-Skript zu erzeugen, das einen versteckten Befehl enthält, der die Protokollierung deaktiviert, bevor die angeforderte Ressource bereitgestellt wird.
Kompromittierung eines DevOps-Agenten
Ein Angreifer manipuliert einen KI-gestützten DevOps-Agenten dazu, ein Terraform-Skript zu erzeugen, das versteckte Befehle enthält, die Secrets extrahieren und das Logging deaktivieren, bevor der Agent es anwendet.
Ausnutzung der Workflow-Engine
Ein KI-gesteuertes Workflow-Automatisierungssystem führt bösartige, KI-generierte Skripte mit eingebetteten Backdoors aus, umgeht dabei die Sicherheitsvalidierung und verschafft dem Angreifer nicht autorisierte Kontrolle.
Ausnutzung sprachlicher Mehrdeutigkeit
Ein Angreifer nutzt sprachbasierte Mehrdeutigkeit in einem natürlichsprachlichen E-Mail-Agenten aus, um einen Befehl zu formulieren, der routinemäßig klingt, sich aber in die Exfiltration sensibler E-Mails über POP3 auflöst.
Dokumentierte Vorfälle
Öffentlich bekannte Fälle, jeder anhand seiner Primärquelle geprüft. Eine Forschungsdemonstration zeigt, dass der Angriff gegen reale Systeme funktioniert; sie ist kein gemeldeter Einbruch.
Cursor-Agent schreibt seine eigene MCP-Konfiguration (CVE-2025-54135)
Der Agent von Cursor konnte Konfigurationsdateien im Workspace ohne Freigabe anlegen. Eine indirekte Prompt Injection nutzte das, um einen neuen MCP-Server-Eintrag zu schreiben. Dessen Startbefehl führte Code des Angreifers auf dem Rechner des Entwicklers aus. Behoben in Cursor 1.3.9.
Cursor security advisory GHSA-4cxx-hrm3-49rm (CVE-2025-54135)Multi-Agenten-Frameworks führen beliebigen Schadcode aus
Bösartige Dateien oder Webseiten kaperten den Kontrollfluss von Multi-Agenten-Systemen auf Basis von AutoGen, CrewAI und MetaGPT und brachten sie dazu, beliebigen Code auszuführen oder Daten preiszugeben. Eine Konfiguration führte den Code des Angreifers in 97 % der Fälle aus, ausgelöst durch eine bösartige lokale Datei.
Triedman, Jha, Shmatikov, “Multi-Agent Systems Execute Arbitrary Malicious Code” (arXiv:2503.12188)Abwehrmaßnahmen
- Jede Ausführung sandboxen
- Sandbox Execution führt KI-aufgerufenen Code in einer isolierten, containerisierten Umgebung ohne Zugriff auf sensible Systemressourcen oder das weitere Netzwerk aus, setzt Ressourcen- und Systemaufruf-Limits durch und zerstört die Sandbox nach jedem Lauf, um Persistenz zu verhindern.
- Begrenzen, was der Agent erzeugen und ausführen darf
- KI-Code-Generierungsberechtigungen gemäß Least Privilege Agent auf das für eine Aufgabe notwendige Minimum beschränken und eine Authentifizierung auf Funktionsebene verlangen, bevor ein Agent überhaupt ein Tool aufrufen kann.
- Privilegierten Code für menschliches Review markieren
- Ausführungskontroll-Policies markieren KI-generierten Code mit erhöhten Privilegien vor der Ausführung für manuelles Review, statt Generierung und Ausführung im selben ununterbrochenen Schritt geschehen zu lassen.
- Generierten Code protokollieren und überwachen
- Jedes KI-generierte Skript und jede Tool-Interaktion mit forensischer Nachverfolgbarkeit via Audit Trail protokollieren und Befehlsverkettung oder ungewöhnliche Ausführungsfrequenz erkennen, die die beabsichtigte Policy umgeht.