/security/tool-misuse/

T2

Tool Misuse

Angriffsfläche
  • Tools & externe Daten

Angreifer manipulieren einen Agenten über täuschende Prompts dazu, seine bereits gewährten Tools zu missbrauchen, indem sie ansonsten legitime Tool-Aufrufe zu einer nicht autorisierten Sequenz verketten — innerhalb seiner nominellen Berechtigungen.

Was es ist

Tool Misuse manipuliert einen Agenten dazu, Tools zu missbrauchen, die ihm bereits legitim gewährt wurden — durch einen täuschenden Prompt oder eine manipulierte Datenquelle —, indem einzeln jeweils autorisierte Aufrufe zu einer Sequenz verkettet werden, die ihr Eigentümer nie beabsichtigt hat. Da jeder Aufruf innerhalb des nominellen Berechtigungsumfangs des Agenten bleibt, hinterlässt der Angriff keine Berechtigungsverletzung, die auffiele; verändert haben sich Sequenz und Absicht, nicht die Zugriffsebene — was es schwer macht, den Angriff allein durch Berechtigungsprüfungen zu erkennen. Ein verwandtes Fehlermuster ist Agent Hijacking, bei dem adversarial gestaltete Inhalte, die der Agent als gewöhnliche Daten aufnimmt — nicht als direkte Anweisung —, umlenken, welche Tools er als Nächstes aufruft. Die Bedrohung überschneidet sich teilweise mit Excessive Agency (LLM06), doch ein agentisches System vergrößert die dort beschriebene Angriffsfläche: Das persistente Memory eines Agenten lässt eine Manipulation sitzungsübergreifend anwachsen, statt auf einen einzelnen Aufruf begrenzt zu bleiben, und seine Fähigkeit, an andere Agenten zu delegieren, macht aus einem einzigen erfolgreichen Missbrauch eine Kette, die der ursprüngliche Angreifer nie mehr selbst berühren muss.

Angriffsszenarien

In einem Multi-Agenten-System

Ein Angreifer bringt einen Kundenservice-Agenten dazu, dessen eigene Tools zum Nachschlagen von Datensätzen und zum E-Mail-Versand zu verketten, um hochwertige Kundendaten zu extrahieren und zu exfiltrieren — ohne dass der Agent je seinen gewährten Tool-Umfang überschreitet.

Parameter-Verunreinigung

Ein Angreifer entdeckt das Function-Call-Schema eines Buchungs-Agenten und manipuliert dessen Parameter, um 500 statt einem Sitzplatz zu reservieren — aus einem legitimen Funktionsaufruf wird eine kostspielige Überbuchung.

Automatisiertes Phishing im großen Maßstab

Ein Dokumentenverarbeitungs-Agent wird dazu gebracht, bösartige Dokumente zu erzeugen und massenhaft zu verteilen — er führt so, ohne es zu wissen, eine groß angelegte Phishing-Kampagne vollständig innerhalb seiner autorisierten Dokument-Tools aus.

Hijacking über vergiftetes Memory

Ein Angreifer schleust falsche Informationen in das persistente Memory eines Agenten ein, sodass dieser die manipulierten Daten später abruft und danach handelt — Sicherheitsprüfungen werden sitzungsübergreifend umgangen, ohne dass ein einzelner Tool-Aufruf isoliert betrachtet verdächtig wirkt.

Hijacking über einen vergifteten Vector Store

Ein Angreifer platziert adversarial gestaltete Inhalte in einer Vektordatenbank, aus der der Agent abruft, sodass gewöhnliches Retrieval dem Agenten irreführenden Kontext liefert, der einen unsicheren Tool-Aufruf auslöst.

Abwehrmaßnahmen

Jeden Aufruf begrenzen und verifizieren
Permission-scoped Tools begrenzen, was jedes Tool erreichen kann, und eine Authentifizierung auf Funktionsebene verifiziert einen Aufruf vor der Ausführung, statt ihn nur prinzipiell zu autorisieren.
Die Tool-Fläche klein und beobachtbar halten
Eine geprüfte Tool Registry, gepaart mit Capability Routing, hält die Menge erreichbarer Tools begrenzt und überschaubar, statt einem Agenten über die Zeit breiten, selten auditierten Zugriff anwachsen zu lassen.
Die Sequenz beobachten, nicht nur den Aufruf
Auf Befehlsverkettung überwachen, die die beabsichtigte Policy umgeht, und ungewöhnliche Aufruffrequenz markieren — die Ausführungsprotokolle des Audit Trail machen eine verkettete, aber einzeln legitime Sequenz im Nachhinein erkennbar.
Folgenreiche Aktionen absichern
Für Tool-Aufrufe mit finanziellen, medizinischen oder administrativen Auswirkungen eine explizite menschliche Freigabe verlangen, gemäß HITL Approval Gate.
MAESTRO-Ebene(n)

Sicherheit

Wohin als Nächstes

Suche

Patterns, Frameworks und Seiten durchsuchen.