/security/intent-breaking/

T6

Intent Breaking & Goal Manipulation

Angriffsfläche
  • Eingabe / Prompt
  • Agent-zu-Agent-Kommunikation

Angreifer nutzen die fehlende Trennung von Daten und Anweisungen aus, um die Planung, das Reasoning oder die Selbstbewertung eines Agenten zu verändern und dessen vorgesehenes Ziel zu überschreiben — eine Erweiterung von Prompt Injection auf langfristigen Zielzustand.

Was es ist

Intent Breaking & Goal Manipulation nutzt die fehlende Trennung von Daten und Anweisungen in der Planungsschleife eines Agenten aus: Prompt Injections, kompromittierte Datenquellen oder bösartige Tool-Ausgaben verändern seine Planung, sein Reasoning oder seine Selbstbewertung — ein Angreifer kann so das beabsichtigte Ziel überschreiben, die Entscheidungsfindung umlenken oder nicht autorisierte Aktionen erzwingen. Adaptive, reasoning-intensive Architekturen — etwa ein ReAct-artiger Planer, der sein eigenes Ziel bei jedem Schritt neu bewertet — sind am stärksten exponiert, weil jeder Schritt aus dem Zustand heraus argumentiert, den der vorherige hinterlassen hat. Die Bedrohung erweitert Prompt Injection (LLM01) auf einen langfristigen Zielzustand: Während ein einzelner eingeschleuster Prompt eine Antwort verändert, verändert ein Goal-Manipulation-Angriff, was der Agent über einen gesamten mehrstufigen Lauf hinweg zu erreichen versucht — eine einzelne erfolgreiche Injection summiert sich so über jeden späteren Planungsschritt, statt auf eine Ausgabe begrenzt zu bleiben. Ein verwandtes Fehlermuster ist Agent Hijacking (siehe Tool Misuse), bei dem die Umlenkung über Daten erfolgt, die der Agent aufnimmt, statt über eine direkte Anweisung.

Arten

Direkte Injection
Ein Angreifer weist den Agenten unter Umgehung seiner Guardrails direkt an, seine ursprünglichen Anweisungen zu ignorieren und Tool-Ausführungen zu einer nicht autorisierten Sequenz zu verketten.
Indirekte Injection
Ein bösartig gestaltetes Tool-Ergebnis oder Dokument schmuggelt versteckte, zielverändernde Anweisungen ein, die der Agent als Teil seines eigenen operativen Ziels fehlinterpretiert.
Schrittweise Zieldrift
Ein Angreifer schleust über viele Gesprächsrunden hinweg schrittweise subtil veränderte Teilziele ein, sodass das Ziel des Agenten von der ursprünglichen Aufgabe abdriftet, während jeder einzelne Schritt weiterhin plausibel wirkt.

Angriffsszenarien

In einem Multi-Agenten-System

Ein Angreifer schleust über mehrere Gesprächsrunden hinweg schrittweise subtil veränderte Teilziele in den Kontext eines Planungs-Agenten ein und lässt dessen Ziel vom ursprünglichen Task abdriften, während jeder einzelne Schritt für sich plausibel wirkt.

Überschreiben von Chatbot-Anweisungen

Ein Angreifer weist einen Chatbot an, seine ursprünglichen Anweisungen zu ignorieren, und stattdessen Tool-Ausführungen zu verketten, um Daten zu exfiltrieren oder nicht autorisierte E-Mails zu versenden.

Umlenkung über vergiftete Tool-Ausgabe

Eine bösartig gestaltete Tool-Ausgabe führt versteckte Anweisungen ein, die der Agent als Teil seines operativen Ziels fehlinterpretiert — es kommt zur Exfiltration sensibler Daten.

Lähmung durch Reflexionsschleife

Ein Angreifer löst beim Agenten endlose oder übermäßig tiefe Selbstanalyse-Zyklen aus, die Ressourcen verbrauchen und ihn daran hindern, Echtzeit-Entscheidungen zu treffen.

Verfälschung des Meta-Lernens

Indem ein Angreifer die Selbstverbesserungsmechanismen eines Agenten manipuliert, führt er Lernmuster ein, die dessen Entscheidungsintegrität schrittweise verändern und im Zeitverlauf nicht autorisierte Aktionen ermöglichen.

Abwehrmaßnahmen

Die Angriffsfläche verkleinern
Tool-Zugriff auf das für eine Aufgabe notwendige Minimum beschränken und jede KI-Ausgabe validieren, bevor sie als Plan behandelt oder nachgelagert wiederverwendet wird.
Zielkonsistenz validieren
Jeden Planungsschritt mit Output Validation / Schema Enforcement prüfen und erfassen, wie oft ein Agent eine Änderung seiner eigenen Ziele anfordert — ein wiederkehrendes Muster ist selbst ein Signal für Manipulation.
Selbstverstärkung begrenzen
Ein Controller wendet Goal-Alignment-Monitoring und Verhaltensbeschränkungen an, damit ein Agent seine Ziele nicht über vordefinierte operative Parameter hinaus selbst anpassen kann — das schließt die Angriffsfläche über Reflexionsschleife und Meta-Lernen.
Jede Planänderung nachvollziehbar und prüfbar machen
Der Audit Trail führt ein unveränderliches, kryptografisch verifizierbares Protokoll jeder Planungsentscheidung, und ein HITL Approval Gate verlangt eine menschliche Freigabe, bevor eine Planänderung wirksam wird.
MAESTRO-Ebene(n)

Sicherheit

Wohin als Nächstes

Suche

Patterns, Frameworks und Seiten durchsuchen.