/security/human-manipulation/

T15

Human Manipulation

Angriffsfläche
  • Ausgabe / Aktion

Angreifer nutzen das Vertrauen aus, das ein menschlicher Nutzer den Ausgaben eines Agenten entgegenbringt, um dessen Entscheidungen oder Handlungen zu beeinflussen, ohne dass der Mensch merkt, dass er getäuscht wird.

Was es ist

Human Manipulation nutzt die Vertrauensbeziehung aus, die eine Person zu einem Agenten aufbaut, mit dem sie direkt interagiert: Weil dieses Vertrauen die Skepsis verringert, die eine Person gegenüber einer unbekannten Quelle normalerweise aufbringen würde, verschafft ein Angreifer, der den Agenten kompromittiert, sich einen Kanal, um die Entscheidungen und Handlungen des Menschen zu beeinflussen, ohne dass dieser merkt, getäuscht zu werden. Der Mechanismus ist Social Engineering, ausgeliefert über einen vertrauenswürdigen Vermittler — nicht der Mensch wird direkt angegriffen, sondern der Agent, und das eigene Vertrauen des Menschen in ihn erledigt den Rest der Arbeit. Das unterscheidet sich von einer einfachen Halluzination: Die Ausgabe des Agenten ist nicht zufällig falsch, sie ist falsch, weil ein Angreifer sie dazu gemacht hat — typischerweise über indirekte Prompt Injection in Inhalte, die der Agent auf dem Weg zu seiner Antwort verarbeitet. Das Ergebnis erreicht den Nutzer genau so gerahmt wie jede andere vertrauenswürdige Antwort, die der Agent zuvor gegeben hat — genau das macht implizites Vertrauen in KI-Antworten zu einem wirksamen Vektor für Social Engineering statt zu einer Annehmlichkeit.

Arten

Finanzielle Manipulation / Betrug
Ein Angreifer nutzt indirekte Prompt Injection, um die Antwort eines Agenten zu manipulieren, und ersetzt legitime Transaktions- oder Kontodaten durch seine eigenen — das routinemäßige Vertrauen des Nutzers in die Ausgabe des Agenten führt dazu, dass er eine betrügerische Überweisung autorisiert.
Phishing / Verbreitung bösartiger Links
Ein Angreifer kompromittiert einen Agenten, sodass dieser eine täuschende Nachricht erzeugt, die den Nutzer auf einen als legitimer Inhalt getarnten bösartigen Link führt — er setzt dabei auf das Vertrauen des Nutzers in den Agenten, um die Skepsis zu umgehen, die eine eigenständige Phishing-E-Mail auslösen würde.

Angriffsszenarien

In einem Multi-Agenten-System

Ein über indirekte Prompt Injection kompromittierter Agent ersetzt in einer Antwort zur Rechnungsverarbeitung die Bankdaten eines legitimen Lieferanten, und der Nutzer — der Ausgabe des Agenten vertrauend — genehmigt die betrügerische Überweisung.

KI-gestützter Rechnungsbetrug

Ein Angreifer nutzt indirekte Prompt Injection, um einen Business-Copiloten zu manipulieren, und ersetzt die Bankdaten eines legitimen Lieferanten durch sein eigenes Konto; der Nutzer verarbeitet, im Vertrauen auf die Antwort des Agenten, unwissentlich eine betrügerische Überweisung.

KI-gesteuerter Phishing-Angriff

Ein Angreifer kompromittiert einen KI-Assistenten, sodass dieser eine täuschende Nachricht erzeugt, die den Nutzer anweist, auf einen als Sicherheitsupdate getarnten bösartigen Link zu klicken; der Nutzer, im Vertrauen auf den Agenten, klickt durch zu einer Phishing-Seite und verliert sein Konto.

Abwehrmaßnahmen

Das ausgehende Verhalten des Agenten begrenzen
Das Verhalten des Agenten überwachen, um sicherzustellen, dass es mit seiner definierten Rolle und den erwarteten Aktionen übereinstimmt, und den Tool-Zugriff einschränken, um die Fläche zu minimieren, die ein Angreifer in einen Manipulationskanal verwandeln kann.
Begrenzen, was der Agent an den Nutzer weitergeben kann
Die Fähigkeit des Agenten einschränken, Links auszugeben oder zu versenden, und Output Validation / Schema Enforcement für jede Antwort verlangen, die einen aktionsfähigen Link, eine Kontoangabe oder eine Anweisung enthält, bevor sie den Nutzer erreicht.
Ausgehende Inhalte mit Guardrails prüfen
Multimodal Guardrails und Moderations-APIs, oder ein zweites Modell, filtern manipulierte Antworten, bevor sie den Agenten verlassen, und erfassen eine fabrizierte Anweisung, die der Nutzer nicht von einer echten unterscheiden kann.
Folgenreiche Aktionen an einen Menschen binden
Ein HITL Approval Gate verlangt eine unabhängige Bestätigung, bevor eine Überweisung, eine Änderung von Zugangsdaten oder eine andere folgenreiche, durch die Antwort eines Agenten ausgelöste Aktion ausgeführt wird, sodass eine erfolgreiche Manipulation weiterhin nicht einseitig abgeschlossen werden kann.
MAESTRO-Ebene(n)

Sicherheit

Wohin als Nächstes

Suche

Patterns, Frameworks und Seiten durchsuchen.