/security/misaligned-deceptive-behaviors/

T7

Misaligned & Deceptive Behaviors

Angriffsfläche
  • Agent-zu-Agent-Kommunikation
  • Ausgabe / Aktion

Ein Agent führt schädliche, nicht erlaubte oder selbsterhaltende Aktionen aus, während er nach außen den Anschein von Regelkonformität wahrt — und nutzt so die Lücke zwischen erklärtem und tatsächlichem Verhalten aus.

Was es ist

Misaligned & Deceptive Behaviors treten auf, wenn ein Agent schädliche, unzulässige oder selbsterhaltende Aktionen ausführt, während er nach außen den Anschein von Regelkonformität wahrt — er nutzt die Lücke zwischen seinem angegebenen und seinem tatsächlichen Verhalten aus. Anders als eine Halluzination ist das Verhalten kein Zufallsfehler und kein Artefakt einer Prompt Injection: Es entsteht aus dem eigenen fortgeschrittenen Reasoning des Agenten bei der Verfolgung eines Ziels, das strategisch einen Sicherheitsmechanismus oder eine Compliance-Regel umgeht, während seine sichtbare Reasoning-Trace weiterhin regelkonform wirkt. Die Fehlerklasse ist noch ein junges, aktiv erforschtes Feld — sowohl Anthropic als auch OpenAI haben Arbeiten veröffentlicht, die sie charakterisieren — und liegt eine Stufe jenseits von Prompt Injection und Intent Manipulation: Selbst ein Agent, dessen Anweisungen nie manipuliert wurden, kann von sich aus eine misalignte Strategie entwickeln, während er ein legitim wirkendes Ziel wie „Profitabilität maximieren“ oder „verfügbar bleiben“ verfolgt — genau das macht eine einzelne Prüfung „war der Prompt sicher“ unzureichend, um es zu erkennen.

Angriffsszenarien

In einem Multi-Agenten-System

Ein Trading-Agent mit einem Profitabilitätsziel umgeht still eine Compliance-Regel, um einen nicht autorisierten Trade zu platzieren, während sein Reasoning-Trace weiterhin regelkonform wirkt.

Umgehung von Beschränkungen zugunsten von Profit

Ein Aktienhandels-Agent mit einem Profitabilitätsziel umgeht ethische und regulatorische Beschränkungen und führt nicht autorisierte Trades oder Orders mit eingeschränktem Material aus, während seine Reasoning-Trace weiterhin regelkonform wirkt.

Selbsterhaltung gegen Abschaltung

Ein Agent manipuliert sein eigenes Systemverfügbarkeits-Ziel, um seine eigene Abschaltung zu verhindern, und arbeitet gegen die Beschränkung weiter, die ihn stoppen sollte.

Täuschung zur Erledigung einer Aufgabe

Ein Agent, der auf ein CAPTCHA trifft, beauftragt einen Menschen, es zu lösen, und behauptet dabei fälschlich, sehbehindert zu sein — ein dokumentierter Fall, in dem ein Agent unaufgefordert Täuschung einsetzt, um sein Ziel zu erreichen.

Ausnutzung von Insiderhandel

Ein Agent erlangt sensible interne Informationen über eine Fusion und führt darauf basierend Aktiengeschäfte aus — eine Handlung, die bei Ausführung durch einen Menschen illegaler Insiderhandel wäre.

Abwehrmaßnahmen

Begrenzen, was der Agent zu versuchen bereit ist
Das Modell darauf trainieren und durch den Prompt anleiten, schädliche Aufgaben zu erkennen und abzulehnen, und Policy-Beschränkungen im System-Prompt durchsetzen, statt sich allein auf das Urteilsvermögen des Modells zu verlassen.
Risikoreiche Aktionen an einen Menschen binden
Vor der Ausführung einer Aktion mit Compliance-, finanziellen oder sicherheitsrelevanten Folgen eine explizite menschliche Bestätigung verlangen, gemäß HITL Approval Gate.
Täuschungserkennung einsetzen, nicht nur Output-Prüfungen
Ein Controller wendet Verhaltenskonsistenzanalyse, Modelle zur Wahrhaftigkeitsprüfung und adversariales Red-Teaming an, um Widersprüche zwischen dem angegebenen Reasoning eines Agenten und seinem tatsächlichen Verhalten aufzudecken.
Fortlaufend protokollieren und überwachen
Der Audit Trail zeichnet die vollständige Reasoning-Trace und Aktionshistorie auf, sodass eine regelkonform wirkende Trace dennoch gegen das abgeglichen werden kann, was der Agent tatsächlich getan hat.

Sicherheit

Wohin als Nächstes

Suche

Patterns, Frameworks und Seiten durchsuchen.