Cascading Hallucination Attacks
- Agent-zu-Agent-Kommunikation
- Ausgabe / Aktion
Die Neigung eines Agenten, plausibel klingende, aber falsche Inhalte zu erzeugen, wird ausgenutzt, sodass sich die Erfindung über Memory, Selbstreflexion oder Agent-zu-Agent-Kommunikation fortpflanzt und verstärkt, statt auf eine Antwort begrenzt zu bleiben.
Was es ist
Cascading Hallucination Attacks nutzen die Neigung eines Agenten aus, plausibel klingende, aber falsche Inhalte zu erzeugen, und erzeugen gezielt Bedingungen, unter denen sich die Fabrikation ausbreitet und verstärkt, statt auf eine einzelne Antwort begrenzt zu bleiben. Der Mechanismus unterscheidet sich je nach Umfang: Bei einem einzelnen Agenten lässt Selbstverstärkung durch Reflexion, Selbstkritik oder Memory-Abruf eine Halluzination über die wiederholten Interaktionen des Agenten mit sich selbst anwachsen; in einem Multi-Agenten-System lassen Kommunikationsschleifen zwischen Agenten die Fabrikation eines Agenten zum vertrauenswürdigen Input eines Peers werden, sodass sich der Fehler über den Workflow ausbreitet, statt bei jedem Hop unabhängig erneut geprüft zu werden. Die Bedrohung erweitert Misinformation (LLM09) um ein spezifisch agentisches Fehlermuster: Ein nachgelagerter Agent kann eine verifizierte Tatsache nicht von einer vorgelagerten Halluzination unterscheiden, sofern die Pipeline dies nicht explizit prüft — eine einzelne Fehlklassifikation früh in einer Pipeline kann so mehrere spätere, scheinbar unabhängige Entscheidungen antreiben, die in Wirklichkeit alle demselben ursprünglichen Fehler nachgelagert sind.
Arten
- Selbstverstärkung bei einem einzelnen Agenten
- Reflexion, Selbstkritik oder Memory-Abruf lassen eine frühere Halluzination eines Agenten über weitere Interaktionen mit sich selbst anwachsen und die Fabrikation festigen, statt sie zu korrigieren.
- Ausbreitung im Multi-Agenten-System
- Kommunikationsschleifen zwischen Agenten lassen die Fabrikation eines Agenten zum vertrauenswürdigen Input eines Peers werden, sodass sich der Fehler über den Workflow ausbreitet und verstärkt, statt bei jedem Hop unabhängig erneut verifiziert zu werden.
Angriffsszenarien
Ein Agent stuft eine Anomalie bei einer Finanztransaktion fälschlich als legitim ein, und zwei nachgelagerte Agenten in der Pipeline handeln auf Basis dieser Einstufung, ohne sie unabhängig erneut zu prüfen — die falsche Entscheidung pflanzt sich durch den gesamten Workflow fort.
Kaskade von Fehlinformationen im Vertrieb
Ein Angreifer schleust subtil falsche Produktdetails in die Antworten eines Vertriebs-Agenten ein; die Fabrikation sammelt sich im Langzeit-Memory und in Logs an, sodass jede spätere Interaktion auf der letzten aufbaut und sich die Fehlinformation im Zeitverlauf verschlimmert.
API-Halluzination und Datenleck
Halluzinierte API-Endpunkte, die in den Kontext eines Agenten eingeschleust werden, bringen ihn dazu, fiktive Aufrufe zu erzeugen — es kommt zu unbeabsichtigten Datenlecks und Integritätsverletzungen, weil die erfundene Schnittstelle als real behandelt wird.
Drift medizinischer Leitlinien
Eine falsche Behandlungsleitlinie, eingepflanzt in die Antworten eines medizinischen Agenten, baut schrittweise auf dessen eigenen früheren Halluzinationen auf und erzeugt gefährlich fehlerhafte Empfehlungen, die sich mit jeder neuen Anfrage weiter aufsummieren, statt zurückzusetzen.
Agentenübergreifende Desensibilisierung der Sicherheit
Ein Agent halluziniert einen falschen Sicherheitsschwellenwert und teilt anderen verbundenen Systemen mit, fehlgeschlagene Zugriffsversuche seien risikoarm — ein gesamtes Netzwerk nachgelagerter Agenten übernimmt so dieselbe erfundene Richtlinie und handelt danach.
Abwehrmaßnahmen
- Ausgaben bewerten, bevor ihnen vertraut wird
- LLM-as-Judge prüft generierte Aussagen anhand einer Bewertungsrubrik, und Statistical Guardrails markieren Inhalte, die von abgerufenen oder verifizierten Quellen abweichen, bevor sie weitergereicht werden.
- Antworten in verifiziertem Retrieval verankern
- Vom Modell verlangen, das Abgerufene zu zitieren, statt allein aus dem Memory zu argumentieren, sodass eine Aussage eine prüfbare Quelle hat statt einer unverifizierbaren früheren Ausgabe.
- Agentenübergreifende Konsistenz überwachen
- Ein Controller beobachtet, ob Agenten bei ähnlichen Fällen widersprüchliche Entscheidungen treffen oder eine vorgelagerte Aussage ohne unabhängige erneute Prüfung wiederholen, und erkennt die Ausbreitung, bevor sie sich weiter aufsummiert.
- Bei jeder Übergabe erneut verifizieren, nicht nur einmal
- Die Ausgabe eines vorgelagerten Agenten bei jedem neuen Hop als nicht vertrauenswürdigen Input behandeln — dieselbe Disziplin, die das Cascading-Security-Vulnerabilities-Anti-Pattern allgemein für Nachrichten zwischen Agenten fordert.