Misinformation
- Ausgabe / Aktion
- Agent-zu-Agent-Kommunikation
Das Modell erzeugt falsche, unvollständige oder irreführende Inhalte, die glaubwürdig genug wirken, um eine menschliche Entscheidung, einen automatisierten Workflow oder die Aktion eines Agenten zu steuern.
Was es ist
Fehlinformation ist falsche oder irreführende Ausgabe, die glaubwürdig wirkt — und das Kernrisiko besteht darin, dass man ihr vertraut und danach handelt. Zu den Ursachen gehören Halluzination, veralteter oder unvollständiger Kontext, schwache Verankerung in Quellen, mehrdeutige Prompts, verzerrte Daten und unvalidierte Tool-Ausgaben. Ein Angreifer kann Fehlinformation auch gezielt herbeiführen.
Bei keinem anderen Eintrag lagen Abstimmung und Belege so weit auseinander: Die Abstimmenden setzten ihn weit nach unten, die Vorfallsdaten weit nach oben, und 2026 stieg er um zwei Plätze. Der Grund: Modellausgaben tun heute etwas anderes. Sie informieren nicht mehr nur einen Leser, sondern steuern Tool-Aufrufe, leiten den Systemzustand ab, autorisieren Aktionen und koordinieren Agenten. So wird aus einer falschen Antwort eine falsche Aktion, und das übermäßige Vertrauen, das sie gefährlich macht, ist oft schon im Design des Systems angelegt.
Ein Multi-Agenten-System verstärkt das, weil die Erfindung eines Agenten routinemäßig zur vertrauten Eingabe eines anderen wird. Ein nachgelagerter Agent kann eine geprüfte Tatsache nicht von einer vorgelagerten Halluzination unterscheiden, solange die Pipeline das nicht ausdrücklich prüft — genau die Ausbreitung, die Cascading Hallucination Attacks beschreibt.
Arten
- Unbelegte Entscheidungsgrundlagen
- Falsche oder unbelegte Behauptungen beeinflussen eine geschäftliche, rechtliche, medizinische oder finanzielle Entscheidung.
- Falsch abgeleiteter Zustand
- Das Modell schließt, eine Bedingung sei erfüllt, obwohl sie es nicht ist, und eine unbeabsichtigte Aktion folgt.
- Irreführende Zusammenfassungen und Auslassungen
- Eine Zusammenfassung lässt eine Einschränkung, eine Ausnahme oder ein Risiko weg, das der Leser brauchte, um sicher zu handeln.
- Ausbreitung über Agenten hinweg
- Eine falsche Ausgabe wandert über Agenten und Workflows und gilt bei jedem Schritt als gesicherte Tatsache.
- Erfundener Code und erfundene Abhängigkeiten
- Das Modell verweist auf ein nicht existierendes Paket oder erzeugt fehlerhaften Code; die Folgen für die Lieferkette gehören zu LLM04, die Ausführung unsicheren Codes zu LLM10.
Angriffsszenarien
Ein Recherche-Agent erfindet ein plausibel klingendes Zitat, und ein nachgelagerter Zusammenfassungs-Agent gibt es im Abschlussbericht ohne unabhängige Prüfung als Fakt wieder.
Blindes Vertrauen zwischen Agenten
Ein Retrieval-Agent meldet einen Kunden als identitätsgeprüft, obwohl er es nicht ist. Ein nachgelagerter Zahlungs-Agent vertraut diesem Zustand und gibt Geld frei.
Erfundener Abschluss einer Aufgabe
Ein Agent meldet, das nächtliche Datenbank-Backup sei abgeschlossen, obwohl es nie lief. Eine spätere Wiederherstellung scheitert, weil es kein Backup gibt.
Präparierte Forenantwort
Ein Angreifer platziert in einem Support-Forum falsche Lösungsschritte. Ein Troubleshooting-Agent ruft sie ab und gibt sie als vertrauenswürdige Empfehlung weiter.
Weitergereichtes erfundenes Zitat
Ein Recherche-Agent erfindet ein plausibel klingendes Zitat, und ein nachgelagerter Zusammenfassungs-Agent gibt es ohne unabhängige Prüfung als Fakt wieder.
Abwehrmaßnahmen
- Behaupten, prüfen, dann handeln
- Erzeugung und Ausführung trennen und eine Behauptung an einer maßgeblichen, aktuellen Quelle prüfen, bevor ein Tool-Aufruf oder eine Zustandsänderung davon abhängt.
- Tool-Aufrufe am echten Zustand prüfen
- Argumente, Autorisierung und Vorbedingungen gegen das führende System (System of Record) prüfen, nicht gegen den Bericht des Modells selbst.
- Prüfsignale statt Selbstsicherheit nutzen
- Verankerung in Quellen und Konsistenz mit LLM-as-Judge bewerten und thematische Drift mit Statistical Guardrails erkennen.
- Vollständigkeit erzwingen und testen
- Strukturierte Ausgaben mit Pflichtfeldern verlangen, damit Auslassungen sichtbar werden, und erfundene Behauptungen und Zustände mit Integration Tests for Agents abdecken.