Misinformation

Angriffsfläche
  • Ausgabe / Aktion
  • Agent-zu-Agent-Kommunikation

Das Modell erzeugt falsche, unvollständige oder irreführende Inhalte, die glaubwürdig genug wirken, um eine menschliche Entscheidung, einen automatisierten Workflow oder die Aktion eines Agenten zu steuern.

Was es ist

Fehlinformation ist falsche oder irreführende Ausgabe, die glaubwürdig wirkt — und das Kernrisiko besteht darin, dass man ihr vertraut und danach handelt. Zu den Ursachen gehören Halluzination, veralteter oder unvollständiger Kontext, schwache Verankerung in Quellen, mehrdeutige Prompts, verzerrte Daten und unvalidierte Tool-Ausgaben. Ein Angreifer kann Fehlinformation auch gezielt herbeiführen.

Bei keinem anderen Eintrag lagen Abstimmung und Belege so weit auseinander: Die Abstimmenden setzten ihn weit nach unten, die Vorfallsdaten weit nach oben, und 2026 stieg er um zwei Plätze. Der Grund: Modellausgaben tun heute etwas anderes. Sie informieren nicht mehr nur einen Leser, sondern steuern Tool-Aufrufe, leiten den Systemzustand ab, autorisieren Aktionen und koordinieren Agenten. So wird aus einer falschen Antwort eine falsche Aktion, und das übermäßige Vertrauen, das sie gefährlich macht, ist oft schon im Design des Systems angelegt.

Ein Multi-Agenten-System verstärkt das, weil die Erfindung eines Agenten routinemäßig zur vertrauten Eingabe eines anderen wird. Ein nachgelagerter Agent kann eine geprüfte Tatsache nicht von einer vorgelagerten Halluzination unterscheiden, solange die Pipeline das nicht ausdrücklich prüft — genau die Ausbreitung, die Cascading Hallucination Attacks beschreibt.

Arten

Unbelegte Entscheidungsgrundlagen
Falsche oder unbelegte Behauptungen beeinflussen eine geschäftliche, rechtliche, medizinische oder finanzielle Entscheidung.
Falsch abgeleiteter Zustand
Das Modell schließt, eine Bedingung sei erfüllt, obwohl sie es nicht ist, und eine unbeabsichtigte Aktion folgt.
Irreführende Zusammenfassungen und Auslassungen
Eine Zusammenfassung lässt eine Einschränkung, eine Ausnahme oder ein Risiko weg, das der Leser brauchte, um sicher zu handeln.
Ausbreitung über Agenten hinweg
Eine falsche Ausgabe wandert über Agenten und Workflows und gilt bei jedem Schritt als gesicherte Tatsache.
Erfundener Code und erfundene Abhängigkeiten
Das Modell verweist auf ein nicht existierendes Paket oder erzeugt fehlerhaften Code; die Folgen für die Lieferkette gehören zu LLM04, die Ausführung unsicheren Codes zu LLM10.

Angriffsszenarien

In einem Multi-Agenten-System

Ein Recherche-Agent erfindet ein plausibel klingendes Zitat, und ein nachgelagerter Zusammenfassungs-Agent gibt es im Abschlussbericht ohne unabhängige Prüfung als Fakt wieder.

Blindes Vertrauen zwischen Agenten

Ein Retrieval-Agent meldet einen Kunden als identitätsgeprüft, obwohl er es nicht ist. Ein nachgelagerter Zahlungs-Agent vertraut diesem Zustand und gibt Geld frei.

Erfundener Abschluss einer Aufgabe

Ein Agent meldet, das nächtliche Datenbank-Backup sei abgeschlossen, obwohl es nie lief. Eine spätere Wiederherstellung scheitert, weil es kein Backup gibt.

Präparierte Forenantwort

Ein Angreifer platziert in einem Support-Forum falsche Lösungsschritte. Ein Troubleshooting-Agent ruft sie ab und gibt sie als vertrauenswürdige Empfehlung weiter.

Weitergereichtes erfundenes Zitat

Ein Recherche-Agent erfindet ein plausibel klingendes Zitat, und ein nachgelagerter Zusammenfassungs-Agent gibt es ohne unabhängige Prüfung als Fakt wieder.

Abwehrmaßnahmen

Behaupten, prüfen, dann handeln
Erzeugung und Ausführung trennen und eine Behauptung an einer maßgeblichen, aktuellen Quelle prüfen, bevor ein Tool-Aufruf oder eine Zustandsänderung davon abhängt.
Tool-Aufrufe am echten Zustand prüfen
Argumente, Autorisierung und Vorbedingungen gegen das führende System (System of Record) prüfen, nicht gegen den Bericht des Modells selbst.
Prüfsignale statt Selbstsicherheit nutzen
Verankerung in Quellen und Konsistenz mit LLM-as-Judge bewerten und thematische Drift mit Statistical Guardrails erkennen.
Vollständigkeit erzwingen und testen
Strukturierte Ausgaben mit Pflichtfeldern verlangen, damit Auslassungen sichtbar werden, und erfundene Behauptungen und Zustände mit Integration Tests for Agents abdecken.

Sicherheit

Wohin als Nächstes

Suche

Patterns, Frameworks und Seiten durchsuchen.