Misinformation
- Ausgabe / Aktion
Das Modell erzeugt falsche oder irreführende Inhalte, die sicher und autoritativ wirken und denen Nutzer oder nachgelagerte Systeme ohne unabhängige Prüfung vertrauen.
Was es ist
Fehlinformation ist falsche oder irreführende Modellausgabe, die überzeugend und glaubwürdig wirkt. Ihre Hauptursache ist Halluzination — das Modell füllt Lücken in seinen Trainingsdaten mit statistisch plausiblem Inhalt statt mit verifizierten Fakten —, aber auch verzerrte oder unvollständige Trainingsdaten tragen dazu bei. Das Risiko wird durch Übermäßige Abhängigkeit verstärkt: Wenn eine Person oder ein nachgelagertes System generiertem Inhalt ohne unabhängige Prüfung vertraut, wird die selbstsicher falsche Antwort eines Modells zu einer realen Entscheidung auf falscher Grundlage — sei diese Entscheidung ein juristischer Schriftsatz, ein medizinischer Ratschlag oder eine in Produktionscode übernommene Abhängigkeit. Ein Multi-Agenten-System verstärkt dies weiter, weil die Erfindung eines Agenten routinemäßig zur vertrauten Eingabe eines anderen wird: Ein nachgelagerter Agent kann eine verifizierte Tatsache nicht von einer vorgelagerten Halluzination unterscheiden, sofern die Pipeline nicht explizit danach prüft — Fehlinformation verbreitet und verstärkt sich so über einen Workflow hinweg, genau wie es Cascading Hallucination Attacks beschreibt.
Arten
- Sachliche Ungenauigkeiten
- Das Modell stellt etwas Falsches dar, als wäre es gesicherte Tatsache, und eine Person oder ein nachgelagerter Prozess handelt danach.
- Unbelegte Behauptungen
- Das Modell behauptet etwas ohne jede Grundlage — besonders schädlich in sensiblen Bereichen wie Gesundheit oder Recht, wo eine unbelegte Behauptung für verifizierte Anleitung gehalten werden kann.
- Falschdarstellung von Fachwissen
- Das Modell vermittelt unbegründetes Vertrauen oder falsche Unsicherheit zu einem Thema — und täuscht die Person darüber, wie gesichert die zugrundeliegende Antwort tatsächlich ist.
- Unsichere Code- oder Paketvorschläge
- Das Modell empfiehlt eine nicht existierende oder unsichere Bibliothek, die direkt ausnutzbar wird, sobald eine entwickelnde Person dem Vorschlag vertraut und sie integriert.
Angriffsszenarien
Ein Recherche-Agent erfindet ein plausibel klingendes Zitat, und ein nachgelagerter Zusammenfassungs-Agent gibt es im Abschlussbericht ohne unabhängige Prüfung als Fakt wieder.
Angriff über halluzinierte Pakete
Angreifende identifizieren Bibliotheksnamen, die Coding-Assistenten häufig halluzinieren, und veröffentlichen dann bösartige Pakete unter diesen Namen — jede Pipeline, die der vorgeschlagenen Abhängigkeit des Modells ohne Prüfung vertraut, übernimmt den Payload.
Unverifizierte nachgelagerte Wiederholung
Ein Recherche-Agent erfindet ein plausibel klingendes Zitat, und ein nachgelagerter Zusammenfassungs-Agent gibt es im Abschlussbericht ohne unabhängige Prüfung als Fakt wieder.
Selbstsicher falsche Antwort in einem folgenschweren Bereich
Ein Chatbot, der Gesundheits- oder Rechtsfragen beantwortet, äußert eine unbelegte Behauptung mit selbstsicherem Ton, und der darauf aufgebaute Prozess handelt ohne Prüfung, was echten Schaden verursacht, bevor jemand den Fehler bemerkt.
Abwehrmaßnahmen
- Ausgaben anhand einer Bewertungsrubrik einstufen
- Nutzen Sie LLM-as-Judge, um generierte Behauptungen oder Zitate gegen eine definierte Rubrik zu prüfen, bevor die Ausgabe nachgelagert vertraut wird, statt einen selbstsicheren Ton als Näherung für Korrektheit zu akzeptieren.
- Thematische Drift statistisch erkennen
- Statistical Guardrails markieren Antworten, deren Inhalt von abgerufenen oder verifizierten Quellen abweicht, und decken so wahrscheinliche Erfindungen auf, bevor sie eine Nutzerin erreichen.
- Antworten in verifiziertem Retrieval verankern
- Nutzen Sie Retrieval-Augmented Generation über eine verifizierte Quelle und verlangen Sie vom Modell, das Abgerufene zu zitieren, statt sich bei sachlichen Behauptungen auf ungestütztes Erinnern zu verlassen.
- Diese Fehlerklasse mit Tests abdecken
- Integration Tests for Agents, die gezielt nach erfundenen Zitaten oder Fakten suchen, da diese Fehlerklasse in gewöhnlichen Funktionstests nicht zuverlässig sichtbar wird.