/security/misinformation/

LLM09

Misinformation

Angriffsfläche
  • Ausgabe / Aktion

Das Modell erzeugt falsche oder irreführende Inhalte, die sicher und autoritativ wirken und denen Nutzer oder nachgelagerte Systeme ohne unabhängige Prüfung vertrauen.

Was es ist

Fehlinformation ist falsche oder irreführende Modellausgabe, die überzeugend und glaubwürdig wirkt. Ihre Hauptursache ist Halluzination — das Modell füllt Lücken in seinen Trainingsdaten mit statistisch plausiblem Inhalt statt mit verifizierten Fakten —, aber auch verzerrte oder unvollständige Trainingsdaten tragen dazu bei. Das Risiko wird durch Übermäßige Abhängigkeit verstärkt: Wenn eine Person oder ein nachgelagertes System generiertem Inhalt ohne unabhängige Prüfung vertraut, wird die selbstsicher falsche Antwort eines Modells zu einer realen Entscheidung auf falscher Grundlage — sei diese Entscheidung ein juristischer Schriftsatz, ein medizinischer Ratschlag oder eine in Produktionscode übernommene Abhängigkeit. Ein Multi-Agenten-System verstärkt dies weiter, weil die Erfindung eines Agenten routinemäßig zur vertrauten Eingabe eines anderen wird: Ein nachgelagerter Agent kann eine verifizierte Tatsache nicht von einer vorgelagerten Halluzination unterscheiden, sofern die Pipeline nicht explizit danach prüft — Fehlinformation verbreitet und verstärkt sich so über einen Workflow hinweg, genau wie es Cascading Hallucination Attacks beschreibt.

Arten

Sachliche Ungenauigkeiten
Das Modell stellt etwas Falsches dar, als wäre es gesicherte Tatsache, und eine Person oder ein nachgelagerter Prozess handelt danach.
Unbelegte Behauptungen
Das Modell behauptet etwas ohne jede Grundlage — besonders schädlich in sensiblen Bereichen wie Gesundheit oder Recht, wo eine unbelegte Behauptung für verifizierte Anleitung gehalten werden kann.
Falschdarstellung von Fachwissen
Das Modell vermittelt unbegründetes Vertrauen oder falsche Unsicherheit zu einem Thema — und täuscht die Person darüber, wie gesichert die zugrundeliegende Antwort tatsächlich ist.
Unsichere Code- oder Paketvorschläge
Das Modell empfiehlt eine nicht existierende oder unsichere Bibliothek, die direkt ausnutzbar wird, sobald eine entwickelnde Person dem Vorschlag vertraut und sie integriert.

Angriffsszenarien

In einem Multi-Agenten-System

Ein Recherche-Agent erfindet ein plausibel klingendes Zitat, und ein nachgelagerter Zusammenfassungs-Agent gibt es im Abschlussbericht ohne unabhängige Prüfung als Fakt wieder.

Angriff über halluzinierte Pakete

Angreifende identifizieren Bibliotheksnamen, die Coding-Assistenten häufig halluzinieren, und veröffentlichen dann bösartige Pakete unter diesen Namen — jede Pipeline, die der vorgeschlagenen Abhängigkeit des Modells ohne Prüfung vertraut, übernimmt den Payload.

Unverifizierte nachgelagerte Wiederholung

Ein Recherche-Agent erfindet ein plausibel klingendes Zitat, und ein nachgelagerter Zusammenfassungs-Agent gibt es im Abschlussbericht ohne unabhängige Prüfung als Fakt wieder.

Selbstsicher falsche Antwort in einem folgenschweren Bereich

Ein Chatbot, der Gesundheits- oder Rechtsfragen beantwortet, äußert eine unbelegte Behauptung mit selbstsicherem Ton, und der darauf aufgebaute Prozess handelt ohne Prüfung, was echten Schaden verursacht, bevor jemand den Fehler bemerkt.

Abwehrmaßnahmen

Ausgaben anhand einer Bewertungsrubrik einstufen
Nutzen Sie LLM-as-Judge, um generierte Behauptungen oder Zitate gegen eine definierte Rubrik zu prüfen, bevor die Ausgabe nachgelagert vertraut wird, statt einen selbstsicheren Ton als Näherung für Korrektheit zu akzeptieren.
Thematische Drift statistisch erkennen
Statistical Guardrails markieren Antworten, deren Inhalt von abgerufenen oder verifizierten Quellen abweicht, und decken so wahrscheinliche Erfindungen auf, bevor sie eine Nutzerin erreichen.
Antworten in verifiziertem Retrieval verankern
Nutzen Sie Retrieval-Augmented Generation über eine verifizierte Quelle und verlangen Sie vom Modell, das Abgerufene zu zitieren, statt sich bei sachlichen Behauptungen auf ungestütztes Erinnern zu verlassen.
Diese Fehlerklasse mit Tests abdecken
Integration Tests for Agents, die gezielt nach erfundenen Zitaten oder Fakten suchen, da diese Fehlerklasse in gewöhnlichen Funktionstests nicht zuverlässig sichtbar wird.

Sicherheit

Wohin als Nächstes

Suche

Patterns, Frameworks und Seiten durchsuchen.