/security/data-and-model-poisoning/

LLM04

Data and Model Poisoning

Angriffsfläche
  • Memory / Zustand
  • Tools & externe Daten

Trainings-, Fine-Tuning- oder Embedding-Daten werden korrumpiert — absichtlich oder über eine kompromittierte Quelle —, sodass die Ausgaben des Modells oder ein Retrieval-Index auf eine vom Angreifer kontrollierte Weise unzuverlässig werden.

Was es ist

Data Poisoning korrumpiert ein Modell auf der Datenebene — Pre-Training-, Fine-Tuning- oder Embedding-Daten werden manipuliert, um eine Verzerrung, eine Schwachstelle oder eine regelrechte Hintertür einzubringen. Da die Manipulation von Trainingsdaten verändert, was das Modell zu vorhersagen lernt, handelt es sich um einen Integritätsangriff, der am schwersten zu erkennen ist, wenn er auf eine Hintertür abzielt: Das Verhalten des Modells bleibt normal, bis ein bestimmter Auslöser eintritt — es entsteht faktisch ein Sleeper Agent, den gewöhnliche Tests nie zu Gesicht bekommen. Ein Multi-Agenten-System erhöht den Einsatz, weil vergiftete Daten selten auf eine einzelne Konsumentin beschränkt bleiben — ein geteilter Retrieval-Index oder eine Wissensdatenbank wird konstruktionsbedingt von jedem Agenten gelesen, der ihn abfragt, sodass ein einziges gefälschtes Dokument dieselbe falsche Antwort im gesamten System verbreitet, statt eine isolierte Antwort zu bleiben.

Arten

Vergiftung von Trainingsdaten
Angreifende schleusen schädliche oder verzerrte Beispiele direkt in Pre-Training- oder Fine-Tuning-Daten ein und nutzen dabei aus, wie Trainingspipelines Daten im Zeitverlauf aufnehmen und gewichten.
Vergiftung von Retrieval / Embeddings
Ein in einer geteilten Wissensdatenbank oder einem Vektorindex platziertes gefälschtes Dokument wird von jedem abfragenden Agenten abgerufen und als gesicherte Wahrheit behandelt, ohne dass die Fälschung je die Gewichte des Modells selbst berührt.
Einbringen einer Hintertür
Eine Auslösephrase oder ein Auslösemuster wird dem Modell antrainiert, sodass sein Verhalten normal bleibt, bis dieser Auslöser erscheint — dann führt es die von Angreifenden beabsichtigte Abweichung aus, schwer zu erkennen, weil gewöhnliche Evaluierung den Auslöser nie zu Gesicht bekommt.

Angriffsszenarien

In einem Multi-Agenten-System

Ein Angreifer platziert in einer von mehreren Agenten geteilten Wissensdatenbank ein subtil verfälschtes Richtliniendokument, sodass jeder Agent, der daraus abruft, dieselbe falsche Antwort übernimmt.

Verzerrte Ausgaben durch manipulierte Trainingsdaten

Angreifende verzerren die Ausgaben eines Modells, indem sie dessen Trainingsdaten manipulieren, und verbreiten so Fehlinformationen, als wären sie eine gewöhnliche Antwort.

Gefälschte geteilte Dokumente

Böswillige Akteure platzieren in einer von mehreren Agenten geteilten Wissensdatenbank subtil gefälschte Dokumente; jeder Agent, der daraus abruft, übernimmt und wiederholt dieselbe falsche Antwort.

Toxische Daten ohne Filterung

Ungefilterte toxische Trainingsdaten verbreiten schädliche oder verzerrte Inhalte in den Ausgaben des Modells, ohne dass eine einzelne offensichtlich bösartige Eingabe dies anzeigt.

Einbringen eines Hintertür-Auslösers

Angreifende vergiften Trainingsdaten, um einen Hintertür-Auslöser einzubringen, der später zur Umgehung der Authentifizierung, zur Datenexfiltration oder zur Ausführung versteckter Befehle ausgenutzt werden kann, sobald der Auslöser in einem Live-Prompt erscheint.

Abwehrmaßnahmen

Herkunft nachverfolgen und Daten verifizieren
Verfolgen Sie die Herkunft der Daten und jede Transformation mit einem Stücklisten-Ansatz, und validieren Sie die Legitimität in jeder Phase der Modell- oder Index-Entwicklung, statt einer vorgelagerten Quelle standardmäßig zu vertrauen.
Memory partitionieren und mit Berechtigungen eingrenzen
Partitionieren Sie Retrieval-Speicher per Semantic / Vector / Graph Memory, sodass ein vergifteter Eintrag in einer Partition nicht still die Anfragen eines fremden Agenten oder Mandanten beantworten kann.
Aufgenommene Inhalte validieren
Prüfen Sie alles, was in einen geteilten Index oder Trainingssatz gelangt, mit dem Integrator, bevor es akzeptiert wird, und fangen Sie manipulierte oder unverifizierte Inhalte an der Grenze ab, statt erst nachdem sie sich bereits verbreitet haben.
Auf Drift überwachen
Beobachten Sie Trainingsverlust und Live-Ausgaben auf die anomalen Muster, die Statistical Guardrails erkennen sollen — Poisoning, das das Verhalten allmählich verändert, ist für eine einmalige Stichprobenprüfung unsichtbar.

Sicherheit

Wohin als Nächstes

Suche

Patterns, Frameworks und Seiten durchsuchen.