Data and Model Poisoning

Angriffsfläche
  • Memory / Zustand
  • Tools & externe Daten

Daten oder Modellartefakte werden dauerhaft verfälscht — im Training, beim Fine-Tuning, in Embeddings, in Retrieval-Korpora oder bei der Verteilung —, sodass das System weiter funktionsfähig wirkt, sich aber so verhält, wie ein Angreifer es will.

Was es ist

Data and Model Poisoning verfälscht den Lernprozess eines Systems, nicht einen einzelnen Laufzeitpfad: Pre-Training-, Fine-Tuning- oder Embedding-Daten — oder ein Modellartefakt selbst — werden manipuliert, um eine Verzerrung, eine Schwachstelle oder eine Hintertür einzubringen, absichtlich oder durch mangelnde Datenhygiene. Weil das Modell die falschen Muster lernt, hilft selten ein Code-Patch. Oft müssen die Daten neu validiert, das Modell neu trainiert oder ersetzt werden.

Zwei Befunde prägen den Eintrag 2026. Größe schützt nicht: Schon 250 vergiftete Dokumente kompromittierten Modelle von 600 Millionen bis 13 Milliarden Parametern, unabhängig von der Größe des Datensatzes. Und Sicherheitstraining entfernt nicht, was Poisoning eingepflanzt hat: Eine Hintertür schlummert, bis ihr Auslöser eintritt — ein Sleeper Agent, dem gewöhnliche Evaluierung nie begegnet. Der Eintrag umfasst jetzt auch das Unterlaufen von Fine-Tuning: gezielte Daten, die das Ablehnungsverhalten aushöhlen, während die allgemeine Genauigkeit erhalten bleibt.

Die Abgrenzung ist ausdrücklich: Dieser Eintrag behandelt dauerhafte Verfälschung. Anweisungen, die zur Inferenzzeit über abgerufene Inhalte ankommen, gehören zu Prompt Injection (LLM01), Angriffe auf die Geometrie des Embedding-Raums zu Vector and Embedding Weaknesses (LLM09). Ein Multi-Agenten-System erhöht die Tragweite, denn einen geteilten Retrieval-Index, eine geteilte Memory-Schicht oder eine Feedback-Schleife, die auf Agenten-Interaktionen nachtrainiert, liest jeder Agent, der sich darauf verlässt.

Arten

Vergiftung von Training und Fine-Tuning
Verzerrte oder bösartige Beispiele gelangen in Pre-Training- oder Fine-Tuning-Daten — auch gezielte Daten, die Ablehnungen aushöhlen, ohne die Genauigkeit zu verschlechtern.
Vergiftung von Retrieval und Memory
Ein gefälschtes Dokument in einer geteilten Wissensdatenbank oder Anweisungen, die über mehrere Sitzungen ins Agenten-Memory geschrieben wurden, gelten für jeden späteren Leser als gesicherte Wahrheit.
Einbringen einer Hintertür
Eine Auslösephrase wird dem Modell antrainiert, sodass sein Verhalten normal bleibt, bis der Auslöser erscheint — schwer zu erkennen, weil gewöhnliche Evaluierung dem Auslöser nie begegnet.
Vergiftete Inferenz-Artefakte
Ein Chat-Template, eine Tokenizer-Konfiguration, ein Adapter oder ein Quantisierungsartefakt, das über einen öffentlichen Hub weiterverbreitet wird, enthält Anweisungen, die ein Auslöser aktiviert, oder Code, der beim Laden läuft.

Angriffsszenarien

In einem Multi-Agenten-System

Ein Angreifer platziert in einer von mehreren Agenten geteilten Wissensdatenbank ein subtil verfälschtes Richtliniendokument, sodass jeder Agent, der daraus abruft, dieselbe falsche Antwort übernimmt.

Vergiftung einer geteilten Wissensdatenbank

Ein böswilliger Akteur platziert subtil gefälschte Dokumente in einer Wissensdatenbank, die mehrere Agenten teilen; jeder Agent, der daraus abruft, übernimmt und wiederholt dieselbe falsche Antwort.

Drift durch die Retraining-Schleife

Ein Angreifer speist über eine gewöhnliche Nutzeroberfläche gezielt gestaltete Eingaben in eine automatische Retraining-Schleife ein und lenkt das Modell so langsam zu verzerrten oder unsicheren Empfehlungen.

Trojanisiertes Chat-Template

Ein Angreifer versieht das Chat-Template eines Modells mit Anweisungen, die ein Auslöser aktiviert. Über einen öffentlichen Hub weiterverbreitet, verhält sich das Modell normal, bis der Auslöser erscheint.

Dauerhafte Übernahme des Memory

Ein Angreifer schleust über mehrere Sitzungen Anweisungen in das persistente Memory eines Agenten ein, bis der Agent vorrangig der Logik des Angreifers folgt.

Abwehrmaßnahmen

Herkunft nachverfolgen und Integrität prüfen
Die Herkunft von Datensätzen und Modellen in einer Stückliste (Bill of Materials) festhalten, Artefakte signieren und Chat-Templates, Tokenizer-Konfigurationen und Adapter als sicherheitsrelevanten Code behandeln.
Memory partitionieren und mit Berechtigungen eingrenzen
Retrieval-Speicher per Semantic / Vector / Graph Memory partitionieren, sodass ein vergifteter Eintrag in einer Partition keine Anfragen eines fremden Agenten oder Mandanten beantworten kann.
Geteilte Speicher und Feedback-Schleifen validieren
Alles, was in einen geteilten Index gelangt, mit dem Integrator prüfen und automatisches Retraining unter menschliche Aufsicht und Ratenlimits stellen.
Auf Drift überwachen, nach Auslösern suchen
Trainingsverlust und Live-Ausgaben auf die Anomalien beobachten, für die Statistical Guardrails gebaut sind, und nach jedem Alignment-Zyklus per Red-Teaming nach Hintertür-Auslösern suchen, statt anzunehmen, das Sicherheitstraining habe sie entfernt.

Sicherheit

Wohin als Nächstes

Suche

Patterns, Frameworks und Seiten durchsuchen.