/security/vector-and-embedding-weaknesses/

LLM08

Vector and Embedding Weaknesses

Angriffsfläche
  • Memory / Zustand
  • Tools & externe Daten

Die Vektor-Speicher und Embedding-Pipelines hinter dem Retrieval werden ausgenutzt — vergiftete Embeddings, mandantenübergreifendes Leck in einem geteilten Index oder feindliche Eingaben, die die Ähnlichkeitssuche manipulieren —, um eine RAG-Pipeline zu kompromittieren.

Was es ist

Retrieval-Augmented Generation fügt eine vom Modell selbst unabhängige Vektorspeicher-Angriffsfläche hinzu: Wie Embeddings erzeugt, gespeichert und abgerufen werden, kann ausgenutzt werden, um vertrauliche Inhalte preiszugeben, das, was das Modell als gesicherte Wahrheit behandelt, zu vergiften oder die Ähnlichkeitssuche zu manipulieren, sodass sie das falsche Dokument liefert. Abgerufene Inhalte gelten typischerweise als vertrauenswürdiger als offene Nutzereingaben, gerade weil sie aus einem kuratierten Index stammen — genau das macht Schwachstellen in diesem Index gefährlich: Sie umgehen Abwehrmaßnahmen, die den Prompt prüfen sollen, nicht den Retrieval-Schritt, der ihn speist. Ein Multi-Agenten-System, das einen einzigen Vektorindex über mehrere Agenten oder Mandanten hinweg teilt, vervielfacht sowohl die Vergiftungsfläche (Data and Model Poisoning, LLM04) als auch die Offenlegungsfläche: Alles, was die Ingestion-Pipeline eines Agenten einbettet, wird für jede andere Abfrage gegen diesen Index abrufbar, sofern der Zugriff nicht explizit partitioniert ist — ein nicht eingegrenzter geteilter Speicher ist damit der Standardweg sowohl zu mandantenübergreifendem Datenleck als auch zu stiller, systemweiter Vergiftung.

Arten

Unbefugter Zugriff & Datenleck
Unzureichende Zugriffskontrollen auf den Vektorspeicher lassen eine Abfrage Embeddings oder Quelldokumente abrufen, die die anfragende Person nie sehen sollte.
Mandanten-/kontextübergreifendes Datenleck
Ein von mehreren Mandanten oder Nutzerklassen geteilter Vektorindex lässt Inhalte eines Mandanten in den Abfrageergebnissen eines anderen auftauchen, ohne logische Trennung zwischen ihnen.
Embedding-Inversion
Angreifende rekonstruieren substanziellen Quellinhalt aus dessen Embedding-Vektor und widerlegen damit die Annahme, ein Embedding sei eine sichere, nicht umkehrbare Darstellung des zugrundeliegenden Texts.
Vergiftetes oder widersprüchliches Retrieval
Ein böswillig platziertes Dokument wird abgerufen und als gesicherte Wahrheit behandelt, oder abgerufener Inhalt widerspricht schlicht dem, was das Modell im Training bereits gelernt hat — beides führt zu unvorhersagbarer Ausgabe.

Angriffsszenarien

In einem Multi-Agenten-System

In einem mandantenübergreifenden Support-System rankt das platzierte Dokument eines Mandanten hoch für die themenfremde Anfrage eines anderen Mandanten und lässt so mandantenfremde Inhalte in die Antwort einfließen.

Vergiftung durch versteckten Text im Lebenslauf

Angreifende reichen einen Lebenslauf ein, der in weißem Text auf weißem Hintergrund versteckte Anweisungen enthält; eine RAG-basierte Screening-Pipeline nimmt ihn ungefiltert auf und folgt später bei einer Anfrage zum Kandidaten der versteckten Anweisung.

Mandantenübergreifendes Embedding-Leck

In einer geteilten mandantenfähigen Vektordatenbank rankt das platzierte oder gewöhnliche Dokument eines Mandanten hoch für die themenfremde Anfrage eines anderen Mandanten und lässt so mandantenübergreifende Geschäftsinformationen in die Antwort einfließen.

Embedding-Inversionsangriff

Angreifende gewinnen erheblichen Quellinhalt zurück, indem sie vom Retrieval-System extrahierte oder offengelegte Embedding-Vektoren invertieren, und kompromittieren so Daten, von denen angenommen wurde, dass der Vektorspeicher sie undurchsichtig hält.

Abwehrmaßnahmen

Berechtigungsbewusste, partitionierte Speicher
Implementieren Sie feingranulare Zugriffskontrolle und strikte logische Partitionierung pro Mandant oder Agent in der Vektordatenbank, per Semantic / Vector / Graph Memory — ein nicht partitionierter geteilter Index ist die Grundursache mandantenübergreifender Lecks.
Vor der Aufnahme validieren
Führen Sie jedes Dokument durch eine Validierungs-Pipeline, die auf versteckte oder bösartige Inhalte prüft und nur vertrauenswürdige, verifizierte Quellen akzeptiert, bevor es in den Index gelangt — die Rolle des Integrators für Retrieval, nicht nur für Tool-Ergebnisse.
Kombinierte Datensätze prüfen und klassifizieren
Kennzeichnen und klassifizieren Sie Inhalte beim Zusammenführen von Daten aus verschiedenen Quellen, sodass Zugriffsebenen mit den Daten mitwandern, statt in einen undifferenzierten Pool zu verschmelzen.
Retrieval-Aktivität überwachen
Führen Sie unveränderliche Protokolle darüber, was von wem abgerufen wurde, sodass ein verdächtiges Zugriffsmuster erkennbar ist statt im normalen Abfrageverkehr unsichtbar zu bleiben.

Sicherheit

Wohin als Nächstes

Suche

Patterns, Frameworks und Seiten durchsuchen.