Vector and Embedding Weaknesses
- Memory / Zustand
- Tools & externe Daten
Die Vektor-Speicher und Embedding-Pipelines hinter dem Retrieval werden ausgenutzt — vergiftete Embeddings, mandantenübergreifendes Leck in einem geteilten Index oder feindliche Eingaben, die die Ähnlichkeitssuche manipulieren —, um eine RAG-Pipeline zu kompromittieren.
Was es ist
Retrieval-Augmented Generation fügt eine vom Modell selbst unabhängige Vektorspeicher-Angriffsfläche hinzu: Wie Embeddings erzeugt, gespeichert und abgerufen werden, kann ausgenutzt werden, um vertrauliche Inhalte preiszugeben, das, was das Modell als gesicherte Wahrheit behandelt, zu vergiften oder die Ähnlichkeitssuche zu manipulieren, sodass sie das falsche Dokument liefert. Abgerufene Inhalte gelten typischerweise als vertrauenswürdiger als offene Nutzereingaben, gerade weil sie aus einem kuratierten Index stammen — genau das macht Schwachstellen in diesem Index gefährlich: Sie umgehen Abwehrmaßnahmen, die den Prompt prüfen sollen, nicht den Retrieval-Schritt, der ihn speist. Ein Multi-Agenten-System, das einen einzigen Vektorindex über mehrere Agenten oder Mandanten hinweg teilt, vervielfacht sowohl die Vergiftungsfläche (Data and Model Poisoning, LLM04) als auch die Offenlegungsfläche: Alles, was die Ingestion-Pipeline eines Agenten einbettet, wird für jede andere Abfrage gegen diesen Index abrufbar, sofern der Zugriff nicht explizit partitioniert ist — ein nicht eingegrenzter geteilter Speicher ist damit der Standardweg sowohl zu mandantenübergreifendem Datenleck als auch zu stiller, systemweiter Vergiftung.
Arten
- Unbefugter Zugriff & Datenleck
- Unzureichende Zugriffskontrollen auf den Vektorspeicher lassen eine Abfrage Embeddings oder Quelldokumente abrufen, die die anfragende Person nie sehen sollte.
- Mandanten-/kontextübergreifendes Datenleck
- Ein von mehreren Mandanten oder Nutzerklassen geteilter Vektorindex lässt Inhalte eines Mandanten in den Abfrageergebnissen eines anderen auftauchen, ohne logische Trennung zwischen ihnen.
- Embedding-Inversion
- Angreifende rekonstruieren substanziellen Quellinhalt aus dessen Embedding-Vektor und widerlegen damit die Annahme, ein Embedding sei eine sichere, nicht umkehrbare Darstellung des zugrundeliegenden Texts.
- Vergiftetes oder widersprüchliches Retrieval
- Ein böswillig platziertes Dokument wird abgerufen und als gesicherte Wahrheit behandelt, oder abgerufener Inhalt widerspricht schlicht dem, was das Modell im Training bereits gelernt hat — beides führt zu unvorhersagbarer Ausgabe.
Angriffsszenarien
In einem mandantenübergreifenden Support-System rankt das platzierte Dokument eines Mandanten hoch für die themenfremde Anfrage eines anderen Mandanten und lässt so mandantenfremde Inhalte in die Antwort einfließen.
Vergiftung durch versteckten Text im Lebenslauf
Angreifende reichen einen Lebenslauf ein, der in weißem Text auf weißem Hintergrund versteckte Anweisungen enthält; eine RAG-basierte Screening-Pipeline nimmt ihn ungefiltert auf und folgt später bei einer Anfrage zum Kandidaten der versteckten Anweisung.
Mandantenübergreifendes Embedding-Leck
In einer geteilten mandantenfähigen Vektordatenbank rankt das platzierte oder gewöhnliche Dokument eines Mandanten hoch für die themenfremde Anfrage eines anderen Mandanten und lässt so mandantenübergreifende Geschäftsinformationen in die Antwort einfließen.
Embedding-Inversionsangriff
Angreifende gewinnen erheblichen Quellinhalt zurück, indem sie vom Retrieval-System extrahierte oder offengelegte Embedding-Vektoren invertieren, und kompromittieren so Daten, von denen angenommen wurde, dass der Vektorspeicher sie undurchsichtig hält.
Abwehrmaßnahmen
- Berechtigungsbewusste, partitionierte Speicher
- Implementieren Sie feingranulare Zugriffskontrolle und strikte logische Partitionierung pro Mandant oder Agent in der Vektordatenbank, per Semantic / Vector / Graph Memory — ein nicht partitionierter geteilter Index ist die Grundursache mandantenübergreifender Lecks.
- Vor der Aufnahme validieren
- Führen Sie jedes Dokument durch eine Validierungs-Pipeline, die auf versteckte oder bösartige Inhalte prüft und nur vertrauenswürdige, verifizierte Quellen akzeptiert, bevor es in den Index gelangt — die Rolle des Integrators für Retrieval, nicht nur für Tool-Ergebnisse.
- Kombinierte Datensätze prüfen und klassifizieren
- Kennzeichnen und klassifizieren Sie Inhalte beim Zusammenführen von Daten aus verschiedenen Quellen, sodass Zugriffsebenen mit den Daten mitwandern, statt in einen undifferenzierten Pool zu verschmelzen.
- Retrieval-Aktivität überwachen
- Führen Sie unveränderliche Protokolle darüber, was von wem abgerufen wurde, sodass ein verdächtiges Zugriffsmuster erkennbar ist statt im normalen Abfrageverkehr unsichtbar zu bleiben.