Sensitive Information Disclosure
- Ausgabe / Aktion
- Memory / Zustand
Vertrauliche Daten verlassen das System über einen Kanal, den niemand freigegeben hat — die Antwort, aber auch ein Tool-Argument, eine Reasoning-Trace, ein Log, ein Embedding oder eine messbare Eigenschaft der Inferenz.
Was es ist
Die Offenlegung sensibler Informationen umfasst jeden vertraulichen Inhalt, den ein LLM-gestütztes System über einen Kanal preisgibt, den er nicht passieren sollte — personenbezogene und Gesundheitsdaten, Zugangsdaten, Geschäftsgeheimnisse, Modellgewichte. Dieser Kanal ist nicht nur die Antwort. Tool-Argumente, Reasoning-Traces, abgerufene Chunks, Logs, Telemetrie, Embeddings und messbare Eigenschaften wie Token-Länge oder Latenz sind ebenfalls Wege der Offenlegung. Für sie sollten dieselben Regeln zur Klassifizierung und Schwärzung gelten.
Zwei strukturelle Fehler verursachen die meisten Vorfälle. Der erste ist zu freigiebiges Teilen an der Quelle: Nicht eingegrenzte Laufwerke und veraltete Berechtigungen füllen einen Retrieval-Index mit Daten, die das Modell dann genau wie vorgesehen abruft. Die Lösung liegt also bei den Daten, nicht beim Modell. Der zweite ist Persistenz: Haben Daten einmal Gewichte, Embeddings oder Adapter beeinflusst, bleiben sie extrahierbar, auch wenn die Quelle gelöscht ist.
Ein Multi-Agenten-System vergrößert die Angriffsfläche mit jeder Ebene, die es hinzufügt: Memory, das über Sitzungen oder Mandanten hinweg geteilt wird, ein Retrieval-Index, den mehrere Agenten befüllen, Übergaben, die rohen Kontext weiterreichen, und eine gemeinsame Observability-Pipeline, die standardmäßig die Prompts und Traces jedes Agenten protokolliert.
Arten
- Beim Training
- Ein Modell, ein Fine-Tune oder ein LoRA-Adapter memoriert Inhalte des Korpus und gibt sie später wieder; eng gefasste Adapter memorieren seltene Beispiele besonders originalgetreu.
- Bei der Inferenz
- Das Modell legt aktuellen Kontext offen — den System Prompt, abgerufene Chunks, Dateien, Tool-Ausgaben, Memory, die Daten einer anderen Sitzung —, oft weil eine Zusammenfassung oder Extraktion mehr zutage fördert als gefragt.
- In der Pipeline
- Fine-Tuning, Destillation, die Erzeugung synthetischer Daten und Observability-Tools übertragen sensible Daten in abgeleitete Artefakte.
- Durch Beobachtung
- Ein Angreifer schließt aus Token-Länge, Latenz, Log-Wahrscheinlichkeiten oder Cache-Treffern auf Fakten, ohne je Inhalte zu erhalten.
Angriffsszenarien
Ein Support-Agent mit mandantenübergreifend geteiltem Memory gibt beim Beantworten der Frage eines Kunden die Kontodaten eines anderen Kunden preis.
Memorierte Daten in großem Umfang
Divergenz-Prompts bringen ein Produktivmodell dazu, memorierte personenbezogene Daten und gültige Zugangsdaten in großem Umfang auszugeben.
Traces im Monitoring-Tool
Extended-Thinking-Traces werden wörtlich in ein geteiltes Monitoring-Projekt geloggt. So sehen Hunderte Entwickler abgerufene personenbezogene Daten, während die sichtbare Antwort bereinigt bleibt.
Mandantenübergreifendes Retrieval
Ein Retrieval-Index, den eine Anwaltskanzlei für alle ihre Mandanten teilt, baut die vertrauliche Strategie eines Mandanten in die Antwort für einen anderen ein.
„Nur Embeddings“-Backup
Ein geleaktes Vektor-Backup wird zunächst als geringes Risiko eingestuft. Sobald die Vektoren wieder in Text zurückverwandelt sind, gilt es als Datenleck der Quelldokumente.
Abwehrmaßnahmen
- Minimieren, was in den Kontext gelangt
- Korpora bei der Aufnahme klassifizieren und bereinigen und an einen externen Anbieter nur die Felder senden, die eine Aufgabe benötigt.
- Vor dem Retrieval autorisieren
- Autorisierung auf Dokument- und Chunk-Ebene innerhalb der Index-Abfrage durchsetzen, nie als Filter nach dem Retrieval, gemäß Semantic / Vector / Graph Memory und Least Privilege Agent.
- Jeden Kanal als Ausgabe behandeln
- Reasoning-Traces und Tool-Argumente wie die finale Antwort klassifizieren und schwärzen, Antworten mit Output Validation / Schema Enforcement prüfen und trainierte Klassifikatoren einsetzen — reguläre Ausdrücke allein scheitern an kodierter und sprachübergreifender Ausgabe.
- Protokollieren, was welche Grenze überschritten hat
- Offenlegungspfade im Audit Trail festhalten und Traces bereinigen, bevor sie eine uneingeschränkt zugängliche Observability-Plattform erreichen.