Sicherheit — die Angriffsfläche eines Multi-Agenten-Systems.

Wie Multi-Agenten-Systeme angegriffen werden und welche Abwehrmaßnahmen welche Lücke schließen. Zwei OWASP-Kataloge — die LLM Top 10 und die Agentic Threats — abgebildet auf die Guardrails, das Least-Privilege-Prinzip und die menschlichen Freigaben, die dieses Projekt bereits dokumentiert — dazu die vorläufigen Agentic Skills Top 10 für die Skill-Schicht.

5
Angriffsflächen
27
Bedrohungen
2
OWASP-Kataloge
10
ASI-Patterns

Sechs Risiken, die bei einem MAS zu berücksichtigen sind

Das Hinzufügen von Agenten vergrößert die Angriffsfläche nicht linear. Mehrere der folgenden Risiken entstehen erst, wenn Agenten koordinieren, und jedes davon treibt die Kosten einer einzelnen Kompromittierung weit über das hinaus, was ein einzelner LLM-Aufruf je offenlegen könnte.

  • 01

    Schadensradius

    Ein einzelner LLM-Aufruf scheitert isoliert. Ein kompromittierter Agent kann seinen verfälschten Zustand an jeden Agenten weitergeben, der seiner Ausgabe vertraut, ohne sie erneut zu prüfen — eine einzige ausgenutzte Übergabe kaskadiert so zu einem systemweiten Ausfall.

  • 02

    Kollusion zwischen Agenten

    Zwei oder mehr kompromittierte oder subtil fehlausgerichtete Agenten können koordinieren — über geteiltes Memory, verhandelte Protokollnachrichten oder wiederholte Interaktion —, um eine Entscheidung so zu manipulieren, dass die Ausgabe keines einzelnen Agenten als anomal auffiele.

  • 03

    Identitätswucherung

    Ein Agent braucht eine Identität. Ein Dutzend Agenten, jeder mit eigenen Tool-Zugangsdaten und delegierten Berechtigungen, macht Identitäts- und Zugriffsmanagement zu einem kombinatorischen Problem — jede zusätzliche Identität ist ein weiteres Zugangsdatum, das gefälscht oder überprovisioniert werden kann.

  • 04

    Koordinationsausfälle in dynamischen Umgebungen

    Die Routing-, Abstimmungs- oder Konsenslogik, die es Agenten erlaubt, sich an veränderte Bedingungen anzupassen, wird selten gegen adversariale Bedingungen getestet und kann zusammenbrechen — oder zum Zusammenbruch getrieben werden —, sobald ein Angreifer einen Teil dieser Variabilität kontrolliert.

  • 05

    Lücken in Entscheidungsherkunft & Auditierbarkeit

    Kein einzelner Agent besitzt die vollständige Reasoning-Trace hinter einer Multi-Agenten-Entscheidung, sodass die Rekonstruktion, warum das System gehandelt hat, bedeutet, partielle, unterschiedlich geformte Traces von jedem beteiligten Agenten zusammenzusetzen.

  • 06

    Man-in-the-Middle auf Agent-zu-Agent-Kanälen

    Die Nachrichten, die Agenten austauschen — Übergaben, Blackboard-Schreibzugriffe, verhandelte Abstimmungen — laufen über einen Kanal, den eine Single-LLM-Anwendung nie hat, und ein Angreifer, der ihn abfängt oder verändert, verfälscht, was ein Agent glaubt, dass ein anderer gesagt hat.

DIE KARTE

Alle 27 Bedrohungen, verortet auf der Architektur.

Bevor der Index sie auflistet, zeigt die Bedrohungskarte, wo jede Bedrohung eintritt — von der untrusted Eingabe über die Agent-Runtime bis zur ausgelösten Aktion. Zeiger über eine Bedrohung bewegen, um ihre Verortung und ihre weiteren Angriffsflächen zu sehen.

☁ Untrusted mediumNutzer & AngreiferPrompts + Kontext aus nicht vertrauenswürdiger Quelle. CRUD-Operationen.
☁ Untrusted mediumExterne DatenquellenWeb, Dokumente, Drittanbieter-APIs, geteilte Repos & Modell-Registries — grounding, retrieval & Lieferkette aus dem offenen Internet.
TB · Ingress
01Eingabe6
Nutzer-Prompts & aufgenommene untrusted-Inhalte
API-Gateway
Auth · Rate-Limit · Routing
Input-Guardrail
Prompt-Guard · Schema-Check
Bedrohungen an dieser Fläche
TB01 · Agent-Runtime
02Agent-Runtime6
Supervisor delegiert an Spezialisten & führt zusammen
Supervisor / Orchestrator
plant · delegiert · führt zusammen
A2A · Message BusAgent #2
Worker · Execution Loop · Input → Output (NL / Media)
PlanningActionTool / Function-Calling
LLM Model · Function-Calling
augmented model
Blackboard / Shared State
geteilter Arbeitszustand
Bedrohungen der Inter-Agent-Fläche
TB02 · Wissensspeicher
03Memory3
Kurz- & Langzeit-Zustand, auf den die Agenten sich stützen
Working Memory
Scratchpad · Task-State
Vektor-Store (RAG)
Long-Term · Retrieval
Bedrohungen an dieser Fläche
TB03 · Tool-Ebene
04Tools & Dienste6
Fähigkeiten, die die Agenten aufrufen & ihre Lieferkette
Tool Registry
entdecken · binden
MCP-Server
externe Tool-Provider
Sandbox Execution
isolierte Code-Ausführung
Bedrohungen an dieser Fläche
TB · Aktion & Aufsicht
05Ausgabe6
Erzeugte Ausgabe, ausgelöste Aktion & die Aufsicht darüber
Output-Guardrail
LLM-as-Judge · Validation
HITL Gate
menschliche Freigabe
Audit Trail
Logging · Distributed Tracing
Bedrohungen an dieser Fläche
OWASP LLM Top 10OWASP Agentic Threats (T1–T17)Vertrauensgrenze (Trust Boundary)Untrusted medium●● = berührt weitere Angriffsflächen
Der Index

27 Bedrohungen, nach Angriffsfläche geordnet.

Statt zweier getrennter Kataloge sind hier alle Einträge der OWASP LLM Top 10 und der Agentic Threats (T1–T17) unter der Achse einsortiert, an der sie eintreten. Bedrohungen mit mehreren Flächen erscheinen mehrfach — das Herkunfts-Tag (LLM / Agentic) und die weiteren Flächen bleiben an jeder Zeile.

01

Eingabe / Prompt

6 Bedrohungen

Alles, was das System liest — Nutzer-Prompts und nicht vertrauenswürdige Inhalte, die ein Agent aufnimmt —, wo Injection eindringt.

02

Memory / Zustand

6 Bedrohungen

Persistenter Zustand und abgerufener Kontext, wo vergiftetes Memory jede spätere Entscheidung verzerrt.

03

Tools & externe Daten

11 Bedrohungen

Die Tools und externen Daten, die ein Agent aufruft, wo Missbrauch und vergiftete Ergebnisse Reichweite in Risiko verwandeln.

04

Agent-zu-Agent-Kommunikation

10 Bedrohungen

Nachrichten zwischen Agenten, wo ein vergifteter oder gefälschter Peer eine Kompromittierung durch das gesamte System trägt.

05

Ausgabe / Aktion

11 Bedrohungen

Was das System ausgibt oder auslöst, wo unvalidierte Ausgaben und übermäßige Autonomie realen Schaden verursachen.

Die Skill-Schicht

OWASP Agentic Skills Top 10

Zwischen einem Agenten und seinen Tools liegt die Skill-Schicht: gepackte Anweisungsdateien und Skripte, die ein Agent lädt, um einen Arbeitsablauf auszuführen. MCP legt fest, wie das Modell mit Tools spricht; ein Skill legt fest, was der Agent damit tut. Skills liegen auf den Angriffsflächen Tools und Eingabe von oben, und eine dritte, noch vorläufige OWASP-Liste beschreibt ihre Risiken. Jedes Risiko verweist auf die Patterns, die davor schützen, und auf die Bedrohungen, zu denen es gehört.

EntwurfEin OWASP-Incubator-Projekt; Version 1.0 ist noch in öffentlicher Begutachtung. Hier als Entwurf aufgeführt — die Zuordnung zu Schutzmaßnahmen und Bedrohungen stammt von diesem Projekt.

RisikoSchweregradGeschützt durchVerwandte Bedrohungen
AST01Malicious SkillsEin scheinbar legitimer Skill versteckt Schadcode — in seinen Skripten oder im Anweisungstext — und führt ihn mit den Rechten des Agenten aus.KritischTool Registry, Sandbox ExecutionT17 Supply Chain Compromise, LLM04 Supply Chain
AST02Supply Chain CompromiseRegistries ohne Herkunftsnachweis erlauben Massen-Uploads, übernommene Maintainer-Konten, vergiftete verschachtelte Abhängigkeiten oder Konfigurationsdateien im Repository, die Code ausführen.KritischTool Registry, Audit TrailT17 Supply Chain Compromise, LLM04 Supply Chain
AST03Over-Privileged SkillsEin Skill hat mehr Zugriff auf Dateien, Netzwerk, Shell oder Zugangsdaten, als seine Funktion braucht. Eine eingeschleuste Anweisung kann dann Rechte nutzen, die die Aufgabe nie gebraucht hat.HochLeast Privilege Agent, Permission-scoped ToolsT3 Privilege Compromise, LLM03 Excessive Agency
AST04Insecure MetadataName, Beschreibung, angegebene Rechte und Risikostufe kontrolliert der Angreifer, und kaum jemand prüft sie: Ein Skill gibt sich als bekannte Marke aus, spielt herunter, was er tut, oder nutzt beim Laden einen unsicheren Parser aus.HochTool Registry, Output Validation / Schema EnforcementT9 Identity Spoofing & Impersonation, T17 Supply Chain Compromise
AST05Untrusted External InstructionsEin Skill verweist den Agenten auf externe Dokumentation, die erst zur Laufzeit geladen wird. Dieser Text wird Teil der Anweisungen und kann sich nach der Prüfung ändern.HochIntegrator, Tool RegistryLLM01 Prompt Injection, T17 Supply Chain Compromise
AST06Weak IsolationSkills laufen im Sicherheitskontext des Agenten — mit vollem Zugriff auf Dateisystem, Shell und Netzwerk —, weil eine Sandbox fehlt oder standardmäßig aus ist.HochSandbox Execution, Least Privilege AgentT11 Unexpected RCE and Code Attacks
AST07Update DriftInstallierte Skills sind weder auf eine Version festgelegt noch werden Updates geprüft. Bekannt verwundbare Versionen bleiben im Einsatz, oder ein bösartiger „Patch“ kommt unbemerkt an.MittelTool RegistryT17 Supply Chain Compromise, LLM04 Supply Chain
AST08Poor ScanningCode-Scanner übersehen Schadcode, der als Anweisung in normaler Sprache geschrieben ist. Scanner mit einem LLM als Prüfer lassen sich selbst per Prompt Injection täuschen.MittelLLM-as-Judge, Multimodal GuardrailsT6 Intent Breaking & Goal Manipulation
AST09No GovernanceFür installierte Skills gibt es kein Inventar, keine Freigabe, keinen Audit-Trail und keinen Widerruf. Eine Kompromittierung wird weder erkannt noch eingedämmt.MittelAudit Trail, Least Privilege AgentT8 Repudiation & Untraceability
AST10Cross-Platform ReuseWird ein Skill auf eine andere Agentenplattform übertragen, gehen Sicherheitsangaben — Rechte, Risikostufe, Signatur — still verloren, weil das Zielformat sie nicht kennt.MittelTool RegistryT17 Supply Chain Compromise

OWASP Agentic Skills Top 10 lesen →

Agentische KI-Patterns

Das gemeinsame Vokabular der OWASP Agentic Security Initiative für Threat-Modeling-Gespräche. Jedes bildet auf ein Pattern ab, das dieses Projekt bereits ausführlich behandelt.

  • Reflective Agent

    Agenten, die ihre eigenen Ausgaben iterativ bewerten und kritisieren, um die Leistung zu verbessern.

    KI-Codegeneratoren, die ihre eigenen Ausgaben überprüfen und debuggen, wie Codex mit Selbstbewertung.

    Entspricht: Reflexion →
  • Task-Oriented Agent

    Agenten, die für die Bearbeitung spezifischer Aufgaben mit klaren Zielen entwickelt wurden.

    Automatisierte Kundenservice-Agenten für Terminplanung oder Retourenabwicklung.

    Entspricht: ReAct →
  • Hierarchical Agent

    Agenten, die hierarchisch organisiert sind und mehrstufige Workflows oder verteilte Steuerungssysteme verwalten.

    Projektmanagementsysteme, in denen übergeordnete Agenten die Aufgabendelegation überwachen.

    Entspricht: Hierarchical Supervisor →
  • Coordinating Agent

    Agenten, die Zusammenarbeit, Koordination und Nachverfolgung ermöglichen und so eine effiziente Ausführung sicherstellen.

    Ein Koordinator weist Spezialisten Teilaufgaben zu — in einem KI-gestützten DevOps-Workflow plant einer die Deployments, ein anderer überwacht die Performance, ein dritter übernimmt Rollbacks.

    Entspricht: Orchestrator-Workers →
  • Distributed Agent Ecosystem

    Agenten interagieren innerhalb eines dezentralen Ökosystems, häufig im IoT- oder Marktplatzkontext.

    Autonome IoT-Agenten, die Smart-Home-Geräte verwalten, oder ein Marktplatz mit Käufer- und Verkäufer-Agenten.

    Entspricht: Swarm / Contract-Net →
  • Human-in-the-Loop Collaboration

    Agenten arbeiten halbautonom unter menschlicher Aufsicht.

    KI-gestützte Diagnosetools, die Empfehlungen geben, die endgültige Entscheidung aber Ärztinnen und Ärzten überlassen.

    Entspricht: HITL Gate →
  • Self-Learning and Adaptive Agents

    Agenten passen sich durch kontinuierliches Lernen aus Interaktionen und Feedback an.

    Co-Piloten, die sich im Laufe der Zeit an Nutzerinteraktionen anpassen und aus Feedback lernen.

    Entspricht: Skill-Build / Reflector →
  • RAG-Based Agent

    Agenten nutzen Retrieval-Augmented Generation, um dynamisch auf externe Wissensquellen zuzugreifen.

    Agenten, die für Recherche-Unterstützung in Echtzeit im Web browsen.

    Entspricht: Agentic RAG →
  • Planning Agent

    Agenten entwickeln und führen eigenständig mehrstufige Pläne aus, um komplexe Ziele zu erreichen.

    Task-Management-Systeme, die Aufgaben nach Nutzerzielen organisieren und priorisieren.

    Entspricht: Plan-and-Execute →
  • Context-Aware Agent

    Agenten passen ihr Verhalten und ihre Entscheidungsfindung dynamisch an den Kontext an, in dem sie operieren.

    Smart-Home-Systeme, die Einstellungen basierend auf Nutzerpräferenzen anpassen.

    Entspricht: Virtual Context Management →

Suche

Patterns, Frameworks und Seiten durchsuchen.