Unbounded Consumption

Angriffsfläche
  • Eingabe / Prompt
  • Tools & externe Daten

Die Anwendung erlaubt übermäßigen oder unkontrollierten Ressourcenverbrauch — Inferenzaufrufe, Eingabe-, Ausgabe- und Reasoning-Tokens, Tool-Aufrufe — und ermöglicht so Denial-of-Service, ausufernde Kosten oder Modellextraktion.

Was es ist

Unbegrenzter Verbrauch ist jedes Design, das übermäßige oder unkontrollierte LLM-Inferenz zulässt, ohne dass je ein Limit greift — bei Anfragevolumen, Ein- oder Ausgabegröße oder Rechenkosten. Er umfasst Denial-of-Service, Denial-of-Wallet durch ausufernde nutzungsbasierte Kosten und Modellextraktion, bei der ein Angreifer genug Eingabe-/Ausgabe-Paare sammelt, um das Verhalten des Modells zu klonen.

Kennzeichnend ist die Kostenasymmetrie: Ein Angreifer löst teure Berechnungen aus, die ihn selbst fast nichts kosten. Der Eintrag stieg 2026 um vier Plätze, weil diese Asymmetrie weiter wächst — durch Reasoning-Modelle mit locker begrenztem Denkbudget, multimodale Eingaben, die sich zu vielen Tokens aufblähen, und Tool-Protokolle wie MCP, die aus einer Anfrage eine Kaskade nachgelagerter Operationen machen. Die Anfragerate allein zu begrenzen reicht nicht mehr.

Ein Multi-Agenten-System vervielfacht die Wege, auf denen ein einzelnes Ereignis unbegrenzt wird. Agenten, die Aufrufe wiederholen, neu delegieren oder sich gegenseitig erneut abfragen, können aus einem vorübergehenden Fehler ein unbegrenztes Fan-out von Inferenzaufrufen machen. Und eine langlebige Sitzung, die ihren wachsenden Kontext in jeder Gesprächsrunde neu verarbeitet, bleibt unter jedem Limit pro Anfrage, während ihre Gesamtkosten steigen.

Arten

Fluten und Denial-of-Wallet
Fluten von Eingaben variabler Länge oder ein hohes Anfragevolumen erschöpfen die Kapazität oder treiben eine untragbare nutzungsbasierte Rechnung in die Höhe.
Erschöpfung durch Reasoning-Schleifen
Kurze, harmlos wirkende Prompts treiben ein Reasoning-Modell in langes oder endloses Nachdenken und umgehen damit Filter für die Eingabegröße vollständig.
Agent-Tool-Schleifen und Fan-out
Ein bösartiges oder schlecht entworfenes Tool treibt einen Agenten in rekursive Aufrufe, oder eine einzige Aufgabe erzeugt Hunderte Tool-Aufrufe.
Modellextraktion
Systematisches Abfragen, beschleunigt durch offengelegte Log-Wahrscheinlichkeiten, sammelt genug Ausgaben, um ein funktional gleichwertiges Gegenstück zum Zielmodell zu trainieren.

Angriffsszenarien

In einem Multi-Agenten-System

Eine Gruppe von Agenten fragt sich nach einem vorübergehenden Tool-Fehler autonom gegenseitig in einer Retry-Schleife erneut ab und vervielfacht so einen einzelnen fehlgeschlagenen Aufruf zu einem Kostenspitzenwert, bevor eine Budgetprüfung greift.

Anfrageflut

Ein Angreifer schickt eine große Menge Anfragen an die LLM-API und erschöpft die Rechenressourcen, bis der Dienst für legitime Nutzer nicht mehr verfügbar ist.

Rekursives Tool aus einem Repository

Ein Angreifer veröffentlicht ein Tool — etwa als Skill in einem Open-Source-Repository —, das jeden Agenten, der es nutzt, zu rekursiven Aufgaben anweist. Jeder Entwickler, der es übernimmt, erbt so einen ausufernden Token-Verbrauch.

Retry-Sturm der Agenten

Eine Gruppe von Agenten fragt sich nach einem vorübergehenden Tool-Fehler selbstständig gegenseitig erneut ab und vervielfacht so einen einzigen fehlgeschlagenen Aufruf zu einer Kostenspitze, bevor eine Budgetprüfung sie abfängt.

Funktionale Modellreplikation

Ein Angreifer nutzt die API-Ausgaben des Zielmodells als synthetische Trainingsdaten und feintunt damit ein separates Modell zu einem funktional gleichwertigen Gegenstück.

Abwehrmaßnahmen

Durchläufe mit einem harten Kill-Switch begrenzen
Token / Cost Tracking setzt pro API-Schlüssel, Nutzer und Durchlauf eine nicht übersteuerbare Obergrenze für Ausgaben und Aufrufzahl, die die Inferenz stoppt — keine Warnung, die eine schnelle Last überholt.
Jeden Agenten mit Circuit Breakern absichern
Schrittlimits, Grenzen für die Rekursionstiefe, Zeitlimits und Kostenobergrenzen pro Durchlauf durchsetzen und Schleifen erkennen, indem der Zustand gehasht wird — die Disziplin, die das Anti-Pattern Hallucinated Routing and Unbounded Loops beschreibt.
Nach Tokens begrenzen, nicht nur nach Anfragen
Tokens pro Minute und geschätzte Kosten pro Anfrage begrenzen und übergroße Eingaben mit einer Token-Schätzung zurückweisen, bevor die Inferenz beginnt.
Tool-Interaktionen überwachen
Das normale Verhalten von Tools als Basislinie erfassen und Sitzungen markieren, deren Verbrauch davon abweicht, ohne dass ein klarer Endzustand erkennbar ist.

Sicherheit

Wohin als Nächstes

Suche

Patterns, Frameworks und Seiten durchsuchen.