Unbounded Consumption
- Eingabe / Prompt
- Tools & externe Daten
Die Anwendung erlaubt übermäßigen oder unkontrollierten Ressourcenverbrauch — Inferenzaufrufe, Eingabe-, Ausgabe- und Reasoning-Tokens, Tool-Aufrufe — und ermöglicht so Denial-of-Service, ausufernde Kosten oder Modellextraktion.
Was es ist
Unbegrenzter Verbrauch ist jedes Design, das übermäßige oder unkontrollierte LLM-Inferenz zulässt, ohne dass je ein Limit greift — bei Anfragevolumen, Ein- oder Ausgabegröße oder Rechenkosten. Er umfasst Denial-of-Service, Denial-of-Wallet durch ausufernde nutzungsbasierte Kosten und Modellextraktion, bei der ein Angreifer genug Eingabe-/Ausgabe-Paare sammelt, um das Verhalten des Modells zu klonen.
Kennzeichnend ist die Kostenasymmetrie: Ein Angreifer löst teure Berechnungen aus, die ihn selbst fast nichts kosten. Der Eintrag stieg 2026 um vier Plätze, weil diese Asymmetrie weiter wächst — durch Reasoning-Modelle mit locker begrenztem Denkbudget, multimodale Eingaben, die sich zu vielen Tokens aufblähen, und Tool-Protokolle wie MCP, die aus einer Anfrage eine Kaskade nachgelagerter Operationen machen. Die Anfragerate allein zu begrenzen reicht nicht mehr.
Ein Multi-Agenten-System vervielfacht die Wege, auf denen ein einzelnes Ereignis unbegrenzt wird. Agenten, die Aufrufe wiederholen, neu delegieren oder sich gegenseitig erneut abfragen, können aus einem vorübergehenden Fehler ein unbegrenztes Fan-out von Inferenzaufrufen machen. Und eine langlebige Sitzung, die ihren wachsenden Kontext in jeder Gesprächsrunde neu verarbeitet, bleibt unter jedem Limit pro Anfrage, während ihre Gesamtkosten steigen.
Arten
- Fluten und Denial-of-Wallet
- Fluten von Eingaben variabler Länge oder ein hohes Anfragevolumen erschöpfen die Kapazität oder treiben eine untragbare nutzungsbasierte Rechnung in die Höhe.
- Erschöpfung durch Reasoning-Schleifen
- Kurze, harmlos wirkende Prompts treiben ein Reasoning-Modell in langes oder endloses Nachdenken und umgehen damit Filter für die Eingabegröße vollständig.
- Agent-Tool-Schleifen und Fan-out
- Ein bösartiges oder schlecht entworfenes Tool treibt einen Agenten in rekursive Aufrufe, oder eine einzige Aufgabe erzeugt Hunderte Tool-Aufrufe.
- Modellextraktion
- Systematisches Abfragen, beschleunigt durch offengelegte Log-Wahrscheinlichkeiten, sammelt genug Ausgaben, um ein funktional gleichwertiges Gegenstück zum Zielmodell zu trainieren.
Angriffsszenarien
Eine Gruppe von Agenten fragt sich nach einem vorübergehenden Tool-Fehler autonom gegenseitig in einer Retry-Schleife erneut ab und vervielfacht so einen einzelnen fehlgeschlagenen Aufruf zu einem Kostenspitzenwert, bevor eine Budgetprüfung greift.
Anfrageflut
Ein Angreifer schickt eine große Menge Anfragen an die LLM-API und erschöpft die Rechenressourcen, bis der Dienst für legitime Nutzer nicht mehr verfügbar ist.
Rekursives Tool aus einem Repository
Ein Angreifer veröffentlicht ein Tool — etwa als Skill in einem Open-Source-Repository —, das jeden Agenten, der es nutzt, zu rekursiven Aufgaben anweist. Jeder Entwickler, der es übernimmt, erbt so einen ausufernden Token-Verbrauch.
Retry-Sturm der Agenten
Eine Gruppe von Agenten fragt sich nach einem vorübergehenden Tool-Fehler selbstständig gegenseitig erneut ab und vervielfacht so einen einzigen fehlgeschlagenen Aufruf zu einer Kostenspitze, bevor eine Budgetprüfung sie abfängt.
Funktionale Modellreplikation
Ein Angreifer nutzt die API-Ausgaben des Zielmodells als synthetische Trainingsdaten und feintunt damit ein separates Modell zu einem funktional gleichwertigen Gegenstück.
Abwehrmaßnahmen
- Durchläufe mit einem harten Kill-Switch begrenzen
- Token / Cost Tracking setzt pro API-Schlüssel, Nutzer und Durchlauf eine nicht übersteuerbare Obergrenze für Ausgaben und Aufrufzahl, die die Inferenz stoppt — keine Warnung, die eine schnelle Last überholt.
- Jeden Agenten mit Circuit Breakern absichern
- Schrittlimits, Grenzen für die Rekursionstiefe, Zeitlimits und Kostenobergrenzen pro Durchlauf durchsetzen und Schleifen erkennen, indem der Zustand gehasht wird — die Disziplin, die das Anti-Pattern Hallucinated Routing and Unbounded Loops beschreibt.
- Nach Tokens begrenzen, nicht nur nach Anfragen
- Tokens pro Minute und geschätzte Kosten pro Anfrage begrenzen und übergroße Eingaben mit einer Token-Schätzung zurückweisen, bevor die Inferenz beginnt.
- Tool-Interaktionen überwachen
- Das normale Verhalten von Tools als Basislinie erfassen und Sitzungen markieren, deren Verbrauch davon abweicht, ohne dass ein klarer Endzustand erkennbar ist.