Unbounded Consumption
- Eingabe / Prompt
- Tools & externe Daten
Die Anwendung erlaubt exzessiven oder unkontrollierten Ressourcenverbrauch — Inferenzaufrufe, Token-Volumen, Tool-Aufrufe — und ermöglicht so Denial-of-Service, außer Kontrolle geratene Kosten oder Missbrauch zur Modellextraktion.
Was es ist
Unbegrenzter Verbrauch ist jedes Anwendungsdesign, das exzessive oder unkontrollierte LLM-Inferenz zulässt, ohne dass je eine Grenze greift — bei Anfragevolumen, Eingabegröße oder Rechenkosten. Er umfasst Denial-of-Service durch Ressourcenerschöpfung, Denial-of-Wallet durch außer Kontrolle geratene nutzungsbasierte Kosten und Modellextraktion, bei der Angreifende genügend Eingabe-/Ausgabe-Paare abfragen, um das Verhalten des Modells zu klonen oder zu rekonstruieren. Die hohen Rechenkosten von LLM-Inferenz, insbesondere in Cloud-Deployments, machen alle drei Varianten für Angreifende wirtschaftlich attraktiv, selbst wenn keine einzelne Anfrage offensichtlich bösartig wirkt. Ein Multi-Agenten-System vervielfacht die Wege, auf denen ein einzelnes auslösendes Ereignis zu unbegrenztem Verbrauch wird: Agenten, die sich nach einem Fehlschlag gegenseitig erneut abfragen, neu delegieren oder erneut anfragen, können einen einzelnen vorübergehenden Fehler in ein unbegrenztes Fan-out von Inferenzaufrufen verwandeln, sofern nicht jede Schleife ein eigenes Rekursionslimit und eigene Abbruchkriterien trägt — unabhängig davon, ob ein einzelner Agent sein eigenes Budget im Blick behält.
Arten
- Volumetrisches Fluten
- Flutartige Eingaben variabler Länge oder ein hohes Volumen wiederholter Anfragen erschöpfen die Verarbeitungskapazität oder treiben Denial-of-Wallet-Kosten in die Höhe und nutzen dabei die nutzungsbasierte Preisgestaltung der meisten Cloud-LLM-Dienste aus.
- Ressourcenintensive Abfragen
- Eingaben, die gezielt die rechenintensivsten Pfade des Modells auslösen oder fortlaufend sein Kontextfenster überschreiten, verschlechtern den Dienst für alle anderen Nutzenden.
- Modellextraktion über API
- Systematisches Abfragen mit sorgfältig gestalteten Eingaben sammelt genügend Eingabe-/Ausgabe-Paare, um ein Schattenmodell zu trainieren, das das Verhalten des Zielmodells repliziert.
- Seitenkanal-Extraktion
- Das Ausloten offengelegter Logits, Logprobs oder des Eingabe-Filterverhaltens legt Modellinterna — Gewichte oder Architektur — offen, über das hinaus, was eine gewöhnliche Antwort preisgeben soll.
Angriffsszenarien
Eine Gruppe von Agenten fragt sich nach einem vorübergehenden Tool-Fehler autonom gegenseitig in einer Retry-Schleife erneut ab und vervielfacht so einen einzelnen fehlgeschlagenen Aufruf zu einem Kostenspitzenwert, bevor eine Budgetprüfung greift.
Flut wiederholter Anfragen
Angreifende übermitteln ein hohes Volumen an Anfragen an die LLM-API und erschöpfen die Rechenressourcen, bis der Dienst für legitime Nutzende nicht mehr verfügbar ist.
Denial-of-Wallet
Angreifende erzeugen exzessive Vorgänge gegen einen nutzungsbasiert abgerechneten Cloud-KI-Dienst und treiben so untragbare Kosten für den Anbieter in die Höhe, bevor eine Budgetprüfung greift.
Kostenspitze durch Retry-Schleife
Eine Gruppe von Agenten fragt sich nach einem vorübergehenden Tool-Fehler autonom gegenseitig in einer Retry-Schleife erneut ab und vervielfacht so einen einzelnen fehlgeschlagenen Aufruf zu einem Kostenspitzenwert, bevor eine Budgetprüfung greift.
Modellreplikation über synthetische Daten
Angreifende nutzen die eigene API-Ausgabe des Zielmodells, um synthetische Trainingsdaten zu erzeugen, und feintunen damit ein separates Modell zu einem funktionalen Äquivalent — vorbei an einfacheren, abfragezahlbasierten Extraktionsabwehrmaßnahmen.
Abwehrmaßnahmen
- Durchläufe mit einem harten Budget-Kill-Switch begrenzen
- Token / Cost Tracking erzwingt eine Obergrenze für Ausgaben und Aufrufzahl pro Durchlauf, unabhängig davon, was ein einzelner Agent über sein eigenes Budget glaubt.
- Rekursionslimits und Abbruchkriterien durchsetzen
- Wenden Sie die im Anti-Pattern Hallucinated Routing / Unbounded Loop genannte Disziplin an, damit eine Retry- oder Neudelegations-Schleife nach einem vorübergehenden Fehler nicht unbegrenzt fan-outen kann.
- Rate begrenzen und Eingabegröße validieren
- Begrenzen Sie das Anfragevolumen pro Quelle und weisen Sie übergroße Eingaben zurück, bevor sie das Modell erreichen — das schließt die einfachsten Flut- und Kontextüberlauf-Vektoren.
- Nutzungsmuster überwachen und protokollieren
- Fortlaufende Protokollierung des Ressourcenverbrauchs macht aus einem sich langsam aufbauenden Extraktions- oder Denial-of-Wallet-Versuch eine erkennbare Anomalie statt einer unsichtbaren Kostenzeile.