/security/unbounded-consumption/

LLM10

Unbounded Consumption

Angriffsfläche
  • Eingabe / Prompt
  • Tools & externe Daten

Die Anwendung erlaubt exzessiven oder unkontrollierten Ressourcenverbrauch — Inferenzaufrufe, Token-Volumen, Tool-Aufrufe — und ermöglicht so Denial-of-Service, außer Kontrolle geratene Kosten oder Missbrauch zur Modellextraktion.

Was es ist

Unbegrenzter Verbrauch ist jedes Anwendungsdesign, das exzessive oder unkontrollierte LLM-Inferenz zulässt, ohne dass je eine Grenze greift — bei Anfragevolumen, Eingabegröße oder Rechenkosten. Er umfasst Denial-of-Service durch Ressourcenerschöpfung, Denial-of-Wallet durch außer Kontrolle geratene nutzungsbasierte Kosten und Modellextraktion, bei der Angreifende genügend Eingabe-/Ausgabe-Paare abfragen, um das Verhalten des Modells zu klonen oder zu rekonstruieren. Die hohen Rechenkosten von LLM-Inferenz, insbesondere in Cloud-Deployments, machen alle drei Varianten für Angreifende wirtschaftlich attraktiv, selbst wenn keine einzelne Anfrage offensichtlich bösartig wirkt. Ein Multi-Agenten-System vervielfacht die Wege, auf denen ein einzelnes auslösendes Ereignis zu unbegrenztem Verbrauch wird: Agenten, die sich nach einem Fehlschlag gegenseitig erneut abfragen, neu delegieren oder erneut anfragen, können einen einzelnen vorübergehenden Fehler in ein unbegrenztes Fan-out von Inferenzaufrufen verwandeln, sofern nicht jede Schleife ein eigenes Rekursionslimit und eigene Abbruchkriterien trägt — unabhängig davon, ob ein einzelner Agent sein eigenes Budget im Blick behält.

Arten

Volumetrisches Fluten
Flutartige Eingaben variabler Länge oder ein hohes Volumen wiederholter Anfragen erschöpfen die Verarbeitungskapazität oder treiben Denial-of-Wallet-Kosten in die Höhe und nutzen dabei die nutzungsbasierte Preisgestaltung der meisten Cloud-LLM-Dienste aus.
Ressourcenintensive Abfragen
Eingaben, die gezielt die rechenintensivsten Pfade des Modells auslösen oder fortlaufend sein Kontextfenster überschreiten, verschlechtern den Dienst für alle anderen Nutzenden.
Modellextraktion über API
Systematisches Abfragen mit sorgfältig gestalteten Eingaben sammelt genügend Eingabe-/Ausgabe-Paare, um ein Schattenmodell zu trainieren, das das Verhalten des Zielmodells repliziert.
Seitenkanal-Extraktion
Das Ausloten offengelegter Logits, Logprobs oder des Eingabe-Filterverhaltens legt Modellinterna — Gewichte oder Architektur — offen, über das hinaus, was eine gewöhnliche Antwort preisgeben soll.

Angriffsszenarien

In einem Multi-Agenten-System

Eine Gruppe von Agenten fragt sich nach einem vorübergehenden Tool-Fehler autonom gegenseitig in einer Retry-Schleife erneut ab und vervielfacht so einen einzelnen fehlgeschlagenen Aufruf zu einem Kostenspitzenwert, bevor eine Budgetprüfung greift.

Flut wiederholter Anfragen

Angreifende übermitteln ein hohes Volumen an Anfragen an die LLM-API und erschöpfen die Rechenressourcen, bis der Dienst für legitime Nutzende nicht mehr verfügbar ist.

Denial-of-Wallet

Angreifende erzeugen exzessive Vorgänge gegen einen nutzungsbasiert abgerechneten Cloud-KI-Dienst und treiben so untragbare Kosten für den Anbieter in die Höhe, bevor eine Budgetprüfung greift.

Kostenspitze durch Retry-Schleife

Eine Gruppe von Agenten fragt sich nach einem vorübergehenden Tool-Fehler autonom gegenseitig in einer Retry-Schleife erneut ab und vervielfacht so einen einzelnen fehlgeschlagenen Aufruf zu einem Kostenspitzenwert, bevor eine Budgetprüfung greift.

Modellreplikation über synthetische Daten

Angreifende nutzen die eigene API-Ausgabe des Zielmodells, um synthetische Trainingsdaten zu erzeugen, und feintunen damit ein separates Modell zu einem funktionalen Äquivalent — vorbei an einfacheren, abfragezahlbasierten Extraktionsabwehrmaßnahmen.

Abwehrmaßnahmen

Durchläufe mit einem harten Budget-Kill-Switch begrenzen
Token / Cost Tracking erzwingt eine Obergrenze für Ausgaben und Aufrufzahl pro Durchlauf, unabhängig davon, was ein einzelner Agent über sein eigenes Budget glaubt.
Rekursionslimits und Abbruchkriterien durchsetzen
Wenden Sie die im Anti-Pattern Hallucinated Routing / Unbounded Loop genannte Disziplin an, damit eine Retry- oder Neudelegations-Schleife nach einem vorübergehenden Fehler nicht unbegrenzt fan-outen kann.
Rate begrenzen und Eingabegröße validieren
Begrenzen Sie das Anfragevolumen pro Quelle und weisen Sie übergroße Eingaben zurück, bevor sie das Modell erreichen — das schließt die einfachsten Flut- und Kontextüberlauf-Vektoren.
Nutzungsmuster überwachen und protokollieren
Fortlaufende Protokollierung des Ressourcenverbrauchs macht aus einem sich langsam aufbauenden Extraktions- oder Denial-of-Wallet-Versuch eine erkennbare Anomalie statt einer unsichtbaren Kostenzeile.

Sicherheit

Wohin als Nächstes

Suche

Patterns, Frameworks und Seiten durchsuchen.