KI-Agenten: 7,3 Billionen Tokens im August – fünfmal mehr als Menschen

Automatisierte Systeme treiben den Tokenbedarf; Strands senkte den Verbrauch in sechs Benchmarks um 28 Prozent.

•

Autonome KI-Agenten verbrauchen inzwischen deutlich mehr Rechenkapazität als menschliche Nutzer. Im August generierten automatisierte Agenten 7,3 Billionen Tokens, während menschliche Anwender auf 1,4 Billionen Tokens kamen. Mit diesem fünffachen Vorsprung verlagert sich das Datenaufkommen zunehmend auf maschinengesteuerte Interaktionen.

Wachsender Abstand und zunehmende Verbreitung

Dieser Trend dürfte sich künftig weiter verstärken. Daniel Newman, CEO der Futurum Group, erklärte am 30. September in einem Beitrag auf der Plattform X, dass der Faktor fünf voraussichtlich auf zehn und noch höhere Werte ansteigen werde.

Treibende Kraft hinter dieser Entwicklung ist die zunehmende betriebliche Integration autonomer Softwarewerkzeuge. Laut dem Bericht „State of AI 2026“ von McKinsey rollen derzeit 40 Prozent der großen Organisationen KI-Agenten aus, verglichen mit 27 Prozent im Vorjahr.

Hohe Kontextlast und Engpässe beim Speicher

Hinter dem enormen Datenvolumen steht vor allem das wiederholte Verarbeiten bereits vorhandener Kontexte. Nach Angaben der Plattform OpenRouter stammten im August mehr als 85 Prozent der Agenten-Tokens aus gecachten Prompts.

Anzeige

Wer sich mit dem Einsatz autonomer Systeme befasst, muss neben der Technik auch die rechtlichen Rahmenbedingungen im Blick behalten. Dieser kostenlose Umsetzungsleitfaden bietet einen kompakten Überblick über alle Anforderungen, Pflichten und Fristen der neuen EU-KI-Verordnung. EU AI Act in 5 Schritten verstehen

OpenRouter nutzt ein System aus sieben Signalen, um zwischen Agenten und menschlicher Nutzung bei API-Schlüsseln zu unterscheiden, wie Peter Walker, Head of Insights bei dem Anbieter, ausführte. Zudem übersteigt der sogenannte KV-Cache bei OpenRouter inzwischen die Kapazität des GPU-HBM-Speichers.

Auch Hardwarehersteller stellen sich auf anhaltende Engpässe ein: Micron erwartet für die Jahre 2027 und 2028 eine verschärfte Knappheit bei RAM und Speicherbausteinen sowie Preise, die über dem Niveau von 2026 liegen dürften.

Wie stark der interne Kontextbedarf ins Gewicht fällt, zeigte im September ein Test einer Callcenter-Beratung. Das Unternehmen mietete vier Grafikprozessoren des Typs Nvidia H200 an, um die Angabe zu überprüfen, wonach DeepSeek V4.1 Flash 80-mal günstiger als das Modell Claude sei. Dabei stellte sich heraus, dass 96 Prozent der Eingaben bei Claude-Code aus dem erneuten Einlesen vorangegangener Konversationen bestanden. Dies entsprach einem Aufkommen von rund 1.000 alten Tokens pro neu geschriebenem Token. Ein Veröffentlichungstermin für das Modell DeepSeek V4.1-Pro steht bislang nicht fest.

Infrastrukturrisiken und Effizienzansätze

Die rasant steigende Nutzung wirft auch infrastrukturelle Fragen auf. Berichte von McKinsey und der Boston Consulting Group warnten im Oktober davor, dass sinkende Token-Preise und kostengünstigere Modelle eine volumenstärkere Nutzung begünstigen, was wiederum die Stromnetze stärker belasten könnte. Unternehmen zahlen KI-Anbietern ihre Dienste üblicherweise auf Token-Basis.

Anzeige

Mit der zunehmenden Integration von KI in den Geschäftsalltag wachsen auch die Anforderungen an die Compliance und Dokumentation. Erfahren Sie in diesem kostenlosen Report, welche KI-Systeme als Hochrisiko eingestuft werden und was Unternehmen jetzt konkret tun müssen. Kostenlosen Leitfaden zum EU AI Act anfordern

Um dem wachsenden Ressourcenverbrauch zu begegnen, entstehen erste Optimierungswerkzeuge. Das Unternehmen Strands veröffentlichte im Oktober ein quelloffenes Agent-Harness für Python und TypeScript, das den Token-Verbrauch über sechs Benchmark-Messungen mit Claude- oder GPT-Modellen um 28 Prozent senkt.

Die Software unterstützt Modelle von Amazon Bedrock, Anthropic, OpenAI, Google Gemini und Ollama und bietet Steuerungsfunktionen für Token-Budgets sowie Interaktionslimits.