Was agentische KI kostet
Von der Token-Lotterie zur Kalkulation: wann sich lokale KI rechnet

10. September 2026, 08:04 Uhr · Quelle: Pressebox
Agentische KI-Projekte scheitern häufig an unvorhersehbaren Token-Kosten, die mit der Zahl der Schritte und Werkzeugaufrufe steigen.

München, 10.09.2026 (PresseBox) - Ein Chat kostet ungefähr so viel, wie er lang ist. Ein Agent, der eine Aufgabe in acht Schritten löst, dabei drei Werkzeuge aufruft und zweimal neu ansetzt, kostet ein Vielfaches davon. Wie viel genau, weiß vor dem Durchlauf niemand. Daran scheitern derzeit die Budgets.

Der Verbrauch steigt schneller als die Aufgabe

Anthropic hat für die eigenen Systeme veröffentlicht, wie sich der Token-Verbrauch zwischen den Nutzungsarten unterscheidet: Agenten verbrauchen etwa das Vierfache einer Chat-Interaktion, Multi-Agent-Systeme etwa das Fünfzehnfache (Anthropic, Juni 2025). Der Grund liegt in der Mechanik. Bei jedem Schritt geht der bisherige Verlauf erneut in den Kontext. Werkzeugausgaben, gelesene Dokumente und Zwischenergebnisse wachsen mit. Fehlversuche werden mitbezahlt, auch wenn sie verworfen werden.

Für die Kalkulation heißt das: Der Verbrauch einer einzelnen Anfrage lässt sich abschätzen, der einer Aufgabe nicht. Zwei Anwender mit derselben Fragestellung können eine Größenordnung auseinanderliegen, weil der eine Agent beim ersten Versuch das richtige Dokument findet und der andere vier Umwege nimmt.

Woran die Projekte scheitern

Gartner prognostiziert, dass über 40 Prozent der agentischen KI-Projekte bis Ende 2027 abgebrochen werden. Als Gründe nennt die Analyse eskalierende Kosten, unklar definierten Geschäftswert und unzureichende Risikokontrolle (Gartner, Juni 2025). Die Kostenseite steht dort an erster Stelle, und sie ist die einzige der drei, die sich mit der Architektur beantworten lässt.

Eine Erhebung des On-Premises-Speicheranbieters Cloudian unter 203 IT-Entscheidern kommt zu einem passenden Befund. 40 Prozent der Befragten überschreiten ihre geplanten Cloud-KI-Ausgaben, 79 Prozent haben KI-Workloads bereits verlagert, 73 Prozent planen weitere Verlagerungen in Richtung On-Premises oder Hybrid (Cloudian, Februar 2026). Die Studie kommt von einem Anbieter, der von diesem Ergebnis profitiert, deckt sich in der Kostenaussage aber mit der Gartner-Begründung.

Im öffentlichen Sektor und im Mittelstand kommt ein struktureller Punkt hinzu. Eine Haushaltsposition, deren Höhe erst nach der Nutzung feststeht, ist schwer genehmigungsfähig. Wer im Frühjahr ein Budget beantragt, muss im Herbst noch damit auskommen.

Rechte skalieren mit der Zahl der Schritte

Ein Agent liest, kombiniert und schreibt in Fachsysteme. Jeder dieser Schritte braucht eine Rechteprüfung, und zwar dieselbe, die auch für den Anwender gelten würde. Hängt das Rechtemodell am Quellsystem und am Identity Provider, bleibt die Prüfung über acht Schritte hinweg gültig. Hängt sie am Werkzeug, entsteht das Problem, das aus der Copilot-Diskussion bekannt ist: Der Assistent sieht mehr als die Person, die ihn bedient.

Dasselbe gilt für Protokollierung. Bei einer Chat-Antwort genügt die Quelle. Bei einem mehrstufigen Vorgang muss nachvollziehbar bleiben, welcher Schritt welche Daten gelesen und welches Ergebnis erzeugt hat. Ohne diese Spur ist der Vorgang gegenüber einer Aufsicht nicht darstellbar.

Zwei Kostenmodelle, eine Entscheidung

Nutzungsabhängige Abrechnung ist günstig, solange die Nutzung selten und kurz ist. Für gelegentliche Recherchen, für Bild-, Video- und Audioaufgaben und für allgemeine Übersetzungen bleibt Cloud-KI die wirtschaftlichere Wahl. Das Verhältnis kippt, wenn viele Anwender täglich mehrstufige Vorgänge starten. Dann bezahlt ein Unternehmen dauerhaft variable Kosten für eine Grundlast, die sich als Anlagegut abbilden ließe.

Die Entscheidung hängt an zwei Größen: der erwarteten Zahl der Vorgänge pro Tag und der Sensibilität der Daten, die dabei durch das System laufen. Für Daten, die das Unternehmen ohnehin nicht an einen US-Anbieter geben würde, ist die Frage bereits entschieden. Alles andere ist eine Rechnung.

Wie FAST LTA das umsetzt

FAST LTA bietet seit Frühjahr 2026 mit Silent AI eine lokale KI-Appliance an, deren KI-Assistent Unternehmenswissen durchsuchbar macht. Die semantische Suche läuft vollständig lokal auf einer RAG-Architektur, jede Antwort nennt ihre Quelle, und die Leserechte kommen aus dem Identity Provider und dem jeweiligen Quellsystem, ob LDAP/AD, Entra ID, Okta oder OIDC.

Ab 1. Oktober 2026 folgt Silent AI Pro. Die Appliance ergänzt Silent AI um Projekte, Skills, Agenten, Artefakte und ein Gedächtnis, das Arbeitskontexte über Sitzungen hinweg hält. Für die Kostenfrage zählt der Aufbau: Die Rechenleistung ist Bestandteil der Appliance. Sie belegt 4 HE im Rack, lässt sich im laufenden Betrieb von einer auf drei GPUs erweitern und ist mandantenfähig, sodass mehrere Organisationsbereiche dieselbe Appliance nutzen und ihre Daten getrennt bleiben. Die Kosten stehen bei der Beschaffung fest, unabhängig davon, wie viele Vorgänge laufen und wie viele Nutzer arbeiten.

Kein Prompt und kein Token verlässt das Netzwerk. Damit entfällt der Zugriffsweg über den US CLOUD Act (18 U.S.C. § 2713) und FISA 702, der bei US-Anbietern unabhängig vom Serverstandort besteht. Silent AI Pro wird in München entwickelt und in Deutschland gefertigt. Der CARE-Vertrag deckt Wartung und Support für ein bis fünf Jahre zu gleichbleibenden Konditionen ab, was den Betriebsanteil der Rechnung für denselben Zeitraum festschreibt.

Die offene Größe im Piloten

Die Rechnung für agentische KI entsteht an einer Stelle, die im Pilotbetrieb kaum sichtbar wird: bei der Zahl der Schritte, die eine Aufgabe im Alltag tatsächlich braucht. Wer diese Zahl nicht kennt, hat zwei Möglichkeiten. Die Kosten nach Nutzung tragen und mit Schwankungen leben. Oder die Rechenleistung in der Beschaffung fixieren und die Schwankung in Auslastung übersetzen statt in Rechnungsbeträge. Beides ist vertretbar, die Wahl fällt vor dem Rollout allerdings leichter als danach.

Wie viele Anwender sollen bei Ihnen gleichzeitig mehrstufige Aufgaben starten?

Danach richtet sich die Ausbaustufe. Silent AI Pro beginnt mit einer GPU und wächst im laufenden Betrieb auf drei. Im Gespräch ordnen wir Ihre Nutzerzahl und Ihre Datenquellen einer Konfiguration zu und sagen Ihnen, wo die Grenzen liegen.

Agentische KI / Token-Verbrauch / Cloud-Kosten / On-Premises / Rechteprüfung / FAST LTA / Silent AI
[pressebox.de] · 10.09.2026 · 08:04 Uhr
[0 Kommentare]
Zahnschmelz remineralisieren: So stärkst du deine Zähne im Herbst
Mörfelden-Walldorf, 22.09.2026 (lifePR) - Remineralisierung bedeutet nichts anderes, als dem Zahnschmelz die  lebenswichtigen Mineralien zurückzugeben, die er im Alltag verliert. Zwar gilt der Zahnschmelz als das  härteste Material unseres Körpers, doch er ist keineswegs unverwundbar.  Säurehaltige Lebensmittel, bakterielle Stoffwechselprodukte oder […] (00)
vor 1 Stunde
Evonik Industries (Archiv)
Essen - Der Chemiekonzern Evonik hat den Abbau von Tausenden Stellen in den kommenden Jahren angekündigt. Im Rahmen eines Umbauprogramms würden weltweit 3.200 Stellen abgebaut, rund 2.150 davon in Deutschland, teilte das Unternehmen am Dienstag mit. Neben der Nicht-Nachbesetzung frei werdender Stellen soll dies über frühere Übergänge in den Ruhestand […] (00)
vor 2 Minuten
Dolly Parton
(BANG) - Dolly Partons Neffe Bryan Seaver soll seinen Posten als Sicherheitschef für die Anwesen der Sängerin verloren haben. Berichten zufolge wurden er und seine Sicherheitsfirmen von sämtlichen Immobilien des Nachlasses abgezogen. Bryan, der den Tod der 80-jährigen Country-Ikone im vergangenen Monat öffentlich verkündet hatte, soll vergangene Woche […] (00)
vor 1 Stunde
Das neue HP Googlebook 14 setzt auf Zusammenspiel mit KI und Smartphone
Mit dem neuen HP Googlebook 14 bringt HP Inc. (NYSE: HPQ) ein Premium-Notebook auf den Markt, das HP Qualität mit der Leistung und Effizienz der Snapdragon X Elite-Prozessoren in einem Googlebook kombiniert. Das HP Googlebook 14 wurde für Anwender entwickelt, die nahtlos zwischen ihren Smartphones, Laptops sowie Arbeit, Kreativität und Privatleben […] (00)
vor 42 Minuten
HOT WHEELS Infinite Rush – neues Car Collection Pack angekündigt
Milestone und Mattel haben heute in Zusammenarbeit mit der Formel 1 das „F1 Car Collection Pack“ für HOT WHEELS Infinite Rush angekündigt. Dieses exklusive Paket erscheint im März 2027 und enthält alle 22 offiziellen Formel-1-Teamautos, die jeweils originalgetreu nach ihren entsprechenden Hot Wheels-Modellen nachgebildet wurden. Die Kollektion […] (00)
vor 11 Stunden
«Villa der Versuchung» bleibt auf Quotensuche
Konnte die Reality-Show am Montag, 21. September, um 20.15 Uhr nun für einen neuerlichen Aufschwung sorgen? Seit Montag, 3. August, um 20.15 Uhr läuft in SAT.1 die zweite Staffel von Villa der Versuchung. Nachdem die Reality-Show zwischenzeitlich zumindest etwas Boden gutmachen konnte, bleibt die Quotenentwicklung allerdings wechselhaft: Auf 0,75 Millionen Zuschauer und 5,8 Prozent bei den […] (00)
vor 1 Stunde
Peter Hermann (M)
Berlin (dpa) - Jupp Heynckes hat der Tod seines langjährigen Freundes und Wegbegleiters Peter Hermann tief erschüttert. Als er und seine Frau Iris die Nachricht erhalten haben, hätten sie ihre «Tränen nicht mehr aufhalten» können. «Das menschliche Vokabular bietet für solche Situationen nicht die passenden Worte, um auszudrücken, wie uns dieser Verlust getroffen […] (00)
vor 1 Stunde
business, computer, security, currency, finance, bitcoin, money, digital, financial, technology
Der KOSPI-Index in Südkorea schloss am Dienstag höher, gab jedoch den Großteil eines anfänglichen, KI-getriebenen Anstiegs wieder ab. Der Nikkei 225 in Japan blieb aufgrund der Silver Week-Feiertage geschlossen, was die Anleger in Tokio vor einer möglicherweise volatilen Wiedereröffnung am Donnerstag stehen lässt. Der südkoreanische Leitindex endete etwa 0,5% […] (00)
vor 13 Minuten
 
Willkommen an Bord: Hochschule Osnabrück begrüßt rund 3.100 neue Erstsemester
Osnabrück, 21.09.2026 (lifePR) - Viele neue Gesichter, ein gemeinsamer Grund zu […] (00)
Über 1.100 Erstsemester starten ins Wintersemester 2026/2027
Ludwigshafen, 21.09.2026 (lifePR) - Die Hochschule für Wirtschaft und Gesellschaft […] (00)
Nachhaltiges Bauen heißt, den Bestand neu zu denken
Potsdam, 21.09.2026 (lifePR) - Wie kann Brandenburg seinen Gebäudebestand weiterentwickeln, […] (00)
Euroscheine (Archiv)
Wiesbaden - Der öffentliche Gesamthaushalt hat gegenüber dem nicht-öffentlichen […] (00)
Keke Palmer hat durch ihren dreijährigen Sohn Leo nicht nur die Mutterschaft, sondern auch einen völlig neuen Freundeskreis für sich entdeckt.
(BANG) - Keke Palmer hat durch ihren dreijährigen Sohn Leo nicht nur die […] (00)
PCGS Tokyo Direct 2026 – Devolver Digital stellt neue Releases vor
Devolver Digital bringt zur diesjährigen PC Gaming Show: Tokyo Direct jede Menge […] (00)
CNN, MS NOW und Politico verklagen Trump wegen Ausschluss aus dem Weißen Haus
Drei große US-Medien ziehen gemeinsam vor Gericht. Sie werfen der Trump-Regierung vor, ihre […] (00)
Auf dem Display eines Smartphones sind zahlreiche Apps zu sehen
Bonn (dpa/tmn) - Auf der Suche nach guten Anwendungen für Smartphone oder Computer […] (00)
 
 
Suchbegriff