Aufschlussreich ist, woher die Überraschungen kommen: Am häufigsten nannten die Befragten Überschreitungen bei Datenplattformen (47 Prozent), noch vor den Token-Kosten der Sprachmodelle (43 Prozent).¹ Wer KI-Kosten steuern will, muss deshalb auf den Weg schauen, den eine Anfrage nimmt.
Der Weg zur Antwort bestimmt die Rechnung
Ein Sprachmodell kennt das Wissen eines Unternehmens nicht von selbst. Es muss sich die passenden Informationen aus Dokumenten, Systemen und Datenbanken beschaffen. Dafür gibt es im Kern drei Muster. Im ersten werden bei jeder Frage große Textmengen mitgeschickt, in der Hoffnung, dass die Antwort darin steckt. Im zweiten durchsucht die KI bei jeder Anfrage die Systeme neu und fragt oft mehrfach nach. Im dritten wird das Wissen einmal erschlossen und so aufbereitet, dass die KI die relevante Stelle in einem Schritt findet.
Abgerechnet wird nach Tokens, also nach der Textmenge, die ein Modell liest und schreibt. Bei den ersten beiden Mustern wächst die Rechnung deshalb mit jeder Anfrage. Beim dritten verteilt sich eine einmalige Investition auf alle Anfragen, und die Kosten pro Antwort sinken mit der Nutzung. Weniger irrelevanter Kontext verbessert zugleich die Qualität der Antworten.
Sieben Fragen vor der nächsten Budgetrunde
- Wird das Wissen einmal aufbereitet, oder durchsucht die KI bei jeder Frage alles neu? Davon hängt ab, ob die Kosten mit der Nutzung steigen oder sinken.
- Erhält das Modell die relevante Information in einem Schritt? Jede zusätzliche Abfrage (sogenannte Tool-Calls), mit der ein schwaches Retrieval ausgeglichen wird, kostet Tokens und Wartezeit.
- Wie viel Text verarbeitet das Modell pro Anfrage, und wie viel davon ist relevant? Bezahlt wird jedes Wort, auch das überflüssige.
- Werden Versionen und Dubletten erkannt? Drei Fassungen desselben Dokuments verdreifachen den Kontext und erhöhen das Risiko, dass die veraltete Fassung in der Antwort landet.
- Sind die Kosten pro Antwort messbar, vor und nach einer Umstellung? Ohne diesen Wert bleibt jede Optimierung eine Vermutung.
- Welche Kosten stehen auf keiner Token-Rechnung? Dazu zählen Datenplattformen ebenso wie Nacharbeit. In einer Studie von BetterUp Labs und Stanford hatten 40 Prozent der Befragten im Vormonat von Kollegen KI-generierte Arbeitsergebnisse erhalten, die gut aussahen, aber inhaltlich nicht trugen, jeder Fall kostete im Schnitt fast zwei Stunden.²
- Wo liegt das aufbereitete Wissen, und wer kann darauf zugreifen? Es ist die zentrale Kopie dessen, was ein Unternehmen weiß. Rechtsraum, DSGVO-Konformität und der Ausschluss von Modelltraining gehören deshalb in jede Kostenbetrachtung.
Nutzung bremsen hilft selten
Die naheliegende Reaktion auf steigende Kosten ist, die Nutzung zu begrenzen. Damit sinkt aber auch der Nutzen. Wirksamer ist es, den teuren Weg zur Antwort zu verkürzen. Je öfter die sieben Fragen mit einem klaren Ja beantwortet werden, desto besser lässt sich ein KI-Budget planen.
Wie Unternehmen ihre KI-Budgets praktisch steuern, diskutiert Bastian Maiworm am 16. November von 15:15 bis 15:45 Uhr auf dem Handelsblatt KI-Summit im Panel „Token-Kosten & ROI Messung: die unbequeme Wahrheit über KI-Investitionen“ auf der TODAY Stage.

¹ Benchmarkit/Mavvrik, State of AI Cost Governance 2026 ² BetterUp Labs/Stanford Social Media Lab, Harvard Business Review 2025
Bastian Maiworm ist Mitgründer und Geschäftsführer von amber. Das Aachener Unternehmen entwickelt eine Business-KI für Mittelstand und Industrie; mehr als 400 Unternehmen setzen sie ein.