Agentenbasierte KI verändert die Wirtschaftlichkeit von Enterprise-KI. Agenten leisten mehr als ein einfacher Chatbot – sie erfassen den Kontext, gehen einzelne Schritte logisch durch, rufen Tools auf, überprüfen die Ergebnisse und wiederholen manchmal alles noch einmal, bevor sie eine Aufgabe abschließen.
Diese zusätzliche Arbeit bietet oft den eigentlichen Mehrwert. Aber sie kann auch zu einer steigenden Nutzung von Token führen.
Wenn KI von Pilotprojekten in den Produktionsbetrieb übergeht, benötigen Führungskräfte einen besseren Überblick darüber, welche Kosten die einzelnen Workflows verursachen, welchen Mehrwert sie schaffen und wo sie ausgeführt werden sollten. Die nächste Kostenüberraschung im Bereich KI könnte sich durch den täglichen Einsatz in Unternehmensworkflows ergeben, insbesondere wenn Agenten Teil von Support, Softwareentwicklung, Finanzen, Betrieb und Wissensarbeit werden.
Genau hier kommt das Konzept der Tokenomics ins Spiel.
Viele Unternehmen verfügen bereits über überzeugende KI-Anwendungsfälle. Die größere Herausforderung besteht darin, diese über isolierte Systeme, verstreute Daten und eine Infrastruktur hinweg zu skalieren, die nicht für dauerhafte agentenbasierte Workflows konzipiert wurde.
In einem neuen Whitepaper von Dell Technologies,„Tokenomics und die neue Wirtschaftlichkeit von agentenbasierter KI“, wird untersucht, wie Unternehmen diesen Wandel bewältigen können. Darin wird erläutert, wie Dell AI Factory with NVIDIA die Lösungen AI Factory Foundation, Dell AI Data Platform with NVIDIA und Deskside Agentic AI vereint, um den Übergang der agentenbasierten KI von fragmentierten Pilotprojekten hin zu kontrollierten, messbaren Produktionsumgebungen zu unterstützen.
- Was bedeutet Tokenomics im Bereich der Enterprise-KI?
- Warum die Kosten für Token bei agentenbasierter KI schwerer zu prognostizieren sind
- Warum die Kosten pro Ergebnis wichtig sind
- Wie können Sie die Kosten für KI-Token kontrollieren?
- Wie können Unternehmen die Verschwendung von Token reduzieren?
- Sollte agentenbasierte KI in einer On-Premise-Umgebung oder in der Cloud ausgeführt werden?
- Wie die Dell AI Data Platform with NVIDIA KI mit intelligenter Tokennutzung unterstützt
- Welche Kontrollen sind vor der Skalierung von Agenten erforderlich?
- Skalierung agentenbasierter KI mit vorhersehbarer Wirtschaftlichkeit
Was bedeutet Tokenomics im Bereich der Enterprise-KI?
Token sind die Einheiten aus Text, Daten und Kontext, die KI-Modelle jedes Mal verarbeiten, wenn sie eine Anfrage interpretieren, Informationen abrufen, ein Tool aufrufen oder eine Antwort generieren. In einem Produktionsworkflow werden Token vor allem für Folgendes verbraucht: den Prompt an sich, die in das Modell abgerufenen Unternehmensinhalte, die Anweisungen, die das System anleiten, und die vom Modell zurückgegebene Ausgabe.
Mithilfe von Tokenomics können Teams diese Aktivitäten aus geschäftlicher Sicht nachvollziehen. Dabei wird analysiert, wie viele Token ein Workflow verbraucht, welches Ergebnis mit diesen Token erzielt wird und ob die Kosten für die Durchführung dieser Aufgaben durch den dadurch geschaffenen Mehrwert gerechtfertigt sind.
Ein einfacher Chatbot-Austausch ist einfacher einzuschätzen. NutzerInnen stellen eine Frage, das Modell antwortet und die Interaktion ist beendet.
Im Gegensatz dazu kann ein KI-Agent ein Ticket lesen, interne Dokumente abrufen, ein Tool auswählen, eine Anwendung aufrufen, das Ergebnis überprüfen und den nächsten Schritt zur Genehmigung vorbereiten.
Auch wenn MitarbeiterInnen möglicherweise nur eine Antwort sehen, bezahlt das Unternehmen für die gesamte Arbeitskette.
Warum die Kosten für Token bei agentenbasierter KI schwerer zu prognostizieren sind
Agentenbasierte KI kann wertvollere Ergebnisse erzielen, weil sie Arbeitsprozesse voranbringen kann. Sie kann beispielsweise dabei helfen, einen Supportfall weiterzuleiten, eine Vertragsprüfung vorzubereiten, Code zu generieren oder Kontext für eine Entscheidung zu sammeln.
Diese Workflows umfassen oft mehrere Schritte. Die Tokennutzung kann steigen, wenn ein Agent ein größeres Kontextfenster benötigt, zu viele Informationen abruft, mehrere Tools aufruft oder nach einem unzureichenden Ergebnis einen erneuten Versuch unternimmt. Eine Aufgabe, die für NutzerInnen einfach aussieht, kann im Hintergrund mehrere Modellaufrufe beinhalten.
Dies erschwert die Kostenprognose für Unternehmen, die agentenbasierte KI einsetzen. Auch ein kostengünstiges Modell kann einen kostspieligen Workflow erzeugen, wenn wiederholte Prompts oder lange Überprüfungszyklen erforderlich sind. Ein kostspieligeres Modell kann die Arbeit hingegen schneller erledigen und den Aufwand für die Nachbearbeitung reduzieren.
Bei agentenbasierter KI erhalten Führungskräfte durch die Kosten pro Ergebnis oft einen klareren Überblick als alleine durch den Tokenpreis vermittelt wird.
Warum die Kosten pro Ergebnis wichtig sind
Die Kosten pro Ergebnis stellen einen Zusammenhang zwischen den Ausgaben für KI und der abgeschlossenen Arbeit her. Bei diesem Ergebnis kann es sich um ein gelöstes Supportticket, einen geprüften Vertrag, einen entworfenen Pull-Request, einen bearbeiteten Antrag oder eine zur Prüfung vorbereitete Finanzausnahme handeln. Diese Kennzahl misst die Gesamtkosten, die von der Anfrage bis zum Ergebnis anfallen.
Ein Workflow mit einer höheren Tokennutzung kann sich dennoch lohnen, wenn er Zeit spart, Nacharbeiten reduziert, die Qualität verbessert oder einen Geschäftsprozess beschleunigt. Ein kostengünstigerer Workflow kann sich wirtschaftlich als ungünstig erweisen, wenn die Ausgabe zu viele Korrekturen erfordert.
Anstelle der Frage „Wie viel hat dies an Token gekostet?“ lautet die bessere Frage: „Hat dieser KI-Workflow nützliche Arbeit zu akzeptablen Kosten erledigt?“
Das Whitepaper stellt zudem einen Zusammenhang zwischen der Wirtschaftlichkeit auf Workflowebene und dem umfassenderen Mehrwert der AI Factory her. Die von Dell in Auftrag gegebene wirtschaftliche Validierung der Enterprise Strategy Group ergab, dass Dell AI Factory with NVIDIA über einen Zeitraum von vier Jahren einen ROI von 1.225 % und im ersten Jahr einen ROI von 269 % erzielen kann. Das verdeutlicht, wie sich eine koordinierte Lösung für Infrastruktur, Daten, Governance und Workload-Platzierung in einen messbaren KI-Mehrwert umsetzen lässt.
Wie können Sie die Kosten für KI-Token kontrollieren?
Beginnen Sie damit, die Tokennutzung auf Workflowebene zu messen. Die Gesamtkosten für KI sind zwar wichtig, zeigen jedoch selten, welche Agenten, Teams oder Anwendungsfälle die Kosten verursachen.
| Frage | Bedeutung |
|---|---|
| Welche Workflows nutzen die meisten Token? | Zeigt auf, wo Optimierungsmaßnahmen die größte Wirkung erzielen können |
| Welche Agenten führen am häufigsten Wiederholungen durch oder scheitern am häufigsten? | Hilft dabei, schwache Prompts, mangelhafte Abrufe, Toolfehler oder Genehmigungsengpässe zu identifizieren |
| Welche Datenquellen führen zu irrelevanten Suchergebnissen? | Zeigt auf, wo eine bessere Datenaufbereitung unnötigen Kontext reduzieren kann |
| Bei welchen Aufgaben werden größere Modelle oder Kontextfenster als nötig verwendet? | Hilft Teams dabei, die Modellauswahl und die Kontextgröße optimal anzupassen |
| Welche Workloads verursachen die höchsten Kosten pro abgeschlossenem Ergebnis? | Stellt einen Zusammenhang zwischen der Tokennutzung und dem geschäftlichen Nutzen, der Nacharbeit, der Latenz sowie der Auslastung der Infrastruktur her |
Das Ziel besteht darin, Token dort einzusetzen, wo sie einen Mehrwert schaffen, und Verschwendung dort zu reduzieren, wo sie kaum einen Mehrwert bieten.
Wie können Unternehmen die Verschwendung von Token reduzieren?
Unternehmen können die Wirtschaftlichkeit von Token verbessern, indem sie den Workflow optimieren, bevor die Kosten ansteigen.
Die richtige Dimensionierung des Modells ist ein Ansatzpunkt. Eine routinemäßige Klassifizierung oder Zusammenfassung lässt sich möglicherweise gut mit einem kleineren Modell bewältigen. Komplexe Schlussfolgerungen erfordern möglicherweise ein größeres Modell.
Das Kontextmanagement ist ein weiterer Ansatz. Größere Kontextfenster können hilfreich sein, aber unnötiger Kontext verursacht Kosten und kann die Qualität der Antworten beeinträchtigen. Hier kommt es auf die Qualität der Datenabfrage an. Wenn die Abrufebene veraltete oder irrelevante Inhalte zurückgibt, verarbeitet der Agent möglicherweise zusätzliche Token und liefert dennoch eine unzureichende Antwort.
Dell AI Data Platform with NVIDIA kann zur Lösung dieses Problems beitragen, da die Lösung verbessert, auf welche Art und Weise Unternehmensdaten für KI-Workloads aufbereitet, indiziert und orchestriert werden. Im Whitepaper verweist Dell auf ein bis zu 200 % schnelleres Datenstreaming, eine 12-mal schnellere Vektorindizierung mit NVIDIA-Beschleunigung und eine automatisierte Datenorchestrierung, die wochenlange manuelle Vorbereitungsarbeiten auf wenige Minuten verkürzen kann.
Eine Optimierung der Workload kann ebenfalls helfen. Einige nicht dringende Aufgaben können gebündelt werden. Parallelitätskontrollen können die Belastung verringern, wenn viele NutzerInnen oder Agenten gleichzeitig aktiv sind. Schrittbegrenzungen können verhindern, dass ein Agent ohne Überprüfung zu viele Wiederholungsversuche unternimmt.
Das vollständige Whitepaper behandelt zudem Infrastrukturtechniken, die die Wirtschaftlichkeit der Inferenz mit hohem Datenaufkommen verbessern können, darunter kontinuierliches Batching, KV-Cache-Optimierung und KV-Cache-Auslagerung auf Dell G4 Storage Engines. Bei agentenbasierten Workflows mit langem Kontext können diese Ansätze dazu beitragen, wiederholte Berechnungen zu reduzieren, den Druck auf den GPU-Speicher zu verringern und die Kosten pro Token bei steigender Nutzung zu verbessern.
Der richtige Ansatz hängt vom jeweiligen Workflow ab. Eine interne Zusammenfassung mit geringem Risiko weist ein anderes Kosten- und Governance-Profil auf als ein juristischer, finanzieller oder klinischer Workflow.
Sollte agentenbasierte KI in einer On-Premise-Umgebung oder in der Cloud ausgeführt werden?
Agentenbasierte KI sollte in der Umgebung ausgeführt werden, die sich für die jeweilige Workload am besten eignet. Die Entscheidung hängt in der Regel von der Sensibilität der Daten, der Latenz, der Governance, der Kostenvorhersehbarkeit und dem Modellzugriff ab.
- Eine private oder On-Premise-Infrastruktur eignet sich besonders gut für Workflows, die sensible Unternehmensdaten verwenden oder eine zuverlässige Performance benötigen. Interne Wissensassistenten, Codeassistenten und dokumentenintensive Workflows sind typische Beispiele.
- Deskside-Systeme können lokale agentenbasierte KI in der Nähe von NutzerInnen und Daten unterstützen. Im Whitepaper verweist Dell auf Dell Pro Max with GB10 und GB300 sowie die stationären Dell Pro Precision-Workstations als Teil seines Deskside Agentic AI-Portfolios.
- Edge-Umgebungen können Workloads unterstützen, die eine niedrige Latenz oder lokale Verarbeitung erfordern, z. B. Agenten für Fabrikinspektionen oder Workflows im Außeneinsatz.
- Cloud- und API-Services können Experimente, eine sprunghafte Nachfrage und den Zugriff auf spezialisierte Modelle unterstützen.
Die meisten Unternehmen werden ein hybrides KI-Modell nutzen. Dell AI Factory with NVIDIA unterstützt diesen Ansatz über Deskside-Systeme, Edge-Umgebungen, Rechenzentren und mit der Cloud verbundene Services hinweg, sodass Unternehmen jede Workload dort platzieren können, wo Kosten, Performance, Governance und Kontrolle am besten dazu passen.
Wie die Dell AI Data Platform with NVIDIA KI mit intelligenter Tokennutzung unterstützt
Die Dell AI Data Platform with NVIDIA unterstützt Unternehmen bei der Aufbereitung, Verwaltung und Kontrolle der Unternehmensdaten, die KI-Anwendungen und agentenbasierte Workflows ermöglichen. Das ist für eine KI mit intelligenter Tokennutzung von Bedeutung, da Agenten relevanten Kontext benötigen, ohne unnötige oder doppelte Informationen verarbeiten zu müssen.
Eine bessere Datenaufbereitung kann die Qualität des Datenabrufs verbessern, unnötigen Kontext reduzieren und Teams dabei helfen, die Tokennutzung bei der Skalierung agentenbasierter Workflows zu kontrollieren.
Im Whitepaper wird erläutert, wie die Dell AI Data Platform with NVIDIA diese Aufgaben durch automatisierte End-to-End-Datenorchestrierung, beschleunigte Vektorindizierung und schnelleres Datenstreaming für KI-Workloads unterstützt. Außerdem wird beschrieben, wie die Plattform Unternehmen dabei hilft, strukturierte, unstrukturierte und Streamingdaten in hybriden Umgebungen zu verwalten.
Durch die Stärkung der Datenschicht hinter KI-Workloads können Unternehmen die Abrufbarkeit, Beobachtbarkeit, Performance und Kostenvorhersehbarkeit verbessern, wenn agentenbasierte KI von Pilotprojekten in die Produktion übergeht.
Welche Kontrollen sind vor der Skalierung von Agenten erforderlich?
In Unternehmen, die Token auf intelligente Weise nutzen, unterliegen KI-Agenten klar definierten Betriebsgrenzen, bevor sie in unternehmensweiten Systemen agieren dürfen.
Für jeden Workflow sollte es dafür zuständige Geschäftsverantwortliche geben und jeder Agent sollte eine definierte Rolle mit eingeschränkten Berechtigungen haben. Teams sollten entscheiden, wann eine Überprüfung durch den Menschen erforderlich ist, bevor ein Agent in unternehmensweiten Systemen agieren darf.
Budgetkontrollen sind ebenso wichtig wie Zugriffskontrollen. Tokenbudgets, Nutzungsobergrenzen und Eskalationsregeln können dazu beitragen, dass Agenten nicht zu oft erneute Versuche unternehmen, unnötige Schritte wiederholen oder Ressourcen ohne Überprüfung verbrauchen.
Durch Beobachtbarkeit werden diese Kontrollen nutzbar. Teams müssen nachvollziehen können, was ein Agent getan hat, welche Tools er aufgerufen hat, wie viele Token er genutzt hat, wo es zu Fehlern kam und ob das Ergebnis den Preis wert war.
Eine starke Governance gibt Teams das Vertrauen, mehr Workflows in die Produktion zu überführen, da die Grenzen klar definiert sind.
Skalierung agentenbasierter KI mit vorhersehbarer Wirtschaftlichkeit
Durch agentenbasierte KI wird das Tokenmanagement zu einem normalen Bestandteil der Enterprise-KI-Planung. Da Agenten immer mehr Arbeitsschritte übernehmen, benötigen Führungskräfte einen klaren Überblick darüber, welche Kosten jeder Workflow verursacht, welchen Mehrwert er schafft und wo er ausgeführt werden soll.
Durch diesen Wandel wird das Konzept der Tokenomics zu einer praktischen operativen Disziplin. Es hilft Teams dabei, KI-Ausgaben mit den erzielten Ergebnissen zu verknüpfen, Kontrollen festzulegen, bevor Agenten skaliert werden, und die Kosten pro Ergebnis im Laufe der Zeit zu optimieren. Außerdem unterstützt es Unternehmen bei der Entscheidung, wann eine Workload auf Deskside-Systemen, am Edge, im Rechenzentrum oder in einer mit der Cloud verbundenen Umgebung ausgeführt werden sollte.
Das vollständige Whitepaper „Tokenomics und die neue Wirtschaftlichkeit von agentenbasierter KI“ von Dell Technologies befasst sich eingehender mit diesen Themen, darunter Kostentreiber für Token, Workload-Platzierung, Wirtschaftlichkeit der Inferenz, Governance-Kontrollen und die Rolle von Dell AI Factory with NVIDIA beim Aufbau einer Grundlage mit intelligenter Tokennutzung für agentenbasierte KI.
Das vollständige Whitepaper „Tokenomics und die neue Wirtschaftlichkeit von agentenbasierter KI“ von Dell Technologies befasst sich eingehender mit diesen Themen, darunter Kostentreiber für Token, Workload-Platzierung, Wirtschaftlichkeit der Inferenz, Governance-Kontrollen und die Rolle von Dell AI Factory with NVIDIA beim Aufbau einer Grundlage mit intelligenter Tokennutzung für agentenbasierte KI.
Laden Sie das vollständige Whitepaper herunter, um zu erfahren, wie Unternehmen Tokenkosten verwalten, die Kosten pro Ergebnis verbessern und agentenbasierte KI mit stärkerer Kontrolle über Performance-, Governance- und Infrastrukturentscheidungen skalieren können.
Häufig gestellte Fragen
Wie verwalte ich die Kosten für KI-Token?
Die Kosten für KI-Token lassen sich verwalten, indem Sie die Tokennutzung auf Workflowebene messen und diese Nutzung anschließend mit den erzielten Geschäftsergebnissen verknüpfen. Teams sollten nachverfolgen, welche Agenten die meisten Token nutzen, welche Workflows am häufigsten wiederholt werden, wo das Abrufen von Daten unnötigen Kontext hinzufügt und ob die erledigte Arbeit die Kosten rechtfertigt.
Im vollständigen Bericht wird erläutert, warum die Kosten pro Ergebnis oft eine bessere Kennzahl sind als der Tokenpreis allein, wenn agentenbasierte KI in die Produktion übergeht.
Wie wirkt sich agentenbasierte KI auf die Tokennutzung aus?
Agentenbasierte KI kann die Tokennutzung erhöhen, da Agenten oft Aufgaben erledigen, die für NutzerInnen unsichtbar bleiben. Bei einer einzigen Anfrage muss der Agent möglicherweise Kontext abrufen, Tools aufrufen, Ergebnisse validieren, den nächsten Schritt weiterleiten oder nach einem unzureichenden Ergebnis einen erneuten Versuch unternehmen.
Aus diesem Grund wird im Whitepaper zu Tokenomics empfohlen, die Tokennutzung über den gesamten Workflow hinweg und nicht nur anhand der endgültigen Antwort zu messen.
Wie kann ich die Kosten pro Token bei der LLM-Inferenz mit großen Datenmengen reduzieren?
Reduzieren Sie die Kosten pro Token, indem Sie das Modell, das Kontextfenster und die Infrastruktur an den Workflow anpassen. Eine bessere Abfragequalität kann zudem unnötigen Kontext und überflüssige Wiederholungsversuche reduzieren. Im Dell Whitepaper wird erläutert, wie Techniken wie kontinuierliches Batching und KV-Cache-Optimierung den Durchsatz, die Parallelität und die Performance bei langem Kontext für Inferenz mit hohem Datenvolumen verbessern können.
Soll ich agentenbasierte KI in einer On-Premise-Umgebung oder in der Cloud ausführen?
Führen Sie agentenbasierte KI dort aus, wo die Anforderungen hinsichtlich Daten, Latenz, Governance und Kosten der jeweiligen Workload am besten erfüllt werden. Sensible oder vorhersehbare Workflows eignen sich möglicherweise für private Infrastrukturen oder Rechenzentrumsumgebungen. Lokale agentenbasierte Workflows können möglicherweise auf Deskside-Systemen ausgeführt werden, während Anwendungsfälle mit niedriger Latenz möglicherweise eine Edge-Bereitstellung erfordern. Bedarfsspitzen und Experimente können weiterhin mit Cloud- oder API-Services unterstützt werden.
Im Dell Whitepaper wird erläutert, wie Dell AI Factory with NVIDIA dieses Hybridmodell über Deskside-Systeme, Edge-Umgebungen, Rechenzentren und mit der Cloud verbundene Services hinweg unterstützt.
Inwiefern trägt die Dell AI Data Platform zur Optimierung der KI-Infrastrukturkosten bei?
Die Dell AI Data Platform with NVIDIA trägt zur Optimierung der KI-Infrastrukturkosten bei, indem sie die Aufbereitung, Indizierung und Bereitstellung von Unternehmensdaten für KI-Workloads verbessert. Eine bessere Datenorchestrierung kann Agenten dabei helfen, relevantere Kontextinformationen abzurufen, die Verschwendung von Token zu reduzieren und unnötige Wiederholungsversuche zu vermeiden.
Der vollständige Bericht hebt zudem messbare Verbesserungen der Datenschicht hervor, darunter ein bis zu 200 % schnelleres Datenstreaming und eine 12-mal schnellere Vektorindizierung mit NVIDIA-Beschleunigung. Als Teil von Dell AI Factory with NVIDIA hilft die Plattform Unternehmen dabei, die Performance, Governance und Kostenvorhersehbarkeit bei der Skalierung agentenbasierter KI zu verbessern.