L'IA agentique transforme l'économie de l'IA d'entreprise. Par rapport à un simple chatbot, les agents effectuent un travail plus conséquent : ils recueillent du contexte, raisonnent en plusieurs étapes, appellent des outils, vérifient les résultats et réessaient parfois avant de terminer une tâche.
C'est souvent de ce travail supplémentaire que provient la valeur ajoutée. C'est également pour cette raison que l'utilisation des jetons peut augmenter.
À mesure que l'IA passe de la phase des projets pilotes à celle de la production, les dirigeants ont besoin d'une méthode plus claire pour comprendre le coût de chaque flux de travail, la valeur qu'il crée et l'environnement dans lequel il doit s'exécuter. La prochaine mauvaise surprise en matière de coûts liés à l'IA pourrait provenir de son utilisation quotidienne dans les flux de travail des entreprises, notamment à mesure que les agents s'intègrent aux fonctions de support, de développement logiciel, de finance, d'opérations et de travail intellectuel.
C'est là que l'économie des jetons, ou « tokénomie », revêt toute son importance.
De nombreuses entreprises ont déjà des cas d'utilisation solides en matière d'IA. Le plus difficile est de les déployer à grande échelle sur des systèmes disparates, des données éparses et une infrastructure qui n'a pas été conçue pour des flux de travail agentiques persistants.
Un nouveau livre blanc de Dell Technologies, intitulé « La tokénomie et la nouvelle économie de l'IA agentique », se penche sur la manière dont les organisations peuvent gérer ce changement. Ce document explique comment Dell AI Factory with NVIDIA réunit AI Factory Foundation, la plateforme de données d'IA de Dell avec NVIDIA et Deskside Agentic AI pour aider à faire passer l'IA agentique du stade de projets pilotes fragmentés à celui d'environnements de production gouvernés et mesurables.
- Qu'est-ce que l'économie des jetons, ou « tokénomie », dans l'IA d'entreprise ?
- Pourquoi l'IA agentique rend-elle les coûts des jetons plus difficiles à prévoir ?
- Pourquoi le coût par résultat est-il important ?
- Comment puis-je gérer les coûts des jetons d'IA ?
- Comment les entreprises peuvent-elles réduire le gaspillage de jetons ?
- L'IA agentique doit-elle être exécutée sur site ou dans le cloud ?
- Comment la plateforme de données d'IA de Dell avec NVIDIA prend-elle en charge une IA basée sur un usage intelligent des jetons ?
- Quels sont les contrôles nécessaires avant que les agents ne soient déployés à grande échelle ?
- Un déploiement de l'IA agentique à grande échelle grâce à une rentabilité prévisible
Qu'est-ce que l'économie des jetons, ou « tokénomie », dans l'IA d'entreprise ?
Les jetons sont les unités de texte, de données et de contexte que les modèles d'IA traitent chaque fois qu'ils interprètent une requête, récupèrent des informations, appellent un outil ou génèrent une réponse. Dans un flux de production, l'utilisation de jetons peut provenir de l'invite elle-même, du contenu d'entreprise intégré au modèle, des instructions qui guident le système et du résultat renvoyé par le modèle.
La tokénomie permet aux équipes de comprendre cette activité en termes de valeur métier. Elle examine le nombre de jetons utilisés par un flux de travail, le résultat obtenu à l'aide de ces jetons et si le coût de réalisation de cette tâche est justifié par la valeur créée.
Un échange simple avec un chatbot est plus facile à estimer. Un utilisateur pose une question, le modèle répond et l'interaction prend fin.
À l'inverse, un agent d'IA peut lire un ticket, récupérer des documents internes, choisir un outil, appeler une application, examiner le résultat et préparer l'étape suivante pour approbation.
Même si l'employé ne voit qu'une seule réponse, l'entreprise paie pour l'intégralité du processus.
Pourquoi l'IA agentique rend-elle les coûts des jetons plus difficiles à prévoir ?
L'IA agentique peut générer des résultats à plus forte valeur ajoutée, car elle permet de faire progresser des tâches. Elle peut aider à acheminer une demande de support, à préparer l'examen d'un contrat, à générer du code ou à recueillir le contexte nécessaire à une décision.
Ces flux de travail impliquent souvent plusieurs étapes. L'utilisation des jetons peut augmenter lorsqu'un agent a besoin d'une fenêtre de contexte plus conséquente, lorsqu'il récupère trop d'informations, lorsqu'il appelle plusieurs outils ou lorsqu'il effectue une nouvelle tentative après un résultat médiocre. Une tâche qui paraît simple à l'utilisateur peut impliquer plusieurs appels du modèle en arrière-plan.
Cela complique la prévision des coûts pour une entreprise utilisant une IA agentique. Un modèle à bas coût peut néanmoins engendrer un flux de travail coûteux s'il nécessite des invites répétées ou de longs cycles de révision. Et un modèle plus onéreux peut permettre de réaliser les tâches plus rapidement et de réduire le nettoyage.
Dans le cas de l'IA agentique, le coût par résultat offre souvent aux dirigeants une vision plus claire que le seul prix du jeton.
Pourquoi le coût par résultat est-il important ?
Le coût par résultat établit une corrélation entre les dépenses en matière d'IA et les tâches accomplies. Ce résultat peut être la résolution d'un ticket de support, l'examen d'un contrat, la rédaction d'une demande de fusion, le traitement d'une réclamation ou la préparation d'une exception financière pour examen. Cet indicateur mesure le coût total du processus, de la requête initiale au résultat final.
Un flux de travail utilisant davantage de jetons peut néanmoins s'avérer intéressant s'il permet de gagner du temps, de réduire les reprises de travail, d'améliorer la qualité ou d'accélérer un processus métier. Un flux de travail moins onéreux peut s'avérer peu rentable si le résultat nécessite trop de corrections.
Plutôt que de vous demander « Combien cela a-t-il coûté en jetons ? », posez-vous la question suivante, beaucoup plus pertinente : « Ce flux de travail d'IA a-t-il accompli un travail utile à un coût acceptable ? ».
Le livre blanc établit également une corrélation entre les aspects économiques au niveau des flux de travail et la valeur ajoutée plus générale d'une usine d'IA. La validation économique commandée par Dell auprès d'Enterprise Strategy Group a révélé que Dell AI Factory with NVIDIA peut offrir un retour sur investissement de 1 225 % sur quatre ans et de 269 % la première année, démontrant comment une infrastructure, des données, une gouvernance et un placement des charges de travail coordonnés peuvent se traduire par une valeur ajoutée d'IA mesurable.
Comment puis-je gérer les coûts des jetons d'IA ?
Commencez par mesurer l'utilisation des jetons au niveau du flux de travail. Les dépenses totales en matière d'IA ont leur importance, mais elles indiquent rarement quels agents, équipes ou cas d'utilisation sont à l'origine des coûts.
| Question | Pourquoi c'est important |
|---|---|
| Quels flux de travail utilisent le plus de jetons ? | Indique les domaines dans lesquels l'optimisation peut avoir le plus grand impact. |
| Quels agents effectuent de nouvelles tentatives ou échouent le plus souvent ? | Permet d'identifier les invites peu claires, les récupérations médiocres, les défaillances des outils ou les goulots d'étranglement en matière d'approbation. |
| Quelles sources de données génèrent des récupérations non pertinentes ? | Montre comment une meilleure préparation des données peut réduire le gaspillage de contexte. |
| Quelles tâches utilisent des modèles ou des fenêtres de contexte plus grands que nécessaire ? | Aide les équipes à choisir le modèle et la taille du contexte adaptés. |
| Quelles sont les charges de travail dont le coût par résultat obtenu est le plus élevé ? | Permet de mettre en rapport l'utilisation des jetons à la valeur métier, aux reprises de travail, à la latence et à l'utilisation de l'infrastructure. |
L'objectif est de dépenser les jetons là où ils créent de la valeur et de réduire le gaspillage là où ils en apportent peu.
Comment les entreprises peuvent-elles réduire le gaspillage de jetons ?
Les entreprises peuvent améliorer leur économie des jetons en optimisant le flux de travail avant que les coûts n'augmentent.
Un dimensionnement adapté du modèle constitue l'un des leviers. Une classification ou une synthèse de routine peut être efficace sur un modèle plus petit. Un raisonnement complexe peut nécessiter un modèle plus élaboré.
La gestion du contexte constitue un autre levier. Des fenêtres de contexte plus conséquentes peuvent être utiles, mais un contexte inutile augmente le coût et peut affaiblir les réponses. Ici, la qualité de la récupération est primordiale. Si la couche de récupération renvoie un contenu obsolète ou non pertinent, l'agent peut traiter des jetons supplémentaires et produire malgré tout une réponse médiocre.
La plateforme de données d'IA de Dell avec NVIDIA peut contribuer à résoudre ce problème en améliorant la façon dont les données d'entreprise sont préparées, indexées et orchestrées pour les charges de travail d'IA. Dans son livre blanc, Dell met en avant une vitesse de diffusion des données jusqu'à 200 % plus rapide, une indexation vectorielle 12 fois plus rapide grâce à l'accélération NVIDIA et une orchestration automatisée des données qui offre une préparation en quelques minutes au lieu de quelques semaines lorsqu'une tâche manuelle est utilisée.
L'optimisation des charges de travail peut également s'avérer utile. Certaines tâches non urgentes peuvent être traitées en lots. Des contrôles d'accès simultané peuvent réduire la charge lorsque de nombreux utilisateurs ou agents sont actifs en même temps. Des limites d'étapes peuvent empêcher un agent de réessayer trop de fois sans vérification.
Le livre blanc complet aborde également les techniques d'infrastructure qui permettent d'améliorer la rentabilité de l'inférence à haut volume, notamment le traitement par lots continu, l'optimisation du cache KV et le déchargement du cache KV vers des moteurs de stockage Dell G4. Pour les flux de travail agentiques en long contexte, ces approches peuvent contribuer à réduire les calculs répétés, à alléger la pression sur la mémoire des GPU et à améliorer le coût par jeton à mesure que l'utilisation se développe.
L'approche adéquate dépend du flux de travail. Une synthèse interne à faible risque présente un profil de coût et de gouvernance différent de celui d'un flux de travail juridique, financier ou clinique.
L'IA agentique doit-elle être exécutée sur site ou dans le cloud ?
L'IA agentique doit être exécutée à l'endroit qui est le plus approprié pour la charge de travail. La décision dépend généralement de la sensibilité des données, de la latence, de la gouvernance, de la prévisibilité des coûts et de l'accès aux modèles.
- Une infrastructure privée ou sur site peut parfaitement convenir aux flux de travail qui utilisent des données d'entreprise sensibles ou qui nécessitent des performances prévisibles. Les assistants de connaissances internes, les assistants de codage et les flux de travail impliquant de nombreux documents en sont des exemples courants.
- Les systèmes de bureau peuvent prendre en charge l'IA agentique en local à proximité des utilisateurs et des données. Dans son livre blanc, Dell met en avant les solutions Dell Pro Max avec GB10 et GB300, ainsi que les stations de travail fixes Dell Pro Precision comme faisant partie de son portefeuille d'IA agentique de bureau.
- Les environnements périphériques peuvent prendre en charge des charges de travail nécessitant une faible latence ou un traitement local, telles que des agents d'inspection d'usine ou des flux de travail d'opérations sur le terrain.
- Les services cloud et d'API peuvent prendre en charge l'expérimentation, les pics de demande et l'accès à des modèles spécialisés.
La plupart des entreprises utiliseront un modèle d'IA hybride. Dell AI Factory with NVIDIA prend en charge cette approche sur l'ensemble des systèmes de bureau, des environnements périphériques, des centres de données et des services connectés au cloud, afin que les organisations puissent placer chaque charge de travail là où le coût, les performances, la gouvernance et le contrôle sont les plus adaptés.
Comment la plateforme de données d'IA de Dell avec NVIDIA prend-elle en charge une IA basée sur un usage intelligent des jetons ?
La plateforme de données d'IA de Dell avec NVIDIA aide les organisations à préparer, gérer et gouverner les données d'entreprise qui alimentent les applications d'IA et les flux de travail agentiques. Cela est important pour une IA basée sur un usage intelligent des jetons, car les agents ont besoin d'un contexte pertinent sans traiter d'informations inutiles ou redondantes.
Une meilleure préparation des données peut améliorer la qualité de la récupération, réduire le gaspillage de contexte et aider les équipes à contrôler l'utilisation des jetons à mesure que les flux de travail agentiques prennent de l'ampleur.
Le livre blanc explique comment la plateforme de données d'IA de Dell avec NVIDIA prend en charge ce travail grâce à une orchestration automatisée des données de bout en bout, une indexation vectorielle accélérée et une diffusion des données plus rapide pour les charges de travail d'IA. Il décrit également comment la plateforme aide les organisations à prendre en charge les données structurées, non structurées et diffusées en continu dans des environnements hybrides.
En renforçant la couche de données sous-jacente aux charges de travail d'IA, les organisations peuvent améliorer la récupération, l'observabilité, les performances et la prévisibilité des coûts à mesure que l'IA agentique passe du stade des projets pilotes à celui de la production.
Quels sont les contrôles nécessaires avant que les agents ne soient déployés à grande échelle ?
Dans les entreprises qui font un usage intelligent des jetons, les agents d'IA ont des limites opérationnelles clairement définies avant de pouvoir agir sur l'ensemble des systèmes de l'entreprise.
Chaque flux de travail doit avoir un responsable opérationnel, et chaque agent doit avoir un rôle défini avec des autorisations limitées. Les équipes doivent décider à quel moment un examen humain est nécessaire avant qu'un agent puisse agir sur l'ensemble des systèmes de l'entreprise.
Les contrôles budgétaires sont tout aussi importants que les contrôles d'accès. Les budgets de jetons, les plafonds d'utilisation et les règles d'escalade peuvent aider à empêcher les agents de réessayer trop souvent, de répéter des étapes inutiles ou de consommer des ressources sans examen.
L'observabilité rend ces contrôles utilisables. Les équipes doivent pouvoir voir ce qu'a fait un agent, les outils qu'il a appelés, le nombre de jetons qu'il a consommés, les domaines où il a échoué et si le résultat justifiait le coût.
Une gouvernance solide donne aux équipes la confiance nécessaire pour mettre en production davantage de flux de travail, car les limites sont clairement définies.
Un déploiement de l'IA agentique à grande échelle grâce à une rentabilité prévisible
L'IA agentique fera de la gestion des jetons une composante normale de la planification de l'IA d'entreprise. À mesure que les agents prennent en charge davantage d'étapes dans les flux de travail, les dirigeants ont besoin d'une vision claire du coût de chacun d'eux, de la valeur qu'il crée et de l'environnement dans lequel il doit être exécuté.
Ce changement transforme la tokénomie en discipline opérationnelle concrète. Elle aide les équipes à corréler les dépenses en matière d'IA et le travail accompli, à définir des contrôles avant que les agents ne soient déployés à grande échelle et à améliorer le coût par résultat au fil du temps. Elle aide également les organisations à décider si une charge de travail doit être exécutée sur des systèmes de bureau, en périphérie, dans un centre de données ou dans un environnement connecté au cloud.
Le livre blanc de Dell Technologies, intitulé « La tokénomie et la nouvelle économie de l'IA agentique », explore ces questions plus en profondeur, notamment les facteurs de coût des jetons, le placement des charges de travail, l'économie de l'inférence, les contrôles de gouvernance et le rôle de Dell AI Factory with NVIDIA dans la construction d'un socle basé sur un usage intelligent des jetons pour l'IA agentique.
Le livre blanc de Dell Technologies, intitulé « La tokénomie et la nouvelle économie de l'IA agentique », explore ces questions plus en profondeur, notamment les facteurs de coût des jetons, le placement des charges de travail, l'économie de l'inférence, les contrôles de gouvernance et le rôle de Dell AI Factory with NVIDIA dans la construction d'un socle basé sur un usage intelligent des jetons pour l'IA agentique.
Téléchargez le livre blanc complet pour découvrir comment les entreprises peuvent gérer les coûts des jetons, améliorer le coût par résultat et déployer l'IA agentique à grande échelle avec un contrôle renforcé sur les décisions relatives aux performances, à la gouvernance et à l'infrastructure.
FAQ
Comment puis-je gérer les coûts des jetons d'IA ?
Gérez les coûts des jetons d'IA en mesurant leur utilisation au niveau du flux de travail, puis en corrélant cette utilisation aux résultats métier obtenus. Les équipes doivent surveiller les agents qui consomment le plus de jetons, les flux de travail qui effectuent le plus de nouveaux essais, les domaines dans lesquels la récupération ajoute un contexte inutile et déterminer si le travail accompli justifie le coût.
Le rapport complet explique pourquoi le coût par résultat est souvent un meilleur indicateur que le prix du jeton seul, à mesure que l'IA agentique entre en production.
Comment l'IA agentique affecte-t-elle l'utilisation des jetons ?
L'IA agentique peut augmenter l'utilisation de jetons car les agents effectuent souvent un travail que l'utilisateur ne voit jamais. Une seule requête peut nécessiter que l'agent récupère le contexte, appelle des outils, valide les résultats, définisse l'étape suivante ou fasse une nouvelle tentative après un résultat médiocre.
C'est pourquoi le livre blanc sur la tokénomie recommande de mesurer l'utilisation des jetons sur l'ensemble du flux de travail, et pas uniquement sur la réponse finale.
Comment réduire le coût par jeton pour l'inférence LLM à volume élevé ?
Réduisez le coût par jeton en faisant correspondre le modèle, la fenêtre de contexte et l'infrastructure au flux de travail. Une meilleure qualité de la récupération peut également réduire le gaspillage de contexte et les nouvelles tentatives inutiles. Le livre blanc de Dell explique comment des techniques telles que le traitement par lots continu et l'optimisation du cache KV peuvent améliorer le débit, l'accès simultané et les performances en long contexte pour l'inférence à volume élevé.
Dois-je exécuter l'IA agentique sur site ou dans le cloud ?
Exécutez l'IA agentique là où les exigences en matière de données, de latence, de gouvernance et de coûts de la charge de travail sont les mieux adaptées. Les flux de travail sensibles ou prévisibles peuvent convenir aux infrastructures privées ou aux environnements de centres de données. Les flux de travail agentiques locaux peuvent convenir aux systèmes de bureau, tandis que les cas d'utilisation à faible latence peuvent nécessiter un déploiement en périphérie. Une demande fluctuante présentant des pics et l'expérimentation peuvent toujours convenir aux services cloud ou d'API.
Le livre blanc de Dell explique comment Dell AI Factory with NVIDIA prend en charge ce modèle hybride sur l'ensemble des systèmes de bureau, des environnements périphériques, des centres de données et des services connectés au cloud.
Comment la plateforme de données d'IA de Dell contribue-t-elle à optimiser les coûts de l'infrastructure d'IA ?
La plateforme de données d'IA de Dell avec NVIDIA contribue à optimiser les coûts de l'infrastructure d'IA en améliorant la façon dont les données d'entreprise sont préparées, indexées et livrées aux charges de travail d'IA. Une meilleure orchestration des données peut aider les agents à récupérer un contexte plus pertinent, à réduire le gaspillage de jetons et à éviter les nouvelles tentatives inutiles.
Le rapport complet met également en évidence des améliorations mesurables de la couche de données, notamment une diffusion des données jusqu'à 200 % plus rapide et une indexation vectorielle 12 fois plus rapide grâce à l'accélération NVIDIA. Dans le cadre de Dell AI Factory with NVIDIA, la plateforme aide les organisations à améliorer leurs performances, leur gouvernance et la prévisibilité de leurs coûts à mesure que l'IA agentique prend de l'ampleur.