Les agents IA posent un nouveau problème : combien coûte réellement une tâche ?
À mesure que les entreprises passent des chatbots aux agents IA capables de travailler pendant plusieurs étapes, la question du coût devient beaucoup plus complexe. Un chatbot traite généralement une demande et génère une réponse, tandis qu’un agent peut interroger plusieurs modèles, rechercher des données, appeler des API, utiliser des outils, conserver une mémoire et répéter certaines opérations avant d’atteindre son objectif. Google Cloud veut rendre cette consommation plus prévisible avec de nouvelles options de facturation et de contrôle des dépenses pour les workloads agentiques de Gemini Enterprise, mais aussi pour les outils destinés aux développeurs comme Google Antigravity.¹ L’objectif est clair : permettre aux entreprises d’accroître l’autonomie de leurs agents sans découvrir trop tard que cette autonomie s’accompagne d’une facture difficile à anticiper.
Google introduit une facturation plus flexible pour Gemini Enterprise
La première évolution concerne directement le modèle économique de Gemini Enterprise. Jusqu’ici largement structuré autour de licences par utilisateur avec des quotas mutualisés, le service gagne une option pay-as-you-go permettant de continuer à exécuter des workloads agentiques sans interrompre une tâche lorsque le quota inclus est atteint.¹ Les organisations peuvent également combiner cette consommation à la demande avec leurs abonnements existants, une approche pensée pour des usages dont l’intensité peut varier fortement selon les projets. Cette flexibilité répond à une caractéristique fondamentale de l’IA agentique : deux utilisateurs disposant du même outil peuvent générer des consommations très différentes selon la longueur des tâches confiées à leurs agents, le nombre d’outils utilisés et la quantité de raisonnement nécessaire.
Un plafond mensuel pour empêcher un agent de dépasser le budget
Google ajoute surtout des mécanismes permettant aux équipes IT et financières de reprendre le contrôle sur cette consommation. Les administrateurs peuvent consulter les dépenses et leur évolution dans l’espace Usage & Spending de Gemini Enterprise, avec une ventilation entre l’application Gemini Enterprise, la plateforme d’agents et les outils de développement comme Antigravity.² Ils peuvent également définir une limite mensuelle de dépenses au niveau du projet : lorsque ce plafond est atteint, les usages facturés en dépassement sont automatiquement interrompus.³ Le principe rapproche directement l’exploitation des agents IA des pratiques FinOps déjà appliquées au cloud, avec une visibilité centralisée sur la consommation et des garde-fous destinés à empêcher qu’une expérimentation ou un workflow particulièrement intensif ne transforme une petite ligne budgétaire en dépense incontrôlée.
Antigravity place aussi le coût du développement agentique sous surveillance
Les développeurs sont directement concernés puisque Google Antigravity, l’environnement agentique de Google destiné au développement logiciel, est intégré aux outils IA de Gemini Enterprise. Google explique que les administrateurs peuvent ainsi gérer dans un même environnement les dépenses, les métriques d’utilisation, la sécurité et l’observabilité des outils développeurs, plutôt que de multiplier les licences et consoles de facturation.⁴ Cette centralisation devient particulièrement pertinente lorsque des agents de développement sont capables d’explorer une codebase, modifier plusieurs fichiers, exécuter des tests et poursuivre une tâche pendant une longue période : derrière une seule instruction humaine peuvent se cacher de nombreux appels modèles et opérations intermédiaires. L’enjeu n’est donc plus seulement de connaître le prix d’un abonnement à un assistant de code, mais de mesurer ce que coûte réellement l’exécution des workflows qu’il automatise.
Tokens, mémoire, sessions, outils : la facture d’un agent devient multidimensionnelle
Le modèle tarifaire de Google Cloud montre surtout que le coût d’un agent ne se résume plus aux tokens consommés par son modèle. La plateforme peut également facturer des ressources liées à sa mémoire, ses sessions, son stockage et ses appels d’API. Depuis le 1er septembre 2026, par exemple, Memory Bank est facturé selon le volume stocké et les opérations effectuées, tandis que les tokens utilisés pour générer les mémoires et embeddings restent facturés séparément. Les services Sessions et Skill Registry suivent eux aussi une tarification mêlant stockage et opérations de lecture ou d’écriture.⁵ Un agent autonome peut donc générer plusieurs couches de consommation simultanément : raisonnement du modèle, conservation de son état, récupération d’informations, appels à des outils et infrastructure nécessaire à son exécution. Pour les équipes FinOps, suivre uniquement le nombre de tokens risque dès lors de donner une vision incomplète du coût réel d’un workflow agentique.
Avec les agents, chaque décision peut avoir un coût cloud
Cette transformation donne une nouvelle dimension au Cloud Computing. Les professionnels chargés de concevoir et d’exploiter les architectures IA doivent désormais comprendre comment un workflow agentique consomme les différentes ressources cloud, identifier les étapes les plus coûteuses et définir des limites compatibles avec la valeur réellement produite. Un modèle extrêmement performant n’est pas nécessairement le meilleur choix pour chaque opération : une tâche simple peut être confiée à un modèle plus économique tandis qu’un modèle plus puissant est réservé aux étapes nécessitant davantage de raisonnement. De la même manière, la mémoire d’un agent, la durée de conservation de ses sessions ou le nombre d’appels à ses outils peuvent être optimisés. La compétence cloud se rapproche ainsi du FinOps, avec un nouvel objectif : ne plus seulement dimensionner une infrastructure, mais construire des agents capables de produire suffisamment de valeur pour justifier chaque ressource qu’ils consomment.
Le coût par tâche pourrait remplacer le coût par token
Cette évolution pourrait finalement changer les indicateurs utilisés pour évaluer l’économie de l’IA. Comparer le prix d’un million de tokens reste utile, mais devient insuffisant lorsqu’un agent peut effectuer une succession variable d’opérations pour accomplir une seule mission. Deux agents utilisant le même modèle peuvent présenter des coûts radicalement différents selon leur orchestration, leur mémoire, le nombre d’appels à leurs outils ou leur capacité à éviter les étapes inutiles. Google Cloud pousse donc les entreprises vers une logique plus proche du coût par workflow ou par résultat obtenu, avec des outils permettant de suivre la dépense et de l’encadrer avant qu’elle ne devienne problématique. À mesure que les agents passeront des expérimentations à des déploiements impliquant des milliers de collaborateurs, cette discipline financière pourrait devenir aussi importante que leur précision ou leur autonomie.
Après la course aux agents, celle de leur rentabilité commence
Les nouveaux contrôles de Google Cloud montrent finalement que l’IA agentique entre dans une phase plus industrielle. Les entreprises ne veulent plus seulement savoir si un agent est capable d’exécuter une tâche, elles doivent déterminer combien cette tâche coûte lorsqu’elle est répétée des milliers de fois et comment éviter que les workflows autonomes consomment davantage de ressources que prévu. La visibilité sur les dépenses, les plafonds budgétaires et les modèles de facturation flexibles deviennent donc des briques essentielles des plateformes agentiques. Après avoir cherché à rendre les agents plus intelligents et plus autonomes, les fournisseurs cloud commencent désormais à répondre à une autre question tout aussi stratégique : comment les rendre économiquement soutenables à grande échelle ?
L’Actu IT à 360° — décrypter la technologie pour comprendre les métiers de demain.
Pour aller plus loin
La question du coût des agents ne commence pas avec Google Cloud. Découvrez notre article CCCLX « La guerre des tokens commence : Headroom veut rendre l’IA moins coûteuse », qui analyse comment l’optimisation des contextes et de la consommation de tokens peut réduire le coût d’exécution des systèmes d’IA, un autre levier complémentaire aux mécanismes FinOps proposés aujourd’hui par les plateformes cloud.
Références
1. Google Cloud. (2026). FinOps for the AI era: New flexible billing and cost controls for agents.
https://cloud.google.com/blog/products/ai-machine-learning/flexible-billing-and-cost-controls-for-agents-on-google-cloud
2. Google Cloud. (2026). View costs in Gemini Enterprise.
https://docs.cloud.google.com/gemini/enterprise/docs/view-costs
3. Google Cloud. (2026). Overview of overages and spend controls.
https://docs.cloud.google.com/gemini/enterprise/docs/manage-costs-overview
4. Google Cloud. (2026). Expanding Google Antigravity for enterprise customers.
https://cloud.google.com/blog/products/ai-machine-learning/expanding-google-antigravity-for-enterprise-customers
5. Google Cloud. (2026). Gemini Enterprise Agent Platform pricing.
https://cloud.google.com/products/gemini-enterprise-agent-platform/pricing
Google Cloud porte ses instances X5 à 48 To pour les grandes bases SAP
Google Cloud annonce la disponibilité générale de la série X5, qui porte à 48 To la capacité mémoire maximale annoncée sur un seul nœud, contre 32 To pour X4.[1] Destinée notamment aux très grandes bases SAP HANA, cette offre repose sur des instances bare metal.[2]...
ShinyHunters contourne des règles WAF et relance les attaques contre PeopleSoft
Mandiant et Google Threat Intelligence Group signalent une reprise des attaques de ShinyHunters contre Oracle PeopleSoft. Certaines protections WAF sont contournées alors que la vulnérabilité reste présente.[1] Pour les entreprises, cette campagne rappelle la...
Cloud Storage : Google automatise le repérage des anomalies
Une hausse des lectures, des transferts entre régions ou du volume stocké peut alourdir la facture cloud et perturber les applications. Avec Storage Intelligence advisor, Google propose une vue des changements inhabituels dans Cloud Storage et des pistes pour les...
Agents vocaux IA : Oracle détaille une architecture LiveKit sur OCI
Oracle décrit une architecture qui associe le framework LiveKit Agents à Oracle Cloud Infrastructure pour automatiser des appels vocaux en temps réel. Le schéma relie téléphonie, modèles d’IA et services métier, tout en plaçant les composants internes dans des...
GitHub Copilot se muscle pour les entreprises : les agents de code passent sous contrôle IT
Copilot n’est plus seulement là pour suggérer la prochaine ligne GitHub Copilot poursuit sa transformation. À l’origine principalement connu pour compléter du code dans l’éditeur, l’outil évolue désormais vers des agents capables d’explorer un projet, de modifier des...
PDF, présentation, audio : Adobe veut faire d’Acrobat une usine à contenus
Acrobat ne veut plus seulement ouvrir vos documents Pendant plus de trente ans, Acrobat a principalement servi à lire, créer, modifier, signer et partager des PDF. Adobe veut désormais lui donner un rôle beaucoup plus large. Le 9 septembre 2026, l’entreprise a annoncé...
Salesforce branche Claude sur son CRM : Claudeforce prépare l’après-interface
Et si le CRM n’avait bientôt plus besoin d’être ouvert ? Pendant des décennies, utiliser un CRM signifiait naviguer entre des fiches clients, des tableaux de bord, des menus et des formulaires. Avec Claudeforce, Salesforce et Anthropic veulent modifier cette logique :...
Enterprise AI Harness : Salesforce s’attaque au chaos des agents IA
Les agents se multiplient, leur contrôle devient le nouveau problème des entreprises Les entreprises commencent à déployer des agents IA dans le support client, les ventes, la finance, les RH ou encore le développement logiciel, mais cette multiplication crée un...
Parlez à votre base de données : Oracle améliore son IA NL2SQL
Oracle veut rapprocher les utilisateurs métiers de leurs données Interroger une base de données d'entreprise nécessite traditionnellement de connaître sa structure et de maîtriser SQL, ce qui laisse souvent les équipes métiers dépendantes des analystes ou des...
Kimi K3, Mistral, DeepSeek : Oracle transforme OCI en hub de modèles IA
Oracle veut faire d’OCI un guichet unique pour l’IA Oracle accélère dans la bataille du cloud IA en élargissant fortement le catalogue de modèles disponibles dans OCI Enterprise AI. Le 4 septembre 2026, le groupe a notamment annoncé l’intégration de Kimi K3, le modèle...
