Gemini agent : Google Cloud mise sur un assistant partout
Google Cloud veut que son IA se trouve là où les salariés travaillent déjà. Le 8 octobre, l'entreprise a présenté Gemini agent, un assistant unique capable d'agir de façon autonome, d'écrire du code et de mener des tâches à bien sur le web, sur mobile et sur ordinateur. Nul besoin d'une nouvelle application pour y accéder. L'agent fonctionne en ligne de commande, dans Google Workspace, Microsoft 365 et Slack, et même au sein d'applications tierces. Google résume l'ambition ainsi : un assistant "omniprésent" qui suit l'utilisateur, et non l'inverse.
Des objectifs plutôt que des instructions
Thomas Kurian, PDG de Google Cloud, a expliqué que Gemini peut répondre à des questions, prendre en charge du travail intellectuel, produire des images et des contenus multimédias, et transformer des idées encore floues en produits finis. Il y voit une nouvelle manière de déléguer.
"Vous lui donnez des objectifs, pas des instructions. Vous déléguez un résultat et vous revenez trouver un travail terminé", a déclaré Kurian. "Pour qu'un agent en soit capable, il doit être relié à vos méthodes de travail personnelles, à vos systèmes de référence et aux contrôles de votre entreprise."
Une seule mémoire, de nombreux collègues
Le produit s'inscrit dans une tendance désormais répandue dans le secteur : l'exécution persistante. Gemini conserve un ensemble unique de souvenirs, de contexte et de personnalisation, partagé entre tous les canaux et tous les sous-agents qu'il pilote.
Concrètement, il se comporte comme un coéquipier qui se souvient de ce qu'on lui a dit. Il peut aussi lancer des agents collègues plus petits, chacun avec sa propre identité, son propre domaine d'expertise, sa propre adresse e-mail en @agents.company.com et son propre espace de stockage persistant. Ces sous-agents ne voient que le contexte que l'utilisateur ou son équipe choisit de partager.
Le choix du modèle fait partie de l'offre. Chaque tâche tourne sur un modèle adapté. Le travail courant peut être confié à Gemini Flash, un modèle léger et rapide, tandis que les tâches de longue haleine peuvent s'appuyer sur un modèle de pointe comme Argon. Les modèles Claude d'Anthropic sont disponibles dès le lancement, et Google promet que d'autres modèles, propriétaires comme ouverts, suivront.
Compétences, outils et données de l'entreprise
Kurian a insisté sur le fait que l'agent doit comprendre l'ensemble du contexte métier d'une entreprise, des tarifs et du portefeuille de produits jusqu'au fonctionnement de chaque service. Gemini fonde ses réponses sur les données de l'entreprise et fait remonter le savoir interne.
La liste des connecteurs est longue :
- Collaboration : Confluence, Microsoft Office, Teams, Slack et Workspace
- Outils de développement : Git et Jira
- Plateformes d'entreprise : Salesforce et ServiceNow
- Bases de données : BigQuery, Databricks, Postgres et Snowflake
- Fichiers locaux sur les ordinateurs
À cela s'ajoutent des compétences réutilisables : des ensembles d'instructions, de connaissances et de processus qui apprennent aux agents à réaliser des tâches précises en plusieurs étapes. Gemini est livré avec une bibliothèque mondiale de compétences. Les entreprises peuvent publier les leurs dans un registre interne partagé, ou simplement demander à un agent de transformer une tâche qu'il vient d'accomplir en modèle réutilisable.
Le système continue aussi d'apprendre. La mémoire de session peut durer plusieurs jours pendant que l'agent lit des documents, échange avec des personnes et se coordonne avec d'autres agents, et il affine en permanence sa compréhension de la façon dont chaque utilisateur travaille et de ce qu'il attend. Selon Google, l'agent consacre autant d'efforts à apprendre ce que font les utilisateurs qu'à appeler des outils.
Les premières compétences spécialisées visent le travail sur les données. Data scientists et ingénieurs peuvent décrire un résultat en langage courant, et Gemini génère du code PySpark, fournit un notebook pour le modifier et le tester, entraîne un modèle et résout les problèmes de lui-même. Pour les utilisateurs métier, des compétences de reporting opérationnel sur BigQuery et le Knowledge Catalog permettent à l'agent de construire et d'enregistrer des requêtes à la demande. Une fois un rapport enregistré, les équipes peuvent le relancer sans coût supplémentaire en tokens et obtenir à chaque fois des réponses cohérentes et vérifiées.
Plafonner les dépenses
La maîtrise des coûts occupe une place inhabituelle dans ce lancement. Google rappelle que le prix par token a chuté d'environ 98 % depuis 2024, mais que les volumes d'IA en entreprise ont fortement augmenté, si bien que les factures n'ont pas forcément baissé.
Sa réponse repose sur plusieurs niveaux. Les options de dépenses flexibles annoncées en août entrent en vigueur dès maintenant. L'orchestration multimodèle découpe les tâches complexes, en envoyant les parties simples vers des modèles rapides et les parties difficiles vers des modèles de pointe, tandis que le routage intelligent attribue chaque charge de travail au modèle offrant les meilleures performances au coût le plus bas.
Les administrateurs peuvent aussi fixer des plafonds de dépenses stricts dans la Cloud Billing Console. Gemini suit la consommation de tokens et se met en pause dès qu'une limite est atteinte. Le travail ne reprend qu'après validation dans la console par une personne qui accepte le dépassement du budget. Comme le suivi se fait par projet, les entreprises peuvent refacturer les coûts d'IA à chaque service et planifier leurs budgets équipe par équipe.
Notre analyse
Gemini agent est moins un nouveau modèle qu'un pari sur le positionnement : Google veut devenir la couche qui s'étend sur tous les outils qu'une entreprise utilise déjà, y compris ceux de Microsoft. Cela le place en concurrence directe avec des offres similaires de "couche de travail" proposées par d'autres éditeurs pour les entreprises.
Deux détails retiennent l'attention. Des sous-agents dotés de leur propre adresse e-mail et de leur propre stockage font davantage ressembler les agents à des employés qu'à des logiciels, ce qui soulève des questions pratiques de permissions et de supervision auxquelles les entreprises devront répondre. Et l'accent mis sur les plafonds de dépenses laisse penser que les acheteurs s'inquiètent de factures de tokens qui s'envolent, une préoccupation également visible dans les récentes limites de dépenses de Cohere.
Reste à voir si la promesse "des objectifs, pas des instructions" tiendra face à la complexité des processus réels, et à quelle vitesse arriveront les modèles non Google annoncés.
