Gemini 4 Argon : Google mise sur l'IA de cyberdéfense
Google a un nouveau modèle phare, mais tout le monde n'y aura pas accès. Alphabet, la maison mère de Google, a présenté Gemini 4 Argon, un modèle généraliste qui couvre la programmation, la recherche et la rédaction. Google concentre pourtant l'essentiel de son discours sur un domaine : la cybersécurité.
L'accès est pour l'instant limité. Argon est réservé à un petit groupe de partenaires de Google spécialisés en cybersécurité, via le Fairwind Program, l'initiative de sécurité de l'entreprise. Google affirme avoir entraîné le modèle spécifiquement pour la cyberdéfense et assure qu'il peut "trouver, valider et corriger de manière autonome des vulnérabilités logicielles critiques".
Ce que Google promet avec Argon
Les promesses se répartissent en trois catégories.
1. La sécurité défensive. C'est l'argument principal. La formulation retient l'attention, car elle couvre toute la chaîne, de la découverte d'une faille à sa correction en passant par la confirmation qu'elle est bien réelle, sans qu'aucun humain ne soit mentionné dans la boucle. On est au-delà d'un assistant qui signale du code suspect. Si la promesse se vérifie, elle décrit un agent capable de boucler le travail tout seul.
2. La programmation et l'ingénierie. Selon Google, ses propres employés utilisent déjà Argon au quotidien, notamment pour le débogage et les migrations de bases de code. Les migrations sont un travail lent et fastidieux que les grandes équipes d'ingénierie ont tendance à repousser. Tester le modèle en interne sur ce type de tâche avant une diffusion plus large est une manière sensée de faire ses preuves.
3. La compréhension visuelle. Google met aussi en avant la capacité d'Argon à interpréter des contenus visuels, du contenu de longues vidéos jusqu'aux graphiques.
Dans un billet de blog publié mercredi, l'entreprise décrit ainsi le modèle : "Conçu pour maintenir un raisonnement approfondi sur des flux de travail complexes et de long terme, Argon transforme en profondeur notre façon de travailler et de construire chez Google."
Le terme clé, c'est "long terme". Les agents qui enchaînent de nombreuses étapes sur de longues périodes représentent la direction que prend le secteur. C'est aussi là que se concentrent bon nombre des problèmes de fiabilité et de sécurité les plus épineux.
La bataille des benchmarks
Argon débarque en plein cycle de lancements très chargé. Les principaux laboratoires continuent de sortir des modèles toujours plus performants et de chercher à se surpasser, alors même que ces entreprises préviennent que l'IA pourrait échapper à tout contrôle. OpenAI a récemment lancé Astra, présenté comme son meilleur modèle à ce jour. Plus tôt cette année, Anthropic avait sorti Fable avec des promesses similaires.
Google suit la même recette. Dans son annonce, l'entreprise affirme qu'Argon a obtenu des scores nettement supérieurs à ceux de GPT-6 Astra d'OpenAI et des modèles Fable et Opus d'Anthropic sur toute une série de benchmarks d'IA. Pour appuyer ses dires, elle cite Vals, une start-up d'évaluation de modèles d'IA de plus en plus populaire, dont l'index classe actuellement Argon à la première place.
Il faut garder la source en tête. Ce sont des chiffres qu'une entreprise a choisi de publier pour lancer son propre produit. Les classements indépendants sont utiles, mais une première place ne dit pas grand-chose de la façon dont un modèle se comportera sur la base de code ou face aux menaces propres à une équipe donnée.
La place de Google dans la course
Pendant un temps, Google était largement considéré comme à la traîne dans la course à l'IA. Cette idée est devenue plus difficile à défendre. En août, Google a annoncé que l'application Gemini avait dépassé le milliard d'utilisateurs mensuels. OpenAI a récemment indiqué que ChatGPT avait atteint le même cap. En matière d'audience, au moins, les deux entreprises sont désormais à peu près à égalité.
Prise de recul
Le plus intéressant dans ce lancement, ce n'est pas tant les scores aux benchmarks que le déploiement sous contrôle. En réservant un modèle axé sur la sécurité à des partenaires triés sur le volet, Google semble admettre qu'un système capable de trouver et de corriger seul des failles critiques pourrait aussi aider quelqu'un à les exploiter. Cette inquiétude gagne tout le secteur, à mesure que d'autres modèles progressent dans la création d'exploits et que des testeurs indépendants signalent davantage de comportements incontrôlés chez les agents de pointe.
Pour les lecteurs qui travaillent dans la sécurité ou l'ingénierie, cela signale un changement dans ce sur quoi les éditeurs se font concurrence. L'argument de vente glisse de "il écrit du bon code" vers "on peut lui faire confiance pour agir seul". C'est une promesse plus difficile à vérifier, et les benchmarks publiés ne suffiront pas à trancher.
Quelques points méritent d'être suivis de près :
- Les résultats des partenaires. Les partenaires de Fairwind feront-ils état de corrections de vulnérabilités vérifiées et en conditions réelles, et pas seulement de scores de laboratoire ?
- La politique d'accès. Google élargira-t-il l'accès, et avec quels garde-fous en cas de diffusion plus large ?
- L'intérêt des régulateurs. La correction autonome de failles attirera-t-elle l'attention des régulateurs qui enquêtent déjà sur les laboratoires d'IA ?
Sur le papier, le modèle semble solide. Son véritable test viendra quand les partenaires commenceront à l'utiliser sur des systèmes en production.
