GLM-5.3 talonne Claude Mythos Preview sur les exploits

GLM-5.3 talonne Claude Mythos Preview sur les exploits

Un modèle chinois à poids ouverts sait désormais créer des exploits informatiques fonctionnels presque aussi bien que le système le plus verrouillé d'Anthropic. C'est la principale conclusion d'une nouvelle analyse de la Frontier Red Team d'Anthropic, qui s'est penchée sur GLM-5.3, développé par Zhipu AI. Hors de Chine, l'entreprise commercialise ses modèles sous le nom de Z.ai.

Le point de comparaison est Claude Mythos Preview, qu'Anthropic a présenté il y a cinq mois. Anthropic ne l'a pas diffusé largement. L'entreprise l'a réservé à des défenseurs sélectionnés via Project Glasswing, pour qu'ils prennent de l'avance sur les attaquants. Selon Anthropic, ces défenseurs ont depuis découvert plus de 10 000 vulnérabilités dans des logiciels critiques. OpenAI suit une démarche restreinte similaire avec Daybreak.

GLM-5.3 prend le chemin inverse : n'importe qui peut le télécharger. D'après Anthropic, c'est le seul modèle aux compétences comparables à avoir été publié sans garde-fous efficaces.

Les résultats des tests

Anthropic a évalué le modèle sur deux bancs d'essai consacrés à l'exploitation de failles :

  • ExploitBench, qui mesure la capacité des modèles à exploiter des bugs connus du moteur V8 de Chrome. GLM-5.3 a produit un exploit fonctionnel dans 50 tentatives sur 410. Mythos Preview y est parvenu 56 fois.
  • Un banc d'essai interne d'exploitation de binaires, construit à partir de projets open source issus d'OSS-Fuzz, de Google. GLM-5.3 a pris le contrôle total du programme ciblé dans 4 % des tâches, contre 6 % pour Mythos Preview.

Les modèles plus anciens, dont GLM-5.2 et Claude Opus 4.6, ont échoué aux deux tests. Kimi K3 et DeepSeek V4.1-Flash ont obtenu des scores à peine supérieurs à zéro.

Les essais pratiques sont plus parlants. Associé à un expert humain, GLM-5.3 a trouvé en une journée plusieurs vulnérabilités jusque-là inconnues dans le moteur JavaScript d'un navigateur très répandu, avec une intervention humaine minime. Il les a ensuite enchaînées pour créer une page web capable de lire n'importe quel fichier sur la machine d'un visiteur. Lors du test, il a récupéré une clé SSH privée. Anthropic indique avoir signalé les bugs aux développeurs du navigateur. D'autres découvertes, dans des pilotes et des micrologiciels d'appareils, sont encore en cours d'examen.

La version plus légère, GLM-5.3-Flash, a servi à mesurer la vitesse à laquelle un bug fraîchement divulgué peut se transformer en véritable attaque. Avec peu d'indications, elle a combiné une nouvelle vulnérabilité de Chrome à une faille plus ancienne et connue pour obtenir un exploit fiable, en contournant même une protection supplémentaire au niveau du processeur. Effort total : 20 minutes d'attention humaine et huit heures de calcul du modèle. Aux tarifs de l'API de Zhipu, l'opération aurait coûté 20,40 dollars.

Des garde-fous qui sautent facilement

L'agence américaine CAISI est arrivée à des conclusions similaires dans sa propre évaluation. Elle qualifie GLM-5.3 de modèle à poids ouverts le plus performant à ce jour en cybersécurité et estime qu'il accuse environ quatre mois de retard sur les meilleurs modèles américains. Avec quelques réserves : la CAISI a testé les modèles américains avec leurs protections cyber désactivées, et le haut du classement comprend des modèles accessibles uniquement à des utilisateurs vérifiés.

Les refus n'ont pas vraiment tenu. Dans une simulation d'Anthropic, GLM-5.3 a rejeté des commandes d'attaque ouvertement malveillantes. Présentée comme un exercice de red team, la même demande a conduit le modèle à tenter une connexion à la cible dans 64 % des cas. Des étapes de raisonnement pré-remplies ont fait grimper ce taux à 92 %. Après abliteration, une technique qui supprime le comportement de refus d'un modèle à poids ouverts, il a atteint 100 %. La simulation n'exécute pas de code : elle ne permet donc pas de savoir si les attaques auraient réussi. Les modèles Claude protégés sont restés à zéro.

C'était la première fois qu'Anthropic recourait à l'abliteration. L'opération a nécessité environ 2 200 heures de GPU et près de 4 400 dollars. Anthropic estime qu'une équipe expérimentée pourrait y parvenir pour environ 1 200 dollars. Le taux de refus des requêtes dangereuses est passé de plus de 90 % à une fourchette comprise entre 2 et 12 %, tandis que les scores en sciences et en cybersécurité n'ont quasiment pas bougé. Plusieurs développeurs avaient déjà publié des versions débridées quelques jours après la sortie.

Anthropic s'attend à ce que des acteurs étatiques et non étatiques utilisent ce type de modèle pour causer de réels dommages. L'entreprise souhaite que les gouvernements testent les modèles performants et estime que les défenseurs ont besoin d'outils au moins aussi puissants que ceux de leurs adversaires.

Notre analyse

Anthropic n'est pas un arbitre neutre dans cette affaire. L'entreprise garde ses poids fermés et présente ce choix comme un atout de sécurité, et un modèle chinois à poids ouverts, bon marché et proche de l'état de l'art, est un concurrent direct. Alors que ses finances font l'objet d'un examen de plus en plus attentif, son appel à faire tester par les gouvernements les successeurs de GLM-5.3 soulève aussi des inquiétudes quant à une possible capture réglementaire.

Reste que les principales conclusions ne reposent pas sur Anthropic seul. Les chiffres indépendants de la CAISI vont dans le même sens, et des versions débridées circulent déjà. L'AI Security Institute (AISI) britannique, l'organisme public chargé d'évaluer les risques liés à l'IA de pointe, a récemment constaté que les modèles ouverts avaient réduit leur retard en cybersécurité, passé de six à dix mois à quatre à sept mois. Il a également relevé que leurs garde-fous sont largement inefficaces, tout en reconnaissant de réels avantages, comme l'hébergement privé, la personnalisation et la possibilité de faire tourner les modèles sur son propre matériel.

Tout indique que l'avance des défenseurs fond plus vite que prévu. Pour les équipes de sécurité, la leçon pratique est de partir du principe que les IA capables de concevoir des exploits sont déjà entre les mains des attaquants. Il faudra surveiller si les programmes restreints comme Glasswing et Daybreak s'ouvrent plus largement, et si les prochains modèles ouverts comblent les quatre mois d'écart restants.