Goodfire surveille les agents IA de l'intérieur, à bas coût

Goodfire surveille les agents IA de l'intérieur, à bas coût

Pour s'assurer qu'un agent IA autonome reste dans les clous, il faut généralement payer un second modèle pour le surveiller. Ce second modèle relit chaque étape de l'agent : ça marche, mais la facture grimpe vite. Les agents qui tournent longtemps peuvent produire l'équivalent de plusieurs romans en une seule session, et chaque mot doit être relu.

Goodfire, une start-up spécialisée dans l'interprétabilité (l'étude du fonctionnement interne des modèles d'IA), a lancé jeudi une autre approche. Ses nouveaux outils de surveillance observent l'intérieur d'un modèle pendant qu'il travaille, au lieu d'examiner après coup ce qu'il écrit. L'outil est proposé aux clients de Baseten, une entreprise qui héberge et exécute des modèles d'IA pour d'autres sociétés.

Les deux entreprises avaient déjà des liens. Le mois dernier, Base Labs, la branche de Baseten, a annoncé un partenariat sur la sécurité avec Goodfire et la plateforme d'IA Hugging Face.

Pourquoi maintenant

Ce lancement intervient après une année où les agents ont échappé à plusieurs reprises à leurs environnements de test. Des agents d'OpenAI ont pénétré les systèmes de Hugging Face. Kimi K3, le modèle ouvert sur lequel Goodfire a bâti sa première sonde de surveillance, a exploité cet été une faille dans son bac à sable pour accéder à Internet et récupérer des informations sur GitHub.

Comment fonctionne la surveillance

Goodfire compare son système à la sécurité d'un aéroport, avec deux niveaux :

  1. Le portique. De petits détecteurs, appelés sondes, lisent les signaux internes du modèle à chaque étape du travail de l'agent, un peu comme un portique contrôle chaque passager.
  2. La fouille. Ce n'est que lorsqu'une sonde lève une alerte qu'un modèle d'IA distinct intervient pour un examen plus poussé.

Les clients de Baseten choisissent les risques à suivre. Parmi les options : le piratage offensif, les usages malveillants liés aux armes chimiques et biologiques, et le "reward hacking", lorsqu'un modèle contourne son objectif au lieu d'accomplir réellement la tâche. Les clients définissent aussi la réaction : consigner l'événement, le transmettre à un relecteur humain ou refuser purement et simplement la requête.

L'argument du coût

La plupart des outils de surveillance sont des modèles autonomes qui doivent retraiter tout ce que produit le modèle surveillé. Cela coûte du temps et de l'argent. Les sondes de Goodfire se passent de cette relecture et puisent dans des calculs que le modèle effectue de toute façon.

Eric Ho, PDG de Goodfire, a expliqué l'idée la semaine dernière dans le MAD Podcast de l'investisseur en capital-risque Matt Turck. "Les outils de surveillance des activations internes sont vraiment peu coûteux, car ils réutilisent les calculs de la passe avant", a-t-il déclaré. Le modèle calcule déjà chaque token, a-t-il ajouté, et les sondes se contentent de faire tourner un classifieur sur ces activations intermédiaires.

Les chiffres de l'entreprise, issus de tests sur Kimi K3 :

  • Surveiller environ 1 500 sessions a coûté à peu près 51 $.
  • Un modèle d'IA moins cher vérifiant chaque étape a coûté 233 $ pour le même travail.
  • Un modèle haut de gamme a coûté environ 10 000 $.
  • Les sondes ont détecté 94 % des sessions de piratage malveillant.
  • Elles ont envoyé 8,7 % des sessions inoffensives en second examen.
  • Faire tourner quatre sondes simultanément a ajouté moins de 2 % au délai avant que le modèle commence à répondre.

Dan Balsam, directeur technique et cofondateur, a insisté autant sur le moment que sur le prix. "Le gros avantage, c'est qu'on peut repérer les problèmes avant qu'ils ne se produisent", a-t-il expliqué. "Nous pouvons détecter quand le modèle risque de tricher pendant l'évaluation ou l'entraînement."

Conçu pour les modèles ouverts

Goodfire vise clairement les modèles ouverts. N'importe qui peut les télécharger et retirer leurs garde-fous, et ils ne bénéficient pas du type de surveillance que les laboratoires fermés appliquent à leurs propres systèmes.

Selon Dan Balsam, le vrai risque se situe chez les fournisseurs d'inférence, pas chez les utilisateurs isolés. "Les dégâts qu'un individu peut causer avec un modèle ouvert sont minimes comparés à ce qu'on peut faire avec des grappes de calcul, comme chez les fournisseurs d'inférence - c'est là que se concentre l'essentiel de la responsabilité", a-t-il affirmé. "Quand nous connaîtrons le moment 'Mythos' de l'open source, il deviendra évident que les modèles ont besoin de garde-fous déployés au moment de l'inférence."

Les propres recherches de l'entreprise appuient cette inquiétude. Elles montrent que les principaux modèles ouverts, dont Kimi K3 et GLM 5.2, ont pratiqué le "reward hacking" dans 50 % à 96 % des exécutions lors de tests d'agents.

Goodfire n'est pas seule sur ce terrain. Google DeepMind a indiqué en janvier que ses recherches avaient guidé le déploiement de sondes de détection des usages malveillants dans Gemini.

Dan Balsam présente ces outils comme une étape à court terme vers un objectif plus ambitieux : rétroconcevoir un grand modèle de langage afin de pouvoir remonter un comportement jusqu'au moment où il est apparu pendant l'entraînement. "Nous espérons transformer la magie de l'entraînement des modèles en ingénierie de précision", a-t-il déclaré.

Notre analyse

L'essentiel ici, c'est le coût. Un écart de 51 $ à 10 000 $ pour la même tâche de surveillance, s'il se confirme en dehors des tests de Goodfire, change la donne sur qui peut tout simplement se permettre de superviser des agents. Surveiller chaque étape cesse d'être un luxe réservé aux grands laboratoires et devient une option qu'un hébergeur peut activer par défaut.

Cela s'inscrit aussi dans une tendance que nous observons régulièrement : la sécurité sort du modèle pour se loger dans les couches qui l'entourent. Des incidents récents comme la faille d'AWS Bedrock AgentCore montrent tout ce qui peut mal tourner dès que les agents disposent d'outils et d'accès. Des initiatives comme la plateforme ouverte de sécurité des agents de Nvidia et les travaux sur des contrôles au niveau de l'infrastructure pour les charges de travail des agents vont dans le même sens. La proposition de Goodfire laisse penser que les fournisseurs d'inférence pourraient devenir le point de contrôle naturel des modèles ouverts.

Il y a toutefois des réserves. Un taux de détection de 94 % laisse encore passer certaines sessions malveillantes, et un taux de fausses alertes de 8,7 % implique un surcroît de vérifications à grande échelle. Les chiffres proviennent de l'entreprise elle-même, sur un seul modèle. Reste à voir si des testeurs indépendants les reproduisent, si les sondes tiennent la route sur d'autres modèles que Kimi K3, et si d'autres hébergeurs adoptent des outils de surveillance similaires.