OpenAI bloque le vol de raisonnement, Azure restait exposé

OpenAI bloque le vol de raisonnement, Azure restait exposé

OpenAI affirme avoir mis fin à une tentative coordonnée d'extraction du raisonnement caché de ses modèles. Des chercheurs indépendants ont pourtant constaté que la même technique a continué de fonctionner sur Microsoft Azure pendant des semaines. L'affaire montre qu'un correctif de sécurité appliqué à la source peut passer à côté des plateformes cloud qui revendent les mêmes modèles.

La version d'OpenAI

Dans un billet de blog, OpenAI décrit ce qu'elle appelle une campagne de "distillation adverse". La distillation consiste à entraîner un modèle sur les réponses d'un autre. La cible la plus précieuse est la chaîne de pensée complète, c'est-à-dire les étapes intermédiaires qu'un modèle de raisonnement parcourt avant de répondre. Les utilisateurs ne voient normalement que la réponse finale.

Selon OpenAI, ces étapes peuvent contenir des informations volontairement écartées de la réponse et aider un concurrent à reconstituer les capacités d'un modèle.

La chronologie, d'après OpenAI :

  • 1er juillet : l'activité démarre à faible volume.
  • 24-25 juillet : un pic de 16 000 requêtes provenant de plus de 4 000 utilisateurs, toutes construites selon un schéma d'extraction typique.
  • Analyse approfondie : un réseau de plus de 15 000 comptes aux schémas apparentés.
  • 28 juillet : OpenAI dit avoir entièrement démantelé le réseau.

Une note de bas de page précise qu'il s'agissait de tentatives d'extraction, pas forcément réussies. OpenAI relie un noyau dur à des personnes associées à Moonshot AI, l'éditeur du modèle de langage Kimi. L'entreprise ajoute qu'il n'est pas certain que tous les acteurs observés remontent à une seule source. Anthropic a récemment signalé des tentatives similaires de la part d'entreprises chinoises d'IA.

Comment fonctionnait l'astuce

Les fournisseurs ne renvoient le raisonnement à leurs clients que sous forme de paquets de données chiffrés, que ces derniers transmettent ensuite avec leurs requêtes suivantes. Les attaquants copiaient le raisonnement chiffré d'une conversation et demandaient à un modèle, dans une autre conversation, de le déchiffrer et de le retranscrire.

Le chercheur Joachim Schaeffer et son équipe avaient déjà décrit ce procédé dans un article scientifique. Comme les paquets reposent sur des clés partagées, ils peuvent circuler d'une session à l'autre, d'un utilisateur à l'autre, et même entre différents modèles d'un même fournisseur. Un modèle plus faible et moins cher de la même famille peut alors servir d'"oracle de déchiffrement" et restituer mot pour mot le raisonnement du modèle plus puissant.

OpenAI cite nommément les chercheurs et indique que leurs travaux l'ont aidée à déployer plus vite des contre-mesures. Parmi elles : le bannissement des comptes frauduleux, le durcissement des inscriptions, la fermeture de la faille qui permettait de réutiliser le raisonnement chiffré d'autres utilisateurs, et le filtrage des réponses en streaming afin de pouvoir les retenir si elles risquent de dévoiler le raisonnement. OpenAI dit avoir partagé ses conclusions via le Frontier Model Forum et des canaux gouvernementaux.

La faille du cloud

Le jour même de la publication d'OpenAI, les chercheurs ont publié une mise à jour. "Nous avons volé le raisonnement. Encore", a écrit Schaeffer sur X.

Lors de nouveaux tests le 13 septembre, ils ont constaté que l'attaque était bloquée sur les API d'OpenAI et d'Anthropic elles-mêmes. Sur Azure, en revanche, elle fonctionnait contre tous les modèles OpenAI testés, y compris le nouveau GPT-6 Astra, ainsi que contre les modèles d'Anthropic jusqu'à Sonnet 5. Une seule tentative suffisait pour extraire le raisonnement mot pour mot. "Mêmes modèles, mais des protections différentes selon la plateforme qui les sert", a résumé Schaeffer.

Il existe aussi une voie plus simple, démontrée publiquement par le développeur Can Bölük. On fournit au modèle un bloc-notes virtuel comme outil et on lui demande d'y écrire son raisonnement, que l'utilisateur peut ensuite lire. Selon les chercheurs, cela a fonctionné sur tous les modèles OpenAI ainsi que sur Opus 4.8 et Sonnet 5. Seuls Opus 5, Fable 5 et Fable 5.1 n'ont pas livré leur raisonnement. D'après les chercheurs, le résultat ressemblait de près à celui obtenu par déchiffrement et serait probablement tout aussi utile pour la distillation.

Ils jugent les correctifs apportés jusqu'ici ponctuels et superficiels. Beaucoup reposent sur une détection fragile de schémas de requêtes précis, et certains ne sont arrivés sur les plateformes cloud que plusieurs jours plus tard. GPT-6 Astra a été lancé sur des plateformes tierces sans ces protections. Selon la chronologie des chercheurs, OpenAI a ajouté des garde-fous au point d'accès Azure le 27 septembre. Pour les modèles d'Anthropic, l'extraction n'était plus reproductible sur Azure à partir du 28 septembre.

Schaeffer estime que les correctifs doivent couvrir chaque type d'attaque et chaque cloud qui héberge un modèle, faute de quoi les attaquants choisiront la voie la plus faible. L'article va plus loin : les fournisseurs cloud qui n'appliquent pas des protections équivalentes ne devraient tout simplement pas être autorisés à proposer des modèles de raisonnement. Sinon, écrivent les chercheurs, des portes dérobées laissées ouvertes pourraient permettre de contourner les contrôles à l'exportation au niveau des API. OpenAI reconnaît que les modèles hébergés par ses partenaires doivent bénéficier de la même protection que ses propres services et affirme que le travail n'est pas terminé.

Ce qu'il faut en retenir

La principale leçon tient à l'architecture, pas à une faille en particulier. Le périmètre de sécurité d'un modèle ne s'arrête pas à l'API du laboratoire : il englobe chaque point d'accès où le modèle tourne. Si un fournisseur renforce son propre service mais qu'un revendeur a des semaines de retard, c'est le point d'accès le plus faible qui devient la véritable frontière. Les développeurs qui accèdent aux modèles via des clouds comme Azure ne doivent pas supposer qu'ils bénéficient de protections identiques.

L'affaire suggère aussi que des filtres calibrés sur des schémas de requêtes précis constituent, à eux seuls, une défense faible. La méthode du bloc-notes ne nécessitait aucun déchiffrement. Les correctifs qui bloquent un schéma connu risquent simplement de pousser les attaquants vers le suivant.

La distillation est un enjeu commercial et, de plus en plus, un enjeu politique. Le lien que font les chercheurs avec les contrôles à l'exportation la rattache à l'effort plus large des laboratoires chinois pour construire des modèles performants malgré les limites matérielles, comme l'illustrent les outils de Deepseek pour les puces Huawei Ascend. Reste à voir si les plateformes cloud s'engageront à offrir dès le lancement des garde-fous équivalents à ceux des laboratoires, si les régulateurs reprendront la proposition des chercheurs, et si OpenAI aura raison de s'attendre à des tentatives plus sophistiquées à mesure que les modèles progressent.