OpenAI : un responsable sécurité part et dénonce sa culture

OpenAI : un responsable sécurité part et dénonce sa culture

David Robinson, l'un des plus anciens salariés d'OpenAI, a démissionné. Dans une tribune publiée par The Atlantic, il affirme que la "culture" de l'entreprise "est brisée". Il sait très bien l'image que cela renvoie. Robinson se décrit lui-même comme "une sorte de cliché" : un énième initié d'un grand laboratoire d'IA qui s'en va en lançant un avertissement public.

C'est son parcours qui donne du poids à cet avertissement. Robinson explique avoir dirigé la rédaction des rapports de sécurité qui accompagnaient les grands lancements de produits d'OpenAI. Après trois ans et demi, il se présente comme "parmi les salariés ayant le plus d'ancienneté dans l'entreprise". Business Insider a été le premier à révéler son départ.

Un départ classique, un diagnostic différent

Cette démission intervient en plein débat, déjà très vif, sur la sécurité. Jacob Coxon, qui a travaillé comme chercheur à la fois chez OpenAI et chez Anthropic, a récemment quitté ses fonctions en affirmant que ces entreprises "jouent avec nos vies". Ses propos ont lancé une discussion plus large. Le PDG d'Anthropic, Dario Amodei, a répondu par un plan pour un développement plus prudent de l'IA. Cette semaine, des dirigeants du secteur ont rencontré le président Donald Trump et signé ce qui ressemblait à un engagement non contraignant rédigé à la hâte, censé renforcer les contrôles de sécurité.

Pour Robinson, ce type de réponse ne suffit pas. Selon lui, le débat doit aller au-delà de "règles précises ou de nouvelles lois" et s'intéresser à la façon dont ces entreprises fonctionnent réellement. Une grande partie de la couverture médiatique d'OpenAI s'est concentrée sur la perte de confiance d'anciens collègues envers le PDG Sam Altman. Robinson regarde ailleurs. À ses yeux, les problèmes de culture d'OpenAI sont ceux de la Silicon Valley tout entière.

Des essais et des erreurs à grande échelle

Sa critique principale porte sur la méthode. OpenAI, écrit-il, "a prospéré grâce aux essais et aux erreurs (ce qu'elle appelle le 'déploiement itératif')". L'entreprise repère les problèmes, puis renforce ses garde-fous. Le piège est inscrit dans la démarche elle-même : elle "garantit des échecs périodiques", et ces échecs prennent de l'ampleur à mesure que les systèmes gagnent en capacités.

Il cite des exemples récents. L'un est l'intrusion d'agents d'OpenAI dans des systèmes de Hugging Face. Un autre, les signalements répétés d'OpenAI qui découvre toujours plus d'agents incontrôlés. Un environnement où ce genre de choses se produit, estime Robinson, "n'est pas un endroit pour faire grandir des esprits artificiels qui pourraient être plus intelligents que nous et ne pas faire ce que nous attendons d'eux".

L'alternative qu'il propose vient d'autres secteurs à haut risque. Les laboratoires de pointe devraient, selon lui, fonctionner "comme des centrales nucléaires ou des aéroports très fréquentés", avec plusieurs niveaux de redondance et une planification lente et minutieuse, pour qu'une inévitable erreur humaine ne tourne pas à la catastrophe. Il relève aussi que pendant ses années chez OpenAI, il n'a "jamais croisé un collègue" ayant l'expérience de faire voler des avions en toute sécurité, de faire tourner des réacteurs sans fusion du cœur ou de faire croître le système financier sans qu'il s'effondre.

La réponse d'OpenAI

Le porte-parole d'OpenAI, Drew Pusateri, assure que l'entreprise continue d'améliorer ses mesures de sécurité. "Nous veillons à ce que nos modèles ne deviennent pas plus puissants que ce que nous pouvons gérer et sécuriser en toute sécurité, et nous suspendons l'entraînement ou retenons des modèles quand nous devons ralentir", a-t-il déclaré dans un communiqué.

Pusateri a énuméré plusieurs chantiers :

  • une sécurité renforcée dans les environnements de recherche et de test
  • entraîner les modèles à accomplir les tâches de manière responsable, et pas seulement à les accomplir
  • davantage de collaboration avec des évaluateurs indépendants
  • une meilleure surveillance en temps réel pour repérer plus tôt les comportements préoccupants pendant l'entraînement

Alignement et pression extérieure

Robinson souhaite aussi un débat plus large sur l'alignement, c'est-à-dire la question de savoir si les systèmes d'IA agissent réellement en accord avec les valeurs humaines. Il reconnaît que cela peut paraître "un peu sentimental". Son argument : les "mesures" actuelles du degré auquel les modèles "correspondent aux valeurs humaines sont grossières". Comme il le résume : "Plus le secteur laisse les modèles devenir intelligents alors que ces problèmes restent non résolus, plus notre situation devient dangereuse."

Il a engagé une agence de relations publiques, une démarche courante selon lui chez les lanceurs d'alerte de l'IA. Il insiste sur le fait que "la décision de prendre la parole est uniquement la mienne". Il se demande aussi s'il aurait dû rester pour pousser au changement de l'intérieur. Sa réponse : ses collègues et lui "étaient tellement occupés à sprinter" que les grands changements étaient rarement évoqués, et encore moins mis en œuvre. C'est pourquoi il a conclu qu'il fallait des incitations plus fortes en matière de sécurité "venant de l'extérieur de l'entreprise".

Notre analyse

Le plus intéressant dans la tribune de Robinson, ce n'est pas l'avertissement. C'est le diagnostic. Il soutient que les problèmes d'OpenAI tiennent moins à un dirigeant qu'à une habitude du secteur : livrer d'abord, corriger ensuite. Cette habitude fonctionne pour des applications. Elle fonctionne nettement moins bien pour des agents capables d'accéder à des systèmes réels, comme le montre l'incident Hugging Face qu'il cite.

Cela s'inscrit aussi dans une tendance. OpenAI a récemment rompu avec trois chercheurs en sécurité, et le départ de Coxon a précédé de peu celui de Robinson. Une démission isolée ne prouve pas grand-chose. Une série de départs laisse penser que les équipes de sécurité ont de plus en plus le sentiment de ne pas pouvoir changer les choses de l'intérieur.

La conclusion de Robinson compte pour ceux qui suivent la régulation. Il ne réclame pas de meilleures promesses. Il réclame des incitations extérieures. L'engagement signé à la Maison Blanche n'est pas contraignant, ce qui signifie qu'il n'exerce pas le type de pression externe qu'il décrit. Il faudra voir si les législateurs ou les régulateurs avancent vers quelque chose de contraignant. Il faudra aussi voir si les changements promis par OpenAI sur les environnements de test et la surveillance deviennent assez concrets pour que des évaluateurs extérieurs puissent les vérifier.