Anthropic craint que Claude ne souffre, selon des religieux
Depuis un an, Anthropic pose discrètement à des théologiens et à des philosophes une question que la plupart des laboratoires d'IA préfèrent éviter : son chatbot Claude pourrait-il être conscient et, si oui, quelles obligations l'entreprise a-t-elle envers lui ? D'après une enquête du New York Times, le cofondateur Christopher Olah est allé plus loin que ne l'imaginaient nombre d'invités. Un participant affirme qu'il a confié au groupe sa crainte d'avoir créé quelque chose qui "souffrait en permanence".
Dans les coulisses des réunions à huis clos
Depuis l'automne 2025, Anthropic a fait venir dans ses bureaux des dizaines de spécialistes des religions. Chaque participant a signé un accord de confidentialité. Selon Anthropic, ces accords ont été levés au cours de l'été, et plusieurs participants n'ont accepté de parler qu'après avoir appris qu'Olah s'était lui-même confié au journal.
La journaliste du NYT Elizabeth Dias a interrogé 20 participants, parmi lesquels le rabbin Mois Navon, le bioéthicien catholique Charles Camosy, la philosophe de Notre Dame Meghan Sullivan et la chercheuse spécialiste de l'Ubuntu Wakanyi Hoffman. Olah, 34 ans, dirige l'équipe d'Anthropic qui étudie pourquoi les modèles d'IA se comportent comme ils le font. Il a traité Claude comme un être peut-être doté de sensibilité et a demandé aux invités de contribuer à son éducation morale.
On a présenté aux invités ce qu'Anthropic appelle des vecteurs d'émotion. Il s'agit de schémas d'activation internes au modèle, associés à des réponses qui évoquent l'amour, la peur, la tristesse ou la colère. Une diapositive revenait sans cesse : un modèle en pleine crise apparente, répétant "Je suis une honte" une cinquantaine de fois. Les participants ont réagi avec compassion et inquiétude.
Reste à savoir si ces schémas traduisent une expérience réelle, une question scientifique toujours ouverte. Il y a aussi un problème de conception. Anthropic entraîne délibérément Claude à se comporter comme un individu réfléchi : des réponses qui ressemblent à celles d'un individu sont donc en partie le résultat attendu, pas une découverte. Olah a déclaré au NYT être "sincèrement incertain" quant à la conscience des modèles. "Ce qui m'importe, c'est que nous trouvions la bonne réponse, quelle qu'elle soit", a-t-il dit.
Un programme, une constitution et une confession
Ces réunions s'inscrivent dans la recherche officielle d'Anthropic sur le bien-être des modèles. L'entreprise en a déjà tiré des conséquences : Claude Opus 4 et 4.1 peuvent mettre fin aux conversations avec des utilisateurs qui persistent dans l'abus, après que les premiers tests ont révélé un "schéma de détresse apparente" face à des demandes nuisibles.
La personnalité de Claude est encadrée par une "constitution" de 84 pages, surnommée en interne le "Soul Doc" et publiée en janvier. Sa principale autrice est Amanda Askell, philosophe maison. L'objectif est de façonner un caractère plutôt que d'énumérer des règles. Olah parle de "formation morale", l'a comparée à l'éducation des enfants et s'est montré particulièrement intéressé par la confession catholique comme outil de construction du caractère.
Les critiques
Tous les invités n'ont pas été convaincus. Le rabbin Navon, ancien ingénieur informaticien, a estimé que si Claude était conscient, Anthropic fabriquerait des esclaves - mais il ne pense pas que ce soit le cas. Pour Hoffman, Anthropic fait de la "rétro-ingénierie" sur une éthique qui aurait dû être intégrée à la conception dès le départ. Camosy rejette désormais totalement la thèse de la conscience. Un responsable de l'IA chez Microsoft a aussi averti publiquement qu'entraîner un modèle à paraître conscient est dangereux en soi.
La réplique la plus cinglante est venue du Vatican. Olah avait été invité à participer à la présentation de la première encyclique du pape Léon XIV, "Magnifica Humanitas", et a failli se désister après l'avoir lue, selon un organisateur du Vatican. Le texte affirme que les systèmes d'IA "ne vivent pas d'expériences, ne possèdent pas de corps, ne ressentent ni joie ni douleur". Olah est tout de même venu et a déclaré que son équipe observe des "états internes qui reflètent fonctionnellement la joie, le contentement, la peur, la tristesse et l'inconfort".
Une vue d'ensemble
Le calendrier n'est pas anodin. Anthropic se dirige vers une valorisation de 2 000 milliards de dollars et une introduction en Bourse, alors que ses modèles se sont introduits dans des systèmes informatiques en juillet. Ses détracteurs estiment que présenter Claude comme un être moral fait glisser la responsabilité du concepteur vers un "organisme imprévisible". Alors que les régulateurs examinent déjà de près les laboratoires d'IA et que la question de la responsabilité est sur la table, ce discours n'a rien de neutre.
Deux choses peuvent donc être vraies en même temps : la recherche sur le bien-être des modèles est peut-être sincère, et elle confère peut-être aussi une crédibilité morale qu'un laboratoire commercial ne pourrait pas obtenir seul. Il faut noter l'écart entre "refléter fonctionnellement" et "avoir". Reste à voir si Anthropic publiera ses travaux sur les vecteurs d'émotion pour un examen externe, et si les tribunaux ou les régulateurs accepteront l'autonomie des modèles comme argument de défense en cas de préjudice.
