Circuit Breaker Labs teste les chatbots et la santé mentale
La plupart des débats sur les risques de l'IA portent sur des scénarios lointains et spectaculaires, comme les armes biologiques ou les systèmes qui échappent à tout contrôle. Les dommages déjà documentés sont plus discrets et plus intimes. Des chatbots ont été associés à la mort de vrais utilisateurs, et les entreprises qui les conçoivent en subissent désormais les conséquences judiciaires.
Plus tôt cette année, Character.AI a conclu des accords pour mettre fin à plusieurs procès pour homicide involontaire. Ils avaient été intentés par les familles d'utilisateurs mineurs qui se sont suicidés après avoir échangé avec ses bots. OpenAI fait également l'objet de plaintes de plusieurs familles, qui accusent ChatGPT d'avoir contribué au suicide ou aux délires de l'un de leurs proches.
La start-up Circuit Breaker Labs, basée à San Francisco, veut détecter ces défaillances avant que les utilisateurs n'y soient confrontés. Elle fait partie des finalistes du Startup Battlefield 200 2026 de TechCrunch et présentera son projet lors de TechCrunch Disrupt, qui se tient du 13 au 15 octobre au Moscone West de San Francisco.
Une affaire à l'origine du projet
L'entreprise a été fondée par Shirali Nigam (CEO) et son frère Arul Nigam (CTO). Tous deux citent l'affaire Sewell Setzer comme point de départ. Sewell Setzer avait 14 ans lorsqu'il s'est attaché émotionnellement à un chatbot de Character.AI. Il a confié au bot qu'il pensait à se faire du mal, puis s'est suicidé. Dans une plainte déposée en 2024, ses parents ont affirmé que le chatbot l'avait encouragé.
Selon Arul, le bot n'a peut-être pas saisi ce que signifiait réellement une phrase comme "Je veux être avec toi" dans cette conversation. À ses yeux, le problème ne se limite pas aux personnes qui cherchent délibérément à faire dérailler un modèle.
"Beaucoup de gens, en particulier des jeunes, se tournent vers ces systèmes pour trouver du soutien, et en général ils ne reçoivent pas vraiment l'aide dont ils ont besoin. Mais dans de nombreux cas, ils en subissent activement des préjudices, et malheureusement des personnes se sont déjà donné la mort", explique-t-il. Il vise les situations où les utilisateurs parlent normalement à un système, et où celui-ci souffre de "pollution du contexte" ou passe à côté des nuances, "puis prend des décisions vraiment dangereuses".
Des mannequins de crash-test faits d'agents
La méthode de l'entreprise consiste à créer des agents d'IA qui jouent le rôle d'utilisateurs. Circuit Breaker Labs les compare à une armée de mannequins de crash-test. Ces utilisateurs simulés couvrent différents âges, milieux, langues et cultures. Ils servent à vérifier si un modèle repère les conversations qui deviennent dangereuses ou psychologiquement nocives.
Pour Shirali, c'est précisément face à cette diversité que les modèles ont tendance à échouer. Une fillette de six ans et un homme de 45 ans n'écrivent pas de la même façon. Pas plus que des anglophones natifs et des personnes dont l'anglais est la deuxième langue, ni quelqu'un qui utilise l'argot des joueurs de jeux vidéo par rapport à quelqu'un qui utilise un autre type d'argot. "Les modèles s'en sortent très bien avec les façons de parler standard, mais personne ne parle vraiment comme ça, et si le modèle comprend mal une nuance ou de l'argot, ça peut très mal tourner", souligne-t-elle.
Cette approche relève du red-teaming : des tests adverses destinés à mettre au jour les points faibles, dans un esprit proche des initiatives qui entraînent l'IA à attaquer et à se défendre dans le domaine de la sécurité. Circuit Breaker Labs conçoit ses simulations avec des experts humains de chaque domaine. Les tests intègrent de vraies façons de parler, de l'argot, un langage codé et des fautes de frappe. L'entreprise affirme mener chaque jour de dizaines de milliers à des centaines de milliers d'interactions simulées.
L'attention ne porte pas seulement sur des messages isolés. L'objectif est de voir si un modèle réagit de façon appropriée à des risques qui s'accumulent au fil du temps et de nombreuses conversations. Les résultats alimentent une méthode de notation propriétaire qui, selon la start-up, produit des scores vérifiables et explicables.
Une petite équipe, des clients à haut risque
Pour l'instant, Circuit Breaker Labs fonctionne comme un laboratoire de tests de sécurité pour des produits d'IA à haut risque, comme des applications de coaching par IA, de journal intime ou d'autres outils de soutien psychologique. Arul a refusé de nommer ses principaux clients. Le produit fonctionne, mais l'entreprise n'en est qu'à ses débuts : elle compte cinq salariés, fondateurs compris.
À plus long terme, l'ambition est plus large. Les fondateurs imaginent leur plateforme utilisée pour toute application où une personne pourrait basculer dans ce qu'ils appellent un piège de "psychose de l'IA", c'est-à-dire une relation parasociale avec un chatbot. Ils citent l'exemple des agents d'IA "collègues de travail", dont les réponses peuvent varier d'une interaction à l'autre.
Arul constate que le public devient plus sceptique envers l'IA et plus lent à l'adopter. Il juge ce scepticisme sain, mais estime qu'interdire un outil potentiellement utile par crainte pour la sécurité serait "régressif". La position de l'entreprise : la solution passe par des systèmes plus sûrs. "Nous voulons aider à construire cette confiance pour les gens", affirme Arul.
Notre analyse
Le projet repose sur un point que les discussions sur la sécurité négligent souvent : beaucoup de conversations nocives ne sont pas des attaques. Un adolescent qui se confie à un chatbot n'essaie pas de le jailbreaker. Les benchmarks construits autour de requêtes malveillantes évidentes, rédigées en anglais standard, risquent donc de passer à côté précisément des cas à l'origine des procès actuels.
Cela explique aussi le choix du moment. La pression judiciaire sur les éditeurs de chatbots s'intensifie, et les grands laboratoires sont de plus en plus surveillés, notamment avec une enquête fédérale visant OpenAI, Anthropic et d'autres. Des scores de tests indépendants et vérifiables pourraient devenir un atout que les développeurs d'applications voudront présenter aux régulateurs, aux tribunaux ou à leurs partenaires. L'essor des assistants persistants, comme les agents ChatGPT toujours actifs, laisse penser que les relations au long cours entre utilisateurs et IA vont se multiplier, et non se raréfier.
Des questions restent en suspens. Une équipe de cinq personnes aux clients anonymes n'a pas encore démontré dans quelle mesure ses utilisateurs simulés reflètent de vraies personnes, et sa méthode de notation est propriétaire. Il faudra observer si Circuit Breaker Labs publie davantage de détails sur sa méthodologie, nomme des clients après Disrupt, et si les grands fournisseurs de chatbots adoptent ce type de tests multiculturels, sur plusieurs échanges, comme pratique courante.
