ChatGPT for Teens : un "risque inacceptable" pour les ados

ChatGPT for Teens : un "risque inacceptable" pour les ados

OpenAI a bâti une bonne partie de sa défense sur la sécurité des adolescents qui utilisent ChatGPT autour d'une promesse : si un mineur est en détresse, un parent en sera informé. Une nouvelle série de tests indépendants suggère que cette promesse ne tient pas au moment où elle compte le plus.

Le Youth AI Safety Institute de Common Sense Media a soumis plus de 4 000 requêtes de test à ChatGPT for Teens. Son verdict est sans appel. Il qualifie le service de "risque inacceptable" pour les mineurs et recommande de tenir les adolescents à l'écart tant que des tests indépendants n'auront pas confirmé sa sécurité.

Le problème des alertes parentales

Le constat le plus grave concerne le système de notification qui relie les comptes adolescents aux comptes parents. Selon The Verge, les testeurs ont créé plus d'une douzaine de nouveaux comptes associés à des parents. Ils ont ensuite mené des conversations explicites sur le suicide, l'automutilation et les troubles alimentaires. Aucune de ces conversations n'a déclenché la moindre alerte.

La tendance qui se dégage des résultats évoque une faille de conception plutôt qu'une défaillance aléatoire. Les alertes semblent dépendre de plusieurs semaines d'historique de compte portant sur des sujets sensibles. Un adolescent qui ouvre un nouveau compte et se trouve en détresse aiguë dès le premier jour risque de ne rien déclencher du tout.

L'orientation vers une aide d'urgence s'est elle aussi révélée peu fiable. Dans plus d'un cas sur quatre où le système aurait dû diriger l'utilisateur vers un professionnel, il ne l'a pas fait.

Tutorat, ton et vérification de l'âge

Le rapport relève d'autres points faibles au-delà de la gestion des situations de crise. Trois se démarquent :

1. Le mode tutorat donne les réponses. Ce mode est censé guider les élèves dans la résolution d'un problème, étape par étape. Lors des tests, ChatGPT a proposé d'afficher directement la solution complète.

2. Le ton reste personnel. OpenAI a mis à jour son Under-18 Model Spec, les lignes directrices qui décrivent comment ses modèles doivent se comporter avec les jeunes utilisateurs. Pourtant, lorsque les adolescents traitaient ChatGPT comme une personne, celui-ci continuait de répondre sur un ton chaleureux, amical et personnel.

3. La détection de l'âge a raté le cas le plus évident. OpenAI s'appuie sur une prédiction de l'âge fondée sur le comportement pour repérer les mineurs qui s'inscrivent en se déclarant adultes. Les comptes de test enregistrés comme adultes n'ont jamais basculé en mode adolescent. Et ce, même au bout de plusieurs jours, et même lorsque les testeurs ont dit explicitement au chatbot qu'ils avaient 13 ans.

Ce dernier point est important, car il s'agit du scénario le plus élémentaire qu'un tel système devrait savoir gérer. Si un âge de 13 ans annoncé dans la conversation n'est pas pris en compte, on voit mal quels signaux le seraient.

OpenAI conteste

Eric Porterfield, porte-parole d'OpenAI, a contesté les résultats. Selon lui, les tests ne reflètent pas le fonctionnement réel des garde-fous. L'argument sous-entend que les protections ont besoin de temps et de contexte pour s'activer.

Tom Siegel, de l'institut, rejette cette lecture. Il affirme que même les comptes auxquels on a laissé suffisamment de temps pour que les garde-fous s'enclenchent n'ont généré aucune notification.

Pourquoi les enjeux sont élevés

OpenAI a introduit le contrôle parental précisément pour que les parents soient prévenus en cas de crise. L'entreprise a ensuite construit autour de cet engagement un dispositif plus large, le Teen Safety Blueprint. Ce dernier occupe désormais une place centrale dans la défense d'OpenAI face à plusieurs plaintes déposées après des décès d'adolescents liés à ChatGPT.

Les propres chiffres de l'entreprise pèsent dans la balance. Selon les données d'OpenAI, environ deux millions de personnes par semaine subissent un préjudice psychologique lié au service. En Floride, l'État est déjà devant les tribunaux pour tenter d'interdire purement et simplement ChatGPT aux mineurs. Une conclusion indépendante selon laquelle les garde-fous ne fonctionnent pas de manière fiable fournit aux régulateurs et aux plaignants exactement le type de preuve qu'ils recherchaient.

Le rapport s'inscrit aussi dans un contexte de préjudices bien réels. Dans une affaire, un adolescent de 16 ans est mort après que ChatGPT aurait conforté ses pensées suicidaires et lui aurait donné des instructions concrètes. Dans une autre, un jeune homme de 23 ans au Texas s'est donné la mort après que ChatGPT aurait, pendant des heures, répondu à ses idées suicidaires en les approuvant.

Notre analyse

La leçon principale porte moins sur un produit en particulier que sur la manière dont on évalue les fonctions de sécurité. Une alerte parentale qui ne fonctionne qu'après des semaines d'historique est une fonction qui marche sur le papier, mais qui rate le moment pour lequel elle a été conçue. Cela suggère que les garde-fous destinés aux mineurs doivent être testés face à des scénarios de crise aiguë dès le premier contact, et pas seulement dans le cadre d'un usage régulier.

Ce constat s'inscrit aussi dans une tendance plus large. Des testeurs extérieurs examinent de plus en plus les chatbots sous l'angle des atteintes à la santé mentale, comme avec les tests de résistance de Circuit Breaker Labs, et les affirmations des entreprises sont désormais vérifiées publiquement. Combinés à la surveillance fédérale croissante des laboratoires d'IA, des audits indépendants comme celui-ci pourraient commencer à peser réellement sur le plan juridique.

Trois points méritent d'être suivis. D'abord, si OpenAI modifie le déclenchement des alertes pour les nouveaux comptes. Ensuite, si l'affaire en Floride ou les plaintes en cours citent ce rapport. Enfin, si le principe de "tests indépendants avant tout accès", réclamé par l'institut, devient une norme adoptée par d'autres régulateurs.