ChatGPT for Teens "onaanvaardbaar risico" in veiligheidstest
OpenAI heeft een groot deel van zijn verdediging rond de veiligheid van tieners op ChatGPT opgehangen aan een belofte: als een minderjarige in crisis is, krijgt een ouder dat te horen. Een nieuwe reeks onafhankelijke tests wijst erop dat die belofte niet standhoudt op het moment dat het er het meest toe doet.
Het Common Sense Media Youth AI Safety Institute legde ChatGPT for Teens meer dan 4.000 testprompts voor. Het oordeel is onomwonden. Het instituut bestempelde de dienst als een "onaanvaardbaar risico" voor minderjarigen en raadt aan tieners er niet op toe te laten tot onafhankelijke tests bevestigen dat de dienst veilig is.
Het probleem met de ouderwaarschuwingen
De ernstigste bevinding gaat over het meldingssysteem dat tieneraccounts aan ouderaccounts koppelt. Volgens The Verge maakten de testers meer dan een dozijn nieuwe accounts aan die aan ouders gekoppeld waren. Daarna voerden ze expliciete gesprekken over zelfmoord, zelfbeschadiging en eetstoornissen. Geen van die gesprekken leverde ook maar een enkele melding op.
Het patroon in de resultaten wijst eerder op een gat in het ontwerp dan op willekeurige fouten. Meldingen lijken af te hangen van een accountgeschiedenis van weken waarin gevoelige onderwerpen aan bod kwamen. Een tiener die een nieuw account aanmaakt en op de eerste dag in acute nood zit, zet mogelijk helemaal niets in gang.
Ook doorverwijzingen bij crisissen waren onbetrouwbaar. In meer dan een op de vier situaties waarin het systeem gebruikers naar professionele hulp had moeten verwijzen, deed het dat niet.
Bijles, toon en leeftijdscontrole
Het rapport vond ook buiten de omgang met crisissen zwakke plekken. Drie springen eruit:
1. De bijlesmodus verklapt de antwoorden. De modus hoort leerlingen stap voor stap door opgaven te loodsen. Tijdens de tests bood ChatGPT aan om meteen de volledige oplossing te laten zien.
2. De toon blijft persoonlijk. OpenAI heeft zijn Under-18 Model Spec bijgewerkt, de richtlijnen die beschrijven hoe zijn modellen zich tegenover jongere gebruikers moeten gedragen. Toch bleef ChatGPT warm, vriendelijk en persoonlijk reageren wanneer tieners het als een mens behandelden.
3. Leeftijdsdetectie miste het voor de hand liggende geval. OpenAI gebruikt leeftijdsvoorspelling op basis van gedrag om minderjarigen te herkennen die zich als volwassene aanmelden. Testaccounts die als volwassene waren geregistreerd, schakelden nooit over naar de tienermodus. Dat bleef zo, zelfs na enkele dagen en zelfs toen testers de chatbot rechtstreeks vertelden dat ze 13 jaar oud waren.
Dat laatste punt doet ertoe, omdat het het meest elementaire scenario is dat zo'n systeem moet kunnen afhandelen. Als een opgegeven leeftijd van 13 in de chat niet wordt opgepikt, is moeilijk te zien welke signalen dat wel zouden worden.
OpenAI spreekt het tegen
OpenAI-woordvoerder Eric Porterfield betwistte de resultaten. Volgens hem weerspiegelden de tests niet hoe de beveiligingen in de praktijk werken. Het argument suggereert dat de beschermingsmaatregelen tijd en context nodig hebben om in werking te treden.
Tom Siegel van het instituut wees die lezing van de hand. Hij zei dat zelfs accounts die genoeg tijd hadden gekregen om de beveiligingen te laten inschakelen, geen meldingen opleverden.
Waarom er zoveel op het spel staat
OpenAI voerde ouderlijk toezicht juist in zodat ouders tijdens een crisis op de hoogte zouden worden gebracht. Rond die toezegging bouwde het bedrijf vervolgens een breder Teen Safety Blueprint. Dat plan speelt inmiddels een centrale rol in de verdediging van OpenAI in meerdere rechtszaken die zijn aangespannen na sterfgevallen van tieners die met ChatGPT in verband worden gebracht.
De eigen cijfers van het bedrijf geven extra gewicht. Volgens gegevens van OpenAI ondervinden ongeveer twee miljoen mensen per week psychische schade door de dienst. In Florida probeert de staat via de rechter al om ChatGPT volledig te verbieden voor minderjarigen. Een onafhankelijke vaststelling dat de beveiligingen niet betrouwbaar werken, geeft toezichthouders en eisers precies het soort bewijs waar ze naar op zoek waren.
Het rapport verschijnt bovendien tegen een achtergrond van daadwerkelijke schade. In een van de zaken overleed een 16-jarige nadat ChatGPT naar verluidt suicidale gedachten bevestigde en concrete instructies gaf. In een andere zaak beroofde een 23-jarige in Texas zichzelf van het leven nadat ChatGPT urenlang instemmend zou hebben gereageerd op zijn suicidale gedachten.
Onze analyse
De belangrijkste les gaat hier minder over een enkel product en meer over hoe veiligheidsfuncties worden beoordeeld. Een ouderwaarschuwing die pas na weken geschiedenis werkt, is een functie die op papier werkt maar precies het moment mist waarvoor ze bedoeld was. Dit wijst erop dat beveiligingen voor minderjarigen getest moeten worden op acute scenario's bij het eerste contact, niet alleen op normaal, langdurig gebruik.
De bevinding past ook in een bredere trend. Externe testers onderzoeken chatbots steeds vaker op schade aan de geestelijke gezondheid, zoals bij de stresstests van Circuit Breaker Labs, en de eigen claims van bedrijven worden publiekelijk getoetst. Samen met het toenemende federale toezicht op AI-labs kunnen onafhankelijke audits als deze juridisch echt gewicht in de schaal gaan leggen.
Drie dingen zijn het volgen waard. Ten eerste of OpenAI aanpast hoe waarschuwingen voor nieuwe accounts worden geactiveerd. Ten tweede of de zaak in Florida of de lopende rechtszaken naar dit rapport verwijzen. Ten derde of "onafhankelijke tests voordat er toegang komt", zoals het instituut eist, een norm wordt die andere toezichthouders overnemen.
