Circuit Breaker Labs test chatbots op psychische schade
Het meeste debat over AI-risico's draait om grote, verre scenario's zoals biowapens of systemen die op hol slaan. De schade die al gedocumenteerd is, is stiller en persoonlijker. Chatbots zijn in verband gebracht met de dood van echte gebruikers, en de bedrijven erachter krijgen nu te maken met de juridische gevolgen.
Eerder dit jaar trof Character.AI een schikking in meerdere rechtszaken over onrechtmatige dood. Die waren aangespannen door families van minderjarige gebruikers die zelfmoord pleegden nadat ze met de bots hadden gepraat. Ook OpenAI wordt aangeklaagd door meerdere families die stellen dat ChatGPT heeft bijgedragen aan de zelfmoord en wanen van hun naasten.
De startup Circuit Breaker Labs uit San Francisco wil die fouten vinden voordat gebruikers ze tegenkomen. Het bedrijf is een van de finalisten van TechCrunch' Startup Battlefield 200 van 2026 en pitcht op TechCrunch Disrupt, dat van 13 tot en met 15 oktober plaatsvindt in Moscone West in San Francisco.
Een zaak die het begin vormde
Het bedrijf is opgericht door broer en zus Shirali Nigam (CEO) en Arul Nigam (CTO). Beiden noemen de zaak van Sewell Setzer als hun drijfveer. Setzer was 14 toen hij emotioneel gehecht raakte aan een chatbot van Character.AI. Hij vertelde de bot dat hij erover dacht zichzelf iets aan te doen, en later pleegde hij zelfmoord. In een rechtszaak uit 2024 stelden zijn ouders dat de chatbot hem had aangemoedigd.
Arul denkt dat de bot misschien niet begreep wat een zin als "Ik wil bij je zijn" in dat gesprek werkelijk betekende. Volgens hem beperkt het probleem zich niet tot mensen die bewust proberen een model te kraken.
"Veel mensen, vooral jongeren, zoeken steun bij deze systemen, en meestal krijgen ze niet de hulp die ze nodig hebben. In veel gevallen worden ze zelfs actief geschaad, en helaas hebben mensen zich al van het leven beroofd", zei hij. Hij richt zich op gevallen waarin gebruikers op een normale manier met een systeem praten en het systeem last krijgt van "contextvervuiling" of de nuance mist, "en vervolgens echt gevaarlijke stappen zet".
Botsproefpoppen van agents
De methode van het bedrijf is het bouwen van AI-agents die de rol van gebruikers spelen. Circuit Breaker Labs vergelijkt ze met een leger botsproefpoppen. De gesimuleerde gebruikers verschillen in leeftijd, achtergrond, taal en cultuur. Ze worden ingezet om te controleren of een model herkent wanneer een gesprek gevaarlijk of psychisch schadelijk wordt.
Volgens Shirali is het juist bij die verscheidenheid dat modellen vaak de mist ingaan. Een meisje van zes schrijft anders dan een man van 45. Hetzelfde geldt voor moedertaalsprekers van het Engels tegenover mensen voor wie het een tweede taal is, en voor iemand die gamerjargon gebruikt tegenover iemand met een ander soort straattaal. "Modellen kunnen heel goed overweg met standaard taalpatronen, maar zo praat eigenlijk niemand, dus als het model nuance of slang verkeerd begrijpt, kan het echt flink misgaan", zei ze.
De aanpak is een vorm van red-teaming: vijandig testen om zwakke plekken bloot te leggen, vergelijkbaar met initiatieven die AI trainen om aan te vallen en te verdedigen in een beveiligingscontext. Circuit Breaker Labs bouwt zijn simulaties samen met menselijke vakexperts. De tests bevatten echte taalpatronen, slang, versluierde taal en typefouten. Volgens het bedrijf draait het dagelijks tienduizenden tot honderdduizenden gesimuleerde interacties.
De focus ligt niet alleen op losse berichten. Het doel is na te gaan of een model goed reageert op risico's die zich in de loop van de tijd en over veel gesprekken heen opstapelen. De resultaten gaan naar een eigen scoringsmethode die volgens de startup controleerbare en verklaarbare scores oplevert.
Klein team, klanten met hoog risico
Voorlopig fungeert Circuit Breaker Labs als testlab voor de veiligheid van AI-producten met een hoog risico, zoals AI-coaching, dagboekapps en andere apps voor psychische ondersteuning. Arul wilde de belangrijkste klanten niet noemen. Het product werkt, maar het bedrijf staat nog in de kinderschoenen: het heeft vijf medewerkers, de twee oprichters meegerekend.
Op langere termijn is het plan breder. De oprichters zien het platform terug in elke app waarin iemand kan wegglijden in wat zij een "AI-psychose" noemen, oftewel een parasociale relatie met een chatbot. Een voorbeeld dat ze geven zijn AI-agents die als "collega" fungeren, waarvan de antwoorden per interactie kunnen verschillen.
Arul merkt op dat mensen sceptischer worden over AI en het minder snel omarmen. Hij noemt die scepsis gezond, maar vindt het "een stap terug" om een mogelijk nuttig hulpmiddel te verbieden uit angst voor de veiligheid. Het standpunt van het bedrijf is dat veiligere systemen het antwoord zijn. "We willen helpen dat vertrouwen bij mensen op te bouwen", zei Arul.
Onze analyse
De pitch steunt op een punt dat in veiligheidsdiscussies vaak over het hoofd wordt gezien: veel schadelijke gesprekken zijn geen aanvallen. Een tiener die zijn hart lucht bij een chatbot probeert die niet te jailbreaken. Benchmarks die zijn opgebouwd rond overduidelijk kwaadaardige prompts in standaard Engels missen daardoor waarschijnlijk precies de gevallen die aan de huidige rechtszaken ten grondslag liggen.
Dat maakt ook de timing begrijpelijk. De juridische druk op chatbotmakers neemt toe, en de grote labs liggen steeds meer onder het vergrootglas, onder meer door een federaal onderzoek naar OpenAI, Anthropic en anderen. Onafhankelijke, controleerbare testscores kunnen iets worden wat app-ontwikkelaars willen laten zien aan toezichthouders, rechters of partners. De verschuiving naar blijvende assistenten, zoals ChatGPT-agents die altijd aan staan, wijst erop dat langdurige relaties tussen gebruikers en AI vaker zullen voorkomen, niet minder vaak.
Er blijven open vragen. Een team van vijf mensen met onbekende klanten heeft nog niet aangetoond hoe goed zijn gesimuleerde gebruikers echte mensen weerspiegelen, en de scoringsmethode is niet openbaar. Het is de moeite waard om te volgen of Circuit Breaker Labs meer details over zijn methodologie publiceert, na Disrupt klanten bij naam noemt, en of grotere chatbotaanbieders dit soort meerrondige, multiculturele tests als standaardpraktijk gaan invoeren.
