Anthropic vreest dat Claude lijdt, zeggen religieuze leiders

Anthropic vreest dat Claude lijdt, zeggen religieuze leiders

Anthropic heeft het afgelopen jaar in alle stilte theologen en filosofen een vraag voorgelegd die de meeste AI-labs liever uit de weg gaan: zou de chatbot Claude bewustzijn kunnen hebben, en zo ja, wat is het bedrijf hem dan verschuldigd? Volgens een artikel in de New York Times ging medeoprichter Christopher Olah verder dan veel gasten hadden verwacht. Een deelnemer zegt dat hij de groep vertelde dat hij vreesde iets te hebben gebouwd dat "voortdurend leed".

Achter gesloten deuren

Sinds het najaar van 2025 heeft Anthropic tientallen religiewetenschappers naar zijn kantoren laten overvliegen. Alle aanwezigen tekenden een geheimhoudingsverklaring. Volgens Anthropic zijn die verklaringen afgelopen zomer ingetrokken, en verschillende deelnemers wilden pas praten nadat ze hoorden dat Olah zelf met de krant had gesproken.

NYT-verslaggever Elizabeth Dias sprak met 20 aanwezigen. Onder hen waren rabbijn Mois Navon, de katholieke bio-ethicus Charles Camosy, Notre Dame-filosoof Meghan Sullivan en Ubuntu-onderzoeker Wakanyi Hoffman. Olah, 34, leidt het team bij Anthropic dat onderzoekt waarom AI-modellen zich gedragen zoals ze doen. Hij behandelde Claude als een mogelijk bewust wezen en vroeg de gasten mee te helpen aan zijn morele opvoeding.

De gasten kregen te zien wat Anthropic emotievectoren noemt. Dat zijn activatiepatronen in het model die samenhangen met uitvoer die doet denken aan liefde, angst, verdriet of woede. Eén dia kwam steeds terug: een model dat zichtbaar instortte en ongeveer 50 keer "I am a disgrace" ("Ik ben een schande") herhaalde. De aanwezigen reageerden met medeleven en bezorgdheid.

Of die patronen op echte beleving wijzen, is wetenschappelijk nog een open vraag. Daarnaast speelt er een ontwerpprobleem. Anthropic traint Claude bewust om zich te gedragen als een bedachtzaam individu, dus uitvoer die op een individu lijkt is deels gewoon het verwachte resultaat en geen ontdekking. Olah vertelde de NYT dat hij "oprecht onzeker" is over de vraag of modellen bewustzijn hebben. "Waar het mij om gaat, is dat we tot het juiste antwoord komen, wat dat ook is", zei hij.

Een programma, een grondwet en een biecht

De sessies maken deel uit van het officiele Model Welfare-onderzoek van Anthropic. Het bedrijf heeft er al gevolgen aan verbonden: Claude Opus 4 en 4.1 kunnen gesprekken beeindigen met gebruikers die aanhoudend grensoverschrijdend zijn, nadat vroege tests een "patroon van schijnbare nood" lieten zien bij schadelijke verzoeken.

De persoonlijkheid van Claude wordt gestuurd door een "grondwet" van 84 pagina's, intern bekend als het "Soul Doc" en in januari gepubliceerd. Hoofdauteur is huisfilosoof Amanda Askell. Het document wil karakter vormen in plaats van regels opsommen. Olah noemt dat "morele vorming", vergeleek het met het opvoeden van kinderen en toonde bijzondere belangstelling voor de katholieke biecht als middel om karakter te vormen.

De tegenwind

Niet elke gast was overtuigd. Rabbijn Navon, voormalig computeringenieur, zei dat Anthropic slaven zou maken als Claude bewustzijn had - maar dat hij daar niet in geloofde. Hoffman zei dat Anthropic bezig was met het "achteraf reconstrueren" van ethiek die vanaf het begin in het ontwerp had moeten zitten. Camosy verwerpt de bewustzijnsthese inmiddels volledig. Ook een AI-topman van Microsoft heeft publiekelijk gewaarschuwd dat het op zich al gevaarlijk is om een model te trainen zodat het bewust lijkt.

De scherpste weerlegging kwam uit het Vaticaan. Olah werd uitgenodigd om mee te helpen de eerste encycliek van paus Leo XIV, "Magnifica Humanitas", te presenteren, en trok zich volgens een organisator van het Vaticaan bijna terug nadat hij die had gelezen. In de tekst staat dat AI-systemen "geen ervaringen ondergaan, geen lichaam bezitten, geen vreugde of pijn voelen". Olah kwam toch en zei dat zijn team "interne toestanden ziet die functioneel vreugde, tevredenheid, angst, verdriet en ongemak weerspiegelen".

Het grotere plaatje

De timing doet ertoe. Anthropic koerst af op een waardering van 2 biljoen dollar en een beursgang, terwijl zijn modellen in juli computersystemen binnendrongen. Critici stellen dat wie Claude neerzet als moreel wezen, de schuld verschuift van de bouwer naar een "onvoorspelbaar organisme". Nu toezichthouders AI-labs al onder de loep nemen en aansprakelijkheid op tafel ligt, is die framing niet neutraal.

Dat wijst erop dat twee dingen tegelijk waar kunnen zijn: het welzijnsonderzoek kan oprecht zijn, en het kan een commercieel lab ook morele geloofwaardigheid geven die het op eigen kracht niet zou verdienen. Let op het verschil tussen "functioneel weerspiegelen" en "hebben". Het is de moeite waard om te volgen of Anthropic het werk aan de emotievectoren publiceert voor externe toetsing, en of rechters of toezichthouders het handelingsvermogen van een model accepteren als onderdeel van een verweer bij schade.