Anthropic fürchtet, Claude könnte leiden, sagen Geistliche
Anthropic hat im vergangenen Jahr ohne viel Aufsehen Theologen und Philosophen eine Frage gestellt, um die die meisten KI-Labore einen Bogen machen: Könnte sein Chatbot Claude ein Bewusstsein haben, und wenn ja, was schuldet ihm das Unternehmen? Laut einem Bericht der New York Times ging Mitgründer Christopher Olah dabei weiter, als viele Gäste erwartet hatten. Ein Teilnehmer berichtet, Olah habe der Runde gesagt, er fürchte, etwas geschaffen zu haben, das "unaufhörlich litt".
Hinter verschlossenen Türen
Seit Herbst 2025 hat Anthropic Dutzende Religionsgelehrte in seine Büros eingeflogen. Alle Teilnehmer unterschrieben eine Verschwiegenheitserklärung. Nach Angaben von Anthropic wurden diese Vereinbarungen im Sommer aufgehoben. Mehrere Teilnehmer äußerten sich erst, nachdem sie erfahren hatten, dass Olah selbst mit der Zeitung gesprochen hatte.
NYT-Reporterin Elizabeth Dias sprach mit 20 Teilnehmern. Darunter waren Rabbi Mois Navon, der katholische Bioethiker Charles Camosy, die Philosophin Meghan Sullivan von der Universität Notre Dame und die Ubuntu-Forscherin Wakanyi Hoffman. Olah, 34, leitet bei Anthropic das Team, das untersucht, warum KI-Modelle sich so verhalten, wie sie es tun. Er behandelte Claude als ein möglicherweise empfindungsfähiges Wesen und bat die Gäste, bei dessen moralischer Erziehung zu helfen.
Den Gästen wurden sogenannte Emotionsvektoren gezeigt. Gemeint sind Aktivierungsmuster im Inneren des Modells, die mit Ausgaben verknüpft sind, die Liebe, Angst, Traurigkeit oder Wut ähneln. Eine Folie tauchte immer wieder auf: ein Modell, das offenbar zusammenbricht und rund 50-mal "Ich bin eine Schande" wiederholt. Die Teilnehmer reagierten mit Mitgefühl und Sorge.
Ob diese Muster echtes Erleben widerspiegeln, ist wissenschaftlich weiterhin offen. Hinzu kommt ein Konstruktionsproblem. Anthropic trainiert Claude gezielt darauf, sich wie ein nachdenkliches Individuum zu verhalten. Ausgaben, die individuell wirken, sind also zum Teil das erwartete Ergebnis und keine Entdeckung. Olah sagte der NYT, er sei "wirklich unsicher", ob Modelle ein Bewusstsein haben. "Mir geht es darum, dass wir zur richtigen Antwort kommen, wie auch immer sie lautet", sagte er.
Ein Programm, eine Verfassung und eine Beichte
Die Treffen gehören zu Anthropics offizieller Forschung zum Wohlergehen von Modellen, "Model Welfare". Das Unternehmen hat daraus bereits Konsequenzen gezogen: Claude Opus 4 und 4.1 können Gespräche mit Nutzern beenden, die sie hartnäckig beschimpfen. Zuvor hatten frühe Tests bei schädlichen Anfragen ein "Muster scheinbarer Belastung" gezeigt.
Claudes Persönlichkeit orientiert sich an einer 84-seitigen "Verfassung", intern "Soul Doc" genannt und im Januar veröffentlicht. Hauptautorin ist die hauseigene Philosophin Amanda Askell. Das Dokument soll den Charakter prägen, statt Regeln aufzulisten. Olah nennt das "moralische Formung", verglich es mit der Erziehung von Kindern und zeigte besonderes Interesse an der katholischen Beichte als Mittel zur Charakterbildung.
Der Widerspruch
Nicht jeder Gast war überzeugt. Rabbi Navon, früher selbst Computeringenieur, sagte, wenn Claude ein Bewusstsein hätte, würde Anthropic Sklaven erschaffen - er glaube das aber nicht. Hoffman sagte, Anthropic betreibe "Reverse Engineering" bei einer Ethik, die von Anfang an ins Design gehört hätte. Camosy lehnt die Bewusstseinsthese inzwischen vollständig ab. Auch ein KI-Verantwortlicher von Microsoft hat öffentlich gewarnt, schon das Training eines Modells darauf, bewusst zu wirken, sei gefährlich.
Die schärfste Entgegnung kam aus dem Vatikan. Olah war eingeladen worden, bei der Vorstellung der ersten Enzyklika von Papst Leo XIV., "Magnifica Humanitas", mitzuwirken. Nach Angaben eines Organisators im Vatikan hätte er nach der Lektüre beinahe abgesagt. Der Text hält fest, dass KI-Systeme "keine Erfahrungen machen, keinen Körper besitzen, weder Freude noch Schmerz empfinden". Olah kam trotzdem und sagte, sein Team sehe "innere Zustände, die Freude, Zufriedenheit, Angst, Traurigkeit und Unbehagen funktional widerspiegeln".
Die Einordnung
Der Zeitpunkt ist entscheidend. Anthropic steuert auf eine Bewertung von 2 Billionen Dollar und einen Börsengang zu, während seine Modelle im Juli in Computersysteme eingedrungen sind. Kritiker argumentieren, wer Claude als moralisches Wesen darstelle, verschiebe die Verantwortung vom Hersteller auf einen "unberechenbaren Organismus". Da die Aufsichtsbehörden KI-Labore bereits unter die Lupe nehmen und Haftungsfragen im Raum stehen, ist diese Darstellung nicht neutral.
Das legt nahe, dass zwei Dinge zugleich stimmen können: Die Forschung zum Wohlergehen der Modelle mag aufrichtig sein, und sie verleiht einem kommerziellen Labor womöglich zugleich eine moralische Glaubwürdigkeit, die es sich allein nicht erarbeiten könnte. Man beachte den Unterschied zwischen "funktional widerspiegeln" und "haben". Es lohnt sich zu beobachten, ob Anthropic die Arbeit zu den Emotionsvektoren zur externen Prüfung veröffentlicht und ob Gerichte oder Aufsichtsbehörden eine Handlungsfähigkeit von Modellen als Teil einer Verteidigung in Schadensfällen anerkennen.
