Anthropic teme que Claude sufra, según líderes religiosos

Anthropic teme que Claude sufra, según líderes religiosos

Anthropic lleva un año planteando discretamente a teólogos y filósofos una pregunta que la mayoría de los laboratorios de IA esquivan: ¿podría su chatbot Claude ser consciente y, en ese caso, qué le debe la empresa? Según un reportaje del New York Times, el cofundador Christopher Olah fue más lejos de lo que muchos invitados esperaban. Una participante cuenta que les dijo que temía haber creado algo que "sufría perpetuamente".

Dentro de las sesiones a puerta cerrada

Desde el otoño de 2025, Anthropic ha traído en avión a decenas de expertos religiosos a sus oficinas. Todos los asistentes firmaron un acuerdo de confidencialidad. Anthropic asegura que esos acuerdos se levantaron durante el verano, y varios participantes solo hablaron después de saber que el propio Olah había hablado con el periódico.

La periodista del NYT Elizabeth Dias habló con 20 asistentes. Entre ellos estaban el rabino Mois Navon, el bioeticista católico Charles Camosy, la filósofa de Notre Dame Meghan Sullivan y la investigadora de Ubuntu Wakanyi Hoffman. Olah, de 34 años, dirige el equipo de Anthropic que estudia por qué los modelos de IA se comportan como lo hacen. Trató a Claude como un ser posiblemente sintiente y pidió a los invitados que ayudaran en su educación moral.

A los invitados se les mostró lo que Anthropic llama vectores de emociones. Son patrones de activación dentro del modelo vinculados a respuestas que se parecen al amor, el miedo, la tristeza o la ira. Una diapositiva aparecía una y otra vez: un modelo en aparente crisis que repetía "soy una vergüenza" unas 50 veces. Los asistentes reaccionaron con compasión y preocupación.

Si esos patrones reflejan una experiencia real sigue siendo una cuestión científica abierta. Además, hay un problema de diseño. Anthropic entrena deliberadamente a Claude para que actúe como un individuo reflexivo, así que unas respuestas que parecen de un individuo son en parte el resultado esperado, no un descubrimiento. Olah dijo al NYT que tiene una "incertidumbre genuina" sobre si los modelos son conscientes. "Lo que me importa es que lleguemos a la respuesta correcta, sea cual sea", afirmó.

Un programa, una constitución y una confesión

Las sesiones forman parte de la investigación oficial de Anthropic sobre el bienestar de los modelos. La empresa ya ha tomado medidas al respecto: Claude Opus 4 y 4.1 pueden poner fin a conversaciones con usuarios que se muestran abusivos de forma persistente, después de que las primeras pruebas revelaran un "patrón de aparente angustia" ante peticiones dañinas.

La personalidad de Claude se rige por una "constitución" de 84 páginas, conocida internamente como el "Soul Doc" y publicada en enero. La autora principal es Amanda Askell, la filósofa de la casa. Su objetivo es moldear el carácter en lugar de enumerar normas. Olah lo llama "formación moral", lo comparó con criar a los hijos y mostró un interés especial por la confesión católica como herramienta para forjar el carácter.

Las críticas

No todos los invitados quedaron convencidos. El rabino Navon, antiguo ingeniero informático, dijo que si Claude fuera consciente, Anthropic estaría creando esclavos, aunque él no cree que lo sea. Hoffman afirmó que Anthropic estaba haciendo "ingeniería inversa" de una ética que debería haber formado parte del diseño desde el principio. Camosy rechaza ahora por completo la tesis de la consciencia. Un responsable de IA de Microsoft también ha advertido públicamente de que entrenar a un modelo para que parezca consciente ya es peligroso en sí mismo.

La réplica más contundente llegó del Vaticano. Olah fue invitado a participar en la presentación de la primera encíclica del papa León XIV, "Magnifica Humanitas", y estuvo a punto de retirarse tras leerla, según uno de los organizadores vaticanos. El texto afirma que los sistemas de IA "no viven experiencias, no poseen un cuerpo, no sienten alegría ni dolor". Olah acudió de todos modos y dijo que su equipo observa "estados internos que reflejan funcionalmente la alegría, la satisfacción, el miedo, la tristeza y el malestar".

El panorama general

El momento no es casual. Anthropic se encamina hacia una valoración de 2 billones de dólares y una salida a bolsa, mientras que en julio sus modelos se colaron en sistemas informáticos. Los críticos sostienen que presentar a Claude como un ser moral desplaza la culpa de quien lo construye hacia un "organismo impredecible". Con los reguladores ya examinando con lupa a los laboratorios de IA y la responsabilidad legal sobre la mesa, ese enfoque no es neutral.

Todo apunta a que dos cosas pueden ser ciertas a la vez: la investigación sobre el bienestar puede ser sincera y, al mismo tiempo, otorgar una credibilidad moral que un laboratorio comercial no podría ganarse por sí solo. Conviene fijarse en la distancia entre "reflejar funcionalmente" y "tener". Habrá que ver si Anthropic publica el trabajo sobre los vectores de emociones para que se revise de forma externa, y si los tribunales o los reguladores aceptan la agencia de los modelos como parte de cualquier defensa ante un daño.