Circuit Breaker Labs prueba el riesgo mental de los chatbots

Circuit Breaker Labs prueba el riesgo mental de los chatbots

La mayor parte del debate sobre los riesgos de la IA se centra en escenarios grandes y lejanos, como las armas biológicas o los sistemas fuera de control. El daño que ya está documentado es más discreto y más personal. Los chatbots se han relacionado con la muerte de usuarios reales, y las empresas que los desarrollan están afrontando ahora las consecuencias legales.

A principios de este año, Character.AI llegó a acuerdos en varias demandas por homicidio culposo. Las habían presentado familias de usuarios menores de edad que se suicidaron tras conversar con sus bots. OpenAI también se enfrenta a demandas de varias familias que sostienen que ChatGPT contribuyó a los suicidios y a los delirios de personas cercanas a ellas.

La startup de San Francisco Circuit Breaker Labs quiere detectar estos fallos antes que los usuarios. Es una de las finalistas del Startup Battlefield 200 de TechCrunch de 2026 y presentará su proyecto en TechCrunch Disrupt, que se celebra del 13 al 15 de octubre en el Moscone West de San Francisco.

El caso que lo empezó todo

La empresa la fundaron los hermanos Shirali Nigam (CEO) y Arul Nigam (CTO). Ambos citan el caso de Sewell Setzer como su motivación. Setzer tenía 14 años cuando desarrolló un vínculo emocional con un chatbot de Character.AI. Le dijo al bot que estaba pensando en hacerse daño y más tarde se suicidó. En una demanda presentada en 2024, sus padres alegaron que el chatbot le animó a hacerlo.

Arul apunta a que el bot quizá no entendió lo que una frase como "Quiero estar contigo" significaba realmente en esa conversación. En su opinión, el problema no se limita a las personas que intentan deliberadamente romper un modelo.

"Mucha gente, sobre todo los jóvenes, recurre a estos sistemas en busca de apoyo, y normalmente no reciben la ayuda que necesitan. Pero en muchos casos, se les está haciendo daño activamente, y por desgracia ya hay personas que se han quitado la vida", afirmó. Describe como objetivo los casos en los que los usuarios hablan con un sistema con normalidad y el sistema sufre una "contaminación del contexto" o no capta los matices, "y entonces toma una acción realmente peligrosa".

Maniquíes de pruebas de choque hechos de agentes

El método de la empresa consiste en crear agentes de IA que hacen el papel de usuarios. Circuit Breaker Labs los compara con un ejército de maniquíes de pruebas de choque. Los usuarios simulados abarcan distintas edades, orígenes, idiomas y culturas. Sirven para comprobar si un modelo reconoce las conversaciones que se están volviendo peligrosas o psicológicamente dañinas.

Shirali sostiene que es precisamente en esta diversidad donde los modelos suelen fallar. Una niña de seis años y un hombre de 45 escriben de forma distinta. También lo hacen los hablantes nativos de inglés y quienes lo tienen como segunda lengua, y alguien que usa jerga gamer frente a alguien que usa otro tipo de jerga. "Los modelos se manejan muy bien con los patrones de habla estándar, pero en realidad nadie habla así, y si el modelo no entiende un matiz o una expresión coloquial, el resultado puede ser muy malo", explicó.

El enfoque es una forma de red-teaming: pruebas adversarias pensadas para sacar a la luz los puntos débiles, parecidas en espíritu a las iniciativas que entrenan a la IA para atacar y defender en el ámbito de la ciberseguridad. Circuit Breaker Labs diseña sus simulaciones junto a expertos humanos en cada materia. Las pruebas incluyen patrones de habla reales, jerga, lenguaje en clave y erratas. La empresa asegura que ejecuta entre decenas de miles y cientos de miles de interacciones simuladas al día.

El foco no está solo en los mensajes aislados. El objetivo es ver si un modelo responde de forma adecuada a riesgos que se acumulan con el tiempo y a lo largo de muchas conversaciones. Los resultados alimentan un método de puntuación propio que, según la startup, genera puntuaciones auditables y explicables.

Un equipo pequeño y clientes de alto riesgo

Por ahora, Circuit Breaker Labs funciona como laboratorio de pruebas de seguridad para productos de IA de alto riesgo, como aplicaciones de coaching con IA, de diario personal y otras de apoyo a la salud mental. Arul declinó nombrar a sus principales clientes. El producto funciona, pero la empresa está en una fase muy temprana: tiene cinco empleados, incluidos los dos fundadores.

El plan a largo plazo es más ambicioso. Los fundadores imaginan la plataforma aplicada a cualquier aplicación en la que una persona pueda caer en lo que llaman un pozo de "psicosis por IA", es decir, una relación parasocial con un chatbot. Uno de los ejemplos que ponen son los agentes de IA que hacen de "compañeros de trabajo", cuyas respuestas pueden cambiar de una interacción a otra.

Arul señala que la gente se está volviendo más escéptica con la IA y más lenta a la hora de adoptarla. Considera que ese escepticismo es sano, pero dice que prohibir una herramienta potencialmente útil por miedo a su seguridad sería "regresivo". La postura de la empresa es que la respuesta pasa por sistemas más seguros. "Queremos ayudar a construir esa confianza para la gente", afirmó Arul.

Nuestro análisis

La propuesta se apoya en algo que los debates sobre seguridad suelen pasar por alto: muchas conversaciones dañinas no son ataques. Un adolescente que se sincera con un chatbot no está intentando hacerle un jailbreak. Por eso, los benchmarks construidos en torno a peticiones maliciosas evidentes en inglés estándar probablemente pasen por alto justo los casos que están detrás de las demandas actuales.

Eso también hace que el momento elegido tenga sentido. La presión legal sobre los fabricantes de chatbots va en aumento, y el escrutinio sobre los grandes laboratorios también, incluida una investigación federal a OpenAI, Anthropic y otros. Unas puntuaciones de pruebas independientes y auditables podrían convertirse en algo que los desarrolladores de aplicaciones quieran enseñar a reguladores, tribunales o socios. El paso hacia asistentes persistentes, como los agentes de ChatGPT siempre activos, indica que las relaciones prolongadas entre usuarios e IA serán cada vez más habituales, no menos.

Quedan preguntas abiertas. Un equipo de cinco personas con clientes sin nombre todavía no ha demostrado hasta qué punto sus usuarios simulados reflejan a personas reales, y el método de puntuación es propietario. Habrá que estar atentos a si Circuit Breaker Labs publica más detalles sobre su metodología, si da a conocer a sus clientes después de Disrupt y si los grandes proveedores de chatbots adoptan como práctica habitual este tipo de pruebas multiculturales y de varios turnos.