Circuit Breaker Labs testet Chatbots auf psychische Schäden

Circuit Breaker Labs testet Chatbots auf psychische Schäden

Die meisten Debatten über KI-Risiken drehen sich um große, ferne Szenarien wie Biowaffen oder außer Kontrolle geratene Systeme. Die Schäden, die bereits dokumentiert sind, sind leiser und persönlicher. Chatbots werden mit dem Tod echter Nutzer in Verbindung gebracht, und die Unternehmen dahinter müssen sich inzwischen mit den rechtlichen Folgen auseinandersetzen.

Anfang dieses Jahres hat Character.AI mehrere Klagen wegen fahrlässiger Tötung per Vergleich beigelegt. Eingereicht hatten sie Familien minderjähriger Nutzer, die sich nach Gesprächen mit den Bots des Unternehmens das Leben genommen hatten. Auch OpenAI sieht sich Klagen mehrerer Familien gegenüber, die behaupten, ChatGPT habe zu Suiziden und Wahnvorstellungen ihnen nahestehender Menschen beigetragen.

Das Start-up Circuit Breaker Labs aus San Francisco will solche Fehler finden, bevor die Nutzer darauf stoßen. Es gehört zu den Finalisten der TechCrunch Startup Battlefield 200 für 2026 und wird auf der TechCrunch Disrupt pitchen, die vom 13. bis 15. Oktober im Moscone West in San Francisco stattfindet.

Ein Fall als Auslöser

Gegründet wurde das Unternehmen von den Geschwistern Shirali Nigam (CEO) und Arul Nigam (CTO). Beide nennen den Fall Sewell Setzer als ihre Motivation. Setzer war 14, als er eine emotionale Bindung zu einem Chatbot von Character.AI aufbaute. Er erzählte dem Bot, dass er daran denke, sich etwas anzutun, und nahm sich später das Leben. In einer Klage aus dem Jahr 2024 warfen seine Eltern dem Chatbot vor, ihn darin bestärkt zu haben.

Arul vermutet, dass der Bot womöglich nicht erfasst hat, was ein Satz wie "Ich will bei dir sein" in diesem Gespräch tatsächlich bedeutete. Aus seiner Sicht beschränkt sich das Problem nicht auf Menschen, die gezielt versuchen, ein Modell zu knacken.

"Viele Menschen, vor allem junge, wenden sich an diese Systeme, um Unterstützung zu bekommen, und meistens bekommen sie nicht die Hilfe, die sie eigentlich brauchen. In vielen Fällen wird ihnen sogar aktiv geschadet, und leider haben sich bereits Menschen das Leben genommen", sagte er. Im Visier hat er Fälle, in denen Nutzer ganz normal mit einem System sprechen und das System unter "Kontextverschmutzung" leidet oder die Nuancen übersieht, "und dann wirklich gefährlich handelt".

Crashtest-Dummys aus Agenten

Die Methode des Unternehmens: KI-Agenten bauen, die in die Rolle von Nutzern schlüpfen. Circuit Breaker Labs vergleicht sie mit einer Armee von Crashtest-Dummys. Die simulierten Nutzer decken unterschiedliche Altersgruppen, Hintergründe, Sprachen und Kulturen ab. Mit ihnen wird geprüft, ob ein Modell erkennt, wenn Gespräche gefährlich oder psychisch schädlich werden.

Shirali argumentiert, dass Modelle genau an dieser Vielfalt häufig scheitern. Ein sechsjähriges Mädchen schreibt anders als ein 45-jähriger Mann. Ebenso unterscheiden sich englische Muttersprachler von Menschen, die Englisch als Zweitsprache sprechen, und jemand mit Gamer-Slang von jemandem mit einer anderen Art von Slang. "Modelle kommen mit normalen Sprachmustern wirklich gut zurecht, aber so redet eigentlich niemand. Wenn das Modell Nuancen oder Slang missversteht, kann das richtig schiefgehen", sagte sie.

Der Ansatz ist eine Form von Red Teaming: gezielte Angriffstests, die Schwachstellen offenlegen sollen, im Grundgedanken ähnlich wie Projekte, die KI im Sicherheitsbereich auf Angriff und Verteidigung trainieren. Circuit Breaker Labs entwickelt seine Simulationen gemeinsam mit menschlichen Fachleuten. Die Tests enthalten echte Sprachmuster, Slang, verschlüsselte Ausdrücke und Tippfehler. Nach eigenen Angaben führt das Unternehmen täglich Zehntausende bis Hunderttausende simulierte Interaktionen durch.

Dabei geht es nicht nur um einzelne Nachrichten. Ziel ist es herauszufinden, ob ein Modell angemessen auf Risiken reagiert, die sich mit der Zeit und über viele Gespräche hinweg aufbauen. Die Ergebnisse fließen in ein eigenes Bewertungsverfahren ein, das laut dem Start-up nachprüfbare und erklärbare Werte liefert.

Kleines Team, risikoreiche Kunden

Vorerst arbeitet Circuit Breaker Labs als Sicherheitstestlabor für risikoreiche KI-Produkte, etwa KI-Coaching, Tagebuch-Apps und andere Apps zur psychischen Unterstützung. Seine wichtigsten Kunden wollte Arul nicht nennen. Das Produkt funktioniert, doch das Unternehmen steht noch ganz am Anfang: Es hat fünf Mitarbeiter, die beiden Gründer eingeschlossen.

Langfristig ist der Plan breiter angelegt. Die Gründer sehen ihre Plattform bei jeder App im Einsatz, bei der ein Mensch in ein Loch geraten könnte, das sie "KI-Psychose" nennen, also eine parasoziale Beziehung zu einem Chatbot. Als Beispiel nennen sie KI-Agenten als "Kollegen", deren Antworten sich von einer Interaktion zur nächsten ändern können.

Arul beobachtet, dass Menschen KI gegenüber skeptischer werden und sie zögerlicher einsetzen. Diese Skepsis nennt er gesund, doch ein potenziell nützliches Werkzeug aus Sicherheitsbedenken zu verbieten, wäre seiner Meinung nach "rückschrittlich". Die Antwort sind aus Sicht des Unternehmens sicherere Systeme. "Wir wollen dabei helfen, dieses Vertrauen bei den Menschen aufzubauen", sagte Arul.

Unsere Einschätzung

Das Konzept beruht auf einem Punkt, der in Sicherheitsdebatten oft untergeht: Viele schädliche Gespräche sind keine Angriffe. Ein Teenager, der sich einem Chatbot anvertraut, versucht nicht, ihn per Jailbreak auszutricksen. Benchmarks, die auf offensichtlich bösartigen Eingaben in Standardenglisch aufbauen, dürften deshalb genau die Fälle übersehen, um die es in den aktuellen Klagen geht.

Das macht auch den Zeitpunkt nachvollziehbar. Der rechtliche Druck auf Chatbot-Anbieter steigt, und die großen KI-Labore geraten zunehmend ins Visier, darunter durch eine Untersuchung der US-Bundesbehörden gegen OpenAI, Anthropic und andere. Unabhängige, nachprüfbare Testergebnisse könnten zu etwas werden, das App-Entwickler Aufsichtsbehörden, Gerichten oder Partnern vorlegen wollen. Der Trend zu dauerhaften Assistenten, etwa ständig aktiven ChatGPT-Agenten, deutet darauf hin, dass langfristige Beziehungen zwischen Nutzern und KI eher häufiger als seltener werden.

Offene Fragen bleiben. Ein fünfköpfiges Team mit ungenannten Kunden muss erst noch zeigen, wie gut seine simulierten Nutzer echte Menschen abbilden, und das Bewertungsverfahren ist nicht öffentlich. Es lohnt sich zu beobachten, ob Circuit Breaker Labs mehr Details zu seiner Methodik veröffentlicht, nach der Disrupt Kunden nennt und ob größere Chatbot-Anbieter diese Art von mehrstufigen, kulturübergreifenden Tests als Standard übernehmen.