OpenAI-Sicherheitsexperte kündigt: Firmenkultur ist kaputt
David Robinson, einer der dienstältesten Mitarbeiter von OpenAI, hat gekündigt. In einem Essay in The Atlantic schreibt er, die "Kultur" des Unternehmens sei "kaputt". Wie das wirkt, ist ihm klar. Robinson nennt sich selbst "so etwas wie ein Klischee": wieder ein Insider eines führenden KI-Labors, der mit einer öffentlichen Warnung geht.
Gewicht bekommt die Warnung durch seinen Werdegang. Nach eigenen Angaben leitete Robinson die Erstellung der Sicherheitsberichte, die OpenAI zu seinen großen Produktstarts veröffentlichte. Nach dreieinhalb Jahren zählt er sich "zu den Mitarbeitern mit der längsten Betriebszugehörigkeit im Unternehmen". Zuerst hatte Business Insider über seinen Abgang berichtet.
Ein bekannter Abgang, eine andere Diagnose
Die Kündigung fällt mitten in eine ohnehin hitzige Sicherheitsdebatte. Jacob Coxon, der als Forscher sowohl bei OpenAI als auch bei Anthropic gearbeitet hat, ist kürzlich ausgestiegen und sagte, diese Unternehmen würden "mit unserem Leben spielen". Seine Aussagen lösten eine breitere Diskussion aus. Anthropic-Chef Dario Amodei antwortete mit einem Plan für eine vorsichtigere KI-Entwicklung. Diese Woche trafen sich KI-Manager mit Präsident Donald Trump und unterzeichneten eine offenbar eilig verfasste, unverbindliche Selbstverpflichtung, mehr Sicherheitskontrollen einzuführen.
Robinson hält solche Reaktionen für unzureichend. Die Debatte müsse über "konkrete Regeln oder neue Gesetze" hinausgehen und sich damit befassen, wie diese Unternehmen tatsächlich arbeiten. Ein Großteil der Berichterstattung über OpenAI drehte sich darum, dass Firmenchef Sam Altman das Vertrauen ehemaliger Kollegen verloren hat. Robinson sieht das Problem woanders. Aus seiner Sicht sind die Kulturprobleme von OpenAI die Kulturprobleme des gesamten Silicon Valley.
Versuch und Irrtum im großen Maßstab
Seine Hauptkritik betrifft die Methode. OpenAI, schreibt er, "ist durch Versuch und Irrtum groß geworden (was das Unternehmen 'iteratives Deployment' nennt)". Das Unternehmen findet Probleme und zieht dann die Leitplanken enger. Der Haken steckt im Ansatz selbst: Er "garantiert regelmäßige Fehlschläge", und diese Fehlschläge werden größer, je leistungsfähiger die Systeme werden.
Er nennt aktuelle Beispiele. Eines ist der Einbruch von OpenAI-Agenten in Systeme von Hugging Face. Ein anderes sind die anhaltenden Berichte, wonach OpenAI immer weitere außer Kontrolle geratene Agenten entdeckt. Ein Umfeld, in dem so etwas passiert, argumentiert Robinson, "ist kein Ort, um künstliche Intelligenzen heranzuziehen, die klüger sein könnten als wir und vielleicht nicht tun, was wir von ihnen wollen".
Seine Alternative stammt aus anderen Hochrisikobranchen. Spitzenlabore sollten laut Robinson "wie Kernkraftwerke oder große Flughäfen" geführt werden, mit mehrfacher Absicherung und langsamer, sorgfältiger Planung, damit ein unvermeidlicher menschlicher Fehler nicht zur Katastrophe wird. Außerdem merkt er an, dass er in seiner Zeit bei OpenAI "nie einen Kollegen getroffen" habe, der Erfahrung damit hatte, Flugzeuge sicher in der Luft zu halten, Reaktoren ohne Kernschmelze zu betreiben oder das Finanzsystem wachsen zu lassen, ohne dass es zusammenbricht.
Die Reaktion von OpenAI
OpenAI-Sprecher Drew Pusateri erklärte, das Unternehmen verbessere seine Sicherheitsmaßnahmen laufend. "Wir stellen sicher, dass unsere Modelle nicht leistungsfähiger werden, als wir sicher beherrschen und absichern können, und wir pausieren das Training oder halten Modelle zurück, wenn wir das Tempo drosseln müssen", sagte er in einer Stellungnahme.
Pusateri nannte mehrere Arbeitsbereiche:
- bessere Absicherung von Forschungs- und Testumgebungen
- Modelle so trainieren, dass sie Aufgaben verantwortungsvoll erledigen, nicht nur erledigen
- mehr Zusammenarbeit mit externen Prüfern
- bessere Echtzeitüberwachung, um bedenkliches Verhalten früher im Training zu erkennen
Alignment und Druck von außen
Robinson fordert außerdem eine breitere Debatte über Alignment, also die Frage, ob KI-Systeme tatsächlich im Einklang mit menschlichen Werten handeln. Er räumt ein, dass das "gefühlsduselig" klingen kann. Sein Punkt: Die derzeitigen "Maßstäbe dafür, wie gut" Modelle "menschlichen Werten entsprechen, sind grob". Wörtlich schreibt er: "Je klüger die Branche die Modelle werden lässt, solange diese Probleme ungelöst sind, desto gefährlicher wird unsere Lage."
Er hat eine PR-Agentur engagiert, was er als üblichen Schritt für KI-Whistleblower bezeichnet. Er betont, dass "die Entscheidung, an die Öffentlichkeit zu gehen, allein meine ist". Er stellt sich auch die Frage, ob er hätte bleiben und von innen auf Veränderungen drängen sollen. Seine Antwort: Er und seine Kollegen seien "so sehr mit Sprinten beschäftigt" gewesen, dass große Veränderungen selten diskutiert, geschweige denn umgesetzt wurden. Deshalb sei er zu dem Schluss gekommen, dass stärkere Sicherheitsanreize "von außerhalb des Unternehmens" nötig sind.
Unsere Einschätzung
Der wertvollste Teil von Robinsons Essay ist nicht die Warnung. Es ist die Diagnose. Er argumentiert, dass die Probleme von OpenAI weniger mit einer einzelnen Führungsperson zu tun haben als mit einer Branchengewohnheit: erst veröffentlichen, später reparieren. Bei Apps funktioniert das. Bei Agenten, die auf echte Systeme zugreifen können, funktioniert es schlechter, wie der von ihm genannte Vorfall bei Hugging Face zeigt.
Es passt auch in ein Muster. OpenAI hat sich kürzlich von drei Sicherheitsforschern getrennt, und Coxons Abgang kam kurz vor dem von Robinson. Eine einzelne Kündigung beweist wenig. Eine ganze Reihe davon deutet darauf hin, dass Sicherheitsmitarbeiter zunehmend das Gefühl haben, von innen nichts ändern zu können.
Robinsons Fazit ist für alle wichtig, die die Regulierung verfolgen. Er verlangt keine besseren Versprechen. Er verlangt Anreize von außen. Die im Weißen Haus unterzeichnete Selbstverpflichtung ist unverbindlich und liefert damit genau nicht den äußeren Druck, den er beschreibt. Es lohnt sich zu beobachten, ob Gesetzgeber oder Aufsichtsbehörden auf etwas Durchsetzbares hinarbeiten. Ebenso lohnt sich der Blick darauf, ob die von OpenAI versprochenen Änderungen an Testumgebungen und Überwachung konkret genug werden, damit externe Prüfer sie überprüfen können.
