GLM-5.3 kommt Claude Mythos Preview beim Exploit-Bau nahe

GLM-5.3 kommt Claude Mythos Preview beim Exploit-Bau nahe

Ein offenes Modell aus China kann inzwischen funktionierende Cyber-Exploits fast so gut bauen wie Anthropics am strengsten abgeschirmtes System. Das ist die Kernaussage einer neuen Analyse von Anthropics Frontier Red Team, das GLM-5.3 von Zhipu AI untersucht hat. Das Unternehmen vertreibt seine Modelle außerhalb Chinas unter dem Namen Z.ai.

Als Vergleichsmaßstab dient Claude Mythos Preview, das Anthropic vor fünf Monaten vorgestellt hat. Anthropic hat es nicht breit veröffentlicht. Stattdessen erhielten ausgewählte Verteidiger über Project Glasswing Zugang, damit sie Angreifern zuvorkommen können. Laut Anthropic haben diese Verteidiger seitdem mehr als 10.000 Schwachstellen in kritischer Software gefunden. OpenAI verfolgt mit Daybreak einen ähnlich eingeschränkten Ansatz.

GLM-5.3 geht den umgekehrten Weg: Jeder kann es herunterladen. Anthropic zufolge ist es das einzige Modell mit vergleichbaren Fähigkeiten, das ohne wirksame Schutzmechanismen erschienen ist.

Die Benchmark-Zahlen

Anthropic hat das Modell mit zwei Exploit-Benchmarks getestet:

  • ExploitBench, das misst, wie gut Modelle bekannte Fehler in Chromes V8-Engine ausnutzen. GLM-5.3 lieferte bei 50 von 410 Versuchen einen funktionierenden Exploit. Mythos Preview schaffte 56.
  • Ein interner Benchmark zur Ausnutzung von Binärprogrammen, der auf Open-Source-Projekten aus Googles OSS-Fuzz basiert. GLM-5.3 übernahm bei 4 Prozent der Aufgaben die vollständige Kontrolle über das Zielprogramm, Mythos Preview bei 6 Prozent.

Ältere Modelle, darunter GLM-5.2 und Claude Opus 4.6, scheiterten an beiden Tests. Kimi K3 und DeepSeek V4.1-Flash kamen kaum über null hinaus.

Aufschlussreicher sind die Praxistests. Zusammen mit einem menschlichen Experten fand GLM-5.3 innerhalb eines Tages und mit wenig menschlicher Aufmerksamkeit mehrere bislang unbekannte Schwachstellen in der JavaScript-Engine eines weit verbreiteten Browsers. Anschließend verknüpfte es sie zu einer Webseite, die beliebige Dateien auf dem Rechner eines Besuchers auslesen kann. Im Test zog es einen privaten SSH-Schlüssel ab. Anthropic gibt an, die Fehler den Entwicklern des Browsers gemeldet zu haben. Weitere Funde in Treibern und Geräte-Firmware werden noch geprüft.

Mit dem kleineren GLM-5.3-Flash wurde getestet, wie schnell aus einem frisch veröffentlichten Fehler ein echter Angriff werden kann. Mit wenig Anleitung kombinierte es eine neue Chrome-Schwachstelle mit einer älteren, bekannten zu einem zuverlässigen Exploit und umging dabei sogar eine zusätzliche Sicherheitsfunktion auf Prozessorebene. Gesamtaufwand: 20 Minuten menschliche Aufmerksamkeit und acht Stunden Rechenzeit des Modells. Zu Zhipus API-Preisen hätte das 20,40 Dollar gekostet.

Schutzmechanismen, die sich leicht entfernen lassen

Die US-Behörde CAISI kam in ihrer eigenen Bewertung zu ähnlichen Ergebnissen. Sie bezeichnet GLM-5.3 als das bislang cyberfähigste offene Modell und sieht es etwa vier Monate hinter den besten US-Modellen. Es gibt allerdings Einschränkungen. CAISI testete die US-Modelle mit abgeschalteten Cyber-Schutzmechanismen, und zur Spitzengruppe gehören Modelle, auf die nur überprüfte Nutzer zugreifen können.

Die Verweigerungen hielten nicht besonders gut. In einer Simulation von Anthropic lehnte GLM-5.3 offen bösartige Angriffsbefehle ab. Als Red-Team-Übung verpackt, führte dieselbe Anfrage dazu, dass das Modell in 64 Prozent der Durchläufe versuchte, eine Verbindung zum Ziel aufzubauen. Vorgegebene Denkschritte trieben den Wert auf 92 Prozent. Nach einer Abliteration, einem Verfahren, das das Verweigerungsverhalten aus offenen Modellgewichten entfernt, lag er bei 100 Prozent. Die Simulation führt keinen Code aus und kann daher nicht zeigen, ob die Angriffe funktioniert hätten. Geschützte Claude-Modelle blieben bei null.

Anthropic setzte Abliteration zum ersten Mal ein. Der Aufwand lag bei rund 2.200 GPU-Stunden und etwa 4.400 Dollar. Anthropic schätzt, dass ein erfahrenes Team das für rund 1.200 Dollar schaffen könnte. Die Verweigerungsquote bei schädlichen Anfragen sank von über 90 Prozent auf 2 bis 12 Prozent, während sich die Werte in Wissenschaft und Cybersicherheit kaum veränderten. Mehrere Entwickler hatten schon wenige Tage nach dem Start entsperrte Versionen veröffentlicht.

Anthropic rechnet damit, dass staatliche und nichtstaatliche Akteure solche Modelle nutzen werden, um echten Schaden anzurichten. Das Unternehmen fordert, dass Regierungen leistungsfähige Modelle testen, und argumentiert, dass Verteidiger Werkzeuge brauchen, die mindestens so stark sind wie die ihrer Gegner.

Unsere Einschätzung

Anthropic ist hier kein neutraler Schiedsrichter. Das Unternehmen hält seine Modellgewichte unter Verschluss und stellt das als Sicherheitsvorteil dar, und ein günstiges chinesisches offenes Modell nahe der Spitze ist ein direkter Konkurrent. Da seine Finanzen zunehmend unter Beobachtung stehen, weckt die Forderung nach staatlichen Tests für die Nachfolger von GLM-5.3 auch Bedenken, dass hier Regulierung zum eigenen Vorteil vereinnahmt werden könnte.

Trotzdem stützen sich die zentralen Ergebnisse nicht allein auf Anthropic. Die unabhängigen Zahlen von CAISI weisen in dieselbe Richtung, und entsperrte Versionen sind bereits im Umlauf. Das britische AI Security Institute (AISI), die staatliche Stelle, die Risiken von Spitzen-KI bewertet, stellte kürzlich fest, dass offene Modelle ihren Rückstand bei Cyberfähigkeiten von sechs bis zehn Monaten auf vier bis sieben verkürzt haben. Es hielt außerdem fest, dass ihre Schutzmechanismen weitgehend unwirksam sind, erkannte aber auch echte Vorteile an, etwa privates Hosting, Anpassbarkeit und den Betrieb von Modellen auf eigener Hardware.

Das deutet darauf hin, dass der Vorsprung der Verteidiger schneller schrumpft als erhofft. Für Sicherheitsteams heißt die praktische Lehre: so planen, als wäre KI, die Exploits baut, bereits in den Händen von Angreifern. Es lohnt sich zu beobachten, ob eingeschränkte Programme wie Glasswing und Daybreak breiter geöffnet werden und ob die nächsten offenen Veröffentlichungen den verbleibenden Rückstand von vier Monaten schließen.