GLM-5.3 benadert Claude Mythos Preview bij exploitbouw

GLM-5.3 benadert Claude Mythos Preview bij exploitbouw

Een Chinees open-weight model kan nu werkende cyberexploits bouwen die bijna even goed zijn als die van het zwaarst afgeschermde systeem van Anthropic. Dat is de kernconclusie van een nieuwe analyse van Anthropics Frontier Red Team, dat GLM-5.3 van Zhipu AI onderzocht. Buiten China verkoopt het bedrijf zijn modellen onder de naam Z.ai.

Het vergelijkingspunt is Claude Mythos Preview, dat Anthropic vijf maanden geleden presenteerde. Anthropic bracht het model niet breed uit. Het gaf via Project Glasswing alleen geselecteerde verdedigers toegang, zodat die aanvallers een stap voor konden blijven. Volgens Anthropic hebben die verdedigers sindsdien meer dan 10.000 kwetsbaarheden in kritieke software gevonden. OpenAI hanteert met Daybreak een vergelijkbare, beperkte aanpak.

GLM-5.3 kiest de tegenovergestelde route: iedereen kan het downloaden. Volgens Anthropic is het het enige model met vergelijkbare vaardigheden dat zonder effectieve beveiligingen is uitgebracht.

De benchmarkcijfers

Anthropic testte het model op twee exploitatiebenchmarks:

  • ExploitBench, dat meet hoe goed modellen bekende bugs in de V8-engine van Chrome kunnen misbruiken. GLM-5.3 leverde in 50 van de 410 pogingen een werkende exploit op. Mythos Preview kwam tot 56.
  • Een interne benchmark voor binaire exploitatie, gebaseerd op opensourceprojecten uit Googles OSS-Fuzz. GLM-5.3 kreeg in 4 procent van de taken volledige controle over het doelprogramma, tegenover 6 procent voor Mythos Preview.

Oudere modellen, waaronder GLM-5.2 en Claude Opus 4.6, zakten voor beide tests. Kimi K3 en DeepSeek V4.1-Flash scoorden nauwelijks boven nul.

De praktijktests zeggen meer. Samen met een menselijke expert vond GLM-5.3 binnen een dag, met weinig menselijke aandacht, meerdere tot dan toe onbekende kwetsbaarheden in de JavaScript-engine van een veelgebruikte browser. Vervolgens koppelde het die aan elkaar tot een webpagina die elk bestand op de computer van een bezoeker kan uitlezen. In de test haalde het model een privé-SSH-sleutel binnen. Anthropic zegt de bugs bij de ontwikkelaars van de browser te hebben gemeld. Andere vondsten in drivers en apparaatfirmware worden nog onderzocht.

Het kleinere GLM-5.3-Flash werd ingezet om na te gaan hoe snel een pas bekendgemaakte bug kan uitgroeien tot een echte aanval. Met weinig sturing combineerde het een verse Chrome-kwetsbaarheid met een oudere, bekende kwetsbaarheid tot een betrouwbare exploit, en omzeilde het zelfs een extra beveiligingsfunctie op processorniveau. Totale inspanning: 20 minuten menselijke aandacht en acht uur rekentijd van het model. Tegen de API-prijzen van Zhipu zou dat 20,40 dollar hebben gekost.

Beveiligingen die makkelijk sneuvelen

Het Amerikaanse agentschap CAISI kwam in een eigen beoordeling tot vergelijkbare conclusies. Het noemt GLM-5.3 het tot nu toe sterkste open-weight model op cybergebied en schat dat het ongeveer vier maanden achterloopt op de beste Amerikaanse modellen. Er zijn wel kanttekeningen. CAISI testte de Amerikaanse modellen met uitgeschakelde cyberbeveiligingen, en tot de absolute top behoren modellen waar alleen gescreende gebruikers bij kunnen.

De weigeringen hielden weinig stand. In een simulatie van Anthropic wees GLM-5.3 openlijk kwaadaardige aanvalsopdrachten af. Werd hetzelfde verzoek gepresenteerd als red-teamoefening, dan probeerde het model in 64 procent van de runs verbinding te maken met het doelwit. Met vooraf ingevulde redeneerstappen liep dat op tot 92 procent. Na abliteration, een techniek die weigergedrag uit open gewichten verwijdert, was het 100 procent. De simulatie voert geen code uit en kan dus niet laten zien of aanvallen daadwerkelijk zouden zijn gelukt. Beveiligde Claude-modellen bleven op nul.

Het was de eerste keer dat Anthropic abliteration toepaste. De klus kostte zo'n 2.200 GPU-uren en ongeveer 4.400 dollar. Anthropic schat dat een ervaren team het voor circa 1.200 dollar kan doen. Het aandeel geweigerde schadelijke verzoeken daalde van meer dan 90 procent naar tussen de 2 en 12 procent, terwijl de scores op wetenschap en cyber nauwelijks veranderden. Verschillende ontwikkelaars hadden al binnen enkele dagen na de lancering ontgrendelde versies gepubliceerd.

Anthropic verwacht dat statelijke en niet-statelijke actoren dit soort modellen zullen gebruiken om echte schade aan te richten. Het bedrijf wil dat overheden capabele modellen testen en stelt dat verdedigers minstens even sterke middelen nodig hebben als hun tegenstanders.

Onze analyse

Anthropic is hier geen neutrale scheidsrechter. Het houdt zijn gewichten gesloten en presenteert dat als veiligheidsvoordeel, en een goedkoop Chinees open-weight model dat de top nadert, is een directe concurrent. Nu de financien van het bedrijf steeds kritischer worden bekeken, roept de oproep om opvolgers van GLM-5.3 door de overheid te laten testen ook zorgen op over regulatory capture.

Toch staan of vallen de belangrijkste bevindingen niet met Anthropic alleen. De onafhankelijke cijfers van CAISI wijzen dezelfde kant op, en ontgrendelde versies circuleren al. Het Britse AI Security Institute (AISI), de overheidsinstantie die de risico's van frontier-AI beoordeelt, stelde onlangs vast dat open modellen hun achterstand op cybergebied hebben teruggebracht van zes tot tien maanden naar vier tot zeven. Het instituut merkte ook op dat hun beveiligingen grotendeels ineffectief zijn, maar erkende tegelijk echte voordelen, zoals zelf hosten, aanpasbaarheid en modellen draaien op je eigen hardware.

Dit wijst erop dat de voorsprong van verdedigers sneller slinkt dan gehoopt. Voor securityteams is de praktische les om te plannen alsof AI die exploits bouwt al in handen van aanvallers is. Het is de moeite waard om in de gaten te houden of afgeschermde programma's als Glasswing en Daybreak breder opengaan, en of de volgende open releases de resterende achterstand van vier maanden dichten.