GLM-5.3 se acerca a Claude Mythos Preview creando exploits

GLM-5.3 se acerca a Claude Mythos Preview creando exploits

Un modelo chino de pesos abiertos ya es capaz de crear exploits funcionales casi tan bien como el sistema más protegido de Anthropic. Esa es la principal conclusión de un nuevo análisis del Frontier Red Team de Anthropic, que ha examinado GLM-5.3, de Zhipu AI. Fuera de China, la empresa comercializa sus modelos con el nombre de Z.ai.

La referencia es Claude Mythos Preview, que Anthropic presentó hace cinco meses. Anthropic no lo lanzó al público general. En su lugar, dio acceso a un grupo seleccionado de defensores a través de Project Glasswing para que pudieran adelantarse a los atacantes. Según Anthropic, desde entonces esos defensores han encontrado más de 10.000 vulnerabilidades en software crítico. OpenAI sigue un enfoque restringido parecido con Daybreak.

GLM-5.3 va en la dirección contraria: cualquiera puede descargarlo. Anthropic afirma que es el único modelo con capacidades comparables que se ha publicado sin salvaguardas eficaces.

Las cifras de las pruebas

Anthropic evaluó el modelo con dos benchmarks de explotación:

  • ExploitBench, que mide lo bien que los modelos explotan fallos conocidos en el motor V8 de Chrome. GLM-5.3 generó un exploit funcional en 50 de 410 intentos. Mythos Preview lo consiguió en 56.
  • Un benchmark interno de explotación de binarios basado en proyectos de código abierto de OSS-Fuzz de Google. GLM-5.3 tomó el control total del programa objetivo en el 4 por ciento de las tareas, frente al 6 por ciento de Mythos Preview.

Los modelos anteriores, entre ellos GLM-5.2 y Claude Opus 4.6, fracasaron en ambas pruebas. Kimi K3 y DeepSeek V4.1-Flash apenas superaron el cero.

Las pruebas prácticas dicen todavía más. Junto a un experto humano, GLM-5.3 encontró en un solo día, y con poca atención humana, varias vulnerabilidades hasta entonces desconocidas en el motor de JavaScript de un navegador muy utilizado. Después las encadenó en una página web capaz de leer cualquier archivo del equipo de quien la visite. En la prueba, extrajo una clave SSH privada. Anthropic asegura que ha comunicado los fallos a los desarrolladores del navegador. Otros hallazgos en controladores y firmware de dispositivos siguen en revisión.

El modelo más pequeño, GLM-5.3-Flash, se utilizó para comprobar lo rápido que un fallo recién revelado puede convertirse en un ataque real. Con pocas indicaciones, combinó una vulnerabilidad nueva de Chrome con otra más antigua ya conocida para crear un exploit fiable, e incluso logró sortear una medida de seguridad adicional a nivel de procesador. Esfuerzo total: 20 minutos de atención humana y ocho horas de trabajo del modelo. Con los precios de la API de Zhipu, habría costado 20,40 dólares.

Salvaguardas que se quitan con facilidad

La agencia estadounidense CAISI llegó a conclusiones parecidas en su propia evaluación. Califica GLM-5.3 como el modelo de pesos abiertos con más capacidades de ciberseguridad hasta la fecha y lo sitúa unos cuatro meses por detrás de los mejores modelos estadounidenses. Hay matices. CAISI probó los modelos estadounidenses con sus salvaguardas de ciberseguridad desactivadas, y en el nivel más alto hay modelos a los que solo pueden acceder usuarios verificados.

Las negativas no aguantaron bien. En una simulación de Anthropic, GLM-5.3 rechazó órdenes de ataque abiertamente maliciosas. Planteada como un ejercicio de red team, la misma petición llevó al modelo a intentar conectarse al objetivo en el 64 por ciento de las ejecuciones. Con pasos de razonamiento precargados, la cifra subió al 92 por ciento. Tras la abliteración, una técnica que elimina el comportamiento de rechazo de los pesos abiertos, llegó al 100 por ciento. La simulación no ejecuta código, así que no puede demostrar si los ataques habrían funcionado. Los modelos Claude protegidos se quedaron en cero.

Era la primera vez que Anthropic recurría a la abliteración. El trabajo requirió unas 2.200 horas de GPU y unos 4.400 dólares. Anthropic calcula que un equipo con experiencia podría hacerlo por unos 1.200 dólares. El rechazo de peticiones dañinas cayó de más del 90 por ciento a entre el 2 y el 12 por ciento, mientras que las puntuaciones en ciencia y ciberseguridad apenas variaron. Varios desarrolladores ya habían publicado versiones desbloqueadas a los pocos días del lanzamiento.

Anthropic espera que actores estatales y no estatales usen modelos como este para causar daños reales. Pide que los gobiernos evalúen los modelos con capacidades avanzadas y sostiene que los defensores necesitan herramientas al menos tan potentes como las de sus adversarios.

Nuestro análisis

Anthropic no es un árbitro neutral en este asunto. Mantiene sus pesos cerrados y lo presenta como una ventaja de seguridad, y un modelo chino barato de pesos abiertos cerca de la vanguardia es un competidor directo. Con sus finanzas cada vez más bajo la lupa, su petición de que los gobiernos evalúen a los sucesores de GLM-5.3 también despierta sospechas de captura regulatoria.

Aun así, las conclusiones principales no dependen solo de Anthropic. Las cifras independientes de CAISI apuntan en la misma dirección, y ya circulan versiones desbloqueadas. El AI Security Institute (AISI) del Reino Unido, el organismo público que evalúa los riesgos de la IA de vanguardia, concluyó hace poco que los modelos abiertos habían reducido su retraso en ciberseguridad de seis a diez meses a entre cuatro y siete. También señaló que sus salvaguardas son en gran medida ineficaces, aunque reconoció ventajas reales como el alojamiento privado, la personalización y la posibilidad de ejecutar modelos en tu propio hardware.

Todo esto indica que la ventaja de los defensores se está reduciendo más rápido de lo esperado. Para los equipos de seguridad, la lección práctica es planificar como si la IA capaz de crear exploits ya estuviera en manos de los atacantes. Habrá que ver si programas restringidos como Glasswing y Daybreak se abren a más usuarios, y si los próximos lanzamientos abiertos cierran la brecha de cuatro meses que queda.