OpenAI frena el robo de razonamiento, pero no en Azure
OpenAI asegura haber desarticulado un intento coordinado de extraer el razonamiento oculto de sus modelos. Sin embargo, unos investigadores independientes comprobaron que la misma técnica siguió funcionando en Microsoft Azure durante semanas. El caso demuestra que un parche de seguridad aplicado en origen puede no llegar a las plataformas en la nube que revenden esos mismos modelos.
Lo que cuenta OpenAI
En una entrada de su blog, OpenAI describe lo que llama una campaña de "destilación adversarial". Destilar consiste en entrenar un modelo con las respuestas de otro. El objetivo más codiciado es la cadena de pensamiento completa: los pasos intermedios que recorre un modelo de razonamiento antes de responder. Normalmente, los usuarios solo ven la respuesta final.
Según OpenAI, esos pasos pueden contener información que se deja fuera de la respuesta a propósito y pueden ayudar a un competidor a reconstruir las capacidades de un modelo.
La cronología, según OpenAI:
- 1 de julio: la actividad arranca con poco volumen.
- 24 y 25 de julio: un pico de 16.000 solicitudes de más de 4.000 usuarios, todas con un patrón de extracción característico.
- Análisis posterior: una red de más de 15.000 cuentas con patrones relacionados.
- 28 de julio: OpenAI afirma que la red quedó completamente desmantelada.
Una nota a pie de página aclara que se trató de intentos de extracción, no necesariamente exitosos. OpenAI vincula a un grupo central con personas relacionadas con Moonshot AI, la empresa que desarrolla el modelo de lenguaje Kimi. Añade que no está claro si todos los actores detectados proceden de una misma fuente. Anthropic informó hace poco de intentos similares por parte de empresas chinas de IA.
Cómo funcionaba el truco
Los proveedores solo devuelven el razonamiento a los clientes en forma de paquetes de datos cifrados, que los clientes reenvían con las solicitudes siguientes. Los atacantes copiaban el razonamiento cifrado de una conversación y pedían a un modelo, en otra conversación distinta, que lo descifrara y lo escribiera.
El investigador Joachim Schaeffer y su equipo ya lo habían descrito en un artículo. Como los paquetes usan claves compartidas, pueden pasar de una sesión a otra, de un usuario a otro e incluso entre distintos modelos del mismo proveedor. Un modelo más débil y barato de la misma familia puede actuar entonces como "oráculo de descifrado" y reproducir palabra por palabra el razonamiento del modelo más potente.
OpenAI cita a los investigadores por su nombre y reconoce que sus hallazgos le ayudaron a desplegar contramedidas más rápido. Entre ellas: el bloqueo de cuentas fraudulentas, un registro más estricto, el cierre del agujero que permitía reutilizar el razonamiento cifrado de otros usuarios y el filtrado de la salida en streaming para poder retenerla si existe riesgo de que revele el razonamiento. OpenAI dice haber compartido sus conclusiones a través del Frontier Model Forum y de canales gubernamentales.
La brecha de la nube
El mismo día que OpenAI publicó su entrada, los investigadores difundieron una actualización. "Hemos vuelto a robar el razonamiento", escribió Schaeffer en X.
Al repetir las pruebas el 13 de septiembre, comprobaron que el ataque estaba bloqueado en las API propias de OpenAI y Anthropic. En Azure, en cambio, funcionó con todos los modelos de OpenAI que probaron, incluido el nuevo GPT-6 Astra, y con los modelos de Anthropic hasta Sonnet 5. Bastaba un solo intento para sacar el razonamiento literal. "Los mismos modelos, pero con protecciones distintas según la plataforma que los sirva", señaló Schaeffer.
Existe además una vía más sencilla, que el desarrollador Can Bölük mostró públicamente. Se le da al modelo un bloc de notas virtual como herramienta y se le pide que escriba ahí su razonamiento, que el usuario puede leer después. Según los investigadores, esto funcionó con todos los modelos de OpenAI y con Opus 4.8 y Sonnet 5. Solo Opus 5, Fable 5 y Fable 5.1 no revelaron su razonamiento. Los investigadores afirman que el resultado se parecía mucho al obtenido con el descifrado y que probablemente sería igual de útil para destilar.
Califican las soluciones aplicadas hasta ahora de fragmentarias y superficiales. Muchas se basan en una detección frágil de patrones de solicitud concretos, y algunas llegaron a las plataformas en la nube días después. GPT-6 Astra se lanzó en plataformas de terceros sin esas protecciones. Según la cronología de los investigadores, OpenAI añadió salvaguardas al endpoint de Azure el 27 de septiembre. En el caso de los modelos de Anthropic, la extracción dejó de poder reproducirse en Azure a partir del 28 de septiembre.
Schaeffer sostiene que los parches deben cubrir todos los tipos de ataque y todas las nubes que alojan un modelo, porque de lo contrario los atacantes elegirán la vía más débil. El artículo va más allá: los proveedores de nube que no apliquen protecciones equivalentes no deberían poder servir modelos de razonamiento. De lo contrario, escriben los investigadores, las puertas traseras abiertas podrían permitir eludir los controles de exportación a nivel de API. OpenAI coincide en que los modelos alojados por socios necesitan la misma protección que sus propios servicios y admite que el trabajo no ha terminado.
El panorama general
La lección principal es de arquitectura, no de un exploit concreto. El perímetro de seguridad de un modelo no es la API del laboratorio, sino cada endpoint en el que se ejecuta. Si un proveedor blinda su propio servicio pero un revendedor va semanas por detrás, el endpoint más débil pasa a ser el verdadero perímetro. Los desarrolladores que acceden a los modelos a través de nubes como Azure no deberían dar por hecho que cuentan con las mismas protecciones.
El caso también apunta a que los filtros ajustados a patrones de solicitud concretos son, por sí solos, una defensa débil. El método del bloc de notas no necesitaba descifrar nada. Las soluciones que bloquean un patrón conocido pueden limitarse a empujar a los atacantes hacia el siguiente.
La destilación es un problema comercial y, cada vez más, también político. La relación que establecen los investigadores con los controles de exportación lo conecta con el esfuerzo más amplio de los laboratorios chinos por crear modelos capaces pese a las limitaciones de hardware, como se ha visto con las herramientas de Deepseek para los chips Huawei Ascend. Habrá que ver si las plataformas en la nube se comprometen a igualar las salvaguardas de los laboratorios desde el lanzamiento, si los reguladores recogen la propuesta de los investigadores y si se cumple la previsión de OpenAI de que llegarán intentos más sofisticados a medida que mejoren los modelos.
