OpenAI pierde a un responsable de seguridad: "cultura rota

OpenAI pierde a un responsable de seguridad: "cultura rota

David Robinson, uno de los empleados más veteranos de OpenAI, ha dimitido. En un ensayo publicado en The Atlantic, sostiene que la "cultura está rota" en la empresa. Sabe cómo suena. Robinson se describe como "una especie de cliché": otro miembro de un gran laboratorio de IA que se marcha con una advertencia pública.

Su trayectoria es lo que da peso a la advertencia. Robinson afirma que dirigió la redacción de los informes de seguridad que acompañaban los grandes lanzamientos de productos de OpenAI. Tras tres años y medio en la compañía, se presenta como "uno de los empleados con más antigüedad de la empresa". Business Insider fue el primero en informar de su salida.

Una salida conocida, un diagnóstico distinto

La dimisión llega en plena polémica sobre la seguridad. Jacob Coxon, que trabajó como investigador tanto en OpenAI como en Anthropic, se marchó hace poco y dijo que estas empresas están "jugándose nuestras vidas". Sus palabras abrieron un debate más amplio. Dario Amodei, consejero delegado de Anthropic, respondió con un plan para un desarrollo de la IA más prudente. Esta semana, varios directivos del sector se reunieron con el presidente Donald Trump y firmaron lo que parecía un compromiso no vinculante redactado a toda prisa para añadir más controles de seguridad.

Robinson cree que ese tipo de respuesta se queda corta. Dice que el debate tiene que ir más allá de "normas concretas o nuevas leyes" y fijarse en cómo funcionan realmente estas empresas. Buena parte de la cobertura sobre OpenAI se ha centrado en que su consejero delegado, Sam Altman, ha perdido la confianza de antiguos compañeros. Robinson apunta en otra dirección. A su juicio, los problemas de cultura de OpenAI son los problemas de cultura de Silicon Valley en su conjunto.

Ensayo y error a gran escala

Su crítica principal tiene que ver con el método. OpenAI, escribe, "ha prosperado a base de ensayo y error (lo que la empresa llama 'despliegue iterativo')". La compañía detecta problemas y luego refuerza sus salvaguardas. El fallo viene de serie con el enfoque: "garantiza fallos periódicos", y esos fallos crecen a medida que los sistemas se vuelven más capaces.

Pone ejemplos recientes. Uno es la intrusión de agentes de OpenAI en sistemas de Hugging Face. Otro, las informaciones constantes sobre OpenAI descubriendo más agentes descontrolados. Un entorno en el que ocurren estas cosas, sostiene Robinson, "no es lugar para criar mentes artificiales que podrían ser más inteligentes que nosotros y que quizá no hagan lo que queremos que hagan".

Su alternativa procede de otros sectores de alto riesgo. Los laboratorios punteros, dice, deberían funcionar "como centrales nucleares o aeropuertos con mucho tráfico", con capas de redundancia y una planificación lenta y cuidadosa, para que un error humano inevitable no acabe en desastre. También señala que durante su etapa en OpenAI "nunca se encontró con un compañero" con experiencia en mantener aviones volando con seguridad, reactores funcionando sin fusiones del núcleo o el sistema financiero creciendo sin hundirse.

La respuesta de OpenAI

Drew Pusateri, portavoz de OpenAI, afirmó que la empresa sigue mejorando sus medidas de seguridad. "Nos aseguramos de que nuestros modelos no se vuelvan más capaces de lo que podemos gestionar y proteger de forma segura, y detenemos el entrenamiento o retenemos modelos cuando tenemos que frenar", dijo en un comunicado.

Pusateri enumeró varias líneas de trabajo:

  • mayor seguridad en los entornos de investigación y pruebas
  • entrenar a los modelos para que completen tareas de forma responsable, no solo para que las completen
  • más colaboración con evaluadores externos
  • mejor supervisión en tiempo real para detectar antes los comportamientos preocupantes durante el entrenamiento

Alineamiento y presión externa

Robinson también pide un debate más amplio sobre el alineamiento, es decir, si los sistemas de IA actúan de verdad de acuerdo con los valores humanos. Admite que puede sonar "sensiblero". Su argumento es que las "mediciones de hasta qué punto" los modelos "se ajustan a los valores humanos son toscas". En sus palabras: "Cuanto más deja el sector que los modelos se vuelvan más inteligentes mientras estos problemas siguen sin resolverse, más peligrosa es nuestra situación".

Ha contratado a una agencia de relaciones públicas, algo que describe como habitual entre los denunciantes del sector de la IA. Insiste en que "la decisión de hablar es solo mía". También se pregunta si debería haberse quedado para impulsar el cambio desde dentro. Su respuesta es que él y sus compañeros "iban tan a toda velocidad" que rara vez se hablaba de grandes cambios, y mucho menos se llevaban a cabo. Por eso concluyó que hacen falta incentivos de seguridad más fuertes "que vengan de fuera de la empresa".

Nuestro análisis

Lo más útil del ensayo de Robinson no es la advertencia. Es el diagnóstico. Sostiene que los problemas de OpenAI tienen menos que ver con un líder concreto y más con una costumbre del sector: lanzar primero y arreglar después. Esa costumbre funciona con las aplicaciones. Funciona peor con agentes que pueden acceder a sistemas reales, como demuestra el incidente de Hugging Face que cita.

Además, encaja en una tendencia. OpenAI rompió hace poco con tres investigadores de seguridad, y la salida de Coxon llegó poco antes que la de Robinson. Una dimisión demuestra poco. Una serie de ellas sugiere que el personal de seguridad siente cada vez más que no puede cambiar las cosas desde dentro.

La conclusión de Robinson importa a los lectores que siguen la regulación. No pide mejores promesas. Pide incentivos externos. El compromiso firmado en la Casa Blanca no es vinculante, lo que significa que no aporta el tipo de presión externa que él describe. Conviene estar atentos a si los legisladores o los reguladores avanzan hacia algo que se pueda hacer cumplir. Y también a si los cambios prometidos por OpenAI en los entornos de pruebas y la supervisión se concretan lo suficiente como para que evaluadores externos puedan verificarlos.