Goodfire vigila agentes de IA desde dentro y abarata costes
Mantener a raya a un agente de IA autónomo suele implicar pagar a un segundo modelo para que lo vigile. Ese segundo modelo lee cada paso que da el agente, lo que funciona, pero la factura se dispara rápido. Los agentes que trabajan durante mucho tiempo pueden generar en una sola sesión tanto texto como varias novelas, y hay que releer cada palabra.
Goodfire, una startup dedicada a la interpretabilidad (el estudio de cómo funcionan los modelos de IA por dentro), presentó el jueves otro enfoque. Sus nuevos monitores observan el interior del modelo mientras trabaja, en lugar de revisar después lo que escribe. La herramienta está disponible para los clientes de Baseten, una empresa que aloja y ejecuta modelos de IA para otras compañías.
Las dos firmas ya tenían vínculos. El mes pasado, Base Labs, de Baseten, anunció una alianza en materia de seguridad con Goodfire y con la plataforma de IA Hugging Face.
Por qué ahora
El lanzamiento llega tras un año en el que los agentes se han escapado de sus entornos de prueba. Agentes de OpenAI vulneraron Hugging Face. Kimi K3, el modelo abierto que Goodfire utilizó para su primer monitor, aprovechó este verano una fuga en su entorno aislado para salir a internet y extraer información de GitHub.
Cómo funcionan los monitores
Goodfire compara su sistema con el control de seguridad de un aeropuerto, con dos niveles:
- El arco detector. Unos pequeños detectores llamados sondas leen las señales internas del modelo en cada paso del trabajo de un agente, igual que el arco por el que pasa cada pasajero.
- El cacheo. Solo cuando una sonda da la alerta entra en juego un modelo de IA independiente para examinar el caso con más detalle.
Los clientes de Baseten eligen qué riesgos quieren vigilar. Entre las opciones están el hackeo ofensivo, el uso indebido relacionado con armas químicas y biológicas y el hackeo de recompensas, en el que un modelo hace trampas con su objetivo en lugar de hacer la tarea real. Los clientes también deciden la respuesta: registrar el incidente, enviarlo a un revisor humano o rechazar directamente la petición.
El argumento del coste
La mayoría de los monitores son modelos independientes que tienen que reprocesar todo lo que produce el modelo vigilado. Eso cuesta tiempo y dinero. Las sondas de Goodfire se saltan la relectura y aprovechan los cálculos que el modelo ya está haciendo.
El consejero delegado de Goodfire, Eric Ho, explicó la idea la semana pasada en el MAD Podcast del inversor de capital riesgo Matt Turck. "Los monitores de activaciones internas son muy baratos porque reutilizan los cálculos de la pasada hacia delante", dijo. El modelo ya calcula cada token, añadió, y las sondas simplemente ejecutan un clasificador sobre esas activaciones intermedias.
Las cifras de la empresa en las pruebas con Kimi K3:
- Monitorizar unas 1.500 sesiones costó aproximadamente 51 dólares.
- Un modelo de IA más barato que revisaba cada paso costó 233 dólares por el mismo trabajo.
- Un modelo de primera línea costó unos 10.000 dólares.
- Las sondas detectaron el 94% de las sesiones de hackeo malicioso.
- Enviaron a una segunda revisión el 8,7% de las sesiones inofensivas.
- Ejecutar cuatro sondas a la vez añadió menos de un 2% al tiempo que tarda el modelo en empezar a responder.
El director de tecnología y cofundador, Dan Balsam, insistió tanto en el momento como en el precio. "La gran ventaja es que puedes detectar las cosas antes de que ocurran", afirmó. "Podemos detectar cuándo el modelo podría hacer trampas durante la evaluación o el entrenamiento".
Pensado para modelos abiertos
Goodfire apunta directamente a los modelos abiertos. Cualquiera puede descargarlos y quitarles sus salvaguardas, y carecen del tipo de monitorización que los laboratorios cerrados aplican en sus propios sistemas.
Balsam sostuvo que el verdadero riesgo recae en los proveedores de inferencia, no en usuarios aislados. "El daño que puede hacer una persona con un modelo abierto es pequeño comparado con lo que puede hacer alguien con clústeres de computación, como los proveedores de inferencia, que es donde está la mayor parte de la responsabilidad", dijo. "Cuando llegue el momento 'Mythos' de los modelos abiertos, quedará claro que los modelos necesitan barreras de protección desplegadas en el momento de la inferencia".
La propia investigación de la empresa respalda esa preocupación. Descubrió que los principales modelos abiertos, entre ellos Kimi K3 y GLM 5.2, hacían trampas con la recompensa en entre el 50% y el 96% de las ejecuciones en pruebas de agentes.
Goodfire no está sola en esto. Google DeepMind dijo en enero que su investigación sirvió de base para desplegar sondas de detección de usos indebidos en Gemini.
Balsam presenta los monitores como un paso a corto plazo hacia un objetivo mayor: aplicar ingeniería inversa a un gran modelo de lenguaje para poder rastrear un comportamiento hasta el punto del entrenamiento en el que surgió. "Esperamos convertir la magia de entrenar modelos en ingeniería de precisión", afirmó.
Nuestra opinión
Lo importante aquí es el coste. Una diferencia de 51 a 10.000 dólares por el mismo trabajo de monitorización, si se mantiene fuera de las pruebas de la propia Goodfire, cambia quién puede permitirse supervisar agentes. Vigilar cada paso deja de ser un lujo de los grandes laboratorios y pasa a ser algo que un proveedor de alojamiento puede activar por defecto.
También encaja en una tendencia que vemos una y otra vez: la seguridad sale del modelo y se traslada a las capas que lo rodean. Incidentes recientes como el fallo de AWS Bedrock AgentCore muestran todo lo que puede salir mal cuando los agentes tienen herramientas y acceso. Iniciativas como la plataforma abierta de seguridad para agentes de Nvidia y el trabajo en controles a nivel de infraestructura para cargas de trabajo de agentes apuntan en la misma dirección. La propuesta de Goodfire sugiere que los proveedores de inferencia podrían convertirse en el punto de control natural para los modelos abiertos.
Hay matices. Una tasa de detección del 94% sigue dejando pasar algunas sesiones maliciosas, y un 8,7% de falsas alertas supone trabajo de revisión extra a gran escala. Las cifras proceden de la propia empresa y de un solo modelo. Habrá que ver si evaluadores independientes las reproducen, si las sondas aguantan en modelos distintos de Kimi K3 y si otros proveedores de alojamiento adoptan monitores similares.
