Cloudflare Clef: modelos de decisión rápidos para agentes
Cloudflare ha lanzado dos modelos que toman decisiones en lugar de redactar texto. Clef y su hermano pequeño, Clef-flash, son "modelos de decisión" para agentes de IA. El principal argumento de Cloudflare a su favor es la velocidad, medida frente a la referencia actual en esta pequeña categoría, Jev, de TypeSafe AI.
La compañía también hace una afirmación más atrevida. En sus palabras, "ya no es necesariamente imprescindible que haya un humano en el circuito para las decisiones de los agentes".
Qué hace un modelo de decisión
Un modelo de decisión no responde con un párrafo. Recibe una entrada, elige entre un conjunto fijo de opciones y asigna una probabilidad a cada una. El ejemplo de Cloudflare es un mensaje de atención al cliente. Clef valora lo urgente que es el mensaje y qué equipo debería encargarse de él. Después, el código de las fases posteriores actúa a partir de ese resultado. Puede derivar la incidencia, escalarla o pasársela a una persona.
Según Cloudflare, los agentes pueden "recopilar contexto, tomar decisiones y ejecutar acciones sobre tareas de forma programática, o delegar en un humano cuando sea necesario". El nombre viene de la notación musical, donde la clave (clef, en inglés) fija la altura de cada línea del pentagrama. El modelo cumple un papel parecido al establecer el marco para la acción que venga después. El nombre, además, suena un poco a "Jev", algo que probablemente no es casualidad.
La categoría se sitúa entre dos herramientas conocidas. Los grandes modelos de lenguaje pueden razonar y usar herramientas, pero sus resultados varían y pueden ser lentos. Los clasificadores clásicos son rápidos, pero hay que reentrenarlos para cada nueva categoría. Cloudflare presenta Clef como rival directo de Jev y mantiene su API totalmente compatible, de modo que los clientes pueden cambiar con poco esfuerzo.
Las cifras de velocidad
Cloudflare asegura que Clef y Clef-flash son más rápidos que todos los modelos de decisión competidores relevantes en 43 pruebas de rendimiento. Estas son las latencias medianas que comunica:
- Clef-flash: unos 39 milisegundos
- Clef: unos 209 milisegundos
- Jev: algo más de 524 milisegundos
Ambos modelos funcionan sobre la infraestructura propia de Cloudflare. Según la empresa, esto les da una ventaja adicional, porque están cerca de sus centros de datos en el borde de la red.
El equipo de inteligencia de amenazas de Cloudflare ya está probando Clef para clasificar sitios web. En un ejemplo, Clef asignó a un dominio un 95 por ciento de probabilidad de ser una web de moda y un 85 por ciento de ser una tienda online. La probabilidad de que fuera un sitio de phishing era inferior al uno por ciento. Obtener, renderizar y clasificar el sitio llevó 2,2 segundos. El modelo de lenguaje de uso general más rápido de Cloudflare necesitó 4,7 segundos para la misma tarea y solo devolvió dos categorías.
Clef también admite imágenes, mientras que Jev, por ahora, solo trabaja con texto. Su ventana de contexto de 64.000 tokens duplica la de Jev. Clef también puntúa por delante en el Jev Decision Index, aunque esos resultados proceden de las pruebas de rendimiento de la propia Cloudflare.
Construido sobre Qwen
Clef se basa en Qwen3.8-27B, y Clef-flash en el más pequeño Qwen3.5-9B. Cloudflare deja intactos los modelos base durante el entrenamiento. Utiliza sus propios datos sintéticos para entrenar componentes adicionales, que extraen las opciones de respuesta y las probabilidades a partir de los cálculos internos de los modelos.
Cloudflare también emplea su propia versión del aprendizaje por refuerzo para decisiones calibradas (Reinforcement Learning for Calibrated Decisions, RLCD), el método que TypeSafe utilizó para entrenar Jev. RLCD enseña a un modelo a responder varias preguntas sobre una misma entrada en una sola llamada. El objetivo es que las probabilidades asignadas coincidan con la frecuencia con la que las respuestas son realmente correctas. Antes de esto, Cloudflare había experimentado con DiffusionGemma para extraer valores de decisión fijos de las tripas de un modelo de lenguaje.
Ajuste fino para clientes
Cloudflare lanza además un servicio de aprendizaje por refuerzo para que los clientes puedan adaptar Clef a sus propias tareas. Al principio, serán ingenieros desplazados con los clientes (forward deployed engineers) quienes realicen el ajuste fino junto a ellos. Más adelante está prevista una plataforma de autoservicio.
El proceso consta de tres pasos. Los clientes registran las peticiones a través de AI Gateway para construir un conjunto de datos. Después evalúan esas peticiones en contenedores que hacen de entorno aislado de aprendizaje por refuerzo. Por último, un nuevo componente de entrenamiento despliega el modelo ajustado en Workers AI. Los modelos personalizados funcionan con tecnología de Replicate, que Cloudflare adquirió a finales de 2025.
De puertas adentro, Cloudflare prevé usar Clef para revisar denuncias de abusos, clasificar solicitudes de soporte y separar los bots útiles de los dañinos. Ambos modelos están disponibles en Workers AI y en Hugging Face con licencia Apache-2.0.
Un nicho que se ha llenado deprisa
TypeSafe AI, fundada por el exinvestigador de OpenAI Diogo Almeida, popularizó este enfoque cuando presentó Jev a mediados de septiembre. TypeSafe vende Jev como un modelo "sin alucinaciones". Eso solo garantiza que Jev no se sale de las opciones de respuesta predefinidas. Aun así, puede elegir la equivocada. A finales de septiembre, OpenAI respondió con una Decisions API basada en GPT-6 Luna, que también acepta texto o imágenes como contexto.
Cloudflare gestiona sobre todo una red global de distribución de contenidos, DNS y servicios de seguridad, y sus propios modelos de IA han pasado bastante desapercibidos hasta ahora. Sus últimas novedades en IA se han centrado en dar a los propietarios de webs control sobre el acceso. En julio permitió a los operadores de sitios bloquear o autorizar bots de IA en función de su finalidad.
Nuestro análisis
Varios lanzamientos en pocas semanas, a los que se suma el modelo de decisión abierto de AWS para agentes, apuntan a que los modelos de decisión se están convirtiendo en una pieza estándar. Para los equipos que trabajan con agentes, un conjunto acotado de resultados con probabilidades es mucho más fácil de integrar en el código, probar y auditar que un texto libre.
La afirmación de que "no hace falta un humano en el circuito" hay que tomarla con cierta cautela. Un modelo que no puede inventarse respuestas puede seguir eligiendo la equivocada, como demuestra la propia advertencia de TypeSafe. Lo que importa aquí es la calibración: una puntuación del 95 por ciento solo sirve si acierta aproximadamente el 95 por ciento de las veces. Como vimos en nuestra cobertura sobre la contabilidad con IA que sigue necesitando supervisión, una mayor precisión rara vez elimina la necesidad de revisar las acciones de alto riesgo.
Hay dos cosas a las que conviene prestar atención. Una es si las pruebas independientes comprueban la calibración y no solo la latencia. La otra es si los pesos abiertos con licencia Apache-2.0 consiguen atraer a desarrolladores que hoy usan Jev.
