Cloudflare Clef : modèles de décision rapides pour agents IA
Cloudflare a lancé deux modèles qui font des choix au lieu de rédiger du texte. Clef et son petit frère Clef-flash sont des "modèles de décision" pour agents IA. Le principal argument de Cloudflare, c'est la vitesse, mesurée face à la référence actuelle de cette petite catégorie : Jev, de TypeSafe AI.
L'entreprise avance aussi une affirmation plus audacieuse. Selon ses termes, "un humain n'a plus forcément besoin d'intervenir dans la boucle pour les décisions agentiques".
Ce que fait un modèle de décision
Un modèle de décision ne répond pas par un paragraphe. Il reçoit une entrée, choisit parmi un ensemble fixe d'options et attribue une probabilité à chacune. Cloudflare prend l'exemple d'un message adressé au support client. Clef évalue le degré d'urgence du message et l'équipe qui doit s'en charger. Du code placé plus loin dans la chaîne exploite ensuite ce résultat. Il peut acheminer le ticket, le faire remonter ou le confier à une personne.
D'après Cloudflare, les agents peuvent "rassembler du contexte, prendre des décisions et agir sur des tâches de manière programmatique, ou s'en remettre à un humain si nécessaire". Le nom vient de la notation musicale, où une clé fixe la hauteur de chaque ligne de la portée. Le modèle joue un rôle comparable en fixant le cadre de l'action qui suit. Le nom sonne aussi un peu comme "Jev", ce qui n'est sans doute pas un hasard.
Cette catégorie se situe entre deux outils bien connus. Les grands modèles de langage savent raisonner et appeler des outils, mais leurs réponses varient et ils peuvent être lents. Les classifieurs classiques sont rapides, mais il faut les réentraîner pour chaque nouvelle catégorie. Cloudflare présente Clef comme un concurrent direct de Jev et garde son API entièrement compatible, pour que les clients puissent changer sans grand effort.
Les chiffres de vitesse
Cloudflare affirme que Clef et Clef-flash sont plus rapides que tous les modèles de décision concurrents pertinents sur 43 benchmarks. Les latences médianes annoncées :
- Clef-flash : environ 39 millisecondes
- Clef : environ 209 millisecondes
- Jev : un peu plus de 524 millisecondes
Les deux modèles tournent sur l'infrastructure de Cloudflare. Selon l'entreprise, c'est un avantage supplémentaire, car ils se trouvent à proximité de ses centres de données en périphérie.
L'équipe de renseignement sur les menaces de Cloudflare teste déjà Clef pour classer des sites web. Dans un exemple, Clef a attribué à un domaine une probabilité de 95 % d'être un site de mode et de 85 % d'être une boutique en ligne. La probabilité qu'il s'agisse d'un site d'hameçonnage était inférieure à 1 %. Récupérer, afficher et classer le site a pris 2,2 secondes. Le modèle de langage généraliste le plus rapide de Cloudflare a mis 4,7 secondes pour la même tâche et n'a renvoyé que deux catégories.
Clef accepte aussi les images, alors que Jev ne traite pour l'instant que du texte. Sa fenêtre de contexte de 64 000 tokens est deux fois plus grande que celle de Jev. Clef obtient également de meilleurs scores sur le Jev Decision Index, même si ces résultats proviennent des propres benchmarks de Cloudflare.
Une base Qwen
Clef repose sur Qwen3.8-27B, et Clef-flash sur le plus petit Qwen3.5-9B. Cloudflare ne modifie pas les modèles de base pendant l'entraînement. L'entreprise utilise ses propres données synthétiques pour entraîner des composants supplémentaires, qui déduisent les options de réponse et les probabilités à partir des calculs internes des modèles.
Cloudflare s'appuie aussi sur sa propre version du Reinforcement Learning for Calibrated Decisions (RLCD), la méthode employée par TypeSafe pour entraîner Jev. Le RLCD apprend à un modèle à répondre à plusieurs questions sur une même entrée en un seul appel. L'objectif est que les probabilités attribuées correspondent à la fréquence à laquelle les réponses sont réellement justes. Auparavant, Cloudflare avait expérimenté DiffusionGemma pour extraire des valeurs de décision fixes des mécanismes internes d'un modèle de langage.
Un ajustement fin pour les clients
Cloudflare lance également un service d'apprentissage par renforcement pour que les clients puissent adapter Clef à leurs propres tâches. Dans un premier temps, des ingénieurs déployés sur le terrain mèneront l'ajustement fin avec les clients. Une plateforme en libre-service est prévue plus tard.
Le processus se déroule en trois étapes. Les clients enregistrent leurs requêtes via AI Gateway pour constituer un jeu de données. Ils évaluent ensuite ces requêtes dans des conteneurs qui servent de bac à sable pour l'apprentissage par renforcement. Enfin, un nouveau composant d'entraînement déploie le modèle ajusté sur Workers AI. Les modèles personnalisés tournent sur la technologie de Replicate, que Cloudflare a rachetée fin 2025.
En interne, Cloudflare compte utiliser Clef pour examiner les signalements d'abus, trier les demandes de support et distinguer les bots utiles des bots malveillants. Les deux modèles sont disponibles sur Workers AI et sur Hugging Face sous licence Apache-2.0.
Une niche vite remplie
TypeSafe AI, fondée par l'ancien chercheur d'OpenAI Diogo Almeida, a popularisé cette approche en présentant Jev à la mi-septembre. TypeSafe vante Jev comme un modèle "sans hallucinations". Cela garantit seulement que Jev reste dans les options de réponse prédéfinies. Il peut quand même choisir la mauvaise. Fin septembre, OpenAI a suivi avec une Decisions API reposant sur GPT-6 Luna, qui accepte elle aussi du texte ou des images comme contexte.
Cloudflare exploite surtout un réseau mondial de diffusion de contenu, de DNS et de services de sécurité, et ses propres modèles d'IA ont jusqu'ici peu fait parler d'eux. Ses récentes annonces dans l'IA visaient surtout à donner aux propriétaires de sites le contrôle de l'accès. En juillet, l'entreprise a permis aux exploitants de sites de bloquer ou d'autoriser les bots d'IA selon leur finalité.
Notre analyse
Plusieurs lancements en quelques semaines, sans compter le modèle de décision ouvert d'AWS pour les agents, laissent penser que les modèles de décision deviennent une brique standard. Pour les équipes qui font tourner des agents, un ensemble limité de résultats assortis de probabilités est bien plus facile à brancher dans du code, à tester et à auditer qu'un texte libre.
L'affirmation sur l'absence d'humain dans la boucle appelle une certaine prudence. Un modèle incapable d'inventer des réponses peut toujours choisir la mauvaise, comme le montre la mise en garde de TypeSafe elle-même. C'est l'étalonnage qui compte ici : un score de 95 % n'est utile que s'il est juste environ 95 % du temps. Comme l'a montré notre article sur la comptabilité par IA qui nécessite encore une supervision, une meilleure précision dispense rarement de vérifier les actions à fort enjeu.
Deux points méritent d'être suivis. D'abord, si des tests indépendants vérifient l'étalonnage et pas seulement la latence. Ensuite, si les poids ouverts sous licence Apache-2.0 détournent les développeurs de Jev.
