Cloudflare Clef: snelle beslismodellen voor AI-agents
Cloudflare heeft twee modellen uitgebracht die keuzes maken in plaats van tekst te schrijven. Clef en het kleinere zusje Clef-flash zijn "beslismodellen" voor AI-agents. Het belangrijkste argument van Cloudflare is snelheid, afgezet tegen de huidige maatstaf in deze kleine categorie: Jev van TypeSafe AI.
Het bedrijf doet ook een gedurfdere bewering. In zijn eigen woorden: "a human does not necessarily need to be in the loop for agentic decisions anymore." Oftewel: een mens hoeft niet per se meer betrokken te zijn bij beslissingen van agents.
Wat een beslismodel doet
Een beslismodel antwoordt niet met een alinea tekst. Het neemt een invoer, kiest uit een vaste set opties en koppelt aan elke optie een waarschijnlijkheid. Cloudflare geeft als voorbeeld een bericht aan de klantenservice. Clef beoordeelt hoe urgent het bericht is en welk team het moet oppakken. Code verderop in de keten handelt vervolgens op basis van die uitkomst. Die kan het ticket doorsturen, escaleren of aan een mens overdragen.
Volgens Cloudflare kunnen agents "programmatically gather context, make decisions, and take actions on tasks, or defer to a human when needed", dus programmatisch context verzamelen, beslissingen nemen en taken uitvoeren, of zo nodig de beslissing aan een mens overlaten. De naam komt uit het notenschrift, waar een sleutel (in het Engels "clef") de toonhoogte van elke lijn op de notenbalk vastlegt. Het model speelt een vergelijkbare rol door het kader te bepalen voor de actie die volgt. De naam klinkt bovendien een beetje als "Jev", en dat is waarschijnlijk geen toeval.
De categorie zit tussen twee bekende soorten tools in. Grote taalmodellen kunnen redeneren en tools aanroepen, maar hun uitkomsten wisselen en ze kunnen traag zijn. Klassieke classificatiemodellen zijn snel, maar moeten voor elke nieuwe categorie opnieuw worden getraind. Cloudflare zet Clef neer als directe concurrent van Jev en houdt de API volledig compatibel, zodat klanten zonder veel moeite kunnen overstappen.
De snelheidscijfers
Volgens Cloudflare zijn Clef en Clef-flash op 43 benchmarks sneller dan alle relevante concurrerende beslismodellen. De gerapporteerde mediane latenties:
- Clef-flash: ongeveer 39 milliseconden
- Clef: ongeveer 209 milliseconden
- Jev: iets meer dan 524 milliseconden
Beide modellen draaien op de eigen infrastructuur van Cloudflare. Volgens het bedrijf levert dat een extra voordeel op, omdat ze dicht bij de edge-datacenters staan.
Het threat-intelligenceteam van Cloudflare test Clef al voor het classificeren van websites. In een van de voorbeelden gaf Clef een domein 95 procent kans om een modesite te zijn en 85 procent kans om een webwinkel te zijn. De kans dat het om een phishingsite ging, lag onder de 1 procent. Het ophalen, renderen en classificeren van de site kostte 2,2 seconden. Het snelste algemene taalmodel van Cloudflare deed 4,7 seconden over dezelfde klus en gaf maar twee categorieen terug.
Clef kan ook afbeeldingen verwerken, terwijl Jev tot nu toe alleen met tekst overweg kan. Het contextvenster van 64.000 tokens is twee keer zo groot als dat van Jev. Clef scoort ook hoger op de Jev Decision Index, al komen die resultaten uit Cloudflares eigen benchmarks.
Gebouwd op Qwen
Clef is gebaseerd op Qwen3.8-27B, Clef-flash op het kleinere Qwen3.5-9B. Cloudflare laat de basismodellen tijdens de training ongemoeid. Met eigen synthetische data traint het bedrijf extra componenten, die antwoordopties en waarschijnlijkheden afleiden uit de interne berekeningen van de modellen.
Cloudflare gebruikt daarnaast een eigen versie van Reinforcement Learning for Calibrated Decisions (RLCD), de methode waarmee TypeSafe Jev heeft getraind. RLCD leert een model om in een enkele aanroep meerdere vragen over een invoer te beantwoorden. Het doel is dat de toegekende waarschijnlijkheden overeenkomen met hoe vaak de antwoorden echt kloppen. Eerder experimenteerde Cloudflare met DiffusionGemma om vaste beslissingswaarden uit de interne werking van een taalmodel te halen.
Finetuning voor klanten
Cloudflare lanceert ook een reinforcement-learningdienst waarmee klanten Clef kunnen aanpassen aan hun eigen taken. In eerste instantie voeren forward deployed engineers de finetuning samen met klanten uit. Later moet er een selfserviceplatform komen.
Het proces bestaat uit drie stappen. Klanten loggen verzoeken via AI Gateway om een dataset op te bouwen. Daarna beoordelen ze die verzoeken in containers die dienen als RL-sandbox. Tot slot zet een nieuwe trainercomponent het aangepaste model live op Workers AI. Eigen modellen draaien op technologie van Replicate, dat Cloudflare eind 2025 overnam.
Intern wil Cloudflare Clef inzetten om misbruikmeldingen te beoordelen, supportverzoeken te sorteren en nuttige bots te scheiden van schadelijke. Beide modellen zijn beschikbaar op Workers AI en op Hugging Face onder de Apache-2.0-licentie.
Een niche die snel volliep
TypeSafe AI, opgericht door voormalig OpenAI-onderzoeker Diogo Almeida, maakte de aanpak populair toen het half september Jev introduceerde. TypeSafe presenteert Jev als een model "zonder hallucinaties". Dat garandeert alleen dat Jev binnen de vooraf vastgelegde antwoordopties blijft. Het kan nog steeds de verkeerde kiezen. Eind september volgde OpenAI met een Decisions API op basis van GPT-6 Luna, die ook tekst of afbeeldingen als context accepteert.
Cloudflare beheert vooral een wereldwijd netwerk voor contentlevering, DNS en beveiligingsdiensten, en de eigen AI-modellen van het bedrijf kregen tot nu toe weinig aandacht. Het recente AI-nieuws van Cloudflare draaide vooral om het geven van controle over toegang aan website-eigenaren. In juli konden sitebeheerders AI-bots blokkeren of toelaten op basis van hun doel.
Onze kijk
Meerdere lanceringen binnen een paar weken, plus het open beslismodel voor agents van AWS, wijzen erop dat beslismodellen een standaardbouwsteen worden. Voor teams die agents draaien, is een afgebakende set uitkomsten met waarschijnlijkheden veel makkelijker in code in te bouwen, te testen en te controleren dan vrije tekst.
De bewering dat er "geen mens meer in de loop" nodig is, verdient enige voorzichtigheid. Een model dat geen antwoorden kan verzinnen, kan nog steeds het verkeerde kiezen, zoals TypeSafes eigen kanttekening laat zien. Kalibratie is hier waar het om draait: een score van 95 procent heeft alleen zin als die ongeveer 95 procent van de tijd klopt. Zoals ons artikel over AI-boekhouding die nog steeds toezicht nodig heeft liet zien, maakt een hogere nauwkeurigheid het zelden overbodig om acties met grote gevolgen te controleren.
Twee dingen zijn het volgen waard. Ten eerste of onafhankelijke tests ook de kalibratie controleren en niet alleen de latentie. Ten tweede of de open Apache-2.0-gewichten ontwikkelaars weglokken bij Jev.
