Cloudflare Clef: Flinke Entscheidungsmodelle für KI-Agenten
Cloudflare hat zwei Modelle veröffentlicht, die Entscheidungen treffen, statt Fließtext zu schreiben. Clef und sein kleineres Geschwistermodell Clef-flash sind "Entscheidungsmodelle" für KI-Agenten. Cloudflares Hauptargument dafür ist die Geschwindigkeit, gemessen am aktuellen Maßstab in dieser kleinen Kategorie: Jev von TypeSafe AI.
Das Unternehmen stellt außerdem eine kühnere Behauptung auf. In seinen Worten muss "ein Mensch bei agentischen Entscheidungen nicht mehr unbedingt eingebunden sein".
Was ein Entscheidungsmodell leistet
Ein Entscheidungsmodell antwortet nicht mit einem Absatz. Es nimmt eine Eingabe entgegen, wählt aus einer festen Reihe von Optionen und versieht jede davon mit einer Wahrscheinlichkeit. Cloudflares Beispiel ist eine Kundenanfrage an den Support. Clef bewertet, wie dringend die Nachricht ist und welches Team sie bearbeiten sollte. Code weiter hinten in der Verarbeitungskette handelt dann auf Basis dieser Ausgabe. Er kann das Ticket weiterleiten, eskalieren oder an einen Menschen übergeben.
Laut Cloudflare können Agenten "programmatisch Kontext sammeln, Entscheidungen treffen und Aufgaben ausführen oder bei Bedarf an einen Menschen abgeben". Der Name stammt aus der Notenschrift, wo ein Notenschlüssel (englisch "clef") die Tonhöhe jeder Linie im Notensystem festlegt. Das Modell spielt eine ähnliche Rolle, indem es den Rahmen für die nachfolgende Aktion setzt. Der Name klingt zudem ein wenig wie "Jev", was vermutlich Absicht ist.
Die Kategorie liegt zwischen zwei vertrauten Werkzeugen. Große Sprachmodelle können schlussfolgern und Werkzeuge aufrufen, aber ihre Ausgaben schwanken und sie können langsam sein. Klassische Klassifikatoren sind schnell, müssen aber für jede neue Kategorie neu trainiert werden. Cloudflare positioniert Clef als direkten Konkurrenten zu Jev und hält seine API vollständig kompatibel, sodass Kunden mit wenig Aufwand wechseln können.
Die Geschwindigkeitswerte
Cloudflare zufolge sind Clef und Clef-flash in 43 Benchmarks schneller als alle relevanten konkurrierenden Entscheidungsmodelle. Die angegebenen mittleren Latenzen:
- Clef-flash: rund 39 Millisekunden
- Clef: rund 209 Millisekunden
- Jev: knapp über 524 Millisekunden
Beide Modelle laufen auf Cloudflares eigener Infrastruktur. Das verschaffe ihnen einen zusätzlichen Vorteil, so das Unternehmen, weil sie nah an seinen Edge-Rechenzentren liegen.
Cloudflares Threat-Intelligence-Team testet Clef bereits, um Websites zu klassifizieren. In einem Beispiel bewertete Clef eine Domain mit 95 Prozent Wahrscheinlichkeit als Mode-Website und mit 85 Prozent als Onlineshop. Die Wahrscheinlichkeit, dass es sich um eine Phishing-Seite handelte, lag unter einem Prozent. Abrufen, Rendern und Klassifizieren der Seite dauerten 2,2 Sekunden. Cloudflares schnellstes Allzweck-Sprachmodell brauchte für dieselbe Aufgabe 4,7 Sekunden und lieferte nur zwei Kategorien.
Clef verarbeitet außerdem Bilder, während Jev bislang nur mit Text umgehen kann. Sein Kontextfenster von 64.000 Token ist doppelt so groß wie das von Jev. Auch im Jev Decision Index liegt Clef vorn, allerdings stammen diese Ergebnisse aus Cloudflares eigenen Benchmarks.
Aufgebaut auf Qwen
Clef basiert auf Qwen3.8-27B, Clef-flash auf dem kleineren Qwen3.5-9B. Cloudflare lässt die Basismodelle beim Training unverändert. Mit eigenen synthetischen Daten trainiert das Unternehmen zusätzliche Komponenten, die Antwortoptionen und Wahrscheinlichkeiten aus den internen Berechnungen der Modelle ableiten.
Cloudflare nutzt zudem eine eigene Variante von Reinforcement Learning for Calibrated Decisions (RLCD), der Methode, mit der TypeSafe Jev trainiert hat. RLCD bringt einem Modell bei, mehrere Fragen zu einer Eingabe in einem einzigen Aufruf zu beantworten. Ziel ist, dass die vergebenen Wahrscheinlichkeiten dazu passen, wie oft die Antworten tatsächlich stimmen. Zuvor hatte Cloudflare mit DiffusionGemma experimentiert, um feste Entscheidungswerte aus dem Innenleben eines Sprachmodells herauszulesen.
Feintuning für Kunden
Cloudflare startet außerdem einen Reinforcement-Learning-Dienst, mit dem Kunden Clef an ihre eigenen Aufgaben anpassen können. Anfangs übernehmen Ingenieure, die Cloudflare direkt zu den Kunden entsendet, das Feintuning gemeinsam mit diesen. Eine Selbstbedienungsplattform ist für später geplant.
Der Ablauf hat drei Schritte. Kunden protokollieren Anfragen über AI Gateway, um einen Datensatz aufzubauen. Anschließend bewerten sie diese Anfragen in Containern, die als RL-Sandbox dienen. Zum Schluss stellt eine neue Trainer-Komponente das angepasste Modell auf Workers AI bereit. Eigene Modelle laufen auf Technik von Replicate, das Cloudflare Ende 2025 übernommen hat.
Intern will Cloudflare Clef nutzen, um Missbrauchsmeldungen zu prüfen, Supportanfragen zu sortieren und nützliche Bots von schädlichen zu trennen. Beide Modelle sind auf Workers AI und auf Hugging Face unter der Apache-2.0-Lizenz verfügbar.
Eine Nische, die sich schnell gefüllt hat
TypeSafe AI, gegründet vom früheren OpenAI-Forscher Diogo Almeida, hat den Ansatz bekannt gemacht, als es Mitte September Jev vorstellte. TypeSafe vermarktet Jev als Modell "ohne Halluzinationen". Das garantiert allerdings nur, dass Jev innerhalb der vordefinierten Antwortoptionen bleibt. Es kann trotzdem die falsche wählen. Ende September zog OpenAI mit einer Decisions API nach, die auf GPT-6 Luna aufbaut und ebenfalls Text oder Bilder als Kontext akzeptiert.
Cloudflare betreibt vor allem ein weltweites Netzwerk für Inhaltsauslieferung, DNS und Sicherheitsdienste, und seine eigenen KI-Modelle haben bisher wenig Aufmerksamkeit bekommen. Seine jüngsten KI-Neuigkeiten drehten sich darum, Website-Betreibern Kontrolle über den Zugriff zu geben. Im Juli ermöglichte das Unternehmen Seitenbetreibern, KI-Bots je nach Zweck zu blockieren oder zuzulassen.
Unsere Einschätzung
Mehrere Starts innerhalb weniger Wochen, dazu AWS' offenes Entscheidungsmodell für Agenten, deuten darauf hin, dass Entscheidungsmodelle zu einem Standardbaustein werden. Für Teams, die Agenten betreiben, lässt sich eine begrenzte Menge an Ausgaben mit Wahrscheinlichkeiten viel leichter in Code einbinden, testen und prüfen als freier Text.
Bei der Behauptung, es brauche keinen Menschen mehr im Entscheidungsprozess, ist etwas Vorsicht angebracht. Ein Modell, das keine Antworten erfinden kann, kann trotzdem die falsche auswählen, wie TypeSafes eigener Vorbehalt zeigt. Entscheidend ist hier die Kalibrierung: Ein Wert von 95 Prozent hilft nur, wenn er in etwa 95 Prozent der Fälle zutrifft. Wie unser Bericht über KI-Buchhaltung, die weiterhin Aufsicht braucht gezeigt hat, macht höhere Genauigkeit die Überprüfung folgenreicher Aktionen nur selten überflüssig.
Zwei Dinge sind einen Blick wert. Zum einen, ob unabhängige Tests die Kalibrierung prüfen und nicht nur die Latenz. Zum anderen, ob die offenen Gewichte unter Apache-2.0 Entwickler von Jev weglocken.
