Cloudflare Clef
Modèles de décision de Cloudflare (1er octobre 2026) : une probabilité par option au lieu de texte, poids ouverts Apache 2.0, hébergés sur Workers AI.
SFEIR AI · Publié le 6 octobre 2026
Un modèle qui décide au lieu d'écrire
Cloudflare Clef désigne deux modèles de décision, Clef et Clef-flash, que Michelle Chen, Alex Reneau et Kevin Flansburg présentent le 1er octobre 2026 sur le blog de Cloudflare. Workers AI y voit ses premiers modèles maison, issus d'un post-entraînement.
Le modèle reçoit un état (texte, JSON, images) et des questions typées, puis renvoie en une passe une probabilité par option autorisée, sans texte libre à analyser. Clef rejoint la catégorie des System One Models ouverte par TypeSafe avec Jev le 15 septembre 2026, en y ajoutant un encodeur de vision (Jev n'accepte que du texte au 6 octobre 2026) et une fenêtre de 65 536 tokens.
Deux tailles, des poids ouverts sous Apache 2.0
Clef compte 27 milliards de paramètres et part de Qwen3.8-27B ; Clef-flash en compte 9 milliards et part de Qwen3.5-9B. Cloudflare publie les deux sous Apache 2.0 sur Hugging Face, sans inscription.
L'open source du billet recouvre les poids et le code d'inférence ; les données d'entraînement, des jeux synthétiques internes, et le code d'entraînement restent privés. Open-weight est le terme exact.
Architecture et entraînement
Cloudflare gèle le squelette Qwen, y ajoute des adaptateurs de rang 256 et une tête de schéma, un petit transformeur qui lit les derniers états cachés et note toutes les options ensemble. À l'inférence, une passe de préremplissage puis la notation des choix valides en parallèle, sans génération autorégressive.
Le post-entraînement combine une entropie croisée lissée et une perte de Brier pour la calibration, plus un objectif secondaire que Cloudflare nomme RLCD (Reinforcement Learning for Calibrated Decisions). Le nom vient de TypeSafe, qui l'a publié le 15 septembre 2026 pour Jev ; le billet de Cloudflare ne le crédite pas, et la méthode décrite est la sienne.
Sur Workers AI : API, images, prix et fine-tuning
Workers AI héberge les deux modèles depuis le 1er octobre 2026 derrière l'API System One de TypeSafe : selon le changelog, une intégration Jev bascule sur Clef en changeant l'endpoint et le nom du modèle. La version hébergée accepte jusqu'à quatre images par requête, mais pas la vidéo citée par la fiche Hugging Face.
Au 6 octobre 2026, Workers AI facture 0,24 $ par million de tokens d'entrée pour Clef et 0,09 $ pour Clef-flash, avec un quota gratuit quotidien d'environ 458 000 tokens sur Clef ou 1,22 million sur Clef-flash. Michelle Chen a annoncé le 4 octobre 2026 une correction du tarif de Clef, encore absente le 6 octobre.
Le fine-tuning par renforcement démarre avec l'équipe de Forward Deployed Engineering de Cloudflare, avant un libre-service annoncé pour plus tard.
Des performances à lire avec leurs conditions
Les scores et latences de Clef publiés le 1er octobre 2026 viennent de Cloudflare. Un modèle Clef mène sept des dix benchmarks retenus (94,20 de macro-F1 sur BANKING77 contre 79,74 pour Jev) ; Jev garde les tests de connaissances comme GPQA Diamond (78,3 contre 48,0).
Au 6 octobre 2026, le Jev Decision Index communautaire n'a pas intégré Clef : sa première place (61,21) n'existe que sur le miroir non officiel de Cloudflare, où Clef-flash est cinquième (57,07), derrière Jev (57,91).
Cloudflare annonce 38,8 ms de médiane pour Clef-flash, 209,3 ms pour Clef et 524,1 ms pour Jev (facteurs 13 et 2,5), mais son tableau précise que Clef a tourné sur sa pile, matériel non divulgué, et Jev par aller-retour réseau. Flavio Copes mesure le 1er octobre 2026, via l'API REST depuis l'Italie, 191 à 205 ms pour Clef-flash et 524 à 726 ms pour Clef.
Questions fréquentes
Qu'est-ce qu'un modèle de décision ?
Un modèle qui reçoit un état et des questions typées, et renvoie une probabilité pour chaque option autorisée au lieu de générer du texte. TypeSafe a nommé cette catégorie System One Models avec Jev le 15 septembre 2026 ; Clef en est l'implémentation de Cloudflare, publiée le 1er octobre 2026, avec des images en entrée.
Clef est-il open source ?
Les poids et le code d'inférence de Clef et Clef-flash sont publiés sous Apache 2.0 sur Hugging Face, en accès public. Les données d'entraînement, synthétiques et internes, et le code d'entraînement ne le sont pas : le terme exact est open-weight.
Clef est-il plus rapide et moins cher que Jev ?
Plus rapide selon Cloudflare (facteurs 13 pour Clef-flash et 2,5 pour Clef à la médiane), mais mesuré sur sa propre pile face à un Jev appelé par réseau, ce que son tableau juge non comparable ; Flavio Copes a relevé le 1er octobre 2026 des médianes de 191 à 205 ms pour Clef-flash et de 524 à 726 ms pour Clef. Moins cher, non : au 6 octobre 2026, Clef coûte 0,24 $ et Clef-flash 0,09 $ par million de tokens d'entrée, contre 0,042 $ pour Jev ; Cloudflare a annoncé le 4 octobre une correction du tarif de Clef.
Sources
- Cloudflare, « Introducing Clef: our open-source decision models, and new RL fine-tuning platform » : annonce, architecture, entraînement, benchmarks et latences auto-déclarés · 2026-10-01
- Changelog Workers AI : disponibilité, API System One, quatre images en entrée, facteurs 2,5 et 13 face à Jev · 2026-10-01
- Fiche Hugging Face Cloudflare/clef : 27B post-entraîné de Qwen3.8-27B, licence Apache 2.0, tête de schéma, tableau complet des benchmarks
- Fiche Hugging Face Cloudflare/clef-flash : 9B post-entraîné de Qwen3.5-9B, licence Apache 2.0
- Tarifs Workers AI : 0,24 $ et 0,09 $ par million de tokens d'entrée, neurones et quota gratuit (page mise à jour le 1er octobre 2026, lue le 6 octobre 2026) · 2026-10-01
- TypeSafe, « Introducing System One Models & Jev » : origine du nom RLCD et de l'API System One · 2026-09-15
- Flavio Copes : mesure indépendante des latences de Clef et Clef-flash via l'API REST depuis l'Italie · 2026-10-01
- Canberk : scores auto-déclarés face aux modèles validés par le tableau, comparaison de latence non homogène