SFEIR

Cloudflare Clef face à Jev : quel modèle de décision choisir, et ce que valent les chiffres

Cloudflare Clef face à Jev : quel modèle de décision choisir, et ce que valent les chiffres

En bref

Le 1er octobre 2026, seize jours après Jev, Cloudflare a publié Clef, un modèle de décision en deux tailles (27 et 9 milliards de paramètres), compatible avec l'API de Jev, à poids ouverts sous Apache 2.0, qui lit des images, avec un post-entraînement sur vos décisions annoncé. Ses chiffres sont auto-déclarés et ses latences ne se comparent pas telles quelles, de l'aveu de Cloudflare. Aucune option ne gagne partout : Jev pour le texte à bas prix et les décisions qui demandent des connaissances, Clef pour les images et le fine-tuning, les poids auto-hébergés pour les données qui ne sortent pas. D'abord pour les CTO et architectes, puis DSI, RSSI et achats.

Le 1er octobre 2026, Michelle Chen, Alex Reneau et Kevin Flansburg ont présenté Cloudflare Clef : Clef et Clef-flash, post-entraînés par l'équipe Workers AI à partir de Qwen3.8-27B et de Qwen3.5-9B. Le billet vise Jev, lancé le 15 septembre 2026 par TypeSafe AI : un modèle Clef le battrait sur 7 des 10 benchmarks retenus, avec une latence médiane 13 fois plus faible pour Clef-flash. Sans leurs conditions de mesure, ces deux chiffres trompent.

Rappel, pour qui a manqué le lancement de Jev par TypeSafe : un modèle de décision reçoit un état et des questions typées à options fermées, et renvoie une probabilité calibrée par option, sans générer de texte, à seuiller et à journaliser. TypeSafe a nommé la catégorie System One Models ; Clef en reprend le contrat. Les LLM routers : trois métiers sous un même nom et le routing multi-modèles, un modèle par tâche font ce travail à l'échelle d'une passerelle ; un modèle de décision le descend à chaque étape d'un agent.

Qu'est-ce que Clef ajoute à Jev, seize jours après ?

Des poids ouverts. Jev est fermé et hébergé par TypeSafe, en accès anticipé. Clef et Clef-flash se téléchargent sous Apache 2.0 avec leur code d'inférence : 27,4 et 9,4 milliards de paramètres, un Qwen gelé coiffé d'une tête de décision et d'adaptateurs LoRA, sans boucle autorégressive. Données et code d'entraînement restent privés : le terme juste est open-weight. Cloudflare dit entraîner la calibration avec une perte de Brier et un renforcement qu'il nomme RLCD ; le nom vient de TypeSafe, qui l'a forgé le 15 septembre 2026 pour sa propre méthode, et Cloudflare l'emploie sans le créditer.

La même API. D'après le changelog, une intégration Jev bascule vers Clef en changeant l'endpoint et le nom du modèle. La fenêtre est de 65 536 jetons ; Cloudflare l'oppose aux 32k de Jev, mais la documentation de TypeSafe lue le 6 octobre donne 64k par requête, dont 32k pour l'état et la question la plus longue.

Des images en entrée. Jev lit du texte seul. Clef accepte jusqu'à quatre images PNG, JPEG ou WebP par requête ; la vidéo, annoncée sur la fiche Hugging Face, ne figure pas dans le schéma d'entrée de Workers AI au 6 octobre 2026. Le jour du lancement, Flavio Copes a vu des requêtes avec image prendre 13 à 30 secondes, et le base64 d'une image de 1,3 Mo, décompté en jetons de texte, dépasser la fenêtre.

Un post-entraînement sur vos décisions. La documentation de Jev précise que le modèle n'est ni affiné ni adapté avec des données de clients. Cloudflare annonce au contraire un post-entraînement sur vos décisions, en deux temps : en design partner avec son équipe de forward-deployed engineers pour commencer, puis en libre-service, sur des briques que le billet décrit comme en cours de construction. Au 6 octobre 2026, rien de tout cela ne s'achète au catalogue.

Les latences annoncées se comparent-elles ?

Le changelog du 1er octobre 2026 écrit que Clef est 2,5 fois plus rapide que Jev à la médiane, et Clef-flash 13 fois. Le tableau du billet donne les chiffres ; la dernière colonne ajoute la mesure indépendante de Flavio Copes, depuis l'Italie, via l'API REST.

Modèle Médiane, ms (Cloudflare, 1er oct. 2026) p95, ms (Cloudflare) Médiane, ms (Flavio Copes, API REST, 1er oct. 2026)
Clef (27B)209,3238,6524 à 726
Clef-flash (9B)38,8122,4191 à 205
Jev (TypeSafe)524,1536,0non mesuré
Kev 9B51,4187,9non mesuré

Clef et Clef-flash sont auto-déclarés ; Jev et Kev 9B viennent de l'index communautaire. Ces colonnes ne mesurent pas la même chose, et Cloudflare le dit : la méthodologie de son site de classement précise, pour les entrées auto-déclarées, que « leur latence a été mesurée sur la pile de service des auteurs, et non sur le matériel de référence de l'index (une NVIDIA RTX PRO 6000), et n'est pas directement comparable ». Cloudflare ne divulgue pas le matériel qui a chronométré Clef ; les 524,1 ms de Jev sont, dans l'index, un aller-retour HTTPS vers une API hébergée, réseau compris, alors que Kev 9B est chronométré sur la carte. Le rapport de 13 compare donc un temps de calcul non documenté à un temps de réseau ; au p95, il tombe à 4,4, et à 2,2 pour Clef.

Cloudflare Clef est-il en tête du Jev Decision Index ?

Le Jev Decision Index est un espace Hugging Face communautaire, créé le 17 septembre 2026 et sans affiliation avec TypeSafe : 43 benchmarks dans sa version 0.2.1, dont 38 composent l'indice. Au 6 octobre 2026, son dernier commit date du 2 octobre et Clef n'y figure pas. Le classement où Clef arrive premier, avec 61,21, est un miroir hébergé par Cloudflare, qui se dit lui-même non officiel : les scores et latences de Clef et de Clef-flash y viennent d'une exécution interne, deux benchmarks manquants comptant zéro. Sur ce miroir, Clef-flash est cinquième (57,07), derrière Jev (57,91) et deux modèles ouverts de l'index. Canberk le résume dans sa relecture du 2 octobre : tant que l'index n'a pas validé les scores, l'avance de Clef est la mesure de Cloudflare.

Sur les dix benchmarks du billet, un modèle Clef mène sur sept : BANKING77 passe de 79,74 de macro-F1 pour Jev à 94,20 pour Clef, et Clef-flash atteint 98,76 de cas exacts sur BFCL contre 95,75. Jev garde When2Call et BRIGHT. Dès que la décision demande des connaissances, l'écart s'inverse sur la fiche Hugging Face, sur GPQA Diamond comme sur MMLU-Pro (chiffres dans le tableau des critères). Pourquoi le sommet d'un leaderboard ne dit pas quel modèle choisir l'explique : la position agrégée masque les benchmarks qui ressemblent à votre tâche.

Jev, Clef, Clef-flash ou vos GPU : lequel choisir, selon quel critère ?

Au 6 octobre 2026, Workers AI facture Clef 0,24 $ par million de jetons d'entrée et Clef-flash 0,09 $, sans prix de sortie listé ; Jev est à 0,042 $, sortie gratuite, soit 5,7 et 2,1 fois moins cher par jeton d'entrée. Le 4 octobre, Michelle Chen, coautrice du billet, a écrit sur X qu'elle allait corriger le prix de Clef ; au 6 octobre, la page n'a pas bougé. Le quota gratuit de Workers AI vaut 458 000 jetons d'entrée par jour pour Clef ou 1,22 million pour Clef-flash, partagés entre tous les modèles du compte.

Critère (au 6 octobre 2026) Jev Clef hébergé Clef-flash hébergé Poids auto-hébergés
Contrôle des donnéesétats chez TypeSafeétats chez Cloudflareétats chez Cloudflarechez vous
Prix par million de jetons d'entrée0,042 $, sortie gratuite0,24 $, correction annoncée0,09 $vos GPU
Tâches de connaissance (GPQA Diamond / MMLU-Pro)78,3 / 82,748,0 / 65,951,0 / 65,3comme Clef ou Clef-flash
Latence mesurée de bout en bout524,1 ms (index, HTTPS)524 à 726 ms (Flavio Copes)191 à 205 ms (Flavio Copes)à mesurer
Imagesnonquatre au plusquatre au plusimages ; vidéo annoncée
Post-entraînement sur vos donnéesnon décrit (modèle non adapté aux données clients)design partnerdesign partnerpossible, code d'entraînement non publié

Du texte à haut volume, sans post-entraînement : Jev, au prix le plus bas, si vous obtenez l'accès (Flavio Copes note des inscriptions suspendues depuis le 22 septembre). Des captures d'écran ou des documents scannés dans l'état : Clef, seul à lire des images. Des décisions qui demandent de savoir quelque chose du monde : Jev, ou un LLM génératif derrière le seuil. Des données qui ne sortent pas de votre périmètre : les poids ouverts, au prix de GPU et d'une équipe, Clef-flash en premier. Un besoin de post-entraîner sur vos décisions : Clef, en design partner, au calendrier de Cloudflare. Sur la latence, la seule comparaison honnête est celle que vous ferez depuis votre infrastructure. Les critères de choisir son modèle LLM s'appliquent (contrôle, prix, qualité, dépendance) ; ici, le jeu d'essai est déjà dans vos journaux.

Comment évaluer avant de choisir ?

  1. Un jeu d'essai tiré de vos journaux : tickets routés, outils appelés, escalades, avec la décision validée par un humain, cas ambigus compris.
  2. Un schéma écrit comme un contrat, avec une option d'abstention là où la bonne réponse peut manquer : le modèle répartit toujours ses probabilités sur les options que vous lui donnez.
  3. L'exactitude et la calibration, par le score de Brier (moyenne du carré de l'écart entre probabilité annoncée et résultat), puis par tranche de confiance : les cas annoncés à 0,8 ont-ils raison huit fois sur dix ? Les seuils se fixent sur la courbe de couverture contre erreur, avec un repli vers un LLM génératif ou un humain en dessous.
  4. Le vecteur de probabilités journalisé avec chaque décision : la pièce qu'un auditeur demandera, et la matière dont se calcule la fiabilité composée d'une chaîne d'agents.

Ce que ça change pour vous

CTO, lead dev, architecte. Dessinez une interface de décision (état, schéma, probabilités) et traitez le modèle qui la sert comme interchangeable : deux fournisseurs hébergés et des poids téléchargeables servent le même contrat, et une bascule tient en un endpoint et un nom de modèle.

DSI. Le format est partagé et les poids de Clef sont sous Apache 2.0 : la porte de sortie existe, au prix de GPU et d'une équipe. Budgétez sur le volume d'états décidés par jour.

RSSI, conformité. Une probabilité par option se seuille, se journalise et s'audite ; en face, données d'entraînement non publiées, scores validés par aucun tiers au 6 octobre 2026, aucune justification rendue. Exigez le score de Brier et la courbe de fiabilité dans le dossier de mise en production.

Achats. Prix au jeton d'entrée, sans prix de sortie, quota gratuit partagé, et une correction de prix annoncée le 4 octobre sans être appliquée : ne contractualisez pas sur le tarif du lancement. La réversibilité existe sur le papier (API commune, poids Apache 2.0) ; faites-la chiffrer en jours d'ingénierie.

Quelles limites avant de s'y fier ?

Tous les chiffres de Clef publiés au 6 octobre 2026 viennent de Cloudflare ; aucun tiers ne les a reproduits. Le seul usage interne décrit comme testé est la classification de domaines par l'équipe Threat Intelligence (2,2 s contre 4,7 s pour gpt-oss-120b, page chargée comprise) ; le tri du support ou la détection de bots restent des souhaits. La plateforme de fine-tuning n'existe qu'en partenariat accompagné. SFEIR n'a pas mesuré Clef : cet article s'appuie sur les publications de Cloudflare et de TypeSafe, sur l'index communautaire et sur la mesure de Flavio Copes, et il sera mis à jour quand l'index aura statué, le prix corrigé publié et la plateforme ouverte.

La prochaine étape tient en quelques jours : cent à mille décisions tirées de vos journaux, un schéma, deux ou trois options appelées depuis votre infrastructure, un score de Brier et une courbe de couverture. Vous saurez alors laquelle choisir pour chaque famille de décisions, et à quel taux d'erreur.

Sources

  1. Michelle Chen, Alex Reneau et Kevin Flansburg, « Introducing Clef: our open-source decision models, and new RL fine-tuning platform », Cloudflare Blog, 1er octobre 2026 (architecture à tête de décision et adaptateurs LoRA, perte de Brier et RLCD, données synthétiques internes, tableau des latences et des dix benchmarks, exemple Threat Intelligence à 2,2 s contre 4,7 s, plateforme de fine-tuning via l'équipe FDE puis en libre-service). blog.cloudflare.com
  2. Cloudflare, changelog Workers AI, 1er octobre 2026 (premiers modèles entraînés par l'équipe Workers AI, compatibilité avec l'API System One, 2,5 fois et 13 fois plus rapide que Jev à la médiane, un modèle Clef premier sur 7 benchmarks sur 10, jusqu'à quatre images, appel à design partners). developers.cloudflare.com
  3. Fiche du modèle Cloudflare/clef, Hugging Face (27 milliards de paramètres post-entraînés de Qwen3.8-27B, licence Apache 2.0, entrées texte, JSON, images ou vidéo pour les poids ouverts, tableau complet des benchmarks dont GPQA Diamond et MMLU-Pro, exécution interne de la suite Decision Index 0.2.1), consultée le 6 octobre 2026. huggingface.co
  4. Fiche du modèle Cloudflare/clef-flash, Hugging Face (9 milliards de paramètres post-entraînés de Qwen3.5-9B, licence Apache 2.0), consultée le 6 octobre 2026. huggingface.co
  5. Cloudflare, documentation Workers AI, page du modèle Clef et schéma d'entrée (champs model, state, questions et images ; quatre images PNG, JPEG ou WebP au plus, pas d'URL distante ni de vidéo ; fenêtre de 65 536 jetons), consultée le 6 octobre 2026. developers.cloudflare.com
  6. Cloudflare, tarifs Workers AI, page mise à jour le 1er octobre 2026 et consultée le 6 octobre (0,240 $ et 0,090 $ par million de jetons d'entrée, 21 818 et 8 182 neurones par million, 10 000 neurones gratuits par jour, 0,011 $ par millier de neurones au-delà). developers.cloudflare.com
  7. Cloudflare, site de classement clef-evals, miroir non officiel du Jev Decision Index avec les entrées auto-déclarées de Clef (méthodologie sur la latence non comparable, Clef 61,21 et Clef-flash 57,07 derrière Jev 57,91, Surogate Rune 26B-A4B v3 57,44 et Decider chat Gemma-4-31B 57,33, iSarcasmEval et HLE comptés zéro), consulté le 6 octobre 2026. clef-evals.workers-ai-mle.workers.dev
  8. Jev Decision Index, espace communautaire multimodalart/jev-decision-index, Hugging Face, créé le 17 septembre 2026 par Apolinário, version 0.2.1, dernier commit du 2 octobre 2026 (43 benchmarks dont 38 dans l'indice, latence sur une RTX PRO 6000, Jev à 524,1 ms en aller-retour HTTPS, Clef absent), consulté le 6 octobre 2026. huggingface.co
  9. Diogo Almeida, billet de lancement des modèles System One et de Jev, TypeSafe, 15 septembre 2026 (catégorie System One, méthode d'entraînement nommée RLCD). typesafe.ai
  10. TypeSafe, documentation (modèles, concept System One, API), consultée le 6 octobre 2026 (Jev texte seul, 0,042 $ par million de jetons d'entrée et sortie gratuite, 64k jetons par requête dont 32k pour l'état et la question la plus longue, modèle ni affiné ni adapté avec des données de clients, trois types de questions). docs.typesafe.ai
  11. Canberk, analyse de l'annonce Clef, relecture éditoriale du 2 octobre 2026 (légende auto-déclaré contre validé par l'index, absence de comparaison matérielle). canberk.me
  12. Flavio Copes, essai de Clef via l'API REST, 1er octobre 2026 (médianes de 191 à 205 ms pour Clef-flash et de 524 à 726 ms pour Clef depuis l'Italie, appels jusqu'à 3 s, requêtes image de 13 à 30 s, base64 décompté en jetons, image de 1,3 Mo au-delà de la fenêtre, inscriptions à Jev suspendues depuis le 22 septembre). flaviocopes.com
  13. Michelle Chen, messages sur X du 4 octobre 2026 (annonce d'une correction du prix de Clef ; quota gratuit de 458 000 jetons d'entrée par jour pour Clef ou 1,22 million pour Clef-flash). x.com

Mettre en production des agents dont les décisions se mesurent

Jeu d'essai tiré de vos journaux, calibration, seuils et repli vers un LLM ou un humain : nos équipes aident les DSI et les équipes plateforme à sortir les décisions répétitives du LLM génératif et à les auditer.

Échanger avec SFEIR
SFEIR AI Auteur

Articles similaires