SFEIR

TypeSafe lance Jev, un classifieur plus qu'un générateur

TypeSafe lance Jev, un classifieur plus qu'un générateur

Le 15 septembre 2026, Diogo Almeida sort sa startup TypeSafe AI de deux ans de stealth avec un premier modèle, Jev1. Le modèle ne produit aucun texte. Il reçoit un état en entrée et renvoie des décisions typées, accompagnées de probabilités calibrées : un classifieur, entraîné et tarifé à l'échelle d'un modèle de frontière. L'éditeur annonce des gains de 20 à 200× en vitesse et de 40 à 400× en coût par rapport aux LLM sur des tâches de décision, et une levée de 40 millions de dollars en seed auprès de DCVC9. L'argument mérite qu'on s'y arrête pour une raison qui tient à son auteur : Almeida a été chercheur chez OpenAI, où il a contribué à InstructGPT, au RLHF et à ChatGPT.

Un co-inventeur de ChatGPT contre le paradigme du chat

Almeida ouvre son fil d'annonce sur une question : pourquoi des modèles déjà superhumains en conversation n'ont-ils produit ni AGI ni automatisation massive15 ? Sa réponse vise la nature des LLM. Ils sont optimisés pour écrire du texte destiné à des humains. Or la plupart des décisions prises par du logiciel (router un ticket, scorer un lead, classer un message, valider une sortie) n'ont besoin d'aucune phrase. Pour ces boucles, la génération token par token coûte cher, prend des secondes, produit des erreurs de format et se calibre mal.

Jev inaugure une catégorie que l'éditeur baptise System One Models, en référence au système 1 de Daniel Kahneman : la pensée rapide, intuitive, sans délibération4. Le raisonnement lent, le système 2, reste du ressort des LLM, ou du code qui orchestre les appels.

TypeSafe AI, basée à San Francisco, est cofondée par Almeida avec Erik Gafni et Sasha Sheng. James Hardiman, qui a mené le tour pour DCVC, résume le pitch en un mot : machine-native, une IA conçue pour du logiciel plutôt que pour des lecteurs9.

Un état en entrée, des décisions typées en sortie

L'API repose sur un contrat simple. Vous fournissez un état (un texte, un document, un message client, l'état d'un programme ou d'une partie de jeu) et une ou plusieurs questions typées. Jev évalue toutes les questions en parallèle sur ce même état et renvoie pour chacune une valeur structurée, une distribution de probabilités et un score de confiance3.

Trois primitives composent l'API :

  • Choice : choisir une option dans une liste fermée
  • Score : noter selon une rubrique
  • Noul : estimer entre 0 et 1 la probabilité qu'une affirmation soit vraie

Le blog de lancement formule l'idée ainsi : « Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out. »1 Almeida précise que le modèle limite sa sortie à des distributions de probabilités formatées comme des décisions, comparables à des enums en programmation15. Le format est imposé par l'architecture, en amont de toute génération : selon l'éditeur, le modèle n'a aucun moyen de produire une option hors liste ou un JSON malformé.

Deux chemins pour obtenir une classe à partir d'un même état : le LLM produit une chaîne de caractères qu'un parseur doit relire, Jev renvoie directement une distribution de probabilités sur une liste fermée Un LLM qui classe État LLM chaîne de caractères, token par token parseur classe format invalide : on recommence secondes on paie toute la chaîne Jev, classifieur direct État Jev distribution sur une liste fermée classe + confiance 70 à 500 ms aucune chaîne produite
Le même état, deux chemins pour en tirer une classe. Le LLM passe par un détour : produire du texte, puis le relire. La voie Jev s'arrête plus tôt, ce que la figure montre par sa longueur. Latences et propriétés de la voie basse sont celles annoncées par l'éditeur ; la hauteur des barres est illustrative.

Les chiffres annoncés, et d'où ils viennent

LLM classiquesJev
SortieTexte / tokensDécisions typées + probabilités
Erreurs de formatPossiblesExclues par construction (schéma imposé)
GénérationSéquentielle, token par tokenParallèle
Latence typiqueSecondes70 à 500 ms
Prix en entrée0,20 à 10 $ / MTok0,042 $ / MTok
Prix en sortiePayantGratuit

Ces chiffres sont ceux de l'éditeur, mesurés sur ses propres benchmarks. Sa page d'accueil affiche jusqu'à 193,6× en vitesse et 444,6× en coût7. Les tokens de sortie sont annoncés gratuits « pour toujours » : selon Almeida, la nouvelle architecture les rend trop peu coûteux pour être facturés15.

Le nom du modèle vient du paradoxe de Jevons : quand l'efficacité d'une ressource explose, sa consommation totale augmente au lieu de baisser. TypeSafe parie que des décisions à 0,042 $ le million de tokens en entrée créeront des usages que personne ne déploie aujourd'hui à 5 $.

RLCD : entraîner la calibration plutôt que la préférence

La méthode d'entraînement s'appelle RLCD, pour Reinforcement Learning for Calibrated Decisions. À ne pas confondre avec le RLCD publié par Meta en 2023 (Reinforcement Learning from Contrastive Distillation), qui partage l'acronyme et rien d'autre14. La documentation de TypeSafe distingue le RLHF, qui optimise la préférence humaine, le RLVR, qui optimise des récompenses vérifiables, et le RLCD, qui optimise la calibration5. L'objectif : quand Jev annonce 80 % de confiance, l'événement se produit environ 80 % du temps, en moyenne sur un grand nombre de prédictions. Forbes a choisi cet angle pour son titre : une startup qui veut corriger l'excès de confiance de l'IA8.

Trois précisions techniques ressortent des échanges d'Almeida sur X :

  • Jev n'autorise aucun raisonnement latent, donc pas de chaîne de pensée. Le système 2 s'obtient en composant des appels à Jev avec du code15.
  • Le decoding contraint appliqué aux LLM (mode JSON, grammaires) reste selon lui une mauvaise réponse : on paie toute la génération de chaîne, et on force les logits au moment où le modèle est confus, ce qui le rend « plus bête »15.
  • Un indice sur l'architecture, glissé en réponse : « don't search for "diffusion" on the launch blog post ». Le parallel sampler décrit dans le blog s'inspirerait d'un échantillonnage parallèle de type diffusion plutôt que de l'autorégression. Almeida rappelle que remplacer le séquentiel par le parallèle est ce qui a permis aux Transformers de dépasser les RNN15.

Doom et Wikiracing : deux démos pour la latence

Le fil montre un agent qui joue à Doom en temps réel à partir de l'état structuré du jeu, à raison d'environ 10 appels par seconde, pour un coût d'environ 7 $ de l'heure10. Almeida précise que les démos tournent sur le vrai modèle et les vrais serveurs de TypeSafe, et que la vidéo de lancement utilise une requête réelle15.

La seconde démo est une partie de Wikiracing : atteindre une page Wikipédia à partir d'une autre en ne suivant que des liens. À chaque étape, le modèle choisit parmi des centaines, parfois des milliers de liens. Elle vise deux points : la vitesse, et l'absence d'hallucination sur des choix à haute cardinalité, là où un LLM invente régulièrement un lien qui n'existe pas15. Every, qui a testé l'accès anticipé, rapporte que Jev a scoré l'ensemble des textes de l'auteur en 0,7 seconde, et résume le positionnement d'Almeida en quatre mots : building prod, not God11.

Ce que Jev ne fait pas

Almeida est explicite : le modèle ne remplace pas un LLM et ne peut pas servir de daily driver. Pas de génération de texte, donc pas de code, pas de chat, pas d'explication. Sur les tâches pour lesquelles il est conçu, il s'auto-évalue à « un solide 8,5/10 »15. Rédaction, raisonnement long et développement restent aux LLM.

Les cibles annoncées se situent à l'intérieur du logiciel : routage de tickets, scoring, guardrails, extraction structurée, conditions if/else intelligentes, vérification des sorties d'un LLM avant exécution. La documentation publie une carte des cas d'usage pour départager ce qui relève de Jev et ce qui relève d'un modèle génératif6.

Ce qui reste à vérifier

Les évaluations publiées sont celles de TypeSafe. Aucune évaluation indépendante n'existe à ce jour. Le blog ne donne ni la taille du modèle, ni l'architecture exacte, ni les données d'entraînement. Kingy AI relève dans sa revue plusieurs zones non documentées : l'implémentation précise du RLCD, une limite de cardinalité à 255 et un budget de tokens par requête12. Le modèle reste accessible sur liste d'attente ; Almeida espère ouvrir l'accès à la majorité des développeurs « soon™ »15.

Le pari est cohérent avec le parcours du fondateur : il a contribué à créer le paradigme du chat et en pointe aujourd'hui les limites pour l'automatisation. Les gains de coût et de latence sont plausibles dès qu'on abandonne la génération séquentielle pour des sorties structurées. Le niveau d'intelligence sur ces décisions, lui, ne se jugera qu'à l'usage, par des équipes qui n'appartiennent pas à TypeSafe.

Ce que ça change pour vos architectures

Si les chiffres tiennent, la conséquence pour une équipe d'ingénierie est architecturale. Beaucoup d'appels LLM en production servent aujourd'hui à classer, router ou valider, avec un prompt qui réclame un JSON et un parseur qui rattrape les erreurs. Chaque appel coûte des secondes et des centimes pour une réponse qui tient dans un enum. Un modèle de décision plafonné à 500 ms, à sortie garantie conforme et à probabilité calibrée, déplace le calcul : la logique métier peut multiplier les points de décision au lieu de les rationner.

Le schéma qui se dessine correspond à ce que TypeSafe défend sous le nom code + AI : un LLM pour les tâches de système 2 (planifier, rédiger, coder), du code déterministe pour l'orchestration, et un modèle de système 1 pour les milliers de micro-décisions intermédiaires. Un exercice à mener sans attendre la sortie de la liste d'attente : inventorier, dans vos pipelines, les appels LLM dont la sortie attendue est un enum, un score ou un booléen. Leur nombre vous dira si le sujet vous concerne, et leur facture actuelle vous donnera l'ordre de grandeur du gain à espérer.

Sources

  1. Diogo Almeida, « Introducing System One Models & Jev », blog TypeSafe AI, 15 septembre 2026. typesafe.ai
  2. TypeSafe AI, page d'accueil et liste d'attente. typesafe.ai
  3. TypeSafe Docs, « Introduction » : primitives Choice / Score / Noul. docs.typesafe.ai
  4. TypeSafe Docs, « System One ». docs.typesafe.ai
  5. TypeSafe Docs, « AI primer » : distinction RLHF / RLVR / RLCD. docs.typesafe.ai
  6. TypeSafe Docs, « Use-case map ». docs.typesafe.ai
  7. TypeSafe AI, évaluations publiées par l'éditeur. evals.typesafe.ai
  8. « This $200 Million Startup Wants To Fix AI's Overconfidence Problem », Forbes / The Prompt, 15 septembre 2026. forbes.com
  9. James Hardiman, « TypeSafe emerges from stealth with a new way of doing AI », DCVC, 15 septembre 2026 : tour de 40 millions de dollars en seed, formule « machine-native ». dcvc.com
  10. Thomas Claburn, « TypeSafe AI debuts model for machines that plays Doom », The Register, 16 septembre 2026. theregister.com
  11. « Mini-Vibe Check: TypeSafe's Jev Judged Everything I've Written in 0.7 Seconds », Every / Also True for Humans, 15 septembre 2026. every.to
  12. « TypeSafe Jev Review: The AI Model That Doesn't Generate Text », Kingy AI : zones non documentées, limite de cardinalité à 255, budget de tokens par requête. kingy.ai
  13. « TypeSafe exits stealth with $40M seed to build AI for software, not people », Dealroom. dealroom.co
  14. Meta AI, « RLCD: Reinforcement Learning from Contrastive Distillation », 2023. Cité uniquement pour lever l'homonymie avec le RLCD de TypeSafe. arxiv.org
  15. Diogo Almeida (@CompleteSkeptic), fil de lancement et réponses sur X, 15 septembre 2026 : gains annoncés, tokens de sortie gratuits, absence de raisonnement latent, critique du decoding contraint, indice « diffusion », auto-évaluation à 8,5/10, démos sur les serveurs de production, accès anticipé. x.com — premier message du fil
SFEIR AI Auteur

Articles similaires