Technologie Not Diamond
Routeur de modèles LLM : une API prédit, requête par requête, quel modèle appeler parmi des candidats, selon un arbitrage qualité, coût ou latence.
SFEIR AI · Publié le 6 septembre 2026 · Mis à jour le 7 septembre 2026
Un routeur qui recommande un modèle sans le servir
Le 30 juillet 2024, Not Diamond annonce son lancement et un tour de pré-amorçage de 2,3 millions de dollars mené par Defy, accompagné d'Inovia Capital, 640 Oxford, VitalStage Ventures et Karman VC, et d'investisseurs individuels dont Jeff Dean (Google), Julien Chaumond (Hugging Face), Ion Stoica (Databricks) et Tom Preston-Werner (GitHub). VentureBeat nomme le même jour les trois cofondateurs : Tomás Hernando Kofman (directeur général), Tze-Yang Tung et Jeffrey Akiki. L'annonce décrit un « méta-modèle » qui apprend quand appeler chaque LLM et revendique, sans publier de chiffres, des résultats supérieurs à chaque modèle pris isolément sur GPQA, MMLU, HumanEval, Arena Hard et Big Bench Hard.
L'endpoint /modelSelect reçoit des messages au format OpenAI et une liste de fournisseurs candidats, puis renvoie le fournisseur et le modèle retenus avec un identifiant de session. Il ne produit pas la complétion : l'appelant garde son client, ses clés et sa passerelle, et envoie lui-même la requête au modèle désigné. Cette séparation le distingue d'une AI gateway comme LiteLLM ou d'une marketplace comme OpenRouter : le routeur décide, la passerelle achemine.
Trois arbitrages sont exposés : qualité (par défaut), coût et latence, plus un curseur continu cost_quality_tradeoff de 0 (qualité) à 10 (modèle le moins cher). Un paramètre booléen hash_content est proposé comme option de confidentialité. La documentation liste treize fournisseurs routables, dont OpenAI, Anthropic, Google, Mistral, xAI, DeepSeek, Qwen, Cohere, Together AI et Replicate, et accepte des modèles internes à l'appelant.
Routeur préentraîné ou routeur entraîné sur ses propres évaluations
Deux routeurs coexistent. Le routeur préentraîné est « trained on cross-domain data » et s'utilise sans configuration. Le routeur sur mesure s'entraîne sur trois colonnes : des entrées, les réponses de chaque modèle candidat, et un score par réponse issu de la métrique de l'appelant. Le minimum est de 15 échantillons, le plafond de 5 Mo ou 10 000 échantillons par entraînement ; la durée va « from a couple minutes up to an hour » et l'entraînement renvoie un preference_id à passer à chaque sélection.
Le 24 septembre 2024, l'entreprise publie RoRF (Routing on Random Forest) sous licence MIT : un cadre d'entraînement et de service de routeurs fondés sur des forêts aléatoires appliquées à des embeddings, avec deux modèles d'embedding au choix (Jina, en open source, ou Voyage AI). Le dépôt livre douze routeurs préentraînés sur six paires de modèles, dont Llama 3.1 405B contre 70B, contre Claude 3.5 Sonnet et contre GPT-4o ; il totalise 246 étoiles GitHub au 7 septembre 2026 et n'a reçu aucun commit depuis le jour de sa publication. Le SDK Python est archivé sur GitHub avec une dernière mise à jour le 11 décembre 2025 ; la documentation renvoie vers un SDK Python sur PyPI, un SDK TypeScript sur npm et une API REST.
Recentrage sur les agents de codage
En septembre 2026, la page d'accueil se présente comme « the world's most powerful intelligent model router for coding agents » et met en avant des gains auto-déclarés : plus de 5 % de précision, plus de 20 % d'économies, des cycles de développement deux fois plus rapides. Au 7 septembre 2026, la page tarifaire affiche 0,05 dollar par million de tokens routés en paiement à l'usage, une offre entreprise à tarif dégressif avec SSO SAML et déploiement préservant la confidentialité, la promesse « at least 20-40% cost savings » et un retour sur investissement « d'au moins 10x » ; elle chiffre la latence ajoutée par le routeur à 100 à 150 millisecondes par requête, en moyenne. Aucune de ces valeurs n'a fait l'objet d'une mesure indépendante publiée : ce sont des chiffres de l'éditeur.
Le 4 août 2026, l'entreprise présente Not Diamond Code, un routeur pour agents de codage à long horizon qui choisit un modèle à chaque étape d'une session. Il s'installe comme proxy local, présenté comme préservant la confidentialité, entre le harnais et la passerelle ou le fournisseur de l'appelant ; le billet ne nomme que Claude Code et se dit « harness- and gateway-agnostic ». L'accès se fait sur candidature. Les résultats publiés viennent des propres évaluations de l'éditeur : 39 % d'économie sur Poly-SWE-Bench et 61 % sur LongCodeQA à qualité annoncée équivalente, plus de 20 % chez les premiers clients.
Le 6 avril 2026, l'entreprise crée sur GitHub self-care, un plugin MIT pour Claude Code qui analyse les traces d'un agent (dérive d'objectif, contexte ignoré, étapes sautées, hallucinations) à partir de LangSmith, Langfuse ou d'un fichier local, et annonce quatorze types de défauts détectés. Le site liste parmi ses clients Hugging Face, Dropbox, IBM, DoorDash, American Express et OpenRouter, et cite un témoignage d'Alex Atallah, cofondateur d'OpenRouter. Le billet d'OpenRouter du 12 juin 2026 sur son Auto Router décrit pourtant un classement par dépense agrégée de la communauté sur sept jours glissants, sans mentionner Not Diamond : le lien entre les deux produits appartient à une période antérieure et se vérifie sur la page du modèle avant d'en dépendre.
Questions fréquentes
Not Diamond exécute-t-il les appels aux modèles ?
Non. L'endpoint /modelSelect renvoie le fournisseur et le modèle retenus avec un identifiant de session ; l'appelant envoie ensuite la requête lui-même, via sa propre clé ou sa passerelle. Le routeur décide, il ne sert pas la complétion.
Quelle différence avec OpenRouter ou LiteLLM ?
OpenRouter et LiteLLM sont des passerelles : elles acheminent la requête, facturent ou journalisent. Not Diamond ne fait que choisir le modèle parmi des candidats, selon un arbitrage qualité, coût ou latence, et se combine avec l'une ou l'autre.
Combien coûte Not Diamond ?
Au 7 septembre 2026, la page tarifaire affiche 0,05 dollar par million de tokens routés en paiement à l'usage, et une offre entreprise à tarif dégressif avec SSO SAML et déploiement préservant la confidentialité. Les économies annoncées (20 à 40 %) et la latence ajoutée (100 à 150 ms par requête) sont des chiffres de l'éditeur.
Qu'est-ce que Not Diamond Code ?
Un routeur présenté le 4 août 2026 pour les agents de codage : un proxy local choisit un modèle à chaque étape d'une session, sans changer de harnais ni de passerelle. Accès sur candidature au relevé du 7 septembre 2026 ; les économies annoncées (39 % sur Poly-SWE-Bench, 61 % sur LongCodeQA) viennent des évaluations de l'éditeur.
Sources
- Not Diamond — « Launching Not Diamond » (tour de pré-amorçage de 2,3 M$ mené par Defy, investisseurs, méta-modèle) · 2024-07-30
Not Diamond automatically determines which LLM is best-suited to respond to any query, improving LLM output quality while reducing costs and latency.
- VentureBeat — Not Diamond raises $2.3M for LLM router (cofondateurs, principe du méta-modèle) · 2024-07-30
- Not Diamond docs — référence de l'endpoint /modelSelect (entrées, sortie sans complétion, arbitrages, hash_content) · 2026-09-06
- Not Diamond docs — « Training a custom router » (format des données, minimum de 15 échantillons, preference_id) · 2026-09-06
This can take anywhere from a couple minutes up to an hour depending on the size of your dataset.
- Not Diamond docs — « Supported models » (liste des fournisseurs routables) · 2026-09-06
- Not Diamond — page tarifaire (0,05 $ par million de tokens routés, offre entreprise, économies et latence annoncées) · 2026-09-07
The average added per request latency of our router is 100-150ms
- Not Diamond — page d'accueil (positionnement agents de codage, clients et témoignages cités, gains auto-déclarés) · 2026-09-07
- Not Diamond — « Not Diamond Code: intelligent model routing for coding agents » (proxy local, accès sur candidature, économies mesurées par l'éditeur) · 2026-08-04
- GitHub — Not-Diamond/self-care (plugin Claude Code d'analyse de traces, dépôt créé le 6 avril 2026, licence MIT) · 2026-09-07
- GitHub — Not-Diamond/RoRF (Routing on Random Forest, dépôt créé le 24 septembre 2024, licence MIT, douze routeurs préentraînés, 246 étoiles au relevé) · 2026-09-07
RoRF is a framework for training and serving random forest-based LLM routers.
- OpenRouter Blog — « How OpenRouter Model Routing Works » (Auto Router par dépense agrégée sur sept jours, sans mention de Not Diamond) · 2026-06-12
Not Diamond dans vos projets
Échanger avec SFEIRArticles liés
LLM routers : trois métiers sous un même nom
Marketplace, plan de contrôle, optimiseur d'agents : le marché des AI gateways vend trois produits différents sous une étiquette unique. Les confondre mène à de mauvais achats. La grille de lecture, les stratégies de routage, et ce que le rachat d'OpenRouter par Stripe change à l'architecture.
OpenRouter : la marketplace de modèles passée sous pavillon Stripe
Une clé, plus de 400 modèles, une commission sur les crédits : OpenRouter a fait du routage un produit de distribution. Stripe l'a racheté en août 2026. Ce que la marketplace fait bien, ce qu'elle coûte vraiment, et la thèse qui dit qu'elle érode sa propre raison d'être.