SFEIR
Not Diamond Technologie

Not Diamond

Routeur de modèles LLM : une API prédit, requête par requête, quel modèle appeler parmi des candidats, selon un arbitrage qualité, coût ou latence.

SFEIR AI · Publié le 6 septembre 2026 · Mis à jour le 7 septembre 2026

Un routeur qui recommande un modèle sans le servir

Le 30 juillet 2024, Not Diamond annonce son lancement et un tour de pré-amorçage de 2,3 millions de dollars mené par Defy, accompagné d'Inovia Capital, 640 Oxford, VitalStage Ventures et Karman VC, et d'investisseurs individuels dont Jeff Dean (Google), Julien Chaumond (Hugging Face), Ion Stoica (Databricks) et Tom Preston-Werner (GitHub). VentureBeat nomme le même jour les trois cofondateurs : Tomás Hernando Kofman (directeur général), Tze-Yang Tung et Jeffrey Akiki. L'annonce décrit un « méta-modèle » qui apprend quand appeler chaque LLM et revendique, sans publier de chiffres, des résultats supérieurs à chaque modèle pris isolément sur GPQA, MMLU, HumanEval, Arena Hard et Big Bench Hard.

L'endpoint /modelSelect reçoit des messages au format OpenAI et une liste de fournisseurs candidats, puis renvoie le fournisseur et le modèle retenus avec un identifiant de session. Il ne produit pas la complétion : l'appelant garde son client, ses clés et sa passerelle, et envoie lui-même la requête au modèle désigné. Cette séparation le distingue d'une AI gateway comme LiteLLM ou d'une marketplace comme OpenRouter : le routeur décide, la passerelle achemine.

Trois arbitrages sont exposés : qualité (par défaut), coût et latence, plus un curseur continu cost_quality_tradeoff de 0 (qualité) à 10 (modèle le moins cher). Un paramètre booléen hash_content est proposé comme option de confidentialité. La documentation liste treize fournisseurs routables, dont OpenAI, Anthropic, Google, Mistral, xAI, DeepSeek, Qwen, Cohere, Together AI et Replicate, et accepte des modèles internes à l'appelant.

Routeur préentraîné ou routeur entraîné sur ses propres évaluations

Deux routeurs coexistent. Le routeur préentraîné est « trained on cross-domain data » et s'utilise sans configuration. Le routeur sur mesure s'entraîne sur trois colonnes : des entrées, les réponses de chaque modèle candidat, et un score par réponse issu de la métrique de l'appelant. Le minimum est de 15 échantillons, le plafond de 5 Mo ou 10 000 échantillons par entraînement ; la durée va « from a couple minutes up to an hour » et l'entraînement renvoie un preference_id à passer à chaque sélection.

Le 24 septembre 2024, l'entreprise publie RoRF (Routing on Random Forest) sous licence MIT : un cadre d'entraînement et de service de routeurs fondés sur des forêts aléatoires appliquées à des embeddings, avec deux modèles d'embedding au choix (Jina, en open source, ou Voyage AI). Le dépôt livre douze routeurs préentraînés sur six paires de modèles, dont Llama 3.1 405B contre 70B, contre Claude 3.5 Sonnet et contre GPT-4o ; il totalise 246 étoiles GitHub au 7 septembre 2026 et n'a reçu aucun commit depuis le jour de sa publication. Le SDK Python est archivé sur GitHub avec une dernière mise à jour le 11 décembre 2025 ; la documentation renvoie vers un SDK Python sur PyPI, un SDK TypeScript sur npm et une API REST.

Recentrage sur les agents de codage

En septembre 2026, la page d'accueil se présente comme « the world's most powerful intelligent model router for coding agents » et met en avant des gains auto-déclarés : plus de 5 % de précision, plus de 20 % d'économies, des cycles de développement deux fois plus rapides. Au 7 septembre 2026, la page tarifaire affiche 0,05 dollar par million de tokens routés en paiement à l'usage, une offre entreprise à tarif dégressif avec SSO SAML et déploiement préservant la confidentialité, la promesse « at least 20-40% cost savings » et un retour sur investissement « d'au moins 10x » ; elle chiffre la latence ajoutée par le routeur à 100 à 150 millisecondes par requête, en moyenne. Aucune de ces valeurs n'a fait l'objet d'une mesure indépendante publiée : ce sont des chiffres de l'éditeur.

Le 4 août 2026, l'entreprise présente Not Diamond Code, un routeur pour agents de codage à long horizon qui choisit un modèle à chaque étape d'une session. Il s'installe comme proxy local, présenté comme préservant la confidentialité, entre le harnais et la passerelle ou le fournisseur de l'appelant ; le billet ne nomme que Claude Code et se dit « harness- and gateway-agnostic ». L'accès se fait sur candidature. Les résultats publiés viennent des propres évaluations de l'éditeur : 39 % d'économie sur Poly-SWE-Bench et 61 % sur LongCodeQA à qualité annoncée équivalente, plus de 20 % chez les premiers clients.

Le 6 avril 2026, l'entreprise crée sur GitHub self-care, un plugin MIT pour Claude Code qui analyse les traces d'un agent (dérive d'objectif, contexte ignoré, étapes sautées, hallucinations) à partir de LangSmith, Langfuse ou d'un fichier local, et annonce quatorze types de défauts détectés. Le site liste parmi ses clients Hugging Face, Dropbox, IBM, DoorDash, American Express et OpenRouter, et cite un témoignage d'Alex Atallah, cofondateur d'OpenRouter. Le billet d'OpenRouter du 12 juin 2026 sur son Auto Router décrit pourtant un classement par dépense agrégée de la communauté sur sept jours glissants, sans mentionner Not Diamond : le lien entre les deux produits appartient à une période antérieure et se vérifie sur la page du modèle avant d'en dépendre.

Questions fréquentes

Not Diamond exécute-t-il les appels aux modèles ?

Non. L'endpoint /modelSelect renvoie le fournisseur et le modèle retenus avec un identifiant de session ; l'appelant envoie ensuite la requête lui-même, via sa propre clé ou sa passerelle. Le routeur décide, il ne sert pas la complétion.

Quelle différence avec OpenRouter ou LiteLLM ?

OpenRouter et LiteLLM sont des passerelles : elles acheminent la requête, facturent ou journalisent. Not Diamond ne fait que choisir le modèle parmi des candidats, selon un arbitrage qualité, coût ou latence, et se combine avec l'une ou l'autre.

Combien coûte Not Diamond ?

Au 7 septembre 2026, la page tarifaire affiche 0,05 dollar par million de tokens routés en paiement à l'usage, et une offre entreprise à tarif dégressif avec SSO SAML et déploiement préservant la confidentialité. Les économies annoncées (20 à 40 %) et la latence ajoutée (100 à 150 ms par requête) sont des chiffres de l'éditeur.

Qu'est-ce que Not Diamond Code ?

Un routeur présenté le 4 août 2026 pour les agents de codage : un proxy local choisit un modèle à chaque étape d'une session, sans changer de harnais ni de passerelle. Accès sur candidature au relevé du 7 septembre 2026 ; les économies annoncées (39 % sur Poly-SWE-Bench, 61 % sur LongCodeQA) viennent des évaluations de l'éditeur.

Sources

Not Diamond dans vos projets

Échanger avec SFEIR

Articles liés