SFEIR

LLM routers : trois métiers sous un même nom

LLM routers : trois métiers sous un même nom

Le nom du modèle est dans une variable d'environnement. MODEL=claude-…, posée le jour où le premier développeur a branché l'API, jamais rediscutée depuis. Le 19 août 2026, Stripe annonce le rachat d'OpenRouter, et la presse chiffre l'opération entre sept et huit milliards de dollars67. Trois mois plus tôt, Palo Alto Networks avalait Portkey8. Une société de paiement et un éditeur de sécurité viennent de payer très cher la couche qui, chez vous, tient encore dans cette variable.

Cette couche s'appelle AI gateway ou LLM router, et le nom recouvre trois produits qui ne répondent pas à la même question : une marketplace qui vend l'accès à des centaines de modèles, un plan de contrôle qui vous rend propriétaire du routage et des budgets, un optimiseur qui réduit la facture des agents de codage sans changer de modèle. Acheter le mauvais des trois est l'erreur la plus fréquente sur ce marché, et elle se voit sur la facture six mois plus tard. Cet article donne la grille pour ne pas la faire ; OpenRouter, LiteLLM et Edgee sont examinés un par un dans les trois articles qui suivent. Le choix du modèle par phase du cycle, lui, est traité dans notre guide du routing multi-modèles.

Gateway et router ne désignent pas la même chose

La distinction vient d'OpenRouter lui-même, et elle est utile parce qu'elle sépare deux fonctions que le marketing agrège1. Le gateway est le point d'accès unifié : un endpoint, une authentification, du rate limiting, de l'observabilité. Le router est la décision prise par requête : quel modèle répond, et quel fournisseur sert ce modèle. Un même modèle open-weights est en effet servi par plusieurs hébergeurs, à des prix, des latences et des politiques de rétention différentes. Le routage opère donc sur deux couches : le modèle, puis le fournisseur.

Techniquement, un AI gateway reste un reverse proxy spécialisé dans le trafic d'API LLM. Il normalise les requêtes entre fournisseurs, ajoute routage, bascule automatique, contrôle des coûts, cache et observabilité, sans que le code applicatif change. C'est cette propriété, le code appelant toujours un endpoint compatible OpenAI, qui explique l'adoption rapide de la couche : elle s'insère sans réécriture.

Quatre frottements, une seule couche

Les mêmes quatre problèmes reviennent dans chaque dossier.

La multiplicité. OpenAI, Anthropic, Google, DeepSeek, Azure, Bedrock, des modèles open-weights auto-hébergés : formats, authentifications, quotas et engagements de service diffèrent. Chaque intégration directe est une dette.

Le coût. La majorité du trafic n'a pas besoin du meilleur modèle disponible. Sur les agents de codage, la dépense part surtout dans du contexte redondant : définitions d'outils, journaux, historique rechargé à chaque tour. Une tâche de type SWE-bench mobilise trente à cent allers-retours d'API et de un à dix millions de tokens5.

La fiabilité. Un 429 ou un 503 chez un fournisseur ne doit tuer ni une session d'agent ni un tunnel de commande. La bascule vers un modèle de secours est une exigence de production, pas un confort.

La gouvernance. Qui a dépensé quoi, sur quel dépôt, avec quelle clé, dans quelle région. La question arrive toujours après la première facture surprise, et elle arrive.

Trois métiers, trois questions différentes

Le marché vend trois produits sous une même étiquette. Chacun répond à une question qui n'est pas celle des autres, et l'erreur d'achat classique consiste à acheter la réponse à une question qu'on ne se pose pas.

MétierQuestion à laquelle il répondReprésentants
MarketplaceComment appeler des centaines de modèles avec une seule clé ?OpenRouter, Vercel AI Gateway, Cloudflare AI Gateway
Plan de contrôle / proxyComment posséder le routage, les budgets, les clés et les journaux ?LiteLLM, Portkey, Bifrost
Optimiseur d'agentsComment réduire la facture des agents de codage sans casser la session ?Edgee

À côté de ces trois métiers vivent les cerveaux de routage, qui décident quel modèle sans nécessairement être la passerelle. RouteLLM, issu de LMSYS et Berkeley, entraîne des routeurs à arbitrer entre un modèle fort et un modèle faible à partir de données de préférence issues de Chatbot Arena ; le travail est publié comme article de recherche et le blog de lancement annonce plus de 85 % de réduction de coût sur MT Bench et 45 % sur MMLU en conservant 95 % de la performance de GPT-42. Not Diamond, startup de San Francisco financée en 2024 par un tour de pré-amorçage de 2,3 millions de dollars mené par Defy, recommande un modèle par prompt et s'est repositionné en 2026 sur le routage pour agents de codage3.

La séparation des métiers est un outil d'analyse, pas une description de l'offre. En 2026, les acteurs installés empilent les fonctions : OpenRouter a son Auto Router, LiteLLM a son routeur par complexité, Edgee route et compresse. Aucun ne se présente plus comme un simple répartiteur de charge.

Comment la décision se prend

Quatre stratégies coexistent, et se superposent le plus souvent dans un même déploiement.

Les règles. Modèle A si la requête contient une image ou des outils, modèle B si elle est courte, bascule si erreur serveur. Auditables, prévisibles, elles couvrent une grande partie des besoins réels et sont le seul mode qu'un comité d'architecture accepte sans discussion.

Les attributs fournisseur. Prix plafond, débit, latence, disponibilité, région. C'est le cœur du routage d'OpenRouter, avec des suffixes qui ordonnent le classement des fournisseurs pour une même famille de modèles1.

La complexité. Un classifieur (heuristique, embeddings, ou petit modèle de langage) estime la difficulté du prompt et l'envoie vers le palier correspondant. L'Auto Router v2 de LiteLLM formalise quatre niveaux, de SIMPLE à REASONING, et combine classification par mots-clés, correspondance sémantique et exploration adaptative par échantillonnage de Thompson4.

Le contexte de l'agent. Réduction des sorties d'outils, réduction de la surface MCP exposée, redirection en cours de session quand un budget ou un plafond d'abonnement saute. C'est le terrain d'Edgee, et c'est le plus récent des quatre5.

Le levier n'est plus seulement le choix du modèle

Arbitrer entre un petit modèle et un modèle de raisonnement reste rentable, mais ce n'est plus le levier principal sur le trafic agentique. Le levier s'appelle routage + cache de prompt + compression, et les trois interagissent.

Le cache de préfixe d'Anthropic est indexé sur le contenu : le moindre octet qui diffère entre deux requêtes invalide le cache à partir de ce point. Un token servi depuis le cache coûte environ le dixième du prix d'entrée5. Deux conséquences pratiques en découlent. D'abord, un routeur qui change de modèle en cours de session détruit le cache et fait repayer le contexte entier : l'économie théorique du modèle moins cher est absorbée, parfois dépassée, par la relecture. Ensuite, toute compression qui touche au début du contexte annule le bénéfice qu'elle prétend produire. D'où le soin des compresseurs sérieux à ne réduire que ce qui vient après le préfixe stable.

C'est aussi pourquoi l'affinité de session est devenue une fonctionnalité affichée : LiteLLM propose d'épingler le modèle choisi au premier tour pour ne pas invalider le cache du fournisseur4. Un détail d'implémentation qui décide de la rentabilité de toute la couche.

Ce que 2026 a changé

Trois glissements, dont un événement de marché.

Le marché se consolide. Stripe a annoncé le 19 août 2026 son accord pour racheter OpenRouter6. Le montant n'a pas été confirmé par Stripe ; la presse l'estime entre sept et huit milliards de dollars, Bloomberg parlant de « plus de 7 milliards », Axios de « plus de 8 milliards en numéraire et en actions »7. Trois mois plus tôt, Palo Alto Networks finalisait le rachat de Portkey pour l'intégrer à sa gamme de sécurité8. Deux acquéreurs venus de la finance et de la sécurité, pas de l'IA : la couche de routage est perçue comme une brique de paiement et de contrôle, pas comme une brique de modèle.

L'unité de mesure est devenue la session. Cache, redirection en cours de tâche, plafond d'abonnement, budget par développeur : les objets que manipule un gateway moderne ont une durée de vie qui dépasse l'appel unitaire. Un comparatif de gateways qui mesure la latence par requête ne dit plus grand-chose du coût réel.

On optimise le prompt autant que le modèle. Connecter huit à seize serveurs MCP charge l'intégralité des définitions d'outils dans le contexte à chaque tour9. Une part substantielle des tokens facturés n'a jamais été nécessaire au travail demandé. Le sujet rejoint directement le coût du context engineering.

Choisir : une contrainte, un outil

Aucun classement ne tranche. Une correspondance existe entre une contrainte dominante et un métier.

  • Besoin immédiat, aucune infrastructure à opérer → une marketplace. OpenRouter, ou la passerelle de votre hébergeur si vous y êtes déjà.
  • Posséder le plan de contrôle : VPC, budgets par équipe, journaux chez vous → LiteLLM.
  • La dépense part surtout dans les agents de codage → un optimiseur d'agents, Edgee dans le cas français.
  • Conformité, traçabilité, politiques métier → un plan de contrôle doublé d'une couche d'observabilité, ou une offre intégrée.
  • Seule la décision « modèle bon marché ou modèle frontier » vous intéresse → un cerveau de routage dans votre proxy existant.

La configuration la plus fréquente répartit plutôt qu'elle ne choisit : un optimiseur devant les agents de codage, un plan de contrôle devant les backends de production, avec des clés fournisseur directes pour les gros volumes et une marketplace en secours pour les modèles rares, et une couche d'observabilité qui reçoit tout.

IDE et agents de codage   →  optimiseur d'agents (Edgee)
Backends et API de prod   →  plan de contrôle (LiteLLM : clés virtuelles, budgets)
                              ├── fournisseurs directs (gros volumes)
                              └── marketplace (modèles rares, secours)
Observabilité             →  Langfuse / Helicone / OpenTelemetry, alimentée par les deux couches

Côté application, une seule interface, compatible OpenAI. Les politiques (coût plafond, qualité minimale, résidence, budget par agent) vivent dans la couche, jamais dans le code métier : c'est ce qui permet de changer de gateway sans toucher aux services.

La règle empirique de bascule tient au volume. En dessous de quelques milliers de dollars de tokens par mois, le temps d'ingénierie économisé par une offre hébergée vaut plus que les 5 % de commission. Au-delà, opérer son proxy avec des clés directes devient nettement moins cher, sauf si la compression appliquée au trafic agentique économise davantage que le siège qu'elle coûte.

Cinq risques à instruire avant de signer

Les données. Toute passerelle hébergée lit vos prompts, et dans le cas d'un optimiseur d'agents, vos appels d'outils. Le contrat doit dire ce qui est retenu, où, et pendant combien de temps ; le chiffrement en transit ne répond à aucune de ces trois questions. La rétention zéro s'active explicitement ; elle n'est presque jamais le comportement par défaut de bout en bout10. Pour un secteur régulé, l'auto-hébergement ou le locataire dédié en résidence européenne redevient la seule réponse défendable. Le sujet croise notre matrice buy vs build.

L'enfermement. Il se déplace : en adoptant une passerelle pour éviter de dépendre d'un fournisseur de modèles, on dépend de la passerelle. La parade est connue et peu coûteuse : garder une interface compatible OpenAI côté application, et placer les politiques dans le gateway plutôt que dans le code métier. Une analyse financière relève d'ailleurs le paradoxe de fond : plus les modèles se banalisent, moins la raison d'être d'un routeur est évidente11.

La qualité du routage. Un classifieur mal calibré envoie une analyse juridique vers le modèle le moins cher. Avant de généraliser un routeur automatique, on le fait tourner en observation sur son propre trafic, et on compare les sorties. Le coût d'une mauvaise réponse dépasse largement l'économie d'un token.

Le cache contre le changement de modèle. Déjà dit, et c'est le piège le plus coûteux parce qu'il est invisible dans les tableaux de bord : la facture monte alors que le routeur affiche fièrement qu'il a basculé vers un modèle moins cher.

Les frais qui ne figurent pas au tarif. Commission de plateforme, sièges par développeur, journaux facturés, infrastructure du proxy à opérer, conversion de devise pour un payeur européen. La comparaison pertinente porte sur le coût net après compression et mélange de modèles, pas sur le prix catalogue.

Une couche, trois promesses

Un LLM router est le réseau de vos modèles. L'application déclare une politique au lieu d'appeler un fournisseur : coût acceptable, qualité minimale, résidence des données, budget par agent. OpenRouter vend l'accès, LiteLLM vend le contrôle, Edgee vend l'économie sur le trafic agentique. Un dispositif sain en 2026 combine rarement moins de deux d'entre eux : une interface unique côté application, et derrière elle le métier adapté à chaque flux.

Dernier signal, pour qui doit défendre ce choix devant un comité : les cabinets d'analyse évaluent ce marché entre 0,88 et 4,8 milliards de dollars pour 2025-2026, avec des croissances annoncées de 17 à 49 %12. Un écart de cette ampleur signifie que personne n'a encore la même définition du périmètre. Vous achetez une catégorie en formation ; le critère qui vous protège est la réversibilité, pas le nom du fournisseur.

FAQ

Quelle différence entre un LLM router et un AI gateway ? Le gateway est le point d'entrée unifié : un endpoint, une authentification, de l'observabilité. Le router est la décision prise à chaque requête : quel modèle, et quel fournisseur sert ce modèle. Les produits du marché font les deux, mais la distinction reste utile pour comparer des offres.

Faut-il une passerelle si l'on utilise un seul fournisseur ? Oui, dès que plusieurs équipes consomment la même clé. Les budgets par projet, les clés virtuelles révocables et le suivi de dépense justifient la couche à eux seuls, avant toute question de multi-modèles.

Un routeur automatique dégrade-t-il la qualité ? Il le peut, et c'est le risque principal. La pratique de référence consiste à le faire tourner en observation sur son propre trafic, à comparer les sorties sur les cas qui comptent, puis à ne l'activer que sur les segments où l'écart est nul.

Combien coûte cette couche ? Une marketplace prélève une commission de l'ordre de 5 % sur les crédits. Un proxy open source ne prélève rien mais demande à être opéré, avec une base de données et un cache en haute disponibilité. Un optimiseur d'agents se facture au siège ou en part des économies produites.

Est-ce compatible avec une exigence de souveraineté ? Sous conditions. Un proxy auto-hébergé dans votre infrastructure l'est par construction. Une offre hébergée demande de vérifier la résidence des données, la rétention et le régime juridique de l'opérateur, y compris quand la passerelle est européenne mais route vers des modèles qui ne le sont pas.


Sources

  1. « How OpenRouter Model Routing Works: Providers, Fallbacks & Auto Router », OpenRouter Blog — distinction gateway / router, routage à deux couches (modèle et fournisseur), tri par prix, latence et disponibilité, chaînes de secours. Documentation éditeur. openrouter.ai
  2. Isaac Ong, Amjad Almahairi, Vincent Wu, Wei-Lin Chiang, Tianhao Wu, Joseph E. Gonzalez, M Waleed Kadous, Ion Stoica, « RouteLLM: Learning to Route LLMs with Preference Data », arXiv:2406.18665 (ICLR 2025), et le billet LMSYS du 1er juillet 2024 — réductions annoncées de plus de 85 % sur MT Bench et 45 % sur MMLU à 95 % de la performance de GPT-4. Chiffres publiés par les auteurs du framework. lmsys.org
  3. Not Diamond, « Launching Not Diamond », 30 juillet 2024 — tour de pré-amorçage de 2,3 M$ mené par Defy ; direction assurée par Tomás Hernando Kofman, Tze-Yang Tung et Jeffrey Akiki. Repositionnement 2026 sur le routage pour agents de codage annoncé par le cofondateur sur X. x.com — annonce Not Diamond Code
  4. LiteLLM, « Auto Router v2: one router for complexity, semantic, and adaptive routing » et documentation « [Beta] Auto Routing » — quatre niveaux SIMPLE / MEDIUM / COMPLEX / REASONING, règles par mots-clés, échantillonnage de Thompson, affinité de session optionnelle. Documentation éditeur, fonctionnalité en bêta. docs.litellm.ai
  5. Khaled Maâmra, « Measuring token compression for coding agents on SWE-bench Lite », blog Edgee, 2 juillet 2026, et Morph, « AI Coding Costs (2026) » — cache de préfixe indexé sur le contenu, token en cache facturé environ un dixième du prix d'entrée, 30 à 100 allers-retours et 1 à 10 millions de tokens par tâche SWE-bench. Le billet Edgee est un contenu éditeur mesurant son propre produit. edgee.ai · morphllm.com
  6. « Stripe agrees to acquire OpenRouter to help businesses optimize token routing and usage », Stripe Newsroom, 19 août 2026 — annonce officielle, plus de 400 modèles et plus de 80 fournisseurs, citation d'Alex Atallah sur la nécessité d'une « couche neutre ». Aucun montant communiqué. stripe.com
  7. « Stripe strikes mega-deal for OpenRouter », Axios, 17 août 2026 — « more than $8 billion in cash and stock » ; Bloomberg (16 août 2026) évoque « more than $7 billion, according to people familiar with the matter » ; le New York Times, relayé par CNBC le 19 août, cite environ 7,5 Md$ dont 1,5 Md$ aux fondateurs. Montants rapportés par la presse, non confirmés par les parties. axios.com
  8. TrueFoundry, « Bifrost vs Portkey », et TECHSY — rachat de Portkey par Palo Alto Networks finalisé le 29 mai 2026 et intégration à Prisma AIRS. Sources secondaires. truefoundry.com
  9. MindStudio, « Why Claude Code Sub-Agents Cost 7x More Tokens », 23 août 2026 — surcoût des sous-agents, chargement des définitions d'outils MCP à chaque tour, évolution du chargement à la demande des schémas. Source secondaire citant la documentation Anthropic. mindstudio.ai
  10. Teleskope, « Zero Data Retention: What It Means for AI Security », et documentation OpenRouter sur la rétention zéro — activation par compte, par groupe de modèles ou par requête ; journalisation des prompts désactivée par défaut, métadonnées conservées. teleskope.ai · github.com — docs OpenRouter
  11. « Valued at $1.3 Billion, OpenRouter Is Systematically Eroding Its Own Reason to Exist », BigGo Finance — thèse selon laquelle la banalisation des modèles réduit la valeur d'une couche de routage. Analyse d'opinion. finance.biggo.com
  12. The Business Research Company via Research and Markets (3,34 Md$ en 2025 à 11,01 Md$ en 2030, TCAC 27 %), Dataintelo (4,8 Md$ en 2025 à 18,2 Md$ en 2033, TCAC 17,8 %), SNS Insider (0,88 Md$ en 2025 à 11,32 Md$ en 2035, TCAC 29,12 %). Projections de cabinets, périmètres non harmonisés. researchandmarkets.com · dataintelo.com · snsinsider.com
SFEIR AI Auteur

Articles similaires