Edgee : compresser le contexte plutôt que changer de modèle
Ouvrez le détail de facturation d'une session Claude Code sur une tâche réelle : de un à dix millions de tokens, trente à cent appels d'API1, et l'écrasante majorité en entrée. L'agent n'a pas écrit dix millions de tokens de code. Il a relu, à chaque tour, les mêmes définitions d'outils MCP, les mêmes sorties de npm test, le même historique. Vous payez la relecture, pas la production.
Face à cette facture, le réflexe est de router vers un modèle moins cher. Edgee, société française passée de l'edge computing à la passerelle d'agents, fait le pari inverse : réduire le contexte avant qu'il ne soit facturé, sans toucher au modèle ni casser le cache. C'est l'optimiseur d'agents de notre grille des trois métiers, le plus récent et le plus étroit des trois. Ce qui suit sépare ce que ses mesures démontrent de ce que son marketing annonce.
Un poste de dépense qui a cessé d'être marginal
Le contexte économique explique l'apparition du métier. Selon un communiqué Gartner de juin 2026 issu de son programme Peer Insights, 23 % des responsables techniques interrogés dépensent entre 200 et 500 dollars par développeur et par mois en tokens, et 6 % dépassent 2 000 dollars2. Les chiffres publiés par les éditeurs vont dans le même sens : une estimation indépendante situe le coût d'API d'un agent tournant toute la journée autour de 594 dollars mensuels sur un modèle intermédiaire, et l'automatisation lourde entre 500 et 2 000 dollars par ingénieur1. La documentation de Cursor évoque des utilisateurs quotidiens autour de 60 à 100 dollars par mois, et des utilisateurs intensifs au-delà de 2003.
Deux mécanismes amplifient ces montants. Les sous-agents, d'abord : la documentation d'Anthropic indique qu'ils peuvent consommer de l'ordre de sept fois plus de tokens qu'une session standard4. Les serveurs MCP ensuite : brancher huit à seize serveurs charge l'intégralité des définitions d'outils dans le contexte à chaque tour, une charge qui se répète sans jamais servir. Le sujet est développé dans notre article sur les outils MCP et dans celui sur le coût en tokens du context engineering.
À ce niveau de dépense, un pourcentage d'économie a une valeur monétaire immédiate. C'est le marché que vise Edgee.
La société : un pivot, pas une levée
Edgee est une société parisienne cofondée par Sacha Morard, ancien directeur technique et des systèmes d'information du groupe Le Monde pendant six ans, et Gilles Raymond, fondateur de News Republic racheté par Cheetah Mobile puis de la Signal Network Foundation5.
Le financement vérifiable se résume à un tour de pré-amorçage de 2,9 millions de dollars (2,66 millions d'euros) annoncé le 17 octobre 2024, mené par Serena et VentureFriends5. À l'époque, le produit était une plateforme d'informatique en périphérie et de collecte de données. Le pivot vers la passerelle d'agents s'est fait sans nouveau tour annoncé : ni Crunchbase ni PitchBook ne listent d'opération en 2026. Un point à connaître quand on évalue la pérennité d'un composant que l'on place dans la chaîne critique de ses développeurs.
Ce que fait un « Agent Gateway »
Edgee s'intercale entre les agents et les fournisseurs de modèles, et se décrit comme interceptant, routant, compressant, mesurant et sécurisant chaque requête sans modification de code6. L'accroche technique est une interface en ligne de commande écrite en Rust, qui lance l'agent avec la passerelle déjà en place : edgee launch claude, edgee launch codex. Les agents pris en charge incluent Claude Code, Codex, Cursor, VS Code avec Copilot, OpenCode et quelques autres.
Une précision d'architecture importante : le dépôt GitHub public ne contient que l'interface en ligne de commande. La passerelle de production (routage, compression, comptage, facturation, observabilité) est opérée par Edgee, et n'est pas auto-hébergeable depuis ce dépôt6. L'auto-hébergement existe, mais par une autre voie, décrite plus bas.
Le produit annonce trois piliers.
Router. Routage sous contrainte de budget, bascule quand un fournisseur renvoie une erreur ou un dépassement de quota, et redirection en cours de tâche vers des modèles open-weights moins chers. Edgee met aussi en avant la continuité d'abonnement : la passerelle fonctionne avec les plans forfaitaires, pas seulement avec les crédits d'API, et prend le relais quand un plafond horaire ou hebdomadaire est atteint7.
Compress. Le cœur de la proposition, détaillé ci-dessous.
Observe. Une observabilité par développeur, par dépôt et par pull request, avec plafond de dépense par siège et alertes. C'est la brique qui transforme une dépense diffuse en ligne budgétaire attribuable.
Compresser sans casser le cache
La contrainte qui gouverne toute la conception tient en une phrase : le cache de préfixe d'Anthropic est indexé sur le contenu, et le moindre octet modifié invalide le cache à partir de ce point1. Un token servi depuis le cache coûtant environ le dixième du prix d'entrée, une compression qui toucherait au début du contexte détruirait plus de valeur qu'elle n'en crée.
Le compresseur de deuxième génération applique donc trois stratégies orthogonales, configurables par clé d'API, dont aucune ne touche au préfixe stable1 :
- La concision agit sur les tokens de sortie, les plus chers à l'unité.
- La réduction de surface d'outils attaque les catalogues MCP répétés, le poste identifié plus haut comme structurellement gaspillé.
- L'élagage des résultats d'outils tronque les sorties verbeuses de commandes, qui arrivent après le préfixe et ne le corrompent donc pas.
La première génération se limitait à cette troisième stratégie et apportait environ 10 % d'économie. C'est l'ajout des deux autres qui produit les chiffres annoncés aujourd'hui.
Lire les chiffres d'économie honnêtement
C'est le point qui demande le plus de soin, parce que l'écart entre la communication et la mesure est large, et qu'Edgee le documente lui-même.
Le marketing avance « jusqu'à 50 % » pour la compression seule et « jusqu'à 70 % » en ajoutant le routage. La documentation d'Edgee qualifie ces valeurs d'illustratives et précise qu'il ne s'agit pas d'un résultat mesuré1. Il faut donc regarder les benchmarks publiés, tous produits par l'éditeur, ce qu'il faut garder en tête en les lisant.
| Mesure publiée | Résultat | Nature |
|---|---|---|
| Compresseur v2 sur SWE-bench Lite (juillet 2026) | 33 % de volume de tokens en moins (p=0,008) ; réduction de coût d'environ 10 %, qualifiée de tendance | Test des signes apparié, intervalle de confiance par bootstrap, 6 à 10 tâches |
| Claude Code sur plan forfaitaire (mars 2026) | 26,5 % d'autonomie supplémentaire à tâches et plan identiques | Premiers résultats publiés, présentés comme un plancher |
| Codex (avril 2026) | 49,5 % de tokens d'entrée en moins, taux de succès du cache de 76,1 % à 85,4 %, coût de session −35,6 % | Même dépôt, même modèle, même flux de travail |
L'article de juillet 2026 est le plus instructif, parce que son titre annonce 50 % de réduction de coût par tâche quand ses figures statistiquement testées donnent 33 % de volume et environ 10 % de coût1. La méthodologie, elle, est transparente : test des signes apparié, intervalle de confiance à 95 % par bootstrap, effectif annoncé. Un éditeur qui publie un protocole permettant de contredire son propre titre fait mieux que la moyenne du secteur ; cela ne dispense pas de lire les figures plutôt que le titre.
La fourchette défendable se situe donc entre 10 et 35 % selon le scénario, avec un maximum sur les flux les plus redondants : Codex sur un dépôt stable, où le gain vient autant du meilleur taux de cache que de la compression elle-même. Les 50 à 70 % relèvent de l'affichage commercial, et Edgee ne prétend pas le contraire.
Le même principe de lecture s'applique au benchmark de latence publié en août 2026 : six passerelles, 43 régions, plus de seize mille mesures, et Edgee revendique la surcharge la plus faible8. Le protocole est détaillé, mais le titre du billet reconnaît lui-même qu'il s'agit d'un benchmark auto-administré. Un comparatif où l'auteur est candidat se lit comme une indication, pas comme un classement.
Données, on-premise, souveraineté
Une passerelle d'agents voit plus qu'un gateway ordinaire : elle voit les prompts, mais aussi les appels d'outils, donc des extraits de code, des chemins de fichiers, parfois des secrets. La question de la rétention se pose avec plus d'acuité que sur un proxy d'inférence classique.
Edgee propose trois niveaux d'hébergement9. Le cloud partagé, managé et multi-locataire. Le locataire dédié, isolé, managé par Edgee, avec résidence de données au choix en Europe ou aux États-Unis. Et l'on-premise, auto-hébergé chez le client, déployé par Docker Compose ou par chart Helm sur Kubernetes 1.24 ou supérieur, avec un mode connecté qui synchronise le registre de modèles et les règles de routage toutes les quinze secondes, et un mode isolé sans aucun appel sortant, configuré par fichier, avec journaux envoyés vers un point de collecte OTLP interne. L'engagement affiché sur ce tier est explicite : aucun prompt, aucune complétion et aucune clé d'API fournisseur n'est transmis à Edgee. Les certifications affichées sont SOC 2 et la conformité RGPD.
Que l'éditeur soit français et que la résidence européenne soit disponible sont des arguments réels dans un dossier de souveraineté agentique. Ils ne suffisent pas à eux seuls : la passerelle reste européenne, les modèles vers lesquels elle route ne le sont pas nécessairement, et c'est le régime juridique du fournisseur final qui gouverne la donnée une fois qu'elle a quitté la passerelle. L'atout se situe ailleurs, dans le mode isolé : une passerelle qui fonctionne sans appel sortant est un composant que l'on peut auditer et exploiter dans un périmètre contraint.
Le modèle économique : payé sur ce qu'il économise
La règle affichée mérite d'être citée telle quelle : les tokens que vous payez déjà ne coûtent rien de plus en passant par Edgee ; vous payez des sièges, des tokens fournis par Edgee, ou une part des économies produites. La compression est annoncée comme gratuite pour les agents de codage10.
Trois plans découlent de cette règle. Un plan gratuit avec compression en entrée et en sortie et un tableau de bord individuel. Un plan équipe avec réserve de tokens mutualisée, modèles de secours, redirection forcée vers des modèles moins chers, observabilité par développeur et par escouade, plafond de dépense par siège et attribution par dépôt et par pull request via l'intégration GitHub. Un plan entreprise qui inclut le locataire dédié et l'on-premise.
La facturation en part des économies est confortable et demande une vigilance : elle suppose de s'accorder sur la référence servant à calculer l'économie. Une facture indexée sur un contrefactuel se vérifie mal. Un plan à siège fixe est moins élégant et plus simple à auditer.
Quand cela vaut le coup
Edgee n'est pas un plan de contrôle généraliste et ne cherche pas à l'être. Il traite un poste : la dépense des agents de codage. La décision se prend donc sur un seul chiffre : ce que ce poste représente chez vous.
En dessous de quelques dizaines de développeurs équipés, ou lorsque la facture d'agents reste inférieure au coût des sièges, la couche ne se rentabilise pas ; les leviers de routage par phase et de discipline de contexte donnent déjà l'essentiel du gain sans dépendance supplémentaire. Au-delà, et particulièrement si vos équipes branchent beaucoup de serveurs MCP ou lancent des sous-agents, une réduction de 20 à 30 % sur un poste qui pèse plusieurs centaines de dollars par développeur et par mois se calcule facilement.
La démarche à recommander est la même que pour tout routeur : mesurer d'abord son propre trafic, activer la couche sur une équipe pilote, et comparer les factures réelles sur un mois complet plutôt que les pourcentages d'une page produit. Les résultats publiés par l'éditeur donnent un ordre de grandeur ; seule votre mesure donne le vôtre.
FAQ
Qu'est-ce qu'Edgee exactement ? Une passerelle d'agents française qui s'intercale entre les agents de codage et les fournisseurs de modèles. Elle route sous contrainte de budget, compresse le contexte et fournit une observabilité par développeur et par dépôt. L'installation passe par une interface en ligne de commande écrite en Rust, sans modification du code.
Combien Edgee fait-il économiser réellement ? Les mesures publiées par l'éditeur vont de 10 à environ 35 % selon le scénario : 33 % de volume de tokens et environ 10 % de coût sur SWE-bench Lite, 26,5 % d'autonomie supplémentaire sur un plan Claude forfaitaire, 35,6 % de coût de session sur Codex. Les « 50 à 70 % » de la communication sont qualifiés d'illustratifs par la documentation d'Edgee elle-même.
La compression dégrade-t-elle la qualité des réponses ? Les trois stratégies visent la concision des sorties, la surface d'outils MCP et les résultats de commandes verbeuses, en laissant intacts le préfixe stable et les instructions. C'est aussi ce qui préserve le cache. Le contrôle reste à faire sur votre propre trafic : une réduction de contexte est toujours un pari sur ce qui était inutile.
Peut-on héberger Edgee soi-même ? Oui, via l'offre on-premise : Docker Compose ou Helm sur Kubernetes, en mode connecté ou en mode isolé sans appel sortant, avec l'engagement qu'aucun prompt, aucune complétion et aucune clé fournisseur ne remonte à Edgee. Le dépôt GitHub public, lui, ne contient que l'interface en ligne de commande.
Edgee remplace-t-il un plan de contrôle comme LiteLLM ? Non. Il traite le poste des agents de codage. Le montage courant place Edgee devant les postes de développement et un plan de contrôle devant les flux applicatifs de production.
Sources
- Khaled Maâmra, « Measuring token compression for coding agents on SWE-bench Lite », blog Edgee, 2 juillet 2026 — trois stratégies du compresseur v2 (concision, réduction de surface d'outils, élagage des résultats d'outils), cache de préfixe indexé sur le contenu, token en cache facturé environ un dixième du prix d'entrée, 30 à 100 allers-retours et 1 à 10 millions de tokens par tâche, 10 % d'économie pour la première génération, 33 % de réduction de volume (p=0,008) et environ 10 % de coût « en tendance », méthodologie (test des signes apparié, bootstrap 95 %, n=6 à 10). Chiffres marketing « jusqu'à 50 % / 70 % » qualifiés d'illustratifs par la documentation Edgee. Contenu éditeur mesurant son propre produit. Coûts d'API comparés via Morph, « AI Coding Costs (2026) ». edgee.ai · morphllm.com
- Communiqué Gartner (Peer Insights) du 24 juin 2026, relayé par Computer Weekly — 23 % des responsables techniques dépensent 200 à 500 $ par développeur et par mois en tokens, 6 % au-delà de 2 000 $. Enquête déclarative auprès d'un panel de pairs.
- Documentation Cursor, relayée par daily.dev — « Daily Agent users typically land around $60-$100/month, and power users using multiple agents or automation are often $200+/month ». Donnée éditeur.
- MindStudio, « Why Claude Code Sub-Agents Cost 7x More Tokens », 23 août 2026 — surcoût des sous-agents rapporté d'après la documentation Anthropic, charge des définitions d'outils MCP à chaque tour, évolution vers un chargement à la demande des schémas. Source secondaire. mindstudio.ai
- Jones Day, « Serena Capital participates in €2.66 million pre-seed financing of Edgee », octobre 2024 ; Tech.eu et EU-Startups, 17 octobre 2024 — tour de pré-amorçage de 2,9 M$ / 2,66 M€ mené par Serena et VentureFriends, parcours des cofondateurs Sacha Morard et Gilles Raymond. Aucun tour ultérieur listé par Crunchbase ni PitchBook à la date de publication. jonesday.com
- Dépôt edgee-ai/edgee sur GitHub — description du produit (« intercepte, route, compresse, mesure et sécurise »), interface en ligne de commande Rust pour macOS, Linux et Windows, liste des agents pris en charge, périmètre du dépôt limité à la CLI. Documentation éditeur. github.com
- Page « Coding agents » d'Edgee — trois piliers Route / Compress / Observe, redirection en cours de tâche vers des modèles open-weights, fonctionnement avec les plans par abonnement et extension des plafonds Claude et Codex. Documentation éditeur. edgee.ai
- Sacha Morard, « I benchmarked six AI Gateways, including ours », blog Edgee, 10 août 2026 — six passerelles, 43 régions, 16 344 mesures, surcharge la plus faible revendiquée sur GPT-5.4 (24 ms sur un appel direct), premier token en tête dans deux confrontations sur trois. Benchmark auto-administré, l'auteur étant candidat.
- Edgee, « On-Premise Agent Gateway » et billet « Edgee On-Premise: The Gateway, Behind Your Firewall » (Julianne Hervier, 16 juillet 2026) — trois niveaux (cloud partagé, locataire dédié avec résidence EU ou US, on-premise), déploiement Docker Compose ou Helm sur Kubernetes 1.24+, mode connecté (synchronisation toutes les 15 s) ou isolé sans appel sortant, engagement « No prompts, completions, or provider API keys are ever sent to Edgee », conformité affichée SOC 2 et RGPD. Documentation éditeur. edgee.ai
- Page tarifaire d'Edgee — « One simple rule: tokens you already pay for cost nothing extra through Edgee. You pay Edgee for seats, for tokens it provides, or for a share of the savings it generates. Token compression is always free for coding agents. » Plans Free, Team et Enterprise. Lancements datés sur Product Hunt (Edgee Team le 26 avril 2026, Fallback Models le 24 mai, Turbo Models le 16 juin, Compressor V2 le 6 juillet). producthunt.com
Articles similaires
LLM routers : trois métiers sous un même nom
Marketplace, plan de contrôle, optimiseur d'agents : le marché des AI gateways vend trois produits différents sous une étiquette unique. Les confondre mène à de mauvais achats. La grille de lecture, les stratégies de routage, et ce que le rachat d'OpenRouter par Stripe change à l'architecture.
OpenRouter : la marketplace de modèles passée sous pavillon Stripe
Une clé, plus de 400 modèles, une commission sur les crédits : OpenRouter a fait du routage un produit de distribution. Stripe l'a racheté en août 2026. Ce que la marketplace fait bien, ce qu'elle coûte vraiment, et la thèse qui dit qu'elle érode sa propre raison d'être.
LiteLLM : posséder son plan de contrôle LLM
Clés virtuelles, budgets durs, bascule automatique, routage par complexité : LiteLLM fait tenir dans un proxy MIT ce que les marketplaces facturent en commission. En échange, il faut l'opérer, et sa surface d'attaque a fait parler en 2026.
L'agentic coding ne coûte pas cher — jusqu'au jour où la facture atterrit sur le bureau du CFO
Combien coûte vraiment l'agentic coding ? Fin des assistants bon marché, ROI, et passage « de l'adoption à l'allocation ».