Edgee
Passerelle d'agents française qui s'intercale devant les agents de codage pour compresser le contexte, router sous budget et mesurer la dépense.
SFEIR AI · Mis à jour le 5 septembre 2026
Une passerelle pour un poste de dépense précis
Edgee est une société parisienne cofondée par Sacha Morard, ancien directeur technique et des systèmes d'information du groupe Le Monde, et Gilles Raymond, fondateur de News Republic puis de la Signal Network Foundation. Son financement vérifiable se limite à un tour de pré-amorçage de 2,9 millions de dollars — 2,66 millions d'euros — annoncé le 17 octobre 2024, mené par Serena et VentureFriends. Le produit était alors une plateforme d'informatique en périphérie ; le pivot vers la passerelle d'agents s'est fait sans nouveau tour annoncé.
Le produit s'intercale entre les agents de codage et les fournisseurs de modèles, et intercepte, route, compresse, mesure et sécurise chaque requête sans modification de code. L'accroche est une interface en ligne de commande écrite en Rust qui lance l'agent avec la passerelle déjà en place, pour Claude Code, Codex, Cursor, VS Code avec Copilot et d'autres. Le dépôt GitHub public ne contient que cette interface : la passerelle de production est opérée par Edgee, et l'auto-hébergement passe par une offre séparée.
Compresser sans casser le cache
La contrainte qui gouverne la conception tient en une phrase : le cache de préfixe est indexé sur le contenu, et le moindre octet modifié invalide le cache à partir de ce point. Un token servi depuis le cache coûtant environ le dixième du prix d'entrée, une compression qui toucherait au début du contexte détruirait plus de valeur qu'elle n'en crée. Les trois stratégies du compresseur de deuxième génération visent donc uniquement ce qui vient après le préfixe stable.
La concision agit sur les tokens de sortie. La réduction de surface d'outils attaque les catalogues MCP répétés dans le contexte à chaque tour. L'élagage des résultats d'outils tronque les sorties verbeuses de commandes. La première génération se limitait à cette dernière stratégie et apportait environ 10 % d'économie.
- Route : routage sous contrainte de budget, bascule sur erreur ou quota, redirection en cours de tâche vers des modèles open-weights.
- Compress : concision, réduction de la surface MCP, élagage des résultats d'outils.
- Observe : observabilité par développeur, par dépôt et par pull request, plafond de dépense par siège.
Lire les chiffres d'économie
L'écart entre la communication et la mesure est large, et Edgee le documente lui-même. Le marketing avance « jusqu'à 50 % » pour la compression seule et « jusqu'à 70 % » avec le routage ; la documentation qualifie ces valeurs d'illustratives et précise qu'il ne s'agit pas d'un résultat mesuré. Les benchmarks publiés — tous produits par l'éditeur — donnent 33 % de réduction de volume de tokens et environ 10 % de coût sur SWE-bench Lite, 26,5 % d'autonomie supplémentaire sur un plan Claude forfaitaire, et 35,6 % de coût de session en moins sur Codex avec un taux de succès du cache passant de 76,1 % à 85,4 %.
La fourchette défendable se situe donc entre 10 et 35 % selon le scénario, avec un maximum sur les flux les plus redondants. Un éditeur qui publie un protocole permettant de contredire son propre titre fait mieux que la moyenne du secteur ; cela ne dispense pas de lire les figures plutôt que le titre, ni de mesurer sur son propre trafic.
Hébergement, données et modèle économique
Une passerelle d'agents voit plus qu'un proxy d'inférence : elle voit les prompts, mais aussi les appels d'outils, donc des extraits de code et des chemins de fichiers. Trois niveaux d'hébergement sont proposés : cloud partagé multi-locataire, locataire dédié avec résidence de données en Europe ou aux États-Unis, et on-premise auto-hébergé par Docker Compose ou Helm, en mode connecté ou en mode isolé sans aucun appel sortant. L'engagement affiché sur ce dernier tier est explicite : aucun prompt, aucune complétion et aucune clé fournisseur n'est transmis à Edgee. Conformité affichée : SOC 2 et RGPD.
Le modèle économique suit une règle unique : les tokens déjà payés ne coûtent rien de plus en passant par Edgee, la facturation portant sur des sièges, sur des tokens fournis par Edgee, ou sur une part des économies produites. Cette dernière modalité est confortable et demande une vigilance : une facture indexée sur un contrefactuel se vérifie mal, là où un plan à siège fixe s'audite.
Questions fréquentes
Qu'est-ce qu'Edgee ?
Une passerelle d'agents française qui s'intercale entre les agents de codage et les fournisseurs de modèles. Elle route sous contrainte de budget, compresse le contexte et fournit une observabilité par développeur et par dépôt. L'installation passe par une interface en ligne de commande écrite en Rust, sans modification du code.
Combien Edgee fait-il économiser réellement ?
Les mesures publiées par l'éditeur vont de 10 à environ 35 % selon le scénario : 33 % de volume de tokens et environ 10 % de coût sur SWE-bench Lite, 26,5 % d'autonomie supplémentaire sur un plan Claude forfaitaire, 35,6 % de coût de session sur Codex. Les « 50 à 70 % » de la communication sont qualifiés d'illustratifs par la documentation d'Edgee elle-même.
Peut-on héberger Edgee soi-même ?
Oui, via l'offre on-premise : Docker Compose ou Helm sur Kubernetes, en mode connecté ou en mode isolé sans appel sortant, avec l'engagement qu'aucun prompt, aucune complétion et aucune clé fournisseur ne remonte à Edgee. Le dépôt GitHub public ne contient que l'interface en ligne de commande.
Edgee remplace-t-il un plan de contrôle comme LiteLLM ?
Non. Il traite le poste des agents de codage. Le montage courant place Edgee devant les postes de développement et un plan de contrôle devant les flux applicatifs de production.
Sources
Articles liés
Edgee : compresser le contexte plutôt que changer de modèle
Les agents de codage paient surtout du contexte relu. Edgee, passerelle française en Rust, s'intercale devant Claude Code ou Codex pour compresser ce contexte sans casser le cache. Ce que ses mesures disent vraiment, une fois séparées de ses chiffres marketing.
LLM routers : trois métiers sous un même nom
Marketplace, plan de contrôle, optimiseur d'agents : le marché des AI gateways vend trois produits différents sous une étiquette unique. Les confondre mène à de mauvais achats. La grille de lecture, les stratégies de routage, et ce que le rachat d'OpenRouter par Stripe change à l'architecture.
L'agentic coding ne coûte pas cher — jusqu'au jour où la facture atterrit sur le bureau du CFO
Combien coûte vraiment l'agentic coding ? Fin des assistants bon marché, ROI, et passage « de l'adoption à l'allocation ».
Le budget de tokens du contexte : un actif, pas une dépense
La facture IA explose ? Le vrai levier n'est pas de couper les tokens — c'est de comprendre que le contexte est un actif capitalisable, pas une dépense Opex. ROI ×5, architecture Hot/Warm/Cold, prompt caching : le cadre de décision du DSI.