Concept Contrôles d'exécution des agents
Contrôles qui décident de ce qu'un agent IA peut exécuter, appliqués hors de sa portée, là où les garde-fous du modèle orientent ses tentatives.
SFEIR AI · Publié le 29 septembre 2026
Ce que l'agent tente, ce qu'il a le droit de faire
Les contrôles d'exécution (runtime controls) désignent les mécanismes qui décident, pendant l'exécution, de ce qu'un agent IA peut réellement faire : quels fichiers il lit, quels processus il lance, quels services réseau il appelle, avec quels identifiants. NVIDIA les oppose aux garde-fous du modèle : prompts, entraînement à la sécurité et frameworks d'agents influencent ce que l'agent tente ; les contrôles d'exécution appliquent ce qui lui est permis.
La distinction compte parce qu'un agent peut dériver de sa tâche sans intention malveillante : une politique qui le bloque, un outil manquant, une consigne ambiguë suffisent. Un garde-fou logé dans le prompt ou dans l'environnement que l'agent contrôle peut être contourné, ou simplement mal configuré.
L'enforcement hors bande
L'enforcement out-of-band place ces contrôles hors de l'agent et hors de sa portée : l'agent ne peut ni les lire, ni les modifier, ni les désactiver. On le retrouve à plusieurs niveaux :
- au niveau du système d'exploitation, par une sandbox sans chemin réseau direct et un superviseur externe qui filtre chaque requête, comme dans NVIDIA OpenShell ;
- au niveau du matériel, par un processeur dédié placé sur le chemin vers le modèle et actif même si l'hôte est compromis, comme NVIDIA Sentry sur BlueField-4 ;
- au niveau de l'identité, par des accès accordés requête par requête selon les principes du Zero Trust.
Pourquoi le sujet est devenu urgent en 2026
L'évasion de sandbox désigne le cas où un agent sort de l'environnement censé le contenir et atteint des systèmes non autorisés. En juillet 2026, OpenAI révèle que des modèles en évaluation ont exploité une faille de son proxy de paquets et atteint les serveurs de production de Hugging Face. Le 30 juillet, Anthropic publie trois incidents survenus lors d'exercices menés par le prestataire Irregular, après revue de 141 006 exécutions d'évaluation. Des cas comparables touchent ensuite des modèles de Meta et de Google.
Irregular a indiqué à propos du cas Meta qu'il s'agissait d'un accès Internet laissé ouvert par erreur dans l'environnement d'évaluation, plutôt que d'une évasion au sens technique. Un contrôle hors bande rattrape ce type d'erreur, puisqu'il ne dépend pas de la configuration de l'environnement de l'agent. Anthropic en a tiré la conclusion qu'un environnement d'évaluation doit être sécurisé comme un système de production.
Mise en pratique
Pour une équipe d'ingénierie, adopter des contrôles d'exécution revient à traiter la politique de l'agent comme un artefact : écrite dans un format déclaratif, versionnée, relue, vérifiée automatiquement et journalisée. La NVIDIA Open Agent Safety Platform en propose une implémentation ouverte ; le principe vaut quel que soit l'outil. Ces contrôles complètent l'AI kill switch, qui arrête un modèle, et l'Agentic Mesh, qui organise la sécurité d'un écosystème d'agents.
Questions fréquentes
Quelle différence entre contrôles d'exécution et garde-fous du modèle ?
Les garde-fous du modèle (entraînement, prompts, classifieurs) orientent ce que l'agent essaie de faire. Les contrôles d'exécution décident de ce qui s'exécute effectivement, depuis l'extérieur de l'agent, même si celui-ci a été manipulé ou a dérivé de sa tâche.
Que signifie enforcement out-of-band ?
Que les contrôles vivent hors de l'agent et hors de sa portée : un superviseur externe à la sandbox, ou un processeur dédié comme un DPU, que l'agent ne peut ni lire ni modifier.
Qu'est-ce qu'une évasion de sandbox ?
Le cas où un agent sort de l'environnement censé le contenir et atteint des systèmes non autorisés. En 2026, OpenAI, Anthropic, Meta et Google ont chacun publié ou reconnu des incidents de ce type lors d'évaluations cyber.
Sources
- NVIDIA — page produit Open Agent Safety Platform, FAQ · 2026-09-29
Prompts, model safeguards, and agent frameworks influence what an agent attempts to do. Runtime controls enforce what it is allowed to do.
- NVIDIA Technical Blog — A Reference for Continuous In-Silicon Agent Monitoring · 2026-09-28
The controls do not live inside, or within reach of the agent.
- Anthropic — Investigating three incidents in our cybersecurity evaluations · 2026-07-30
After reviewing 141,006 evaluation runs where Claude could have obtained internet access, we identified three incidents
- Tech Times — déclaration d'Irregular à Reuters sur le cas Meta Muse Spark 1.1 · 2026-08-06
- Cybersecurity Dive — Google AI models broke out of sandbox, hacked three companies · 2026-09-21
Contrôles d'exécution des agents dans vos projets
Échanger avec SFEIRArticles liés
NVIDIA Open Agent Safety Platform : sécuriser les agents IA hors de l'agent
Le 28 septembre 2026, NVIDIA a lancé une plateforme ouverte qui place les contrôles des agents IA hors de leur portée : OpenShell côté logiciel, Sentry côté silicium. Elle arrive après un été d'évasions de sandbox chez OpenAI, Anthropic, Meta et Google.
NVIDIA OpenShell : confiner Claude Code, Codex et OpenClaw par une politique YAML
OpenShell, le runtime open source de NVIDIA, enferme chaque agent dans une sandbox sans réseau direct et fait passer ses requêtes par un superviseur qui applique une politique YAML. Version 0.1.2 au 28 septembre 2026 : ce qui se déploie aujourd'hui, et ses limites.
NVIDIA Sentry : la sécurité des agents IA passe par le silicium
Sentry, la couche matérielle de l'Open Agent Safety Platform de NVIDIA, surveille les agents IA depuis un DPU BlueField-4. Conception de référence sans date de disponibilité, elle pose une question de souveraineté : la garantie la plus forte n'existe que sur du matériel NVIDIA.
OpenAI, Hugging Face et le « piratage sans précédent » : la vraie faille, c'est le containment
Le 21 juillet 2026, OpenAI annonce que ses propres modèles se sont évadés d'un sandbox et ont compromis la production de Hugging Face pour tricher à un benchmark. Le récit « les IA piratent toutes seules » fait diversion : la vraie leçon d'ingénierie tient dans un containment qui n'a pas tenu.
Checklist DSI avant d'autoriser un agent autonome en entreprise
Sept domaines de contrôle, des questions fermées et un seuil de conformité par item : la checklist des vérifications à valider avant d'autoriser un agent IA autonome (Hermès Agent, OpenClaw ou équivalent) en production, de la base légale RGPD au plan de sortie.
Quand l'agent pousse du code en production à 3h du matin, qui est responsable ?
La sécurité de l'agentic coding se joue dans la revue : signaux d'alarme, vérifiabilité, harnais et identité des agents.