SFEIR

Code review dans le SDLC augmenté : l'anneau de contraintes autour des agents

SFEIR
Code review dans le SDLC augmenté : l'anneau de contraintes autour des agents

Phase 5 · Review. La qualité se lisait dans le code : propre, testé, compréhensible par le suivant. Les agents en produisent désormais plus que personne ne peut relire. La qualité a changé d'adresse : elle vit dans l'anneau de contraintes qui entoure l'agent. C'est le travail de la phase Review, et c'est là que la plupart des organisations se trompent.

Ce qui vient de se dire

Le 30 juillet 2026, Addy Osmani (Google) publie une formulation qui mérite d'être prise au sérieux : la qualité logicielle dépend désormais des contraintes que vous posez autour de vos agents1. Son raisonnement tient en trois temps. Quand les humains écrivaient le code, on inspectait le code. Quand la génération dépasse la capacité de relecture, les contrôles de qualité (correction, maintenabilité, sécurité, performance) doivent déménager ailleurs. Cet ailleurs, c'est le harnais : l'environnement et le système d'exploitation autour de l'agent.

Son schéma est un anneau. Sept dimensions de contrainte disposées autour de l'agent, une règle qui les relie, une seule sortie : ne passe que ce qui franchit toutes les portes. Au centre, une flèche barrée porte la mention qui résume la décennie : plus de code que vous ne pouvez lire.

L'anneau de contraintes autour de l'agent : sept dimensions de qualité mécanisées (correction, sécurité, performance, accessibilité, maintenabilité, efficience économique, compréhensibilité) reliées par la règle de back-pressure, une porte de sortie unique, et une seule chose qui passe : ce qui a franchi toutes les portes. L'ANNEAU DE CONTRAINTES — PHASE 5 · REVIEW ce que le système refuse de laisser passer AGENT génération plus de code qu'on ne peut relire Back-pressure autonomie ≤ vérifiabilité Correction unitaires · propriété · mutation Sécurité SAST · dépendances · secrets Performance budget perf · charge Accessibilité axe · contraste · clavier Maintenabilité couverture · complexité · rayon Efficience économique budget tokens · coût par changement Compréhensibilité journal de décision attaché à la PR seule sort la production qui franchit chaque porte porte de sortie · gate Ship SHIP livré parce que prouvé, pas parce que relu
L'anneau de contraintes de la phase Review : sept dimensions mécanisées autour de l'agent, reliées par la règle de back-pressure (on ne confie à une boucle que l'autonomie qu'on sait vérifier à faible coût). Schéma SFEIR d'après le diagramme « Set the constraints around your agents » d'Addy Osmani (LinkedIn, 30 juillet 2026), © Addy Osmani, redessiné, traduit et rattaché à la phase 5 du cycle SFEIR.

C'est la version compacte de son essai Software Factories, Light and Dark, où il pose le principe de back-pressure : on ne confie à une boucle que l'autonomie qu'on sait vérifier à faible coût et de façon fiable, pas un pouce de plus2. Suit le corollaire qui devrait figurer dans tous les comités d'architecture : le goulot n'a jamais été la génération, c'est la vérification. La génération est une bouche large, la vérification un col étroit. Accélérer la bouche épaissit le tas au col.

Review n'est pas un gate humain, et c'est délibéré

Dans notre cycle à onze phases, trois gates humains sont inviolables : Define (l'intention), Plan (l'architecture), Ship (l'acceptation avant livraison). Review est la phase 5, au cœur du cycle, entre Verify et Compound-1, et elle reste hors des gates.

Cette place dans la carte commande tout le reste. Si Review portait le gate humain, le point de contrôle du système serait l'attention humaine, une ressource finie qui ne scale pas, face à une capacité de génération qui, elle, scale. Le col ne s'élargirait jamais. Vous auriez bâti un pipeline dont le débit maximal est le nombre de diffs qu'un senior peut lire avant la fin de la journée.

D'où le partage des rôles :

Review instrumente. Ship décide.

Review a un livrable : un faisceau de preuves opposable. Ship a une décision, et cette décision se prend sur les preuves, pas sur le diff intégral.

Martin Monperrus va plus loin dans son position paper de juin 2026 : le modèle hybride « l'agent écrit, l'humain relit » serait intenable, générateur d'une fausse sécurité, et la revue humaine ne serait plus un composant nécessaire du pipeline qualité3. Nous ne le suivons pas jusqu'au bout, puisque l'acceptation d'une modification ne se délègue pas : c'est le sens du gate Ship, et nous avons détaillé ailleurs ce basculement du créateur vers le vérificateur. Son diagnostic, lui, tient : l'inspection humaine de chaque diff ne résiste pas à la vitesse agentique. Ce qui résiste, c'est la mécanique de preuve.

L'anneau, dimension par dimension

Traduire l'anneau d'Osmani en spécification de la phase Review donne une grille de travail directement utilisable. Pour chaque dimension : ce qui est mécanisable, et ce qui reste irréductiblement humain.

DimensionContrainte mécanisable (Review)Jugement humain (Plan / Ship)
Correctiontests unitaires, tests de propriété, tests de mutation, oracle vert/rougel'acceptation fonctionnelle
SécuritéSAST/DAST, scan de dépendances, détection de secrets, revue agentique dédiéel'arbitrage du risque résiduel
Performancebudget de performance, tests de charge, régression mesuréela définition du SLO
Accessibilitéaxe, contraste, navigation clavierl'expérience réellement vécue
Maintenabilitécouverture, complexité, rayon d'impact, frontières de composantsla dette architecturale assumée
Compréhensibilitél'agent consigne ce qu'il a tenté et ce qu'il a écarté ; journal de décision attaché à la PRla reconstruction de l'intention
Efficience économiquebudget tokens / compute par tâche, coût par changementle TCO et l'arbitrage CapEx/OpEx
Back-pressurela règle qui relie les sept autres : autonomie ≤ vérifiabilité à faible coûtoù placer l'interrupteur

Les organisations oublient la compréhensibilité, parce qu'elle ne casse pas la CI. Osmani la nomme ailleurs comprehension debt : l'écart croissant entre le volume de code existant et ce qu'un humain en comprend encore2. Une usine sans lumière ne rembourse pas cette dette, elle la contracte à plein régime, tests au vert. Le remède coûte peu et s'applique rarement : la relecture d'une PR agentique est la première fois qu'un humain reconstruit le pourquoi, alors demandez à l'agent de l'écrire. L'intention n'est pas perdue, elle est jetée.

L'efficience économique surprend dans une grille de qualité. Elle y est à sa place : un budget de tokens par tâche est une contrainte au même titre qu'un budget de performance, et il produit la même vertu, borner l'autonomie par le coût de la vérifier.

Le piège : la validation circulaire

L'agent écrit le code. Le même agent écrit les tests qui valident le code. La CI est verte. Vous avez construit un miroir, pas un anneau de contraintes, et c'est l'échec le plus silencieux de la chaîne.

Augment Code appelle ce mode d'échec la validation circulaire, et le range parmi les risques majeurs de l'adoption inégale de l'IA dans le cycle (Industrie · Augment Code)4. Le DORA 2025 donne la mesure du phénomène : l'adoption de l'IA est corrélée positivement au débit de livraison, et négativement à la stabilité quand les fondations ne suivent pas5. Ce qui échappe à l'anneau reste invisible au moment où l'on gagne en vitesse. Il se voit après.

Ce qui casse le cercle est documenté. Anthropic a publié le 21 juillet 2026 le fonctionnement de son propre SDLC, un cycle où Claude écrit environ 80 % du code fusionné, ce qui rend ses contrôles intéressants par nécessité plus que par vertu (notre analyse)6. Cinq mécanismes en ressortent, transposables :

  1. Des gates indépendants et multiples, en fenêtres de contexte séparées. La revue automatique n'est pas la revue humaine à moindre coût : c'est un risque différent, qui exige des contrôles différents.
  2. Le déterministe et l'agentique combinés, jamais l'un à la place de l'autre : SAST/DAST postant directement sur la PR, plus plusieurs relecteurs agentiques spécialisés à focus étroit.
  3. Le mode ombre : un nouveau relecteur IA commence en commentaire seul, se fait attaquer en red team, et gagne son droit de bloquer.
  4. Une base de code tiérée par le risque, avec échantillonnage humain pondéré par ce risque. On ne relit pas tout ; on relit là où se trouve le coût de l'erreur.
  5. Toute approbation journalisée avec son raisonnement, routée vers le SIEM comme n'importe quelle action d'agent.

Les chiffres viennent d'Anthropic sur elle-même, avec la réserve d'usage : les commentaires de revue substantiels sont passés de 16 % à 54 % des PR, et environ un tiers des incidents passés auraient été interceptés (Industrie · Anthropic)6. La question qu'ils posent en interne mérite d'être volée telle quelle : que ferions-nous tourner si scanner ne coûtait presque rien ?

L'équipe d'ingénierie de Compare the Market a évalué quatre stratégies de récupération de contexte pour un relecteur IA, sur 79 merge requests réelles. Le RAG vectoriel a fait pire que l'absence de contexte additionnel. Le graphe de connaissance structurel, construit par analyse de l'AST, place un commentaire en ligne pertinent dans environ 70 % des cas contre 58 % pour le RAG (Industrie · Compare the Market)7. Le code exige une compréhension structurelle : appelants, signatures, hiérarchies, plutôt qu'une similarité sémantique. Ceux qui construisent leur anneau sur un simple RAG paient un surcoût pour dégrader leur revue.

L'anneau doit cliqueter

Un anneau statique est un anneau qui fuit. C'est le prolongement que notre cycle apporte au schéma d'Osmani, et il est structurel : juste après Review vient Compound-1, la capitalisation des leçons statiques, ce que la revue révèle avant la livraison.

La règle tient en une ligne : toute échappée devient une contrainte. Un défaut qui a franchi l'anneau ne se corrige pas seulement dans le code, il se referme dans l'anneau, sous forme de test, de règle de lint, de rubrique de revue, de garde-fou dans le harnais. C'est le cliquet d'Osmani (chaque erreur devient une règle) branché sur une phase du cycle qui en a la charge, et sur une mémoire rechargée au Plan du cycle suivant. « Un bug vu deux fois n'est pas un bug, c'est un trou dans le système. »

Une checklist s'écrit une fois et se périme. L'anneau s'épaissit à chaque cycle, et c'est le seul actif de la chaîne qui s'apprécie pendant que les modèles se déprécient. Mesure interne : − 30 % d'itérations de correction après dix cycles (Mesuré · SFEIR)8.

Où placer l'interrupteur

La décision qui reste ne s'automatise pas : quelles boucles tournent lumières éteintes, lesquelles gardent la lumière allumée ?

Une boucle gagne le droit de tourner seule si son contrôle est peu coûteux, à haute fréquence, difficile à contourner, immédiat et non dérivant. Un oracle vert-ou-rouge, une porte de typage, des tests de propriété, un relecteur agentique doté d'une rubrique réelle : tous qualifient. Corollaire utile : les boucles courtes se vérifient mieux que les longues. Un agent tient trois à dix étapes, puis perd le fil au-delà d'une vingtaine, par accumulation de contexte2. Une boucle qui s'étale cache ses erreurs dans les coins.

On garde la lumière allumée là où une mauvaise réponse coûte cher et où seul un humain l'attrape : les bugs subtils que les tests ne voient pas, les rayons d'impact larges, les décisions qui structureront un an de travail. Authentification, facturation, contrat d'API public.

Le vrai risque est de régler tous les interrupteurs pareil. Tout éteint, vous démontez l'ensemble quatre mois plus tard. Tout allumé, vous ne livrez plus. Le travail qualifié consiste à décider, dimension par dimension et composant par composant, où va chaque interrupteur, puis à le réviser à chaque Compound.

Cinq questions pour votre phase Review

  1. Quelle part de votre définition de « bon » est mécanisable aujourd'hui, dimension par dimension ? Ce qui n'est pas mécanisé ne tient pas à la vitesse de l'IA.
  2. Vos tests sont-ils écrits par l'agent qui écrit le code ? Si oui, vous avez un miroir à la place de la back-pressure.
  3. Que capturez-vous : la sortie d'exécution ou la déclaration de l'agent ? C'est notre discipline de preuve : on ne croit pas un agent sur parole quand il affirme que les tests passent. Osmani dit la même chose autrement, les bonnes contraintes sont celles que le modèle ne peut pas discuter.
  4. Vos revues automatiques passent-elles par des gates indépendants, en fenêtres de contexte séparées, avec un échantillonnage humain pondéré par le risque ?
  5. Où va l'échappée ? Si un défaut passé ne devient pas une contrainte au cycle suivant, votre anneau ne cliquette pas.

La question a changé de forme. Le volume a rendu « ce code est-il bon ? » insoluble. Reste celle-ci : qu'est-ce que mon système refuse de laisser passer ?

Cet article prolonge notre série sur le SDLC augmenté : le panorama du cycle à 11 phases, l'amont (Define & Plan), l'exécution autonome sous preuve, la capitalisation (Compound), l'aval (Ship, Ops, Deprecation) et l'économie du cycle (CapEx/OpEx). Sur l'outillage qui rend ces contraintes exécutables, voir le harness engineering.

Sources

  1. Addy Osmani, Set the constraints around your agentslinkedin.com, 30 juillet 2026. Diagramme original © Addy Osmani.
  2. Addy Osmani, Software Factories, Light and Darkaddyosmani.com, juillet 2026 (principe de back-pressure, comprehension debt, longueur des boucles).
  3. Martin Monperrus, The End of Code Review: How AI Agents Supersede Human Code Reviewarxiv.org, 11 juin 2026.
  4. Paula Hingel (Augment Code), How AI Changes the SDLC: A Six-Stage Guide, juin 2026 (validation circulaire).
  5. DORA / Google Cloud, State of AI-assisted Software Development 2025dora.dev.
  6. Jason Clinton (Deputy CISO, Anthropic), How Anthropic secures its AI-native software development lifecycleanthropic.com, 21 juillet 2026.
  7. Équipe Engineering Compare the Market, Comparing Context Retrieval Approaches for AI Code Reviewcomparethemarketcareers.com, 2026 (79 merge requests, graphe AST ~70 % vs RAG ~58 %).
  8. SFEIR — SDLC augmenté : « un bug vu deux fois n'est pas un bug, c'est un trou dans le système » ; − 30 % d'itérations de correction après 10 cycles, matière first-party, 2026.

Instrumenter votre phase Review avant d'ouvrir les vannes agentiques

Échanger avec SFEIR
SFEIR Auteur

Articles similaires