Code review dans le SDLC augmenté : l'anneau de contraintes autour des agents
Phase 5 · Review. La qualité se lisait dans le code : propre, testé, compréhensible par le suivant. Les agents en produisent désormais plus que personne ne peut relire. La qualité a changé d'adresse : elle vit dans l'anneau de contraintes qui entoure l'agent. C'est le travail de la phase Review, et c'est là que la plupart des organisations se trompent.
Ce qui vient de se dire
Le 30 juillet 2026, Addy Osmani (Google) publie une formulation qui mérite d'être prise au sérieux : la qualité logicielle dépend désormais des contraintes que vous posez autour de vos agents1. Son raisonnement tient en trois temps. Quand les humains écrivaient le code, on inspectait le code. Quand la génération dépasse la capacité de relecture, les contrôles de qualité (correction, maintenabilité, sécurité, performance) doivent déménager ailleurs. Cet ailleurs, c'est le harnais : l'environnement et le système d'exploitation autour de l'agent.
Son schéma est un anneau. Sept dimensions de contrainte disposées autour de l'agent, une règle qui les relie, une seule sortie : ne passe que ce qui franchit toutes les portes. Au centre, une flèche barrée porte la mention qui résume la décennie : plus de code que vous ne pouvez lire.
C'est la version compacte de son essai Software Factories, Light and Dark, où il pose le principe de back-pressure : on ne confie à une boucle que l'autonomie qu'on sait vérifier à faible coût et de façon fiable, pas un pouce de plus2. Suit le corollaire qui devrait figurer dans tous les comités d'architecture : le goulot n'a jamais été la génération, c'est la vérification. La génération est une bouche large, la vérification un col étroit. Accélérer la bouche épaissit le tas au col.
Review n'est pas un gate humain, et c'est délibéré
Dans notre cycle à onze phases, trois gates humains sont inviolables : Define (l'intention), Plan (l'architecture), Ship (l'acceptation avant livraison). Review est la phase 5, au cœur du cycle, entre Verify et Compound-1, et elle reste hors des gates.
Cette place dans la carte commande tout le reste. Si Review portait le gate humain, le point de contrôle du système serait l'attention humaine, une ressource finie qui ne scale pas, face à une capacité de génération qui, elle, scale. Le col ne s'élargirait jamais. Vous auriez bâti un pipeline dont le débit maximal est le nombre de diffs qu'un senior peut lire avant la fin de la journée.
D'où le partage des rôles :
Review instrumente. Ship décide.
Review a un livrable : un faisceau de preuves opposable. Ship a une décision, et cette décision se prend sur les preuves, pas sur le diff intégral.
Martin Monperrus va plus loin dans son position paper de juin 2026 : le modèle hybride « l'agent écrit, l'humain relit » serait intenable, générateur d'une fausse sécurité, et la revue humaine ne serait plus un composant nécessaire du pipeline qualité3. Nous ne le suivons pas jusqu'au bout, puisque l'acceptation d'une modification ne se délègue pas : c'est le sens du gate Ship, et nous avons détaillé ailleurs ce basculement du créateur vers le vérificateur. Son diagnostic, lui, tient : l'inspection humaine de chaque diff ne résiste pas à la vitesse agentique. Ce qui résiste, c'est la mécanique de preuve.
L'anneau, dimension par dimension
Traduire l'anneau d'Osmani en spécification de la phase Review donne une grille de travail directement utilisable. Pour chaque dimension : ce qui est mécanisable, et ce qui reste irréductiblement humain.
| Dimension | Contrainte mécanisable (Review) | Jugement humain (Plan / Ship) |
|---|---|---|
| Correction | tests unitaires, tests de propriété, tests de mutation, oracle vert/rouge | l'acceptation fonctionnelle |
| Sécurité | SAST/DAST, scan de dépendances, détection de secrets, revue agentique dédiée | l'arbitrage du risque résiduel |
| Performance | budget de performance, tests de charge, régression mesurée | la définition du SLO |
| Accessibilité | axe, contraste, navigation clavier | l'expérience réellement vécue |
| Maintenabilité | couverture, complexité, rayon d'impact, frontières de composants | la dette architecturale assumée |
| Compréhensibilité | l'agent consigne ce qu'il a tenté et ce qu'il a écarté ; journal de décision attaché à la PR | la reconstruction de l'intention |
| Efficience économique | budget tokens / compute par tâche, coût par changement | le TCO et l'arbitrage CapEx/OpEx |
| Back-pressure | la règle qui relie les sept autres : autonomie ≤ vérifiabilité à faible coût | où placer l'interrupteur |
Les organisations oublient la compréhensibilité, parce qu'elle ne casse pas la CI. Osmani la nomme ailleurs comprehension debt : l'écart croissant entre le volume de code existant et ce qu'un humain en comprend encore2. Une usine sans lumière ne rembourse pas cette dette, elle la contracte à plein régime, tests au vert. Le remède coûte peu et s'applique rarement : la relecture d'une PR agentique est la première fois qu'un humain reconstruit le pourquoi, alors demandez à l'agent de l'écrire. L'intention n'est pas perdue, elle est jetée.
L'efficience économique surprend dans une grille de qualité. Elle y est à sa place : un budget de tokens par tâche est une contrainte au même titre qu'un budget de performance, et il produit la même vertu, borner l'autonomie par le coût de la vérifier.
Le piège : la validation circulaire
L'agent écrit le code. Le même agent écrit les tests qui valident le code. La CI est verte. Vous avez construit un miroir, pas un anneau de contraintes, et c'est l'échec le plus silencieux de la chaîne.
Augment Code appelle ce mode d'échec la validation circulaire, et le range parmi les risques majeurs de l'adoption inégale de l'IA dans le cycle (Industrie · Augment Code)4. Le DORA 2025 donne la mesure du phénomène : l'adoption de l'IA est corrélée positivement au débit de livraison, et négativement à la stabilité quand les fondations ne suivent pas5. Ce qui échappe à l'anneau reste invisible au moment où l'on gagne en vitesse. Il se voit après.
Ce qui casse le cercle est documenté. Anthropic a publié le 21 juillet 2026 le fonctionnement de son propre SDLC, un cycle où Claude écrit environ 80 % du code fusionné, ce qui rend ses contrôles intéressants par nécessité plus que par vertu (notre analyse)6. Cinq mécanismes en ressortent, transposables :
- Des gates indépendants et multiples, en fenêtres de contexte séparées. La revue automatique n'est pas la revue humaine à moindre coût : c'est un risque différent, qui exige des contrôles différents.
- Le déterministe et l'agentique combinés, jamais l'un à la place de l'autre : SAST/DAST postant directement sur la PR, plus plusieurs relecteurs agentiques spécialisés à focus étroit.
- Le mode ombre : un nouveau relecteur IA commence en commentaire seul, se fait attaquer en red team, et gagne son droit de bloquer.
- Une base de code tiérée par le risque, avec échantillonnage humain pondéré par ce risque. On ne relit pas tout ; on relit là où se trouve le coût de l'erreur.
- Toute approbation journalisée avec son raisonnement, routée vers le SIEM comme n'importe quelle action d'agent.
Les chiffres viennent d'Anthropic sur elle-même, avec la réserve d'usage : les commentaires de revue substantiels sont passés de 16 % à 54 % des PR, et environ un tiers des incidents passés auraient été interceptés (Industrie · Anthropic)6. La question qu'ils posent en interne mérite d'être volée telle quelle : que ferions-nous tourner si scanner ne coûtait presque rien ?
L'équipe d'ingénierie de Compare the Market a évalué quatre stratégies de récupération de contexte pour un relecteur IA, sur 79 merge requests réelles. Le RAG vectoriel a fait pire que l'absence de contexte additionnel. Le graphe de connaissance structurel, construit par analyse de l'AST, place un commentaire en ligne pertinent dans environ 70 % des cas contre 58 % pour le RAG (Industrie · Compare the Market)7. Le code exige une compréhension structurelle : appelants, signatures, hiérarchies, plutôt qu'une similarité sémantique. Ceux qui construisent leur anneau sur un simple RAG paient un surcoût pour dégrader leur revue.
L'anneau doit cliqueter
Un anneau statique est un anneau qui fuit. C'est le prolongement que notre cycle apporte au schéma d'Osmani, et il est structurel : juste après Review vient Compound-1, la capitalisation des leçons statiques, ce que la revue révèle avant la livraison.
La règle tient en une ligne : toute échappée devient une contrainte. Un défaut qui a franchi l'anneau ne se corrige pas seulement dans le code, il se referme dans l'anneau, sous forme de test, de règle de lint, de rubrique de revue, de garde-fou dans le harnais. C'est le cliquet d'Osmani (chaque erreur devient une règle) branché sur une phase du cycle qui en a la charge, et sur une mémoire rechargée au Plan du cycle suivant. « Un bug vu deux fois n'est pas un bug, c'est un trou dans le système. »
Une checklist s'écrit une fois et se périme. L'anneau s'épaissit à chaque cycle, et c'est le seul actif de la chaîne qui s'apprécie pendant que les modèles se déprécient. Mesure interne : − 30 % d'itérations de correction après dix cycles (Mesuré · SFEIR)8.
Où placer l'interrupteur
La décision qui reste ne s'automatise pas : quelles boucles tournent lumières éteintes, lesquelles gardent la lumière allumée ?
Une boucle gagne le droit de tourner seule si son contrôle est peu coûteux, à haute fréquence, difficile à contourner, immédiat et non dérivant. Un oracle vert-ou-rouge, une porte de typage, des tests de propriété, un relecteur agentique doté d'une rubrique réelle : tous qualifient. Corollaire utile : les boucles courtes se vérifient mieux que les longues. Un agent tient trois à dix étapes, puis perd le fil au-delà d'une vingtaine, par accumulation de contexte2. Une boucle qui s'étale cache ses erreurs dans les coins.
On garde la lumière allumée là où une mauvaise réponse coûte cher et où seul un humain l'attrape : les bugs subtils que les tests ne voient pas, les rayons d'impact larges, les décisions qui structureront un an de travail. Authentification, facturation, contrat d'API public.
Le vrai risque est de régler tous les interrupteurs pareil. Tout éteint, vous démontez l'ensemble quatre mois plus tard. Tout allumé, vous ne livrez plus. Le travail qualifié consiste à décider, dimension par dimension et composant par composant, où va chaque interrupteur, puis à le réviser à chaque Compound.
Cinq questions pour votre phase Review
- Quelle part de votre définition de « bon » est mécanisable aujourd'hui, dimension par dimension ? Ce qui n'est pas mécanisé ne tient pas à la vitesse de l'IA.
- Vos tests sont-ils écrits par l'agent qui écrit le code ? Si oui, vous avez un miroir à la place de la back-pressure.
- Que capturez-vous : la sortie d'exécution ou la déclaration de l'agent ? C'est notre discipline de preuve : on ne croit pas un agent sur parole quand il affirme que les tests passent. Osmani dit la même chose autrement, les bonnes contraintes sont celles que le modèle ne peut pas discuter.
- Vos revues automatiques passent-elles par des gates indépendants, en fenêtres de contexte séparées, avec un échantillonnage humain pondéré par le risque ?
- Où va l'échappée ? Si un défaut passé ne devient pas une contrainte au cycle suivant, votre anneau ne cliquette pas.
La question a changé de forme. Le volume a rendu « ce code est-il bon ? » insoluble. Reste celle-ci : qu'est-ce que mon système refuse de laisser passer ?
Cet article prolonge notre série sur le SDLC augmenté : le panorama du cycle à 11 phases, l'amont (Define & Plan), l'exécution autonome sous preuve, la capitalisation (Compound), l'aval (Ship, Ops, Deprecation) et l'économie du cycle (CapEx/OpEx). Sur l'outillage qui rend ces contraintes exécutables, voir le harness engineering.
Sources
- Addy Osmani, Set the constraints around your agents — linkedin.com, 30 juillet 2026. Diagramme original © Addy Osmani.
- Addy Osmani, Software Factories, Light and Dark — addyosmani.com, juillet 2026 (principe de back-pressure, comprehension debt, longueur des boucles).
- Martin Monperrus, The End of Code Review: How AI Agents Supersede Human Code Review — arxiv.org, 11 juin 2026.
- Paula Hingel (Augment Code), How AI Changes the SDLC: A Six-Stage Guide, juin 2026 (validation circulaire).
- DORA / Google Cloud, State of AI-assisted Software Development 2025 — dora.dev.
- Jason Clinton (Deputy CISO, Anthropic), How Anthropic secures its AI-native software development lifecycle — anthropic.com, 21 juillet 2026.
- Équipe Engineering Compare the Market, Comparing Context Retrieval Approaches for AI Code Review — comparethemarketcareers.com, 2026 (79 merge requests, graphe AST ~70 % vs RAG ~58 %).
- SFEIR — SDLC augmenté : « un bug vu deux fois n'est pas un bug, c'est un trou dans le système » ; − 30 % d'itérations de correction après 10 cycles, matière first-party, 2026.
Instrumenter votre phase Review avant d'ouvrir les vannes agentiques
Échanger avec SFEIRArticles similaires
Un SDLC piloté par l'IA : le cycle SFEIR à 11 phases (et pourquoi l'industrie y converge)
Greffer l'IA sur un cycle pensé pour des humains ne donne pas un facteur 10, juste un goulot qui produit ses erreurs dix fois plus vite. Le SDLC augmenté : 11 phases, 3 gates humains, 2 capitalisations, et la convergence des cadres qui le valident.
Code review à l'ère de l'IA : du créateur au vérificateur
Le code review à l'ère de l'IA : quand le goulot devient visible Imaginez la scène : votre équipe adopte un assistant de code IA. Les développeurs senior sont enthousiastes, les juniors encore plus. En quelques semaines, la vitesse de production de code explose. Tout le...
Anthropic sécurise un SDLC où l'IA écrit 80 % du code : le cycle redevient le socle
Le 21 juillet 2026, Jason Clinton (Deputy CISO d'Anthropic) détaille les contrôles qui tiennent un SDLC dont Claude écrit 80 % du code fusionné. Chaque contrôle s'accroche à une étape nommée du cycle. Sans SDLC formalisé, ni gains, ni sécurité, ni FinOps token, ni mesure.
« Les tests passent » : pourquoi l'IA exécute (et ne se contente pas d'assister)
Un agent qui annonce « les tests passent » ne prouve rien : il déclare. La conviction 1 du SDLC SFEIR — l'IA exécute, elle n'assiste pas — tient à une discipline simple et non négociable : capturer la sortie réelle de chaque étape, sur tout le cycle, jamais le claim de l'agent.