Claude Opus 5 : l'intelligence quasi-frontier au prix du modèle par défaut
Le 24 juillet 2026, Anthropic a mis Claude Opus 5 en disponibilité générale sur toutes ses plateformes1. La formule d'accroche tient en une phrase : un modèle « réfléchi et proactif qui s'approche de l'intelligence frontier de Claude Fable 5 à moitié prix ». Le tarif ne bouge pas d'un centime par rapport à Opus 4.8, à 5 $ le million de tokens en entrée et 25 $ en sortie. L'identifiant API est claude-opus-5, et le modèle devient le défaut de Claude Max et le plus puissant de Claude Pro.
Il faut lire l'annonce pour ce qu'elle est. Anthropic ne prétend pas qu'Opus 5 soit son modèle le plus intelligent : Fable 5 garde ce rang. L'argument est économique. Dans une large bande médiane de difficulté, une intelligence quasi-frontier livrée efficacement et à bas coût bat une intelligence frontier livrée cher1. Pour comprendre où Opus 5 se range dans l'ensemble de la gamme, notre carte des modèles Claude pose le décor ; cet article se concentre sur ce que le nouveau modèle par défaut change concrètement.
Le pivot : le modèle par défaut devient quasi-frontier
La bascule n'est pas une histoire de podium. Opus 5 est rapporté en tête de l'Artificial Analysis Intelligence Index avec un score de 61, devant Fable 5 (60) et GPT-5.6 Sol (59), mais cette mesure provient d'une source secondaire et n'a pas été confirmée sur la page primaire d'Artificial Analysis6. Anthropic ne cite d'ailleurs pas cet index sur sa propre page. L'entreprise met en avant des benchmarks « coût par tâche », là où se joue son argument réel.
Sur Frontier-Bench v0.1, Anthropic affirme qu'Opus 5 dépasse tous les autres modèles et plus que double la performance d'Opus 4.8, à un coût par tâche inférieur1. Sur CursorBench 3.2 à effort maximal, il se place à moins d'un demi-point du meilleur score de Fable 5, pour la moitié du coût par tâche. Sur OSWorld 2.0 (usage d'ordinateur), il dépasse le pic de Fable 5 pour environ un tiers du budget. En sciences de la vie, il progresse sur toutes les évaluations face à Opus 4.8, dont un gain de 10,2 points en chimie organique. Ces chiffres sont des mesures constructeur, sur des harnais internes, et méritent la prudence d'usage que nous appliquons à toute release : la valeur réelle se lit en coût par résultat, pas au sommet d'un classement. À signaler pour l'honnêteté du dossier : Anthropic n'a pas publié de SWE-bench Verified pour Opus 5 à la date du lancement.
Ce qui change côté ingénierie
Opus 5 introduit plusieurs changements qui touchent directement le code d'intégration, et l'un d'eux est cassant.
L'adaptive thinking est activé par défaut : le modèle décide quand et combien réfléchir. Le paramètre d'effort (échelle low, medium, high, xhigh, max) devient le levier de profondeur de raisonnement. Conséquence directe : désactiver le thinking n'est accepté qu'à effort high ou moins ; le faire à xhigh ou max renvoie désormais une erreur 400. Tout code hérité d'Opus 4.8 qui coupait le thinking à effort élevé casse2.
Trois nouveautés d'API accompagnent le modèle. L'échange d'outils en cours de conversation (bêta) permet d'ajouter ou retirer des tools entre deux tours sans invalider le cache de prompt, ce qui compte pour les agents longue durée. Les fallbacks automatiques (mode default, bêta) appliquent les modèles de repli recommandés par catégorie de refus, pour que les requêtes routent toujours vers le meilleur modèle disponible plutôt que d'être bloquées. Le minimum de cache descend à 512 tokens (contre 1 024 sur Opus 4.8), rendant cachables des prompts jusque-là trop courts2. S'ajoute un Fast mode (research preview) à environ 2,5× la vitesse par défaut, tarifé 10 $/50 $, disponible sur l'API Claude uniquement.
Un comportement mérite l'attention. Opus 5 vérifie son propre travail sans qu'on le lui demande et produit des réponses plus longues. La documentation officielle le reconnaît et recommande de retirer les instructions de vérification héritées pour éviter la sur-vérification2. La critique publique a été plus directe : dans sa revue du 24 juillet, Claire Vo décrit un modèle « brillant mais agaçant », à la personnalité « névrotique », et pointe un problème de verbosité surnommé « Claude Slop »8. Pour une équipe qui met Opus 5 en production, calibrer la longueur des sorties et l'effort n'est pas cosmétique : c'est une variable de coût.
Sécurité et alignement : une asymétrie voulue
Anthropic présente Opus 5 comme son modèle le plus aligné à ce jour. Son audit comportemental automatisé lui attribue un score de 2,3 sur l'échelle des comportements désalignés, le plus bas de ses modèles récents, devant Opus 4.8, Mythos 5 et Sonnet 51. Le system card conclut qu'Opus 5 ne franchit pas le seuil d'autonomie en R&D d'IA fixé par la Responsible Scaling Policy ; il est traité comme ayant des capacités CB-1 (armes non nouvelles) mais pas CB-2, et hérite des mêmes protections ASL-3 qu'Opus 4.85.
Sur le cyber, Anthropic a fait un choix de conception assumé. Opus 5 est proche de Mythos 5 pour identifier des vulnérabilités, mais reste nettement en retrait pour développer des exploits : l'entreprise a délibérément évité de l'entraîner sur des tâches cyber offensives1. Ses classificateurs de sécurité sont proportionnellement moins restrictifs que ceux de Fable 5 ; Anthropic s'attend à ce qu'ils interviennent environ 85 % moins souvent. Une requête signalée bascule par défaut vers Opus 4.8 dans Claude.ai, Claude Code et Claude Cowork, avec notification à l'utilisateur. Nouveauté : les requêtes de biologie bloquées sur Fable 5 routent désormais vers Opus 5, et non plus vers Opus 4.8. Le mécanisme complet est décrit dans notre article sur les classificateurs et safeguards de la classe Mythos.
Le point qui décide pour une DSI européenne : la rétention
Voici l'information qui, pour un CTO en France, au Benelux ou en Suisse, pèse plus lourd qu'un point de benchmark. Anthropic l'écrit noir sur blanc : « conformément aux modèles Opus précédents, Opus 5 n'a pas d'exigence de rétention de données pour l'accès général »1. À l'inverse, Fable 5 et Mythos 5, classés « Covered Models », imposent une rétention de 30 jours sur tout le trafic, sans possibilité de Zero Data Retention, sur toutes les plateformes (API, Bedrock, Google Cloud, Foundry)7. Cette obligation écrase les accords ZDR existants.
La ligne de partage est nette. Tous les modèles Claude courants hors classe Mythos (Opus 5, Opus 4.8, Sonnet 5, Haiku 4.5) restent éligibles au Zero Data Retention. Pour un cabinet juridique routant des communications privilégiées, un acteur de la santé ou un établissement financier soumis à des obligations de résidence des données, Fable 5 est de fait hors de portée sur les workloads sensibles, tandis qu'Opus 5 préserve les contrôles. C'est ce qui fait d'Opus 5, pour l'Europe, le meilleur compromis capacité/conformité de la gamme Anthropic. Côté résidence géographique, deux options existent : les endpoints régionaux sur Bedrock et Google Cloud (prime d'environ 10 %) et le paramètre inference_geo sur l'API (multiplicateur ×1,1)4.
Cette lecture s'inscrit dans une gestion plus large du risque fournisseur, que l'épisode des contrôles à l'export de juin 2026 a rendue tangible : un modèle de haut de gamme peut être coupé du jour au lendemain, y compris hors des États-Unis. Nous en tirons une méthode dans notre architecture multi-LLM souveraine et notre analyse du risque de continuité de l'IA.
Migrer d'Opus 4.8 à Opus 5 : la checklist
La bascule est un drop-in à prix identique, mais trois vérifications s'imposent avant la mise en production2 :
1. Retirer les instructions de vérification héritées. Opus 5 vérifie déjà son travail ; garder d'anciennes consignes de contrôle produit de la sur-vérification et gonfle les sorties.
2. Réviser max_tokens. Le thinking activé par défaut consomme du budget de sortie ; un plafond calibré pour Opus 4.8 peut devenir trop juste.
3. Corriger le code qui désactive le thinking à effort élevé. À xhigh ou max, cet appel renvoie une erreur 400.
Un point de coût total à ne pas oublier : depuis Claude 4.7, le tokenizer produit environ 30 % de tokens de plus pour le même texte4. Toute projection budgétaire fondée sur d'anciennes mesures doit l'intégrer. La bonne discipline reste d'instrumenter le coût par tâche et de piloter par l'effort, comme nous le détaillons pour le routage multi-modèles.
Questions fréquentes
Opus 5 est-il plus intelligent que Fable 5 ?
Non, Fable 5 reste le modèle le plus capable d'Anthropic. L'argument d'Opus 5 est économique : sur une large bande de difficulté, il livre une intelligence quasi-frontier à moitié prix (5 $/25 $ contre 10 $/50 $), avec moins de tours et de tokens à qualité comparable.
Quel est le prix de Claude Opus 5 ?
5 $ le million de tokens en entrée et 25 $ en sortie, identique à Opus 4.8. Le cache hit revient à 0,50 $, le Batch API applique −50 %. La fenêtre de contexte est de 1 million de tokens sans prime long-contexte.
Pourquoi choisir Opus 5 plutôt que Fable 5 en Europe ?
Parce qu'Opus 5 n'impose aucune rétention de données pour l'accès général et reste éligible au Zero Data Retention, alors que Fable 5 et Mythos 5 imposent 30 jours de rétention sans ZDR sur toutes les plateformes. Pour les secteurs régulés, c'est déterminant.
Migrer d'Opus 4.8 vers Opus 5 demande-t-il du travail ?
C'est un remplacement direct à prix égal, mais avec trois précautions : retirer les instructions de vérification héritées, réviser max_tokens (thinking par défaut), et corriger tout code qui désactive le thinking à effort xhigh ou max (erreur 400).
Le point de vue SFEIR : une innovation d'orchestration, pas de podium
L'intérêt d'Opus 5 n'est pas un saut de capacité brute, c'est un déplacement du rapport coût/intelligence. Quand le modèle par défaut d'un fournisseur atteint le quasi-frontier au prix d'un daily driver, la question utile pour une plateforme agentique cesse d'être « quel modèle est le plus fort » et devient « comment orchestrer une flotte dont le défaut est déjà excellent ». La réponse est une architecture hétérogène routée par difficulté et par sensibilité : Haiku 4.5 pour la classification et l'extraction, Sonnet 5 pour le gros de la production, Opus 5 comme défaut agentique et de code, Fable 5 réservé aux tâches long-horizon les plus ambitieuses et aux seuls workloads compatibles avec la rétention 30 jours.
Ce raisonnement rejoint notre conviction « AI Only » : le modèle est une commodité, l'avantage durable vit dans le système qui l'entoure, sa discipline de Context Engineering et la qualité de son harnais. Deux critères non techniques finissent souvent par trancher pour une DSI : le coût total, tokenizer +30 % compris, et la conformité. Sur ce dernier terrain, Opus 5 marque un vrai point pour l'Europe, et il faut savoir le lire dans les petites lignes plutôt que dans les graphes de benchmark.
Sources
- « Introducing Claude Opus 5 », Anthropic, 24 juillet 2026 — annonce et positionnement (« s'approche de l'intelligence frontier de Fable 5 à moitié prix »), Frontier-Bench (plus que double Opus 4.8), CursorBench, OSWorld, sciences de la vie, alignement (2,3 sur l'échelle de désalignement), asymétrie cyber défense/offense, safeguards routing et absence de rétention pour l'accès général. Chiffres constructeur, harnais internes, témoignages partenaires sélectionnés par Anthropic. anthropic.com — Claude Opus 5
- « What's new in Claude Opus 5 », Claude Platform Docs, juillet 2026 — adaptive thinking par défaut et erreur 400 à effort élevé (changement cassant), échelle d'effort, échange d'outils préservant le cache, fallbacks automatiques, minimum de cache à 512 tokens, Fast mode, recommandation de retirer les instructions de vérification, checklist de migration. platform.claude.com — What's new in Opus 5
- « Models overview », Claude Platform Docs, juillet 2026 — spécifications (contexte 1M, sortie 128K, cutoff mai 2026), modalités texte et image en entrée, hiérarchie de gamme et logique de segmentation. platform.claude.com — Models overview
- « Pricing », Claude Platform Docs, juillet 2026 — grille tarifaire, prompt caching (cache hit 0,1×), Batch (−50 %), résidence des données (endpoints régionaux,
inference_geo×1,1) et effet tokenizer (~+30 % de tokens depuis Claude 4.7). platform.claude.com — Pricing - « System Card: Claude Opus 5 », Anthropic (PDF), 24 juillet 2026 — franchissement du seuil d'autonomie R&D non atteint, capacités CB-1 sans CB-2, mêmes protections ASL-3 qu'Opus 4.8. anthropic.com — System Card Opus 5 (PDF)
- « Claude Opus 5 Becomes Top Model on Artificial Analysis Intelligence Index », OfficeChai, 24 juillet 2026 — score AA de 61 (devant Fable 5 à 60 et GPT-5.6 Sol à 59). Source secondaire ; la page primaire d'Artificial Analysis pour Opus 5 n'a pas pu être vérifiée à cette date. officechai.com — AA Index
- Politique de rétention des « Covered Models » (Fable 5 / Mythos 5) : rétention obligatoire de 30 jours sans Zero Data Retention sur toutes les plateformes, écrasant les accords ZDR existants ; Opus 5 et les autres modèles hors classe Mythos restent éligibles au ZDR. cybernews.com · Forrester
- Claire Vo, « Claude Opus 5 review: this model is brilliant (but annoying) », Lenny's Newsletter, 24 juillet 2026 — personnalité « névrotique », verbosité (« Claude Slop »). Source secondaire, retour d'usage individuel. lennysnewsletter.com
Articles similaires
La famille de modèles Claude : Haiku, Sonnet, Opus, Fable, quel modèle pour quelle tâche
Au 24 juillet 2026, la gamme Claude compte cinq niveaux : Haiku, Sonnet, Opus, puis la classe Mythos (Fable et Mythos). Ce que chacun sait faire, par complexité de tâche et par cas d'usage, et pourquoi choisir le bon niveau est une décision d'architecture.
Claude Fable 5 : le premier modèle Mythos-class d'Anthropic disponible pour tous
Claude Fable 5, premier modèle Mythos-class d'Anthropic (9 juin 2026) : specs, benchmarks constructeur, sécurité, fallback Opus 4.8 et avis d'experts.
Claude Sonnet 5 : le modèle le plus agentique d'Anthropic, et pourquoi il divise
Sorti le 30 juin 2026, Claude Sonnet 5 est le modèle le plus agentique d'Anthropic : bonds nets en codage et tool use face à Sonnet 4.6, mais un accueil très polarisé. Benchmarks, prix, retours d'usage, et notre lecture : un instrument spécialisé, pas universel.
Le prix par token est une illusion : mesurer le coût par résultat
Comparer les grilles tarifaires ne dit presque rien de la facture réelle. Sur un cycle agentique, la dépense suit l'ingestion, pas la génération : 153 pour 1. Un modèle « moins cher au token » qui relit plus n'économise rien. Le seul indicateur qui compte est le coût par résultat.