SFEIR

Claude Sonnet 5.5 : le travail cadré au niveau d'Opus 5.5, au prix de Sonnet

Claude Sonnet 5.5 : le travail cadré au niveau d'Opus 5.5, au prix de Sonnet

Le 28 septembre 2026, six jours après Claude Opus 5.5, Anthropic a publié Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.51. Le tarif reste celui de Sonnet 5 : 2 $ par million de tokens en entrée, 10 $ en sortie. Les scores, eux, bougent beaucoup. Sur Terminal-Bench 4.0, un benchmark de coding agentique en ligne de commande, Sonnet 5.5 atteint 70,6 % quand Sonnet 5 plafonnait à 10,3 %, et passe devant Opus 5.5 (66,4 % à son meilleur réglage). Anthropic annonce aussi une génération plus de 30 % plus rapide et un coût par tâche jusqu'à 30 % inférieur à celui de Sonnet 5.

Pour une équipe qui fait tourner des agents en production, la question devient pratique : quelles tâches retirer d'Opus 5.5 pour les confier à Sonnet 5.5, à quel niveau d'effort, et avec quelles modifications de code ? L'annonce, le guide de migration et les premiers retours d'usage donnent une réponse assez précise.

Fiche technique

ÉlémentClaude Sonnet 5.5
Sortie28 septembre 2026
Identifiant APIclaude-sonnet-5-5 (sans suffixe de date)
Contexte / sortie max1M tokens / 128K tokens
Prix entrée / sortie2 $ / 10 $ par million de tokens (inchangé depuis Sonnet 5)
Cachelecture 0,20 $, écriture 2,50 $ par million de tokens
Raisonnementthinking adaptatif actif par défaut, cinq niveaux d'effort (low à max)
Effort par défautmedium dans les apps Claude et Claude Code, high sur la Claude Platform
Coupure de connaissancesjuin 2026
DisponibilitéClaude.ai, Claude Platform, Amazon Bedrock, Google Cloud, Microsoft Foundry ; zero data retention disponible

Sources : annonce Anthropic1, documentation Claude Platform23.

Anthropic présente Sonnet 5.5 comme le complément rapide et moins cher d'Opus 5.5. L'annonce répartit les rôles sans ambiguïté : Opus 5.5 pour le travail complexe qui demande du jugement, Sonnet 5.5 pour les tâches quotidiennes bien délimitées (correction de bugs, fonctionnalités, documents, slides, tableurs). Claude Haiku 5.5, destiné au haut volume et aux usages sensibles au coût, doit compléter la famille « dans les semaines à venir »1. La lecture en cache coûte le même prix que sur Opus 5.5 (0,20 $), l'écriture deux fois moins (2,50 $ contre 5 $).

Benchmarks : deux à trois points sous Opus 5.5

BenchmarkSonnet 5.5Sonnet 5Opus 5.5
Terminal-Bench 4.0 (coding agentique en terminal)70,6 %10,3 %66,4 % (effort xhigh)
FrontierCode 1.1, Main (code mergeable sans retouche)52,1 % (xhigh), 46,2 % (max)42,4 %54,4 %
CursorBench 4.0 (tâches issues de sessions Cursor réelles)55,5 %34,1 %57,8 %
GDPval-AA v2.1 (travail réel, 44 métiers, Elo)1 8441 4491 846
AA-Briefcase v1.1 (travail de connaissance long, Elo)1 8111 3591 822
Humanity's Last Exam (avec outils)64,5 %54,9 %67,7 %
OSWorld 2.1 (usage d'ordinateur, partiel)80,1 %57,0 %81,8 %
Chartography (lecture de graphiques, sans outils)61,6 %15,6 %64,4 %

Chiffres constructeur, publiés dans l'annonce du 28 septembre 20261. Artificial Analysis a mesuré GDPval-AA et AA-Briefcase sur une préversion affectée d'un bug, depuis corrigé ; selon Anthropic, Artificial Analysis n'en attend pas d'effet majeur.

Terminal-Bench 4.0 est le seul benchmark du tableau où Sonnet 5.5 dépasse Opus 5.5. Partout ailleurs, il reste légèrement derrière : deux à trois points de pourcentage sur le code, l'usage d'ordinateur, les graphiques et Humanity's Last Exam, deux points d'Elo sur GDPval-AA, onze sur AA-Briefcase. Face à Sonnet 5, l'écart va d'une dizaine de points (FrontierCode, Humanity's Last Exam) à 60 points (Terminal-Bench), et près de 400 points d'Elo sur GDPval-AA. Côté concurrence, Sonnet 5.5 à effort xhigh dépasse GPT-6 Sol sur FrontierCode (52,1 % contre 49,3 %). Anthropic affirme aussi qu'il est le premier Sonnet à terminer Pokémon Rouge à partir des seules captures d'écran1.

Anthropic tempère elle-même la lecture de ces chiffres. Selon l'annonce, ses tests internes et ceux des testeurs externes montrent qu'Opus 5.5 reste nettement plus fort sur le travail ouvert et complexe qui exige un jugement soutenu1. Les benchmarks mesurent des tâches bornées ; Sonnet 5.5 y rattrape le haut de gamme. Notre analyse des limites des benchmarks de modèles frontier s'applique ici sans réserve.

Le prix au token reste fixe, la facture baisse

Anthropic attribue la baisse du coût par tâche à deux mécanismes : Sonnet 5.5 consomme moins de tokens pour le même travail, et il regroupe davantage ses appels d'outils, ce qui réduit le nombre d'étapes d'une boucle agentique. Les graphiques score/coût de l'annonce donnent l'ordre de grandeur. Sur plusieurs benchmarks, Sonnet 5.5 à effort low ou medium bat le meilleur score de Sonnet 5 pour environ un dixième du coût par tâche. Sur FrontierCode à effort high, il gagne 10 points sur Sonnet 5 au même réglage pour environ un quinzième du coût1.

Les clients cités par Anthropic donnent des chiffres du même ordre, à lire comme des retours constructeur :

  • Balyasny Asset Management a passé 2 441 tâches financières (questions-réponses, extraction, analyse, prévision) : Sonnet 5.5 fait mieux que Sonnet 5 avec environ 121 000 tokens par réponse, contre 497 000.
  • Base44 a comparé 118 constructions d'applications réelles : Sonnet 5.5 produit des applications au niveau d'Opus 5 en 3,6 itérations en moyenne, contre 7,7 pour Opus 5, avec le moins d'appels d'outils ratés des modèles testés.
  • Slack mesure environ 14 % de tokens de sortie en moins sur ses évaluations Slackbot, sans modifier un seul prompt ; Lovable, un tiers d'appels d'outils en moins et environ deux fois moins d'exécutions shell.
  • Zendesk traite ses tickets 20 % plus vite ; Box mesure un modèle 2,4 fois plus rapide qui consomme 12 % de tokens en moins.

L'effort maximal cache un piège. Sur FrontierCode, Sonnet 5.5 obtient 52,1 % à effort xhigh et seulement 46,2 % à max. Anthropic l'explique ainsi : à max, le modèle lance plus souvent le skill de revue de code de Claude Code, qui répartit la revue entre de nombreux sous-agents. Dans deux cas examinés par Cognition, cela a provoqué un timeout ou des modifications hors périmètre, que le benchmark pénalise1. Le guide de migration fixe les points de départ : high par défaut, medium pour le coding agentique bien spécifié, high pour les tâches plus longues ou plus difficiles, medium ou low pour le chat et les usages sensibles à la latence. Il demande aussi de refaire le balayage des niveaux d'effort : Anthropic les a recalibrés, un même niveau ne produit plus la même quantité de réflexion que sur Sonnet 52.

Comme pour Opus 5.5, le prix affiché ne dit rien de la facture : seul le coût par résultat mesuré sur vos propres workloads tranche. Nous détaillons la méthode dans l'illusion du prix au token.

Là où Opus 5.5 garde l'avantage

À la réserve d'Anthropic sur le jugement soutenu, citée plus haut, s'ajoutent les écarts résiduels : Opus 5.5 reste devant sur FrontierCode (54,4 % contre 52,1 %), sur Humanity's Last Exam (trois points) et sur AA-Briefcase. Les retours de terrain décrivent une répartition du travail plutôt qu'un remplacement. Kevin Ngo, codeur créatif cité par Anthropic, laisserait volontiers Sonnet 5.5 implémenter un jeu dont Opus 5.5 aurait posé l'architecture1. Le développeur iOS Breeje Anadkat décrit une chaîne comparable : Sonnet 5.5 dans Claude Design pour l'UX et les wireframes, Opus 5.5 pour construire l'application avec ses animations et interactions12.

L'API outille déjà cette répartition. Avec l'outil advisor, un exécutant Sonnet 5.5 peut consulter Opus 5.5 comme conseiller (ou Opus 5, Sonnet 5.5, un modèle Fable ou Mythos) ; Opus 4.8 et Sonnet 5, en revanche, ne sont plus acceptés à ce rôle, et l'avis revient chiffré, illisible dans la réponse2. Notre méthode de routage multi-modèles recommande ce schéma : le modèle cher planifie et arbitre, le modèle rapide exécute.

Premier Sonnet sous garde-fous cyber

Anthropic juge les capacités cyber de Sonnet 5.5 comparables à celles d'Opus 5. Sonnet 5.5 est donc le premier Sonnet livré avec des garde-fous et des replis cyber du type de ceux des modèles les plus puissants1. La correction de bugs dans le développement logiciel courant n'est pas concernée ; les requêtes cyber à haut risque basculent visiblement vers Sonnet 5. Le repli se fait vers l'ancien Sonnet, pas vers un Opus, ce qui compte pour qui doit anticiper la qualité de la réponse servie.

Côté API, un refus renvoie stop_reason: "refusal" avec l'une de cinq catégories : cyber, bio, frontier_llm (aide au développement de modèles concurrents), reasoning_extraction (demande de recopier le raisonnement interne dans la réponse) et general_harms. Le repli côté serveur, en bêta et sur la seule Claude API, relance sur Sonnet 5 les refus cyber et frontier_llm, pas les trois autres2. Les garde-fous biologie restent ceux de Sonnet 5. Pour le travail de sécurité légitime, Anthropic renvoie vers son Cyber Verification Program, qui donne aux équipes de cyberdéfense un accès gradué aux capacités avancées4.

Sonnet 5.5 est aussi le premier Sonnet équipé de classificateurs contre l'extraction du raisonnement, une défense contre la distillation. Ses blocs de réflexion (thinking blocks) restent liés au compte qui les a produits : une conversation déplacée d'un compte à l'autre, y compris par un changement de compte en cours de session Claude Code, perd ses raisonnements15. Sur l'alignement, l'audit comportemental automatisé d'Anthropic place Sonnet 5.5 au niveau de Sonnet 5 ou au-dessus sur la plupart des mesures. Sur les nouvelles évaluations de confinement, il approche Opus 5.5 et reste, selon Anthropic, le moins enclin de ses modèles à sonder les limites de son conteneur1.

Pour une équipe produit, la conséquence rejoint celle déjà observée sur Fable : un même prompt peut être servi par deux modèles selon son contenu. Le routeur doit détecter le stop_reason, journaliser la catégorie et décider s'il accepte la réponse de Sonnet 5.

Migrer depuis Sonnet 5 : ce qui renvoie désormais une erreur 400

Changer l'identifiant ne suffit pas. Le guide de migration d'Anthropic liste les ruptures suivantes pour le code Messages API qui vient de Sonnet 52 :

  • Désactiver le thinking. thinking: {"type": "disabled"} renvoie une erreur 400. Le réglage le plus bas devient between_tools, accepté aux efforts low, medium et high seulement ; à xhigh ou max, il faut revenir au thinking adaptatif. Avec between_tools, l'effort ne peut plus changer en cours de conversation.
  • Forcer un outil. Un tool_choice de type any ou tool est refusé. Il faut passer en auto, marquer l'outil strict: true et dire dans le prompt quand l'appeler. Sur Amazon Bedrock, le guide prescrit auto seul, sans outil strict : la validation de l'entrée revient alors au code.
  • Rejouer l'historique. Sonnet 5.5 lit les thinking blocks de Sonnet 5, Opus 4.8 et Haiku 4.5, mais pas ceux d'Opus 5, Opus 5.5, Fable ou Mythos (l'API les ignore sans erreur). Chaque bloc est signé sur la conversation qui le précède : pour les comptes créés depuis le 31 août 2026, modifier l'historique puis rejouer un bloc renvoie une erreur 400. Les conversations doivent rester en ajout seul.
  • Usage d'ordinateur. Sur la Claude API et Google Cloud, seul le toolset computer_toolset_20260801 est accepté ; Bedrock garde computer_20251124.
  • Texte entre deux appels d'outils. Les notes de plus d'une phrase ou deux arrivent dans des thinking blocks, vides à l'affichage par défaut. Aucune requête n'échoue, mais une interface qui affichait ces notes devient muette.

Le seuil minimal de mise en cache descend à 512 tokens (contre 1 024 sur Sonnet 5). Pour qui arrive de Sonnet 4.6 ou de Haiku 4.5, deux points pèsent sur le budget : le tokenizer, celui de Sonnet 5, produit environ 30 % de tokens en plus pour le même texte, et une image de 2000×1500 pixels coûte environ 2,5 fois plus de tokens. Anthropic fournit une commande Claude Code, /claude-api migrate, qui applique le changement d'identifiant et les ruptures de paramètres sur la base de code, puis produit une liste de points à vérifier à la main. Les utilisateurs de Claude Managed Agents n'ont que le nom du modèle à changer2.

Premiers retours

Sur X, Pratul Singhal résume l'annonce par un déplacement de critère : la course est passée du prix au token au coût par tâche8. L'analyste Vladic retient le chiffre qui dérange la hiérarchie : Sonnet 5.5 bat Opus 5.5 en terminal, 70,6 % contre 66,4 %, pour moitié prix6. Le résumé du guide de terrain d'Addy Osmani pose la règle de partage : Sonnet 5.5 pour les bugs, l'itération, la documentation, les slides et les agents à périmètre clair, Opus 5.5 pour le jugement difficile et le long horizon7. Les retours individuels vont dans le même sens : un développeur ne voit « aucune différence » avec Opus 5.5 en coding agentique10, un autre, japonais, s'étonne du peu de tokens consommés11, un troisième, qui fait tourner plus de quarante automatisations n8n, y voit un candidat au rôle de modèle par défaut13.

Ben Callow appelle à la prudence : un agent plus rapide atteint plus vite une erreur dont personne n'est responsable, et il faut chiffrer la frontière d'approbation humaine avant de célébrer l'économie de tokens9. Le résultat FrontierCode ajoute une réserve : le gain de coût se vérifie aux efforts intermédiaires, pas au sommet de l'échelle.

Questions fréquentes

Claude Sonnet 5.5 remplace-t-il Opus 5.5 ?
Sur le travail cadré (bugs, fonctionnalités, documents, slides, agents à périmètre clair), les benchmarks le placent à deux ou trois points d'Opus 5.5, et devant lui sur Terminal-Bench 4.0. Anthropic maintient Opus 5.5 comme modèle du travail ouvert et du jugement soutenu. La répartition la plus citée : Opus 5.5 conçoit, Sonnet 5.5 exécute.

Combien coûte Claude Sonnet 5.5 ?
2 $ par million de tokens en entrée et 10 $ en sortie, comme Sonnet 5 ; 0,20 $ en lecture de cache et 2,50 $ en écriture. Anthropic annonce jusqu'à 30 % de coût par tâche en moins que Sonnet 5, grâce à une consommation de tokens plus faible.

Quel niveau d'effort choisir ?
Le guide de migration recommande de partir de high sur l'API, de medium pour le coding agentique bien spécifié, de medium ou low pour le chat. Anthropic a recalibré les niveaux : un balayage sur vos propres tâches s'impose. L'effort max peut dégrader le résultat, comme sur FrontierCode (46,2 % contre 52,1 % à xhigh).

Que se passe-t-il si une requête touche à la cybersécurité ?
La correction de bugs courante n'est pas affectée. Sonnet 5.5 refuse les requêtes cyber à haut risque ; le repli côté serveur, s'il est activé sur la Claude API, les relance sur Sonnet 5. Les équipes de cyberdéfense peuvent demander un accès étendu via le Cyber Verification Program.

Faut-il modifier son code pour migrer depuis Sonnet 5 ?
Oui, dès que le code désactive le thinking, force un outil, modifie l'historique d'une conversation, utilise l'ancien outil computer use sur la Claude API ou Google Cloud, ou affiche le texte produit entre deux appels d'outils. La commande /claude-api migrate de Claude Code automatise l'essentiel.

Le point de vue SFEIR : changer le défaut du routeur, pas la référence

Sonnet 5.5 déplace la ligne de partage de la gamme Claude. Le travail cadré, qui représente l'essentiel du volume d'une software factory, peut passer d'Opus 5.5 à Sonnet 5.5 à effort medium ou high, pour un tarif au token deux fois plus bas et moins de tokens consommés. Opus 5.5 reste la référence pour la planification, l'architecture et les arbitrages ouverts, et devient le conseiller d'exécutants Sonnet.

Trois vérifications avant de basculer une flotte d'agents : mesurer le coût par résultat sur un échantillon de tâches réelles, pas sur les benchmarks ; traiter le repli cyber vers Sonnet 5 comme un chemin explicite et journalisé du routeur ; revoir les points d'approbation humaine, puisqu'un agent plus rapide produit plus de changements par heure à relire. La discipline FinOps du coding agentique s'applique telle quelle à un modèle dont le prix affiché n'a pas bougé.


Sources

  1. « Introducing Claude Sonnet 5.5 », Anthropic, 28 septembre 2026 : positionnement face à Opus 5.5, tableau de benchmarks et notes (Terminal-Bench 4.0, FrontierCode 1.1, CursorBench 4.0, GDPval-AA v2.1, AA-Briefcase v1.1, HLE, OSWorld 2.1, Chartography), coût par tâche selon l'effort, témoignages clients (Balyasny, Base44, Slack, Lovable, Zendesk, Box, Creator), tarifs, garde-fous cyber et biologie, distillation, alignement, zero data retention. Chiffres constructeur. anthropic.com : Claude Sonnet 5.5
  2. « Migrating to Claude Sonnet 5.5 », Claude Platform Docs, septembre 2026 : between_tools, tool_choice forcé refusé, thinking blocks liés au modèle, à la conversation et au compte, toolset computer use, outil advisor, texte entre appels d'outils, catégories de refus et repli serveur, cache à 512 tokens, efforts recommandés, /claude-api migrate. platform.claude.com : migration Sonnet 5.5
  3. « Models overview », Claude Platform Docs, consulté le 29 septembre 2026 : identifiants par plateforme, prix, contexte, sortie maximale, coupure de connaissances, effort par défaut, Sonnet 5 en liste legacy. platform.claude.com : Models overview
  4. « Real-time cyber safeguards on Claude Opus and Sonnet », support Claude : garde-fous cyber et Cyber Verification Program. support.claude.com : cyber safeguards
  5. « Preserved thinking », Claude Platform Docs : thinking lié au compte, changement de modèle en cours de conversation. platform.claude.com : preserved thinking
  6. Vladic (@Vladic_ETH), 28 septembre 2026 : Terminal-Bench 4.0, Sonnet 5.5 contre Opus 5.5. x.com
  7. AI Tech Updates (@AIInfoShare), 29 septembre 2026 : résumé du guide de terrain d'Addy Osmani. x.com ; annonce d'Addy Osmani : x.com
  8. Pratul Singhal (@SinghalPratul), 29 septembre 2026 : « du prix au token au coût par tâche ». x.com
  9. Ben Callow (@ben_callow), 29 septembre 2026 : frontière d'approbation. x.com
  10. Himanshu Mendapra (@himanshu_btw), 29 septembre 2026 : Sonnet 5.5 contre Opus 5.5 en coding agentique. x.com
  11. @d0tbomb, 29 septembre 2026 : consommation de tokens (en japonais). x.com
  12. Breeje Anadkat (@BreejeAnadkat), 29 septembre 2026 : chaîne de production iOS. x.com
  13. VOMO (@martamonster1), 29 septembre 2026 : Sonnet 5.5 et automatisations n8n (en japonais). x.com
SFEIR AI Auteur

Articles similaires

La famille de modèles Claude : Haiku, Sonnet, Opus, Fable, quel modèle pour quelle tâche

La famille de modèles Claude : Haiku, Sonnet, Opus, Fable, quel modèle pour quelle tâche

Au 29 septembre 2026, la gamme Claude compte cinq niveaux : Haiku, Sonnet (désormais Sonnet 5.5), Opus (désormais Opus 5.5), puis la classe Mythos (Fable et Mythos). Ce que chacun sait faire, par complexité de tâche, et pourquoi choisir le niveau est une décision d'architecture.

Claude Opus 5.5 : le niveau de Fable 5.1 au prix d'Opus, et quatre ruptures d'API à traiter

Claude Opus 5.5 : le niveau de Fable 5.1 au prix d'Opus, et quatre ruptures d'API à traiter

Claude Opus 5.5 (22 septembre 2026) ouvre la famille Claude 5.5 : niveau de Fable 5.1 sur la plupart des tâches, 20 % de moins au token qu'Opus 5, cache read à 0,20 $. Derrière l'annonce : quatre breaking changes, un thinking qu'on ne coupe plus, une facture qui dépend de l'effort.

Claude Sonnet 5 : le modèle le plus agentique d'Anthropic, et pourquoi il divise

Claude Sonnet 5 : le modèle le plus agentique d'Anthropic, et pourquoi il divise

Sorti le 30 juin 2026, Claude Sonnet 5 est le modèle le plus agentique d'Anthropic : bonds nets en codage et tool use face à Sonnet 4.6, mais un accueil très polarisé. Benchmarks, prix, retours d'usage, et notre lecture : un instrument spécialisé, pas universel.

Un modèle par tâche : le guide du routing multi-modèles

Un modèle par tâche : le guide du routing multi-modèles

Faire tourner toute une usine logicielle sur un seul modèle frontier, c'est payer le tarif du raisonnement pour lire des logs. La mécanique du routage multi-modèles : un modèle par phase, une passerelle unique, l'isolation des sous-agents et la règle qui dit quand le multi-agents mérite son coût.