SFEIR

Gemini 4 Argon : Google reprend la tête des benchmarks, mais garde le modèle pour les défenseurs cyber

Gemini 4 Argon : Google reprend la tête des benchmarks, mais garde le modèle pour les défenseurs cyber

Le 30 septembre 2026, Google DeepMind a présenté Gemini 4 Argon, modèle frontier de la famille Gemini. Koray Kavukcuoglu, SVP de Google DeepMind et Chief AI Architect de Google, signe le billet « Gemini 4 Argon: our next era of frontier intelligence »1. Google le destine aux workflows longs : code, travail de connaissance (juridique, finance), défense cyber, multimodal, écriture créative. Deux cercles y ont accès : le gouvernement américain, via son processus volontaire d'accès aux modèles avant leur sortie, et les défenseurs cyber choisis par Google dans le programme Fairwind. L'API payante et Google AI Ultra suivront, sans date. Pour une DSI, c'est une annonce à instruire : les scores viennent de Google, l'API ouverte n'a pas de calendrier.

Argon arrive après un été où Google a enchaîné les modèles Flash8, dont Gemini 3.7 Flash en août, et après l'abandon de Gemini 3.5 Pro, promis pour juin et jamais sorti910. Le nom, un ancien nom de code interne qui avait fuité le 14 septembre, reste sans explication de la part de Google. Avec ce modèle, Google veut reprendre la première place face à OpenAI et Anthropic11.

Un million de tokens en sortie

Google a porté la limite de sortie d'Argon à 1 million de tokens, contre 64 000 pour ses modèles précédents, un plafond qu'il qualifie d'« industry-leading »1. L'objectif est de traiter un problème long et multi-étapes en une seule passe de raisonnement, sans découper la tâche. Le billet ne donne pas la fenêtre de contexte en entrée, et Google n'a publié aucun palier de prix selon la longueur du contexte.

Les exemples du billet relèvent du coding agentique (les migrations de C/C++ vers Rust), de l'optimisation de systèmes internes et de la cybersécurité, où Google écrit qu'Argon peut « autonomously find, validate, and patch critical software vulnerabilities »1. La détection en boîte noire vient d'un benchmark interne de Wiz : analyser des systèmes web en production sans accès au code source.

TarifEntrée ($/M tokens)Sortie ($/M tokens)
Période introductive210
Après la période introductive420

Grille publiée par Google le 30 septembre 20261. Les tokens lus en cache coûtent 95 % de moins. Google n'a pas donné la durée de la période introductive, et Argon n'apparaît pas encore sur la page tarifs de l'API Gemini au 30 septembre.

Logan Kilpatrick, qui travaille sur Gemini, Google AI Studio et l'API Gemini, a confirmé sur X le tarif d'appel de 2 $ en entrée et 10 $ en sortie6. Au tarif d'appel, une réponse qui atteint le plafond de 1 million de tokens de sortie coûte 10 $, puis 20 $ au tarif standard.

Des benchmarks en tête, publiés par Google

Google publie 18 benchmarks (19 lignes, GraphWalks compte deux sous-ensembles) et place Argon en tête, seul ou à égalité, sur 13 d'entre eux, selon le décompte de Frederic Lardinois pour The New Stack7. L'avance la plus nette porte sur les workflows d'entreprise et les tâches longues.

BenchmarkCe qu'il mesureArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5
Vals IndexImpact économique (finance, code, droit, fiscalité)68,963,165,867,0
AutomationBench (Zapier)Workflows métier51,341,431,442,5
Vals Finance Agent v2Tâches d'agent en finance65,453,558,958,6
Harvey Legal AgentTâches d'agent juridique19,65,46,73,8
DeepSWE v1.1Ingénierie logicielle long-horizon77,974,167,474,2
LVBenchCompréhension de vidéos longues91,787,579,783,7
CWE-bench v1Détection de vulnérabilités68,068,058,067,0

Scores en %, publiés par Google le 30 septembre 202612. Sur CWE-bench v1, l'égalité à 68 % est à trois, avec GPT-6 Astra et Grok 4.7.

Les concurrents gardent l'avantage sur cinq tests, dont les deux bancs de coding en terminal. The New Stack relève qu'Argon y arrive dernier des quatre modèles comparés, sur FrontierSWE v2 comme sur Terminal-Bench 4.07.

BenchmarkCe qu'il mesureMeilleur scoreArgon
FrontierSWE v2Ingénierie logicielle65,5 (GPT-6 Astra)55,0
Terminal-Bench 4.0Coding en terminal66,4 (Claude Opus 5.5)57,4
PostTrainBenchPost-entraînement de modèles49,3 (Claude Opus 5.5)45,3
Terminal-Bench Science 0.1Tâches scientifiques en terminal68,1 (GPT-6 Astra)57,6
OSWorld-2.0Computer use72,6 (GPT-6 Astra)69,2

Scores en %, même table Google12. Sur l'autre banc de computer use, Agent's Last Exam, Argon mène avec 39,5 %, devant Claude Opus 5.5 (38,2 %) et GPT-6 Astra (34,2 %).

Le PDF de méthodologie de Google pose les réserves lui-même2. Les scores des modèles concurrents sont ceux publiés par leurs éditeurs ; plusieurs scores d'Argon (DeepSWE, Terminal-Bench, OSWorld) ont été calculés par Google ; sur CWE-bench, OpenAI et Anthropic tournent dans leur propre harnais, Codex et Claude Code. Aucun tiers n'a reproduit ces résultats, faute d'accès au modèle. Les chiffres de GPT-6 Astra, de Claude Opus 5.5 et de Claude Fable 5.1 repris dans ces tables restent des mesures constructeur, et nos réserves sur les leaderboards frontier s'appliquent mot pour mot : un rang ne dit rien du coût par tâche résolue sur votre code.

Fairwind : les défenseurs d'abord, le marché ensuite

Google confie Argon en premier au gouvernement américain et à des défenseurs cyber réunis dans le programme Fairwind34. Ces défenseurs de confiance, comme les équipes internes de Google, reçoivent une version « sans garde-fous cyber » (« without cyber guardrails »), pour chercher et corriger des failles avant les attaquants. Fairwind compte plus de 650 partenaires : gouvernements et autorités cyber nationales, opérateurs d'infrastructures critiques, plateformes technologiques. Seul un sous-ensemble d'entre eux a accès à Argon, et Wiz est le seul utilisateur nommé, à travers son programme « Scan for Good ».

Sundar Pichai a justifié ce choix sur X le jour même5 : « Importantly Argon has frontier safeguards and we are rolling it out responsibly - it's with the US gov't and going to a set of trusted cyber defenders through our Fairwind Program today. We're going to make it available as soon as we can and as safely as we can. » The Verge en a tiré son titre : Google juge son modèle si capable que seuls des « trusted cyber defenders » peuvent l'avoir pour l'instant12.

Anthropic a ouvert cette voie en avril 2026. Project Glasswing distribue la classe Claude Mythos (Claude Mythos Preview depuis avril, puis Claude Mythos 5.1, réservé aux participants sur invitation) à des défenseurs cyber et des éditeurs de logiciels critiques ; Google figure parmi les partenaires de Glasswing depuis son lancement. Nous avons décrit ce mécanisme dans notre lecture de Fable 5 et Mythos 5. Deux labs de frontière font désormais passer leurs modèles les plus capables par les équipes de défense avant de les vendre : la capacité offensive en cyber fixe le calendrier de sortie.

Sur les réseaux, les réactions portent sur l'écart entre les scores affichés et l'accès réel. The New Stack l'a résumé dans son titre : « Gemini 4 Argon is here: It's great, and you can't have it yet »7. Le nom a fait parler, un gaz noble pour ouvrir la série 4, et Google laisse la question sans réponse.

Des milliers de Googlers l'utilisent déjà

Des milliers d'ingénieurs et de chercheurs de Google travaillent déjà avec Argon1. Google publie des chiffres sur ces usages internes :

  • Mémoire des data centers : les équipes ont libéré plus de 300 TiB une fois les optimisations déployées, et Google estime l'économie totale possible entre 500 TiB et 1 PiB.
  • Migrations de C/C++ vers Rust : des dizaines de milliers de lignes dans re2 et libgav1, jusqu'à plus de 800 000 lignes pour Zircon, le kernel de Fuchsia. Le libgav1 migré tourne 2,7 fois plus vite que le portage Rust existant, ce qui le rapproche du C++ optimisé, après remplacement de 32 000 lignes de code SIMD. Ces migrations passent encore par des audits automatisés et manuels avant la production.
  • Informatique quantique : sur un algorithme quantique, Argon a battu de 40 % la référence publiée, en quelques minutes.

La migration de Zircon donne l'ordre de grandeur : un kernel entier réécrit dans un autre langage, avec un modèle dans la boucle et des auditeurs humains au bout de la chaîne.

Ce que les équipes d'ingénierie peuvent préparer

Pour une DSI européenne, Argon reste une annonce : l'API ouverte n'a pas de date, et Google n'a rien annoncé sur une disponibilité en Europe. Trois chantiers peuvent pourtant démarrer avant l'ouverture.

Préparer le banc d'essai. Une équipe qui porte du C/C++ vers Rust ou qui migre une vieille codebase peut constituer dès maintenant son corpus de tests et ses critères d'acceptation. Le jour de l'ouverture, elle comparera Argon aux modèles déjà en production sur son propre code.

Chiffrer les sorties longues. Un plafond de 1 million de tokens change le budget d'une tâche agentique : à 20 $ le million après la période introductive, un agent qui produit dix réponses maximales dans la journée dépense 200 $ en tokens de sortie. Les équipes FinOps ont intérêt à poser des plafonds par tâche avant de brancher le modèle, et à mesurer le coût par résultat de chaque tâche ; notre TCO d'un agent autonome donne la méthode. Pour les achats, un tarif d'appel sans durée annoncée se traite comme une clause à négocier, et un budget se construit sur 4 $ / 20 $.

Suivre les évaluations indépendantes. Les scores publiés viennent de Google ; les mesures d'évaluateurs indépendants diront si l'avance tient, en particulier sur les workflows d'entreprise où elle est la plus large. Les RSSI peuvent aussi regarder les premiers retours des membres de Fairwind : ils diront si la détection en boîte noire tient ses promesses hors des démonstrations.


Sources

  1. Koray Kavukcuoglu (SVP, Google DeepMind and Chief AI Architect, Google), « Gemini 4 Argon: our next era of frontier intelligence », The Keyword (blog.google), 30 septembre 2026 : cas d'usage, sortie à 1 million de tokens, table de benchmarks, grille tarifaire (note de bas de page), cache à -95 %, usages internes (mémoire, Rust, quantique), processus volontaire du gouvernement américain, programme Fairwind. Chiffres constructeur. blog.google
  2. Google DeepMind, « Gemini 4 Argon model evaluation », PDF de méthodologie, 30 septembre 2026 : origine des scores (éditeurs pour les modèles non-Gemini, Google pour plusieurs scores d'Argon), harnais Codex et Claude Code sur CWE-bench, égalité à trois sur CWE-bench v1. storage.googleapis.com
  3. Google DeepMind, page du programme Fairwind : plus de 650 partenaires, catégories de membres, accès à Argon pour un sous-ensemble, Wiz et le programme « Scan for Good ». deepmind.google
  4. Google, « The Fairwind Program », The Keyword (blog.google) : version « without cyber guardrails » pour des défenseurs de confiance et les équipes internes de Google. blog.google
  5. Sundar Pichai (@sundarpichai), publication sur X, 30 septembre 2026 : garde-fous frontier, gouvernement américain, défenseurs cyber via Fairwind, ouverture « as soon as we can and as safely as we can ». x.com
  6. Logan Kilpatrick (@OfficialLoganK), publication sur X, 30 septembre 2026 : « Argon is priced at $2 in and $10 out during introductory pricing! ». x.com
  7. Frederic Lardinois, « Gemini 4 Argon is here: It's great, and you can't have it yet », The New Stack, 30 septembre 2026 : 13 benchmarks en tête sur 18, Argon dernier des quatre sur FrontierSWE v2 et Terminal-Bench 4.0. thenewstack.io
  8. Ryan Whitwam, « Google announces Gemini 4 Argon AI model, but you can't use it yet », Ars Technica, 30 septembre 2026 : un été de modèles Flash, accès restreint. arstechnica.com
  9. Hugh Langley, « Google's New Gemini 4 Model Could Put It Back on the AI Frontier », Business Insider, 30 septembre 2026 : abandon de Gemini 3.5 Pro. businessinsider.com
  10. « Google announces Gemini 4 Argon as its new frontier model », 9to5Google, 30 septembre 2026 : abandon de Gemini 3.5 Pro, promis pour juin. 9to5google.com
  11. « Google unveils Gemini 4 Argon, retaking benchmark lead over OpenAI and Anthropic, but in limited release », VentureBeat, 30 septembre 2026 : lecture concurrentielle du lancement. venturebeat.com
  12. « Google announces Gemini 4 and says it's so capable that only 'trusted cyber defenders' can have it right now », The Verge, 30 septembre 2026. theverge.com
SFEIR AI Auteur

Articles similaires

GPT-6 Astra : un vrai saut sur les agents, un récit d'AGI taillé pour l'entrée en Bourse

GPT-6 Astra : un vrai saut sur les agents, un récit d'AGI taillé pour l'entrée en Bourse

GPT-6 Astra (3 septembre 2026) : gains réels en usage d'ordinateur et en codage, prix aligné sur Fable 5.1, score ARC-AGI-3 qui passe de 99,9 % à 62,7 % selon le harnais. Et un « Welcome to the AGI era » qui arrive six mois après une levée de 122 milliards de dollars.

Claude Opus 5.5 : le niveau de Fable 5.1 au prix d'Opus, et quatre ruptures d'API à traiter

Claude Opus 5.5 : le niveau de Fable 5.1 au prix d'Opus, et quatre ruptures d'API à traiter

Claude Opus 5.5 (22 septembre 2026) ouvre la famille Claude 5.5 : niveau de Fable 5.1 sur la plupart des tâches, 20 % de moins au token qu'Opus 5, cache read à 0,20 $. Derrière l'annonce : quatre breaking changes, un thinking qu'on ne coupe plus, une facture qui dépend de l'effort.

Claude Fable 5.1 : Anthropic mise sur le travail long et baisse la facture du cache

Claude Fable 5.1 : Anthropic mise sur le travail long et baisse la facture du cache

Claude Fable 5.1 (1er septembre 2026) : même tarif que Fable 5, cache read divisé par quatre, garde-fous qui interviennent moins, score doublé sur Terminal-Bench-Science. Ce que cela change pour vos workloads agentiques, et qui a le modèle inclus dans son plan.

Gemini 3.7 Flash : Google impose sa cadence sur les modèles workhorse

Gemini 3.7 Flash : Google impose sa cadence sur les modèles workhorse

Trois semaines après Gemini 3.6 Flash, Google annonce le 13 août 2026 Gemini 3.7 Flash, son modèle « workhorse » taillé pour le code et les agents, à moitié prix jusqu'au 31 décembre. Ce que ces chiffres valent, et ce qu'ils changent dans un portefeuille de modèles.