Gemini 3.7 Flash : Google impose sa cadence sur les modèles workhorse
Google a annoncé Gemini 3.7 Flash le 13 août 2026, trois semaines après Gemini 3.6 Flash. L'annonce est signée Tulsee Doshi, Senior Director Product Management, et le positionnement tient dans son titre : « our most intelligent workhorse model »1. Le cheval de trait, donc : le modèle qu'on appelle des millions de fois par jour dans les pipelines de code et les boucles agentiques. Jusqu'au 31 décembre 2026, il est facturé 0,75 $ le million de tokens en entrée et 3,75 $ en sortie, moitié moins que le tarif de lancement de 3.6 Flash.
SFEIR est partenaire Google Cloud depuis seize ans et partenaire Anthropic. Cette double position n'incite ni à surjouer l'annonce ni à la minimiser. Voici ce que le modèle change pour une DSI qui fait déjà tourner des agents en production, et ce que ses chiffres de lancement ne démontrent pas encore.
Le segment workhorse est celui qui paie la facture
Google publie trois Flash en trois mois. L'équipe Gemini attribue ce rythme aux retours des développeurs et à des innovations algorithmiques qu'elle promet de retrouver dans ses prochains modèles6. La cadence est devenue, en soi, un argument produit.
Le choix du mot compte. « Real-world work runs on workhorse models », écrit Google sur X6. La formule décrit assez bien la réalité comptable d'une plateforme agentique : un agent en production passe l'essentiel de son temps sur des tâches de difficulté moyenne, répétées à haute fréquence, où le modèle de frontière coûte trop cher pour être appelé à chaque tour. C'est la case que remplissent Gemini Flash, GPT-5.6 Luna ou Claude Haiku dans une architecture routée par tâche. Le haut de gamme fait les gros titres ; le milieu de gamme fait le volume, et donc la facture.
Des gains concentrés là où les agents échouent
Les progrès annoncés visent les points de friction connus des systèmes agentiques. En ingénierie logicielle, Google revendique des gains en débogage et en résolution d'issues, un code plus juste au premier passage et plus proche de l'état production-ready1. En développement web, des layouts plus fonctionnels, des applications plus complètes en moins de prompts, et une meilleure fidélité aux designs de référence (captures d'écran, images, design systems). Sur le travail de connaissance, le raisonnement progresse dans les domaines denses : finance, droit, biosciences.
| Benchmark | Gemini 3.5 Flash | 3.6 Flash | 3.7 Flash |
|---|---|---|---|
| Codage agentique (DeepSWE v1.1) | 37,0 % | 49,0 % | 65,3 % |
| Codage agentique (FrontierCode 1.1, Main) | — | 34,4 % | 43,6 % |
| Documents complexes (GDP.pdf) | — | 22,0 % | 34,0 % |
| Workflows métier (AutomationBench) | 13,4 % | 17,0 % | 30,4 % |
| Développement web (WebDev Arena, Elo) | — | 1538 | 1588 |
Scores publiés par Google le jour du lancement15 ; mesures constructeur, harnais internes. Les cases vides correspondent à des benchmarks non rapportés pour 3.5 Flash.
Koray Kavukcuoglu, qui vient de prendre la direction opérationnelle de Google DeepMind, insiste sur la trajectoire plutôt que sur le point : de 3.5 à 3.7 en trois mois, DeepSWE passe de 37,0 % à 65,3 % et AutomationBench de 13,4 % à 30,4 %5. Il a publié pour la démonstration une expérience où trois agents entraînent de façon autonome, from scratch, un modèle de contrôle robotique.
Google met surtout en avant le comportement agentique : planification multi-étapes, usage plus discipliné des outils, adaptation aux obstacles, fidélité accrue aux instructions1. En clair, moins de supervision manuelle et moins de retries. Ces qualités-là ne se lisent pas dans un score ; elles se mesurent sur le taux d'intervention humaine de vos propres boucles.
Ce que ces chiffres valent face au haut de gamme
Trois de ces benchmarks apparaissent aussi dans la table publiée par Anthropic pour Claude Opus 5 le 24 juillet7. La mise en regard est instructive, à condition d'énoncer d'abord ce qu'elle ne vaut pas : deux fournisseurs, deux harnais internes, trois semaines d'écart, aucune exécution tierce. Ce sont des revendications qui se croisent, pas une comparaison contrôlée.
| Benchmark | Gemini 3.7 Flash | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|
| Codage agentique (DeepSWE v1.1) | 65,3 % | 68,8 % | 72,7 % |
| Codage agentique (FrontierCode v1.1, Main) | 43,6 % | 53,4 % | 47,5 % |
| Workflows métier (AutomationBench) | 30,4 % | 26,0 % | 18,1 % |
Sources constructeur distinctes : Google, 13 août 20261 ; Anthropic, 24 juillet 20267. Harnais, dates et méthodes diffèrent ; à traiter comme un ordre de grandeur.
Sous cette réserve, le signal reste net. Un modèle vendu 0,75 $ / 3,75 $ se tient à trois points d'un modèle vendu 5 $ / 25 $ sur le codage agentique, et le devance sur les workflows métier. L'écart de capacité entre le segment workhorse et le segment frontier se resserre plus vite que l'écart de prix, ce qui déplace la question : la bonne unité de mesure devient le nombre de tâches qu'un modèle résout par euro dépensé, pas son rang. Nos réserves sur les benchmarks frontier valent ici mot pour mot, et le décalage de trois semaines rappelle qu'une table de lancement périme vite.
Un prix d'appel très calculé
À partir du 1er janvier 2027, le tarif passe à 1,50 $ en entrée et 7,50 $ en sortie16. La fenêtre d'appel dure donc quatre mois et demi, et elle porte sur le poste qui compte : un agent consomme surtout des tokens de sortie, raisonnement, appels d'outils et itérations compris. Google casse le prix exactement là où se joue la facture, le temps que les équipes industrialisent leurs workloads. Le pari est classique : peu d'entre elles redéploieront ailleurs le 1er janvier.
| Modèle (segment workhorse et voisins) | Entrée ($/M tokens) | Sortie ($/M tokens) |
|---|---|---|
| Gemini 3.7 Flash (tarif d'appel, jusqu'au 31/12/2026) | 0,75 | 3,75 |
| Gemini 3.7 Flash (à partir du 01/01/2027) | 1,50 | 7,50 |
| GPT-5.6 Luna | 1 | 6 |
| Claude Sonnet 5 | ~2 | ~10 |
| GPT-5.6 Terra | 2,50 | 15 |
| Claude Opus 5 | 5 | 25 |
Tarifs Gemini au 13 août 20261 ; tarifs OpenAI relevés au 16 juillet 2026 et tarifs Anthropic au 24 juillet 2026, tels que publiés dans nos analyses de GPT-5.6 et d'Opus 5. Grilles à revérifier sur les pages officielles avant tout arbitrage.
Le prix au token n'est qu'une variable de l'équation, comme nous le détaillons dans notre analyse du coût par outcome : un modèle deux fois moins cher qui relit deux fois plus de contexte ne fait économiser rien du tout. Un modèle Flash bien placé dans un routage produit en revanche des gains mesurables sur les tâches à haute fréquence. Nos mesures sur le TCO d'un agent autonome chiffrent l'écart : router le seul heartbeat vers un modèle éco réduit la facture de 40 à 70 %.
Sous le capot
Le modèle (gemini-3.7-flash) offre une fenêtre de contexte de 1 048 576 tokens et jusqu'à 65 536 tokens de sortie2. Il accepte texte, image, audio et vidéo en entrée, produit du texte en sortie, et embarque l'outillage attendu d'un modèle orienté agents : exécution de code, function calling, grounding sur Google Search et Google Maps, computer use (en preview) et context caching. Le thinking est supporté et configurable, ce qui en fait un levier de coût autant que de qualité.
Côté accès, les développeurs passent par la Gemini API, Google AI Studio, Android Studio et Antigravity ; les entreprises par la Gemini Enterprise Agent Platform et l'application Gemini Enterprise2. Pour le grand public, Gemini Spark, l'agent personnel des abonnés Google AI Pro et Ultra, bascule dès aujourd'hui sur 3.7 Flash pour orchestrer les tâches multi-étapes dans Gmail, Calendar ou Docs, dans les pays où Spark est disponible6.
Un lancement sous pression
Le contexte pèse sur la lecture de cette annonce. Depuis le printemps, Google encaisse : Gemini 3.5 Pro a pris plusieurs mois de retard, Bloomberg et Axios rapportant que ses performances en coding et en tâches agentiques n'atteignaient pas les objectifs internes malgré des réentraînements8. Les utilisateurs se plaignent de réponses verbeuses, de pertes de contexte, de boucles de « Thinking… » interminables. Des analystes comme SemiAnalysis sont allés jusqu'à contester à DeepMind son statut de laboratoire de frontière.
S'y ajoute une hémorragie de talents rare à ce niveau. Noam Shazeer, co-auteur d'« Attention Is All You Need », est parti chez OpenAI. John Jumper, prix Nobel de chimie 2024 pour AlphaFold, a rejoint Anthropic, comme Jonas Adler et Alexander Pritzel. Jeff Dean, Oriol Vinyals, Quoc Le et Sanjay Ghemawat ont quitté le navire pour fonder la startup Discovery Loop. Début août, une réorganisation a acté un nouveau partage des rôles : Demis Hassabis devient Chairman et Chief Scientist d'Alphabet, Koray Kavukcuoglu prend la direction opérationnelle de DeepMind8.
Google répond par une cadence plutôt que par un communiqué : trois Flash en trois mois, un prix divisé par deux, une intégration produit qui avance sur tous les fronts (Spark, Antigravity, Workspace, l'API). S'y ajoutent des avantages structurels que personne d'autre ne cumule : des TPU maison, un Google Cloud en forte croissance, une distribution native dans Search, Workspace, Android et YouTube. Enterrer Google serait une erreur d'analyse.
Ce que nous en ferions cette semaine
Pour une DSI qui fait déjà tourner des agents, l'annonce ouvre une fenêtre de mesure, pas une injonction à migrer. Trois gestes suffisent.
Rejouer vos evals, pas les leurs. Prenez vos dix tâches agentiques les plus fréquentes, celles qui pèsent le plus dans votre consommation mensuelle, et mesurez le coût par tâche résolue et le taux d'intervention humaine sur 3.7 Flash. Les benchmarks publics ne disent rien de votre base de code ni de vos données.
Router, pas remplacer. Un modèle workhorse gagne son intérêt sur les tours à haute fréquence : triage, lectures d'outils, boucles de vérification, heartbeats. Les phases de planification et d'architecture restent le terrain des modèles de raisonnement. Le routage par phase capte la baisse de prix sans exposer les décisions structurantes.
Poser la question de janvier maintenant. Un tarif d'appel qui double au 1er janvier est une donnée d'architecture. Si votre système ne peut pas changer de modèle sans réécriture, la fenêtre promotionnelle achète un verrou. La discipline Design to Exit et une architecture multi-LLM transforment cette échéance en simple ligne de configuration.
Questions fréquentes
Quel est le prix de Gemini 3.7 Flash ?
0,75 $ le million de tokens en entrée et 3,75 $ en sortie jusqu'au 31 décembre 2026, tarif d'appel correspondant à la moitié du prix de lancement de 3.6 Flash. À partir du 1er janvier 2027, la grille passe à 1,50 $ en entrée et 7,50 $ en sortie.
Gemini 3.7 Flash remplace-t-il un modèle de frontière ?
Google ne le présente pas ainsi. C'est un modèle workhorse, conçu pour le volume et la latence sur des tâches de difficulté moyenne. Sur les benchmarks de codage agentique publiés par les fournisseurs, il se rapproche du haut de gamme sans l'égaler, et il le devance sur les workflows métier d'AutomationBench. Les phases de planification et d'architecture restent mieux servies par un modèle de raisonnement.
Les benchmarks annoncés sont-ils vérifiables ?
Ce sont des mesures constructeur, obtenues sur des harnais internes, publiées le jour du lancement. Elles indiquent une direction, pas une performance sur votre contexte. La seule mesure qui engage une décision reste celle que vous exécutez sur vos propres tâches, en coût par résultat.
Quelles modalités et quelle fenêtre de contexte ?
1 048 576 tokens de contexte, jusqu'à 65 536 tokens de sortie, entrées texte, image, audio et vidéo, sortie texte. Le modèle embarque l'exécution de code, le function calling, le grounding Search et Maps, le computer use en preview, le context caching, et un thinking configurable.
Le point de vue SFEIR : la vraie bataille se joue sur le milieu de gamme
La course à la frontière fait les gros titres ; l'économie réelle des agents en 2026 se joue un cran en dessous, sur les modèles qu'on appelle des millions de fois. Voir un workhorse à 3,75 $ en sortie s'approcher des scores de codage agentique d'un modèle à 25 $ confirme ce que nous documentons depuis des mois : la couche modèle se banalise, et la valeur migre vers le système qui l'assemble. Notre carte des modèles traite chaque annonce comme un point ajouté au portefeuille, qualifié par ce qu'il fait bien, jamais comme un ordre de migration.
Ce qui reste vôtre, dans cette affaire, tient dans le harnais et la discipline de Context Engineering : la qualité des guides en amont, la mémoire, les garde-fous, les capteurs de retour. À modèle égal, cet attelage fait gagner davantage que l'écart entre deux lignes de benchmark. Et il rend indolore la seule décision que Google vous impose vraiment : celle du 1er janvier.
Sources
- Tulsee Doshi, « Gemini 3.7 Flash: our most intelligent workhorse model », blog Google, 13 août 2026 — positionnement « workhorse », gains revendiqués en ingénierie logicielle, développement web et travail de connaissance, scores DeepSWE v1.1, FrontierCode 1.1, GDP.pdf, AutomationBench, WebDev Arena, et grille tarifaire (tarif d'appel jusqu'au 31 décembre 2026, tarif standard au 1er janvier 2027). Mesures constructeur, harnais internes. blog.google — Introducing Gemini 3.7 Flash
- Documentation technique Gemini Enterprise Agent Platform, Google Cloud — identifiant
gemini-3.7-flash, fenêtre de contexte de 1 048 576 tokens, 65 536 tokens de sortie, modalités d'entrée, outillage (exécution de code, function calling, grounding Search et Maps, computer use en preview, context caching), thinking configurable et canaux de disponibilité. docs.cloud.google.com — Gemini 3.7 Flash - Model card Gemini 3.7 Flash, Google DeepMind — caractéristiques du modèle et évaluations publiées par le laboratoire. deepmind.google — Model card
- « Gemini 3.7 Flash launch », 9to5Google, 13 août 2026 — couverture du lancement, canaux de disponibilité et bascule de Gemini Spark. Source secondaire. 9to5google.com
- Koray Kavukcuoglu (Google DeepMind), publications sur X, 13 août 2026 — trajectoire chiffrée de 3.5 à 3.7 Flash (DeepSWE de 37,0 % à 65,3 %, AutomationBench de 13,4 % à 30,4 %) et démonstration de trois agents entraînant de façon autonome un modèle de contrôle robotique. trajectoire · démonstration
- Fils officiels sur X, 13 août 2026 — @Google (annonce et tarif d'appel, « Real-world work runs on workhorse models », bascule de Gemini Spark, canaux de disponibilité et fin du tarif d'introduction), @GoogleAI (Spark, exécution, prix), @GoogleAIStudio (sortie trois semaines après 3.6 Flash, rôle des retours développeurs), @GoogleDeepMind (annonce). @Google · @GoogleAI · @GoogleAIStudio · @GoogleDeepMind
- « Introducing Claude Opus 5 », Anthropic, 24 juillet 2026 — scores DeepSWE v1.1, FrontierCode v1.1 (Main) et AutomationBench pour Opus 5 et GPT-5.6 Sol, et grille tarifaire Opus 5, repris ici pour la mise en regard. Mesures constructeur Anthropic, harnais internes, date et méthode distinctes de celles de Google : la comparaison croisée vaut comme ordre de grandeur, pas comme mesure contrôlée. anthropic.com — Claude Opus 5
- Contexte de marché sur Google DeepMind — retards de Gemini 3.5 Pro et objectifs internes non atteints (rapportés par Bloomberg et Axios), critiques d'analystes dont SemiAnalysis, départs de chercheurs (Noam Shazeer vers OpenAI ; John Jumper, Jonas Adler et Alexander Pritzel vers Anthropic ; Jeff Dean, Oriol Vinyals, Quoc Le et Sanjay Ghemawat vers Discovery Loop) et réorganisation d'août 2026 (Demis Hassabis Chairman et Chief Scientist d'Alphabet, Koray Kavukcuoglu à la direction opérationnelle de DeepMind). Éléments de presse agrégés dans notre veille du 13 août 2026, non re-vérifiés article par article sur les sources primaires ; à traiter comme du contexte, pas comme des faits établis.
Articles similaires
Comment choisir son modèle LLM en 2026 : la carte, pas le classement
Cinq laboratoires, des capacités qui convergent, des prix qui s'effondrent : en 2026, « quel est le meilleur modèle ? » devient la mauvaise question. Voici le cadre de décision qui remplace le classement : router par tâche, mesurer le coût par résultat, rester réversible, investir dans le système.
Un modèle par tâche : le guide du routing multi-modèles
Faire tourner toute une usine logicielle sur un seul modèle frontier, c'est payer le tarif du raisonnement pour lire des logs. La mécanique du routage multi-modèles : un modèle par phase, une passerelle unique, l'isolation des sous-agents et la règle qui dit quand le multi-agents mérite son coût.
Le prix par token est une illusion : mesurer le coût par résultat
Comparer les grilles tarifaires ne dit presque rien de la facture réelle. Sur un cycle agentique, la dépense suit l'ingestion, pas la génération : 153 pour 1. Un modèle « moins cher au token » qui relit plus n'économise rien. Le seul indicateur qui compte est le coût par résultat.
Pourquoi le sommet du leaderboard ne vous dit pas quel modèle choisir
À défaut du prix, on arbitre sur les benchmarks. Mauvais réflexe : un classement mesure des capacités moyennes sur des tests standardisés, pas la performance sur votre legacy. La précision plafonne, la variance explose, et l'écart au sommet compte moins que le harnais. Que mesurer à la place.