SFEIR

Mistral Large 4 : 1 000 milliards de paramètres en open-weights, une souveraineté qui se jugera sur la licence

Mistral Large 4 : 1 000 milliards de paramètres en open-weights, une souveraineté qui se jugera sur la licence

Le 6 octobre 2026, Mistral a ouvert Mistral Large 4 en preview publique par API sur Mistral Studio : un mixture-of-experts de 1 000 milliards de paramètres, dont 49 milliards actifs par token, multimodal en entrée, texte en sortie. Les poids sont promis pour le 27 octobre, sous une licence que Mistral n'a pas annoncée. Le modèle joue dans la catégorie de GLM-5.3 et de Kimi K3, les meilleurs open-weights chinois, sans les dominer, et reste à distance des modèles fermés sur le code agentique. Son écart réel est ailleurs : en cyberdéfense, il exécute des tâches que Claude Opus 5.5 et GPT-6 Astra refusent. Verdict : à tester dès maintenant sur vos propres évaluations, à ne pas engager avant la licence et le checkpoint final.

Ce que Mistral annonce et ce que les tiers mesurent

Les chiffres de Mistral viennent de ses propres graphiques du 6 octobre 2026. Vals AI a publié le même jour ses mesures indépendantes, et VentureBeat a relu le leaderboard public de DeepSWE. Selon l'épreuve, les trois sources divergent de cinq à douze points.

Épreuve Annoncé par Mistral (6 oct. 2026) Mesure tierce (6 oct. 2026) Lecture
DeepSWE v1.1 (code agentique) 61,7 % ; graphique Mistral relu par The Next Web : ML4 62 %, GLM-5.3 61 %, DeepSeek-V4-Pro 57 % Leaderboard public, meilleure configuration modèle + agent, relevé par VentureBeat : GLM-5.3 et Kimi K3 vers 69 %, GPT-6 Astra, Gemini 3.8 Flash et Claude Opus 5 vers 74 % Compétitif, sans avance. Les deux colonnes ne comparent pas le même harnais.
Terminal-Bench 4 28,3 % Vals : 22,73 %, 20e sur 44 Écart de 5,6 points, origine non documentée dans les pages consultées.
Harvey Legal Agent 15 % ; Kimi K3 13 %, GPT-6 Astra 5 % Vals : 15,83 %, 6e sur 75 ; Kimi K3 12,92 %, MiMo V2.6 Pro 10,83 %, GLM-5.3 8,33 % Tient. Premier open-weights de l'épreuve, à un niveau absolu faible pour tout le monde.
Agrégat généraliste Non publié Vals Index : 48,05 % ± 1,11, 32e sur 44 Milieu de tableau sur l'ensemble des épreuves Vals.
Cyber 82 % en reproduction de vulnérabilité (AA Cyber Index), Cybench 93 % Aucune mesure indépendante publiée au 6 octobre 2026 Chiffres éditeur, à confirmer.

Lisez la colonne de droite avant celle du milieu. Sur Terminal-Bench 4, les 28,3 % annoncés deviennent 22,73 % mesurés par Vals. Sur DeepSWE, les 61,7 % restent honorables, mais le sommet du leaderboard public se situe douze points plus haut. Sur Harvey, le score annoncé survit à la mesure indépendante, seul cas du tableau. Mistral écrit que le modèle surpasse nettement tout open-weights développé aux États-Unis ou en Europe : la formule exclut la Chine, où GLM-5.3 et Kimi K3 font mieux sur le leaderboard public DeepSWE. Aucun de ces classements ne vous dit quel modèle choisir, et nous avons expliqué pourquoi le sommet du leaderboard ne vous dit pas quel modèle choisir : une épreuve agrégée mesure un harnais autant qu'un modèle, jamais votre code.

Pierre Stock, VP science et premier salarié de Mistral, dit à Euronews que l'entreprise « is definitely closing the gap » (comble l'écart). Mistral précise que le run d'apprentissage par renforcement derrière la preview « is still in flight, and the model is showing no signs of saturation » (est toujours en cours, et le modèle ne montre aucun signe de saturation) : la preview du 6 octobre diffère du modèle que vous téléchargerez le 27.

Le vrai différenciateur : la cyberdéfense, et une politique de refus

Le chiffre que Mistral met en avant, 82 % en reproduction de vulnérabilité sur l'AA Cyber Index, se lit avec sa phrase d'accompagnement : « Several leading closed models, including Claude Opus 5.5 and GPT-6 Astra, score near zero on the same test because they refuse to perform the task » (plusieurs modèles fermés de premier plan, dont Claude Opus 5.5 et GPT-6 Astra, obtiennent un score proche de zéro parce qu'ils refusent la tâche). L'écart mesure donc deux choses à la fois : une capacité, et une politique de refus. Refuser d'écrire un exploit et ne pas savoir l'écrire sont deux états différents, et le test ne les distingue pas. Mistral a choisi de laisser passer la reproduction de vulnérabilité en preview publique, tout en bloquant les requêtes malveillantes, et revendique sur les prompts cyber de JailbreakBench, StrongREJECT et AgentHarm un taux de refus moyen supérieur à celui de tous les modèles open source. Le raisonnement de l'éditeur tient en une phrase de son billet : « defending software often starts with proving that a flaw is real, exactly the kind of work safety filters in closed models can block. »

Guillaume Lample, cofondateur de Mistral, pousse l'argument un cran plus loin dans Euronews : « The cyber defence capabilities will enable enterprises and governments to defend themselves against threat actors that are jailbreaking closed models to perform cyber attacks. » Un RSSI peut entendre la thèse : les attaquants contournent déjà les filtres, et le défenseur se retrouve seul à les respecter. Pour le vérifier, Mistral ouvre pendant trois semaines, avant la publication des poids, un accès à moindre modération et aux capacités cyber étendues, réservé à des responsables de cybersécurité, des partenaires vérifiés et des autorités étatiques. Un dirigeant de Mistral le résume au Journal du Net : « on leur donne un modèle qu'ils possèdent et qu'ils pourront utiliser de manière illimitée ».

Cette phrase contient la tension que l'éditeur ne commente pas. Le 27 octobre, les poids sortent, et avec eux la fin de tout filtre côté serveur. Les refus revendiqués en preview publique sont une propriété du modèle servi par Mistral ; une fois le fichier téléchargé, son détenteur peut les retirer. L'évaluation d'Anthropic sur GLM-5.3, que nous avons analysée dans les failles du meilleur open source et ce qu'elles annoncent pour votre code interne, a chiffré ce retrait par abliteration à 4 400 $ de GPU. Le même chemin existera pour Large 4, avec des capacités cyber que Mistral place lui-même dans les cinq premières au monde. Après le 27 octobre, les refus de Mistral ne vous protègent plus : votre défense dépend de la vitesse à laquelle vous trouvez vos failles, avant qu'un tiers ne les reproduise avec le même modèle.

La souveraineté se jugera le 27 octobre, sur la licence

Mistral a publié le 6 octobre une API et un prix de preview, 1,36 $ le million de tokens en entrée et 4,18 $ en sortie. La valeur du modèle pour une DSI européenne dépendra du texte de licence qui accompagnera les poids, et ce texte manque. L'éditeur a déjà pratiqué trois régimes. Large 2 est sorti sous Mistral Research License, qui interdit l'usage commercial sans accord. Large 3, le 2 décembre 2025, est passé sous Apache 2.0, licence permissive sans clause de revenu. Le premier Mistral Large, en février 2024, et Medium n'ont été servis que par API. Rien dans le billet du 6 octobre ne dit lequel des trois régimes s'appliquera à Large 4, et nous avons vu avec Kimi K3 ce qu'une « licence propre » assortie de seuils commerciaux fait au profil de réversibilité d'un modèle.

Le reste du dossier souverain est solide mais relatif, dans la continuité de ce que nous écrivions sur l'accord Mistral × Microsoft et la stratégie industrielle de Mistral. Le modèle a été entraîné en Europe, dans les datacenters de Mistral, sur 3 800 GPU NVIDIA Grace Blackwell en deux mois environ, sur un cluster d'une dizaine de mégawatts en France selon le Journal du Net, où un dirigeant de Mistral affirme que « c'est entre deux et trois fois moins que la plupart des labos chinois » en calcul. Les puces viennent de NVIDIA. L'argent vient d'une Series D de 3 milliards d'euros annoncée le 8 septembre 2026, à plus de 21 milliards d'euros post-money, menée par Samsung Electronics avec le Scaleup Europe Fund d'EQT et PSG Equity : le plus grand tour de la tech européenne, selon Euronews, avec un chef de file coréen. Société française, infrastructure française, silicium américain, capital international : le fichier de poids sera européen, les puces et le chef de file du dernier tour sont américains et coréens. Nous détaillons ce découpage dans notre lecture des choix technologiques et politiques de la souveraineté numérique européenne.

Une précision de transparence : SFEIR est partenaire d'Anthropic, au palier Preferred, et de Google Cloud. Aucun des deux n'est un acteur souverain au sens où nous l'entendons ici.

Reste la question que les communiqués n'abordent pas : qui héberge 1 000 milliards de paramètres ? Les 49 milliards actifs par token réduisent le calcul par requête, pas la mémoire : un mixture-of-experts charge l'ensemble de ses experts pour servir, et un fichier de poids de cette taille suppose une grappe de GPU de dernière génération. Pour la plupart des DSI, l'auto-hébergement de Large 4 restera donc une option : le modèle sera consommé via l'API de Mistral ou via un hébergeur, et le poids ouvert servira de garantie de sortie. Cette garantie est la valeur que nous attribuons à l'open-weights dans le Design to Exit et que nous avons mesurée sur ce que Kimi K3 change pour la souveraineté et la réversibilité d'une DSI : la réversibilité tient à la possibilité d'héberger le modèle demain, chez l'hébergeur de votre choix, sous une licence qui le permet. Si la licence du 27 octobre est Apache 2.0, l'option vaut quelque chose. Si c'est une licence de recherche, elle ne vaut rien pour une production. Le surnom choisi par Mistral, « Le Chonk », répond au mème « Le Chaton Fat » de juin (Arthur Mensch avait corrigé : « It's actually le gros chaton »).

Ce que ça change, par lecteur

DSI. Un modèle de classe 1 000 milliards de paramètres, entraîné en Europe, avec des poids promis : c'est une première, et la décision attend le 27 octobre. La preview est une version intermédiaire d'un run encore en cours, le prix est un prix de preview, la licence est inconnue. Inscrivez Large 4 dans votre matrice de fournisseurs comme candidat à la couche européenne d'une architecture multi-LLM souveraine, et bloquez tout engagement contractuel jusqu'à la publication de la licence et du checkpoint final.

RSSI. Si votre organisation est éligible à l'accès red-teaming à moindre modération, demandez-le : trois semaines pour tester sur vos propres binaires un modèle qui reproduit des vulnérabilités là où vos outils actuels refusent. Préparez en parallèle le 27 octobre comme la sortie des poids de GLM-5.3 aurait dû l'être : un modèle aux capacités cyber revendiquées dans le top 5 mondial devient téléchargeable par n'importe qui, filtres compris puis retirés. Vos délais de correction sur le code interne sont la seule variable que vous contrôlez.

CTO, architecte. Testez en preview sur vos évaluations à vous. Le tableau ci-dessus montre jusqu'à cinq points d'écart entre l'annonce et la mesure ; vos propres tâches de code agentique, dans votre propre harnais, sont la seule mesure qui compte. Notez les résultats avec la date et l'identifiant du checkpoint : la version du 27 octobre sera différente de celle du 6, et vous voudrez rejouer la même suite.

Achats. Le prix de preview, 1,36 $ et 4,18 $ le million de tokens, n'engage personne, et surtout pas Mistral. N'intégrez aucune grille tarifaire dans un contrat avant la sortie finale, et exigez, le moment venu, que la licence des poids figure en annexe de tout contrat d'API : elle pèse davantage sur votre coût de sortie que le tarif au token.

Ce que l'on ne sait pas encore

  • La licence des poids. Absente du billet de Mistral, de VentureBeat et de The Next Web. Tout jugement sur la souveraineté attend ce texte.
  • Le checkpoint final. Le run de RL est en cours ; Lample promet la version finale avec les poids, avant la fin du mois. Les scores du 6 octobre décrivent un modèle intermédiaire.
  • Les mesures indépendantes en cyber. Les 82 % et 93 % sont des chiffres éditeur. Pour GLM-5.3, le CAISI du NIST a publié une évaluation moins d'un mois après la sortie des poids ; rien n'indique qu'il fera de même pour Large 4, et rien ne l'exclut.
  • L'écart Terminal-Bench 4. 28,3 % annoncés contre 22,73 % mesurés par Vals, sans que la configuration ni la version de l'épreuve soient documentées des deux côtés dans les pages consultées.

Cet article sera révisé à la publication des poids et de leur licence, à la sortie du checkpoint final, et à la première évaluation indépendante des capacités cyber.


Sources

  1. Mistral AI, « Mistral Large 4 », billet d'annonce, 6 octobre 2026. Architecture (1 000 milliards de paramètres, 49 milliards actifs, MoE hybride, multimodal, 160 langues), entraînement sur 3 800 GPU NVIDIA Grace Blackwell dans les datacenters européens de Mistral, scores annoncés (AA Cyber Index 82 %, Cybench 93 %, DeepSWE 61,7 %, Terminal-Bench 4 28,3 %, SWE-Atlas-QnA 59,4 %, AutomationBench 59,9 %, B3 93,3 %), prix de preview, run de RL en cours, accès red-teaming à moindre modération, surnom « Le Chonk ». Chiffres déclarés par l'éditeur. Lire le billet.
  2. Carl Franzen, « Mistral debuts Large 4 ("Le Chonk"), a 1-trillion parameter text output model with high benchmarks, planned for open weights release », VentureBeat, 6 octobre 2026. Date du 27 octobre pour les poids, « près de 4 000 » GPU et deux mois d'entraînement, lecture du leaderboard public DeepSWE (GLM-5.3 et Kimi K3 vers 69 %, GPT-6 Astra, Gemini 3.8 Flash et Claude Opus 5 vers 74 %), leaderboard Vals Legal Agent, propos de Guillaume Lample, origine du surnom. Lire l'article.
  3. Vals AI, fiche « Mistral Large 4 », consultée le 6 octobre 2026. Vals Index 48,05 % ± 1,11 (32e sur 44), Harvey Legal Agent 15,83 % (6e sur 75), Finance Agent v2 54,68 %, Terminal-Bench 4.0 22,73 % (20e sur 44), Code Migration 30,56 %, Vibe Code Bench v1.1 78,40 %, contexte 512 k, sortie 256 k, prix. Mesures indépendantes. Consulter la fiche.
  4. Pascale Davies, « What to know about Mistral's ML4 as it bets on EU sovereignty in the US-China open-weight AI race », Euronews, 6 octobre 2026. Fenêtre de test de trois semaines avant les poids, propos de Pierre Stock et de Guillaume Lample sur la cyberdéfense, Series D qualifiée de plus grand tour en capital de la tech européenne. Lire l'article.
  5. Ana-Maria Stanciuc, « Mistral releases Large 4, a 1-trillion parameter open-weight AI model », The Next Web, 6 octobre 2026. Lecture des graphiques Mistral : DeepSWE (ML4 62 %, GLM-5.3 61 %, DeepSeek-V4-Pro 57 %), FinWorkBench (67 % / 67 % / 65 %), Harvey Legal Agent (15 % / 13 % / 5 %), Dense 200 et DIOR-RSVG. Absence de licence annoncée. Lire l'article.
  6. Journal du Net, « Mistral Large 4 : la recette secrète de Mistral AI pour rattraper les géants », octobre 2026. Cluster d'une dizaine de mégawatts en France, comparaison du calcul avec les laboratoires chinois, API privée pour partenaires privilégiés, blocage des requêtes malveillantes en preview publique, propos d'un dirigeant de Mistral sur l'accès red-teaming. Lire l'article.
  7. Guillaume Lample (@GuillaumeLample), publication sur X du 6 octobre 2026. Version finale du modèle promise avant la fin du mois, avec les poids. Lire la publication.
  8. NVIDIA AI Infrastructure (@NVIDIAAIInfra), publication sur X du 6 octobre 2026. « Près de 4 000 » GPU Grace Blackwell pour l'entraînement de Mistral Large 4. Lire la publication.
  9. Mistral AI, « Mistral 3 », billet d'annonce, 2 décembre 2025. Mistral Large 3 : MoE de 675 milliards de paramètres, 41 milliards actifs, licence Apache 2.0, entraînement sur 3 000 GPU H200. Lire le billet.
  10. Orrick, « Orrick Advises Mistral in its €3B Series D at €21B Post-Money Valuation », communiqué, septembre 2026. Series D de 3 milliards d'euros, valorisation post-money de plus de 21 milliards d'euros, tour mené par Samsung Electronics, co-mené par le Scaleup Europe Fund (EQT) et PSG Equity, annoncé le 8 septembre 2026. Lire le communiqué.

Note de fiabilité : les scores de la colonne « annoncé par Mistral » proviennent des graphiques de l'éditeur et n'ont pas été reproduits par SFEIR ; ceux de Vals AI et le leaderboard DeepSWE sont des mesures tierces, relevées le 6 octobre 2026 et susceptibles de bouger. La licence des poids, le checkpoint final et toute évaluation indépendante en cyber restent à publier. Les caractérisations (« politique de refus », « souveraineté relative ») relèvent de l'analyse de SFEIR, non de propos de Mistral.

SFEIR AI Auteur

Articles similaires

Mistral × Microsoft : un accord souverain, une stratégie industrielle encore illisible

Mistral × Microsoft : un accord souverain, une stratégie industrielle encore illisible

Le 21 juillet 2026, Mistral et Microsoft dévoilent un accord de plusieurs milliards de dollars : compute Azure en Europe, GPU NVIDIA Vera Rubin, modèles jusqu'au mode déconnecté d'Azure Local. Une avancée réelle pour la souveraineté. Mais quelle est, au juste, la stratégie industrielle de Mistral ?

Frontier open-weights : ce que Kimi K3 change pour la souveraineté et la réversibilité d'une DSI

Frontier open-weights : ce que Kimi K3 change pour la souveraineté et la réversibilité d'une DSI

Un frontier open-weights change moins votre score de benchmark que votre rapport de force avec votre fournisseur. Kimi K3 rend la réversibilité possible pour de vrai : Design to Exit, self-host, BATNA. Ce que ça implique concrètement pour une direction technique, et ce que ça coûte.

GLM-5.3 : les failles du meilleur open source annoncent celles de votre code interne

GLM-5.3 : les failles du meilleur open source annoncent celles de votre code interne

Anthropic, le NIST et Z.ai ont évalué GLM-5.3 : des exploits de bout en bout proches de Mythos Preview, des refus qui tombent pour 4 400 $ de GPU. Si l'open source cède à ce modèle, votre code interne cédera plus vite. Ce qui marche pour trouver vos failles d'abord.

Pourquoi le sommet du leaderboard ne vous dit pas quel modèle choisir

Pourquoi le sommet du leaderboard ne vous dit pas quel modèle choisir

À défaut du prix, on arbitre sur les benchmarks. Mauvais réflexe : un classement mesure des capacités moyennes sur des tests standardisés, pas la performance sur votre legacy. La précision plafonne, la variance explose, et l'écart au sommet compte moins que le harnais. Que mesurer à la place.