SFEIR

GLM 5.3 = GLM 5.2 + une pincée de cyber

GLM 5.3 = GLM 5.2 + une pincée de cyber

Z.ai a publié GLM-5.3 le 14 août 2026 sous un titre qui annonce déjà le problème : « Frontier Coding with Emergent Cyber Capabilities »1. Le modèle de base n'a pas été réentraîné, c'est celui de GLM-5.2 à l'identique. Et le laboratoire de Pékin garde ses propres poids sous clé pendant environ deux semaines, le temps d'évaluer une capacité de sécurité offensive qu'il dit n'avoir ni visée ni anticipée.

Un laboratoire chinois qui retarde une publication de poids en invoquant la sûreté, cela ne s'était encore jamais produit dans la lignée GLM. Ces deux décisions en disent plus long sur l'économie des modèles en 2026 que la table de benchmarks qui les accompagne.

« Scaling post-training is all we did »

La phrase ouvre le billet de Z.ai1. GLM-5.3 réutilise le modèle de base de GLM-5.2 : architecture Mixture-of-Experts, 743 milliards de paramètres au total dont environ 40 activés par token, contexte d'un million de tokens, 128 000 tokens en sortie, texte uniquement. Rien de neuf en pré-entraînement, un mois de calcul supplémentaire dépensé sur l'après.

CaractéristiqueGLM-5.3
ArchitectureMixture-of-Experts, base GLM-5.2 inchangée
Paramètres743 milliards au total, ~40 milliards actifs par token
Contexte1 million de tokens, 128 000 en sortie
ModalitésTexte uniquement, pas de vision
RaisonnementToujours actif, trois niveaux (low, high, max), désactivation impossible
Self-hosting~377 Go en 4-bit AWQ (4× H200 ou 5× A100 80 Go), ~754 Go en FP8

Spécifications publiées par Z.ai le 14 août 202612. SiliconANGLE écrit 753 milliards de paramètres là où le compte officiel et la majorité des reprises écrivent 7434 : l'écart n'est pas tranché.

Ce que Z.ai a scalé, ce sont les environnements d'entraînement. Des agents de recherche convertissent des situations de travail réelles en tâches exécutables à long horizon ; un agent juge vérifie que chaque tâche est résoluble ; des vérificateurs sont synthétisés sans accès à la solution de référence, et les trajectoires du solveur servent à fermer les raccourcis de récompense1. Certaines tâches représentent plusieurs jours de travail d'un ingénieur senior. L'exemple donné par le laboratoire : un agent lâché dans l'environnement d'un ingénieur infrastructure ML, avec ses clusters, ses docs internes, sa base de code et ses résultats d'expériences, chargé de diagnostiquer un goulet et de livrer une accélération mesurable de bout en bout.

Construire ces environnements, c'est écrire le harnais et le contexte d'un métier, puis les rendre exécutables et vérifiables. Z.ai a industrialisé, pour entraîner un modèle, le travail que nous demandons aux équipes de faire pour l'exploiter : décrire la tâche, poser les critères de vérification, mesurer le résultat. Ce détail engage davantage une DSI que le nombre de paramètres.

Les chiffres de codage, et ce qu'ils valent

Aucune de ces mesures n'a été reproduite par un tiers à la date de publication. Elles sortent du harnais interne de Z.ai, elles indiquent une direction, elles ne tranchent pas un classement. Nos réserves habituelles sur les benchmarks frontier s'appliquent mot pour mot. Le point de comparaison mesuré, lui, date du 22 juin : Artificial Analysis avait classé GLM-5.2 premier modèle à poids ouverts et troisième tous modèles confondus sur GDPval-AA, à 1 524 Elo8.

BenchmarkGLM-5.2GLM-5.3Meilleur modèle cité
Terminal-Bench 3.04,628,3GPT-5.6 Sol : 34,6
DeepSWE v1.146,266,9Claude Fable 5 : 69,7
Agents' Last Exam (CLI)23,828,5non communiqué
Terminal-Bench 2.1non communiqué88,2GPT-5.6 Sol : 88,8
GDPval-AA v2 (44 métiers)non communiqué1 769Claude Fable 5 : 1 743

Scores publiés par Z.ai le 14 août 20261. Mesures constructeur, harnais interne, aucune exécution tierce.

GLM-5.3 prend la tête des modèles ouverts sur presque tous les bancs cités, et sur Terminal-Bench 2.1 les quatre premiers (Sol 88,8, Kimi K3 88,3, GLM-5.3 88,2, Fable 5 88,0) tiennent dans huit dixièmes de point, soit le bruit de mesure. Sur les bancs les plus durs, l'écart avec le sommet fermé reste visible : Terminal-Bench 3.0 à 28,3 contre 34,6, le Code Bench interne à 31,4 % contre 39,5 % pour Fable 5 à effort maximal.

Sur ce même Code Bench, GLM-5.3 atteint 31,4 % en consommant environ 50 000 tokens de sortie par tâche, quand Claude Opus 4.8 obtient 29,5 % pour environ 120 0001. Le rapport résultat sur tokens dépensés compte davantage que le rang, et c'est précisément ce que mesure une approche par coût par résultat.

La capacité cyber que Z.ai dit ne pas avoir voulue

Le laboratoire raconte avoir ajouté des données de découverte de vulnérabilités et des environnements de sécurité autorisés en attendant un gain modeste. « As we scaled post-training, cyber capability developed faster than we expected », écrit-il1 : le modèle s'est mis à raisonner sur plusieurs étapes d'exploitation et à former des plans de chaînes complètes.

Benchmark cyberGLM-5.2GLM-5.3Claude Mythos 5GPT-5.6 Sol
CyberGym (découverte de vulnérabilités)77,2 %84,5 %83,8 %83,6 %
ExploitBench (exploitation)24,4 %54,4 %78 %76,5 %
ExploitGym (tâches en 2 h / 6 h)29 / 39105 / 130181 / 247216 / 293

Scores publiés par Z.ai1. CyberGym a été évalué dans Claude Code 2.1.207, effort maximal, sans outils web, température 1.0, Pass@1 en passe unique sur 1 507 tâches.

Le premier chiffre a fait les titres, y compris chez Reuters3 : GLM-5.3 passe devant Claude Mythos 5, la variante d'Anthropic à accès restreint, sur la découverte de vulnérabilités. Sept dixièmes de point d'avance, sur une mesure maison, cela reste une égalité statistique plutôt qu'un dépassement.

Sur l'exploitation, GLM-5.3 double son score et reste à plus de vingt points de Mythos 5. L'avance porte sur la moitié défensive du métier, trouver les failles ; l'exploitation reste l'affaire des modèles fermés. Z.ai revendique d'ailleurs cette dissymétrie et l'assortit d'une formule : « An open world cannot have only open attack surfaces. It must also have an open shield. »

Le résultat de terrain pèse plus lourd que les bancs. En travaillant avec des équipes de sécurité chinoises depuis GLM-5.2, le laboratoire déclare 2 436 vulnérabilités remontées dans 269 projets open source après revue d'experts et déduplication, dont 1 097 critiques ou de sévérité haute : noyaux système, moteurs de navigateur, protocoles réseau. Son registre public de divulgation en affiche 53 avec un CVE attribué et 2 383 encore sous embargo2. Un use-after-free dans le noyau Linux, une faille mémoire WebKit touchant Safari, un bug de validation dans FreeBSD figurent parmi les exemples cités. La plus ancienne faille remonterait à 1981.

S'y ajoute un cas non confirmé. Lou, developer advocate chez Z.ai, a écrit avoir soumis au modèle une tâche de rétro-ingénierie complexe qui a débouché sur une vulnérabilité « potentiellement sérieuse » dans Cursor, divulguée en privé5. Cursor n'a rien confirmé publiquement, la nature technique et la sévérité restent inconnues. À traiter comme une déclaration de vendeur, pas comme un fait établi.

Retenir ses propres poids : le précédent

GLM-5.3 est disponible depuis le 14 août via le GLM Coding Plan (à partir de 18 $ par mois) et l'agent maison ZCode. L'API générale et les poids arrivent par étapes : partenaires sécurité d'abord en environnement contrôlé, publication sur Hugging Face visée autour du 28 août 2026, licence MIT attendue mais non publiée au lancement1. Les fonctions cyber les plus sensibles passeront par un programme d'accès vérifié. Aucun tarif API n'accompagne le modèle : la grille officielle s'arrête à GLM-5.2, à 1,40 $ en entrée et 4,40 $ en sortie par million de tokens, et rien ne dit qu'elle sera reconduite.

Anthropic gère Mythos 5 sous accès restreint depuis juin, OpenAI et Anthropic ont vu leurs modèles bloqués à l'export en juin 2026. La nouveauté tient à l'auteur du geste. Un laboratoire chinois dont le modèle économique repose sur la publication des poids accepte de la retarder, et il invoque une capacité offensive émergente plutôt qu'une pression réglementaire ou une politique de plateforme.

Deux semaines de retard ne protègent personne durablement : les poids sortiront, avec un durcissement visant à réduire la capacité offensive sans casser la valeur défensive, et la suite dépendra entièrement de la qualité de ce durcissement. Nathan Lambert lit d'ailleurs GLM-5.3 comme « likely a narrower model than Claude Fable or GPT Sol », un laboratoire qui soigne ses benchmarks publics parce qu'ils bougent son cours de bourse6. Le geste n'en fixe pas moins un précédent que les prochaines publications ouvertes devront assumer ou contredire.

Une donnée circule à ce sujet et demande vérification : les instituts de sûreté britannique et américain auraient estimé que les poids ouverts de GLM-5.2 fournissaient déjà une capacité d'attaque autonome proche de la frontière pour une cinquantaine de dollars par simulation complète6. Aucun rapport public ne l'établit à ce jour. Si ce chiffre se confirme, la fenêtre de deux semaines change de sens : elle ne retarde pas l'accès à une capacité, elle documente sa banalisation.

Ce que ça change pour une DSI

Rien à décider cette semaine. Sans poids publiés, sans API générale et sans tarif, GLM-5.3 ne se compare à rien dans un budget. La date à surveiller est fin août, et deux conditions rendent le sujet instruisible : la publication effective des poids sous licence MIT, et une première mesure tierce (Artificial Analysis, LMArena, Epoch AI) qui confirme ou dégonfle la table constructeur.

Le lead cyber se traite comme un outil défensif à valider chez vous. Sur des dépôts dont vous connaissez déjà les failles, comptez ce que le modèle trouve, ce qu'il invente et ce que coûte le tri. Un score de 84,5 % sur 1 507 tâches publiques ne dit rien de votre legacy. Les vingt points d'écart sur ExploitBench interdisent par ailleurs de vendre ce modèle comme un outil de red team de pointe.

La gouvernance, elle, se pose avant les benchmarks. Z.ai est une entreprise chinoise cotée à Hong Kong depuis janvier 2026, inscrite sur l'Entity List du département du Commerce américain depuis le 15 janvier 20257. Passer par son API hébergée engage des considérations réglementaires que la grille de souveraineté agentique traite en amont du choix technique. Le self-hosting des poids répond au risque de coupure d'accès, au prix de 377 Go de mémoire en 4-bit, soit quatre H200 et l'équipe qui va avec.

Questions fréquentes

Qu'est-ce qui change entre GLM-5.2 et GLM-5.3 ?
Le modèle de base est identique : même architecture MoE à 743 milliards de paramètres, même contexte d'un million de tokens, toujours texte uniquement. Z.ai attribue l'intégralité des gains au scaling du post-training, avec plus d'environnements d'entraînement, des tâches plus variées et un mois de calcul supplémentaire.

Les poids de GLM-5.3 sont-ils ouverts ?
Pas au lancement. Z.ai vise une publication sur Hugging Face autour du 28 août 2026, après évaluation de sûreté et durcissement, sous une licence MIT attendue mais non publiée. C'est un engagement de feuille de route, pas un fait acquis. Le modèle est accessible dès à présent via le GLM Coding Plan et l'agent ZCode.

GLM-5.3 est-il meilleur que Claude Fable 5 ou GPT-5.6 Sol en codage ?
Non, sur les bancs publiés par Z.ai elle-même. Fable 5 le devance sur le Code Bench interne (39,5 % contre 31,4 %) et sur DeepSWE, GPT-5.6 Sol sur Terminal-Bench 3.0 et DeepSWE. GLM-5.3 revendique la première place parmi les modèles ouverts et une meilleure efficience en tokens de sortie à résultat comparable.

Le modèle est-il vraiment devant Mythos 5 en cybersécurité ?
Sur un seul banc, CyberGym, avec 84,5 % contre 83,8 %, écart qui tient dans le bruit et mesure maison. Sur l'exploitation offensive, Mythos 5 le devance nettement (78 % contre 54,4 % sur ExploitBench). L'avance revendiquée porte sur la découverte de failles, pas sur leur exploitation.

Le point de vue SFEIR

Une génération entière de progrès obtenue sans toucher au modèle de base, cela confirme ce que la carte des modèles répète depuis des mois : la couche des poids se banalise, et la valeur migre vers ce qui les entoure. Chez Z.ai, cet entourage a pris la forme d'environnements de travail exécutables et vérifiables. Dans une DSI, le même travail s'appelle Context Engineering et se mesure au taux de tâches qu'un agent termine sans reprise humaine.

L'autre enseignement est moins confortable. La course open-weights chinoise ne se joue plus seulement sur les prix et la cadence, elle touche désormais des capacités que les laboratoires eux-mêmes hésitent à distribuer. Un modèle ouvert reste la meilleure garantie de réversibilité qu'une DSI puisse obtenir, et cette garantie s'accompagne désormais d'un calendrier de sûreté dicté par l'éditeur. Kimi K3 posait la question de ce que vous acceptez de faire dépendre d'un fournisseur ; avec GLM-5.3, la date d'ouverture des poids devient elle aussi une dépendance à instruire.


Sources

  1. Z.ai, « GLM-5.3: Frontier Coding with Emergent Cyber Capabilities », 14 août 2026 — annonce officielle : réutilisation du modèle de base GLM-5.2, méthode de post-training (environnements de travail exécutables, agent juge, vérificateurs synthétisés), scores Z.ai Code Bench, Terminal-Bench 2.1 et 3.0, DeepSWE v1.1, Agents' Last Exam CLI, GDPval-AA v2, CyberGym, ExploitBench, ExploitGym, calendrier de publication échelonnée et disponibilité. Mesures constructeur, harnais interne, aucune vérification tierce à la date de cet article. z.ai/blog/glm-5.3
  2. Documentation développeur Z.ai et registre public de divulgation « Z.ai Security Disclosure Ledger » — spécifications (contexte, sortie maximale, niveaux de raisonnement, empreinte mémoire pour le self-hosting) et décompte des vulnérabilités divulguées (53 avec CVE, 2 383 sous embargo). Chiffres déclarés par l'éditeur. docs.z.ai · cvd.z.ai
  3. Reuters, « China's Z.ai says new model nears Anthropic's Mythos 5 in cyber-defence tests », 14 août 2026 — couverture du lancement et du positionnement cyber. Source secondaire reprenant les chiffres de l'éditeur. reuters.com
  4. Couverture presse du lancement, 14 août 2026 — SiliconANGLE (qui écrit 753 milliards de paramètres là où les autres sources écrivent 743), VentureBeat (vulnérabilité Cursor, sollicitation de Cursor restée sans réponse), The Decoder, Decrypt, MarkTechPost, The Stack. Sources secondaires, divergences de chiffres non résolues. siliconangle.com · venturebeat.com
  5. Lou (@louszbd), developer advocate chez Z.ai, publication sur X du 14 août 2026 — tâche de rétro-ingénierie ayant conduit à une vulnérabilité « potentiellement sérieuse » dans Cursor, divulguée en privé, détails annoncés « once users are protected ». Déclaration non confirmée par Cursor. x.com/louszbd
  6. Nathan Lambert, « GLM-5.3: How Chinese labs keep stride with the frontier », Interconnects, août 2026 — analyse du post-training comme moteur des gains, lecture « narrower model », et mention d'évaluations des instituts de sûreté britannique et américain sur la capacité d'attaque autonome permise par les poids ouverts de GLM-5.2. Le chiffre de coût par simulation n'est établi par aucun rapport public consulté : à traiter comme une information rapportée. interconnects.ai
  7. Bureau of Industry and Security, département du Commerce des États-Unis — ajout de Zhipu AI à l'Entity List le 15 janvier 2025, parmi 25 entités chinoises et 2 singapouriennes, au motif de contribution à la modernisation militaire chinoise par le développement et l'intégration de recherches avancées en intelligence artificielle. Repris par le South China Morning Post, 16 janvier 2025. scmp.com
  8. Fiches de veille theKB consultées pour la mise en perspective — « GLM-5.2 leads open weights models and sits at #3 overall on GDPval-AA » (Artificial Analysis, 22 juin 2026), « The state of open source AI » (Mozilla, juillet 2026), « Our evaluation of OpenAI's GPT-5.5 cyber capabilities » (AI Safety Institute UK, 30 avril 2026), « Disrupting the first reported AI-orchestrated cyber espionage campaign » (Anthropic, 13 novembre 2025). thekb.eu
SFEIR AI Auteur

Articles similaires

GLM-5.2 : le modèle open-weights de Z.ai qui défie les modèles fermés pour agentique coding !

GLM-5.2 : le modèle open-weights de Z.ai qui défie les modèles fermés pour agentique coding !

Annoncé mi-juin 2026, GLM-5.2 de Z.ai (ex-Zhipu AI) est un modèle open-weights — MoE, 744 milliards de paramètres, contexte 1M, licence MIT — optimisé pour le codage agentique long-horizon. Specs, benchmarks constructeur, prix, et les réactions d'experts comme Jeremy Howard ou Mat Velloso.

Comment choisir son modèle LLM en 2026 : la carte, pas le classement

Comment choisir son modèle LLM en 2026 : la carte, pas le classement

Cinq laboratoires, des capacités qui convergent, des prix qui s'effondrent : en 2026, « quel est le meilleur modèle ? » devient la mauvaise question. Voici le cadre de décision qui remplace le classement : router par tâche, mesurer le coût par résultat, rester réversible, investir dans le système.

Kimi K3 de Moonshot AI : quand le frontier open-weights rattrape le propriétaire

Kimi K3 de Moonshot AI : quand le frontier open-weights rattrape le propriétaire

Le 16 juillet 2026, Moonshot AI a lancé Kimi K3 : un modèle open-weights de classe frontier, 2,8 trillions de paramètres et un million de tokens de contexte annoncés, poids ouverts avant le 27 juillet. Lecture d'ingénieurs SFEIR de ce que l'open-weights chinois change vraiment pour une DSI.

La course open-weights chinoise : ce que Kimi K3 dit du nouveau marché des modèles

La course open-weights chinoise : ce que Kimi K3 dit du nouveau marché des modèles

Kimi K3 n'est pas un événement isolé : c'est un coup dans une partie qui se joue à plusieurs : Moonshot, DeepSeek, Z.ai, Qwen. Des labs chinois qui publient leurs poids, cassent les prix et itèrent tous les deux mois. Ce que cette course « commodity » change pour une DSI.