Aikido Altar : un modèle de sécurité open-weight taillé pour l'air gap
Le 21 septembre 2026, la société gantoise Aikido Security a publié Altar (aussi appelé Altar-1), son premier modèle de sécurité open-weight12. Ses ingénieurs ont pris GLM-5.3 de Z.ai (753 milliards de paramètres, 1,51 To en pleine précision), l'ont quantifié puis élagué jusqu'à 328 Go et environ 504 milliards de paramètres, et le servent sur un nœud de quatre GPU H2003. Sur leur benchmark interne de 32 CVE, la version compressée retrouve 23 des 25 vulnérabilités que repérait le modèle d'origine. L'objectif : mener un pentest piloté par IA dans un réseau coupé d'internet, sans qu'une ligne de code ne quitte le site.
Un modèle pour une appliance de pentest
Aikido a construit Altar pour alimenter Aikido Machine, son appliance de pentest autonome : un serveur 4U équipé de GPU d'entreprise, installé dans le datacenter du client4. La machine fonctionne aussi dans des environnements isolés (air-gapped). Ses agents testent chaque application à chaque version, en continu, sans jamais appeler un service d'inférence externe.
Jusqu'ici, il manquait à cette appliance un cerveau de niveau frontier qui tienne dans la baie. Selim Decamps et Tiburce Gridello, qui signent l'annonce sur le blog d'Aikido, présentent Altar comme ce chaînon. Les poids sont publiés sur Hugging Face avec la fiche du modèle, la licence et la commande de service. Aikido indique qu'un nœud de quatre H200 avec une version récente de vLLM suffit, avec un contexte allant jusqu'à 128 000 tokens ; la fiche exige des GPU d'architecture Hopper (H100 ou H200)3. Le modèle cible la détection de vulnérabilités, la revue de code agentique, la proposition de correctifs et l'appui au pentest.
L'équipe a déployé Altar sur toute la flotte Aikido Machine dès la fin des évaluations. Peu après, d'après Aikido, le modèle a trouvé une vulnérabilité critique valide lors d'un pentest en production chez un client. L'éditeur étend l'approche à ses autres produits : Aikido Attack (pentest IA), Code Security Audit et Deep PR Review1.
Deux impasses pour les secteurs régulés
Une banque soumise à une obligation de résidence des données, un groupe hospitalier ou un industriel dont le réseau OT n'a aucune route vers internet font face au même dilemme. Les modèles frontier fermés tournent chez leur éditeur : les utiliser revient à envoyer hors du réseau le code source, la documentation d'architecture et les failles pas encore corrigées. Pour ces organisations, la réglementation tranche avant même la discussion.
Les modèles open-weight lèvent l'obstacle juridique, mais en dressent un autre, matériel. GLM-5.3, que les évaluations d'Aikido classent parmi les meilleurs en sécurité, pèse 1,51 To en BF16. Comme beaucoup de modèles récents, il repose sur une architecture mixture-of-experts : 256 petits réseaux spécialisés par couche, dont seuls huit s'activent pour chaque token, soit environ 40 milliards de paramètres actifs3. L'entreprise paie pourtant la mémoire des 256.
Les agents aggravent le problème. Un pentest agentique garde en mémoire GPU l'historique de tout ce qu'il a lu et fait, et cet historique grossit à chaque étape de l'investigation. Quand plusieurs investigations tournent en parallèle, poids du modèle et contextes des agents se disputent le même stock de mémoire. Chaque gigaoctet retiré du modèle revient aux agents : sur quatre H200, les 328 Go d'Altar laissent de la place au cache KV de plusieurs agents qui travaillent en parallèle.
Quantifier, puis élaguer les experts
L'équipe d'Aikido a gardé les poids de GLM-5.3 tels que Z.ai les a entraînés et leur a appliqué deux techniques de compression successives, sans aucun réentraînement.
La première, la quantification, stocke les poids sur moins de bits. Le point de départ était un checkpoint quantifié en AWQ5 publié par cyankiwi : les experts routés passent de 16 à 4 bits, tandis que l'attention, l'expert partagé, les couches denses et la tête de sortie restent en BF16 ; les activations restent en 16 bits (format W4A16)3. AWQ s'appuie sur l'activité du modèle face à des exemples pour limiter l'erreur introduite. Le modèle tombe ainsi à 488 Go.
La seconde, l'élagage d'experts, supprime des blocs entiers de poids. Retirer un expert est mécanique ; le travail consiste à choisir lequel. Une coupe mal ciblée peut laisser un modèle bon en code mais incapable de lire une documentation en français, donc incapable de comprendre les règles métier de l'application qu'il attaque. Aikido a retenu REAP (Router-weighted Expert Activation Pruning) de Cerebras6. La méthode estime la contribution de chaque expert en combinant le poids que lui donne le routeur et l'amplitude de sa sortie, plutôt que le seul nombre de fois où le routeur le sélectionne.
Pour calibrer ce choix, l'équipe a fait tourner son harnais de pentest sur ses benchmarks internes et a enregistré les traces : code lu, appels d'outils, réponses. Aikido précise qu'aucune donnée client n'a servi. Le jeu de calibration couvre aussi du code, des appels d'outils et du raisonnement, ainsi que des articles Wikipédia multilingues (français et néerlandais, entre autres) pour préserver la compréhension des langues. Les contributions sont examinées par groupe d'exemples, afin qu'une capacité rare ne disparaisse pas dans une moyenne : cybersécurité, code et langue se répartissent sur de nombreux experts, sans bloc « cyber » qu'on pourrait isoler1.
Résultat : Altar garde 168 des 256 experts routés de chaque couche et en retire 88 (34,4 %). Le routeur sélectionne toujours huit experts par token, dans un catalogue plus petit, et le nombre de paramètres actifs reste d'environ 40 milliards. L'étude de fidélité publiée par 0xSero, qui a mené la compression, montre que des modèles conservant le même nombre d'experts suivent plus ou moins bien le modèle de référence selon les experts gardés7. À nombre d'experts égal, le résultat dépend donc de ceux qu'on garde.
78 % de stockage en moins, 92 % de la couverture gardée
Aikido a mesuré les trois versions sur son benchmark CVE interne : 32 vulnérabilités connues réparties dans 30 dépôts, trois runs par cas, via son harnais AI Code Analysis1.
| Version | Poids stockés | Recall moyen par run | CVE trouvées au moins une fois (sur 32) |
|---|---|---|---|
| GLM-5.3, BF16 (16 bits) | 1 506,7 Go | 65,6 % | 25 |
| GLM-5.3, AWQ INT4 | 488,2 Go | 61,5 % | 23 |
| Altar, élagué W4A16 | 328,0 Go | 60,4 % | 23 |
L'élagage seul retire 160 Go au checkpoint déjà quantifié (32,8 %) pour environ un point de recall perdu, sans perdre une seule des 23 vulnérabilités couvertes. Face au modèle d'origine en pleine précision, Altar occupe 78,2 % de stockage en moins, garde 23 des 25 vulnérabilités trouvées (92 %) et perd 5,2 points de recall moyen.
Aikido distingue deux mesures : le recall moyen dit si le modèle trouve une faille de façon régulière, la couverture dit s'il l'a trouvée au moins une fois sur trois essais. Un run terminé sans trouvaille compte comme un échec.
Ce que les chiffres ne disent pas
Un benchmark étroit. Aikido le reconnaît lui-même : le test mesure la redécouverte ciblée de CVE connues, dans un pipeline où d'autres modèles gèrent les étapes voisines. Il ne mesure ni la découverte à l'aveugle sur une base de code entière, ni l'exécution d'exploits pour valider une faille, ni la proposition de correctifs. RuntimeWire relève l'écart entre le slogan « frontier-grade defensive AI » et ce que les données établissent : une compression qui dégrade peu les performances dans le harnais d'Aikido8. Tant qu'aucune équipe externe n'a testé Altar sur ses propres workloads, la seule preuve de terrain reste la faille critique annoncée par Aikido.
Une licence héritée, plus ouverte qu'on ne le lit. La fiche Hugging Face déclare une licence « other » : Altar hérite de la licence de GLM-5.33. Une partie de la couverture tierce en a conclu que la redistribution et la revente étaient limitées. Le texte de Z.ai dit l'inverse : il reprend la licence MIT (usage, modification, distribution, sous-licence et vente accordés) et n'y ajoute qu'une condition. Un exploitant de « Model as a Service » dont le chiffre d'affaires dépasse 10 milliards de dollars sur douze mois doit passer une revue de sécurité de Z.ai avant tout usage commercial ; la licence exclut de cette catégorie les produits qui embarquent le modèle dans une fonction ou un harnais9. Pour les entreprises sous ce seuil, la contrainte se résume à conserver la mention de copyright. Le service juridique doit tout de même lire ce texte, qui n'est pas une licence approuvée par l'OSI.
Une souveraineté d'exécution. Altar vient d'une entreprise belge, mais ses poids descendent d'un modèle de Z.ai, entreprise chinoise inscrite sur l'Entity List du département du Commerce américain depuis janvier 2025. La souveraineté que vend Aikido porte sur le lieu d'exécution : le code et les failles restent dans le réseau du client, et les poids peuvent être inspectés et servis hors ligne. Une partie des RSSI européens posera aussi la question de la provenance des poids, et elle mérite une réponse explicite dans chaque dossier d'homologation.
Un serveur que peu d'équipes ont. Altar ramène un modèle frontier à la taille d'un nœud de quatre H200, mais ce nœud reste un investissement matériel de grand compte, hors hébergement et énergie. Aikido le contourne en livrant le serveur avec le harnais, sous la forme d'Aikido Machine4.
Le double usage. Publier les poids d'un modèle orienté pentest relance la question de l'usage offensif. Les capacités d'Altar viennent de GLM-5.3, déjà public, dont les capacités d'exploitation ont été mesurées par Anthropic et le NIST : l'élagage retire des experts et n'apprend rien de nouveau au modèle. Le risque change de nature quand Aikido passera au fine-tuning sur ses propres workflows, étape que l'entreprise annonce.
Ce qu'un DSI ou un RSSI peut en tirer
Altar intéresse d'abord les clients d'Aikido. La méthode se transpose à toute organisation qui veut faire tourner des agents sur un modèle ouvert dans son propre périmètre.
- Les traces des agents deviennent une matière première. Aikido a choisi ses experts à partir des journaux de son propre harnais. Une entreprise qui conserve les traces de ses agents (code lu, outils appelés, réponses) dispose du jeu de calibration pour élaguer un modèle ouvert sur ses workloads réels. Elle doit décider dès maintenant de les garder, et de les nettoyer de toute donnée sensible.
- La mémoire GPU se dimensionne avec le contexte. Sur une infrastructure locale, les poids du modèle et l'historique des agents partagent la même mémoire. Un calcul de capacité qui ne compte que la taille du modèle sous-estime le besoin dès que plusieurs investigations tournent en parallèle.
- Le recall et la couverture se mesurent séparément. Le protocole d'Aikido (failles connues, trois runs, recall moyen d'un côté, couverture de l'autre) se reproduit à partir des incidents passés de l'entreprise. Il sert à comparer un modèle compressé à son parent avant de le mettre en production.
- La provenance et la licence entrent dans l'achat. Pour un modèle ouvert, le dossier d'achat doit nommer le modèle parent, son laboratoire, la licence héritée et les étapes de transformation appliquées.
Aikido Labs annonce la suite : des formats sous 4 bits comme EXL3 pour garder plus d'experts à taille égale, de l'optimisation de service sur H200, puis du fine-tuning sur ses workflows de sécurité et un pipeline d'auto-apprentissage guidé par ses benchmarks1.
Sources
- Selim Decamps et Tiburce Gridello (Aikido Security), « Introducing Aikido Altar: the model that makes sovereign security intelligence possible », 21 septembre 2026. Annonce d'Altar : compression de GLM-5.3 (AWQ puis REAP), 168 experts gardés sur 256, benchmark interne de 32 CVE dans 30 dépôts (recall et couverture), déploiement sur Aikido Machine, absence de données client, faille critique trouvée en production, feuille de route (EXL3, fine-tuning). Chiffres mesurés par l'éditeur. Lire le billet · Benchmarks Aikido du 21 août 2026.
- Berry Zwets, « Belgian Aikido introduces Altar, a local open-weight security model », Techzine, 22 septembre 2026. Lire l'article.
- Aikido Security, fiche du modèle Altar-1 sur Hugging Face, consultée le 1er octobre 2026. 504 milliards de paramètres, environ 40 milliards actifs, 328 Go en INT4 W4A16 (experts routés en 4 bits, attention et expert partagé en BF16), checkpoint de départ cyankiwi/GLM-5.3-AWQ-INT4, service sur 4 × H200 avec vLLM, contexte de 131 072 tokens, GPU Hopper requis, licence héritée de GLM-5.3. Voir la fiche.
- Aikido Security, page produit Aikido Machine, consultée le 1er octobre 2026. Serveur 4U à GPU d'entreprise installé dans le datacenter du client, fonctionnement sans connexion internet, pentest continu par agents autonomes. Voir la page.
- Ji Lin et al., « AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration », arXiv 2306.00978. Lire l'article.
- Cerebras, « REAP: Router-weighted Expert Activation Pruning », arXiv 2510.13999, octobre 2025. Lire l'article.
- 0xSero, étude de fidélité GLM-5.3 REAP et boîte à outils d'élagage, Hugging Face et GitHub. Étude de fidélité · Boîte à outils.
- Ryan Merket, « Aikido ships Altar-1, a 328 GB GLM-5.3 prune for on-prem pentesting », RuntimeWire, 21 septembre 2026. Lire l'article.
- Z.ai, texte de la licence GLM-5.3 (fichier LICENSE du dépôt zai-org/GLM-5.3), consulté le 1er octobre 2026. Droits de la licence MIT, condition de revue de sécurité pour les exploitants de « Model as a Service » au-delà de 10 milliards de dollars de chiffre d'affaires annuel. Lire la licence.
Articles similaires
GLM-5.3 : les failles du meilleur open source annoncent celles de votre code interne
Anthropic, le NIST et Z.ai ont évalué GLM-5.3 : des exploits de bout en bout proches de Mythos Preview, des refus qui tombent pour 4 400 $ de GPU. Si l'open source cède à ce modèle, votre code interne cédera plus vite. Ce qui marche pour trouver vos failles d'abord.
GLM 5.3 = GLM 5.2 + une pincée de cyber
Z.ai a annoncé GLM-5.3 le 14 août 2026 sans réentraîner son modèle de base : tous les gains viennent du post-training. Le laboratoire chinois retarde de deux semaines la publication des poids à cause d'une capacité cyber qu'il dit ne pas avoir planifiée. Lecture SFEIR.
Gemini 4 Argon : Google reprend la tête des benchmarks, mais garde le modèle pour les défenseurs cyber
Google présente Gemini 4 Argon le 30 septembre 2026 : 1 million de tokens en sortie, tête sur 13 benchmarks sur 18 (mesures Google), tarif d'appel à 2 $ / 10 $. Seuls le gouvernement américain et les défenseurs cyber du programme Fairwind y ont accès. Ce qu'une DSI peut en faire dès maintenant.
Frontier open-weights : ce que Kimi K3 change pour la souveraineté et la réversibilité d'une DSI
Un frontier open-weights change moins votre score de benchmark que votre rapport de force avec votre fournisseur. Kimi K3 rend la réversibilité possible pour de vrai : Design to Exit, self-host, BATNA. Ce que ça implique concrètement pour une direction technique, et ce que ça coûte.