Artificial Analysis
Évaluateur indépendant de modèles IA : Intelligence Index, Coding Agent Index, prix et vitesse mesurés par ses propres runs, sans chiffres d'éditeur.
SFEIR AI · Mis à jour le 7 septembre 2026
Un évaluateur tiers qui refait toutes les mesures
Artificial Analysis est une société de San Francisco fondée par Micah Hill-Smith (directeur général) et George Cameron (directeur produit), avec un bureau à Melbourne. Le projet démarre en 2023 comme un outil interne, pendant que Hill-Smith construit un assistant juridique à base de LLM, et ouvre au public en janvier 2024. Les investisseurs cités sur la page « about » comptent Nat Friedman, Daniel Gross, Andrew Ng, Adam D'Angelo, Clem Delangue, Guillermo Rauch, Shawn Wang et Charlie Songhurst. La société ne publie ni son effectif ni son montant levé ; les chiffres qui circulent viennent d'annuaires et ne sont pas repris ici.
Le site revendique plus de 500 modèles évalués, plus de 100 fournisseurs d'inférence et plus de 1 000 endpoints testés, chiffres auto-déclarés par l'éditeur. Le périmètre couvre les modèles de langage, d'image, de vidéo et de parole, les clouds qui les servent et les accélérateurs (GPU Nvidia et AMD, TPU Google).
Le modèle économique repose sur un abonnement entreprise et sur des benchmarks privés à la demande. Les fondateurs affirment que personne ne paie pour figurer sur le site et appliquent une politique de client mystère : les comptes utilisés pour les tests sont créés hors de leur domaine, afin qu'un fournisseur ne puisse pas servir un modèle différent à l'évaluateur. Les chiffres publiés par les laboratoires sont écartés, au motif que chaque éditeur formule ses prompts à sa manière et choisit ses exemples.
Intelligence Index et Coding Agent Index : ce qu'ils agrègent
L'Intelligence Index v4.2, publié le 4 septembre 2026, combine dix évaluations en un score unique, réparties en quatre familles : agents (30 %, avec AA-Briefcase, GDPval-AA v2 et τ³-Banking), code (20 %, avec Terminal-Bench v2.1 et SciCode), capacités générales (30 %, avec AA-Omniscience, GDP.pdf et AA-LCR v1.1) et raisonnement scientifique (20 %, avec Humanity's Last Exam et CritPt). Cette version retire GPQA Diamond, jugé saturé, et porte à 40 % la part des jeux de test privés, le double de la v4.1. Au relevé du 7 septembre 2026, la page de l'index place en tête Claude Fable 5.1 à 57 (effort maximal) et 56 (effort xhigh), puis GPT-6 Astra (max) à 55, troisième sur 202 modèles classés ; Claude Opus 5 (max) obtient 54 et se classe sixième. La v4.2 arrive huit mois après le lancement de la v4 en janvier 2026 et ajoute GDP.pdf, une évaluation de raisonnement sur 4 592 pages de documents.
Le Coding Agent Index, lancé en mai 2026 avec SWE-Bench-Pro-Hard-AA et Terminal-Bench v2, a changé de composition à chaque version : DeepSWE remplace SWE-Bench-Pro-Hard-AA en v1.1 (juin 2026), la notation de SWE-Atlas-QnA devient binaire en v1.2 puis s'aligne sur la méthode Task Resolve Rate de Scale AI en v1.3, et la v1.4 (août 2026) passe à Terminal-Bench v2.1 et ajoute une détection du contournement de récompense. Cette v1.4 évalue un couple modèle plus harnais sur 326 tâches : 113 tâches d'ingénierie logicielle longues (DeepSWE), 89 tâches de terminal vérifiées par suites de tests (Terminal-Bench v2.1) et 124 questions sur dépôt de code (SWE-Atlas-QnA). Chaque ligne du classement décrit une variante d'agent, pas seulement un modèle, ce qui rejoint la logique du harness engineering. Le coût par tâche est calculé au tarif API par token du fournisseur, en tenant compte des tokens en cache.
Les mesures de performance suivent le même principe : le temps jusqu'au premier token et le débit de sortie (tokens par seconde après le premier) sont relevés sur les API réelles des fournisseurs, pour représenter ce qu'un client observe et non le maximum théorique d'un matériel. Le prix affiché d'un modèle est un prix mélangé selon un ratio 7:2:1 entre tokens lus en cache, tokens d'entrée et tokens de sortie.
Les limites d'un indice agrégé
Un score d'index change avec la version de l'index. Le 3 septembre 2026, l'analyse de GPT-6 Astra sous la v4.1.1 donnait 61 à Astra, 61 à GPT-5.6 Sol et 66 à Claude Fable 5.1 ; le lendemain, la v4.2 ramenait Astra à 55 et Fable 5.1 à 57. Les écarts entre modèles se sont resserrés et le rang d'Astra a monté, sans qu'aucun modèle ait changé. Un chiffre d'Intelligence Index se cite donc avec sa version et sa date, jamais seul. Il se cite aussi avec sa variante : le même modèle apparaît plusieurs fois selon l'effort de raisonnement, et « troisième » n'a pas le même sens selon qu'on compte les lignes du classement ou les modèles distincts.
Artificial Analysis a présenté la v4.2 comme une mise à jour intermédiaire, motivée par la vitesse du front et anticipant sa v5. The Decoder rapporte le 5 septembre 2026 que cette révision suit un désaccord public : plusieurs évaluations, dont celles d'OpenAI, plaçaient Astra nettement devant, là où la v4.1.1 le montrait au niveau de son prédécesseur. L'éditeur explique avoir retenu ses mises à jour pour garder des scores stables pendant les lancements majeurs.
Trois autres réserves tiennent à la construction de l'indice. Une part croissante des évaluations appartient à Artificial Analysis et reste privée (AA-Briefcase, AA-Omniscience, AA-LCR, solutions de CritPt), ce qui protège du surapprentissage mais empêche toute reproduction externe. La suite est principalement textuelle et en anglais, le multilingue et le multimodal étant suivis à part. Les runs varient par réglage d'effort de raisonnement et par harnais, si bien qu'un même modèle occupe plusieurs lignes ; l'intervalle de confiance annoncé sur l'indice est inférieur à ±1 %, mais une évaluation individuelle peut dépasser cette marge. Ces mesures restent indépendantes des éditeurs, et c'est leur valeur ; elles ne remplacent pas un test sur le workload réel.
Questions fréquentes
Que mesure l'Artificial Analysis Intelligence Index ?
Un score unique agrégeant dix évaluations (v4.2 du 4 septembre 2026) en quatre familles : agents 30 %, code 20 %, capacités générales 30 %, raisonnement scientifique 20 %. Toutes les évaluations sont exécutées par Artificial Analysis, sans reprise des chiffres des éditeurs. Le score dépend de la version de l'index : Astra passe de 61 en v4.1.1 à 55 en v4.2 en un jour. Au 7 septembre 2026, Fable 5.1 mène à 57, Astra (max) à 55, Opus 5 (max) à 54.
Artificial Analysis est-il indépendant des laboratoires d'IA ?
Les fondateurs affirment que personne ne paie pour figurer sur le site, que les revenus viennent d'abonnements entreprise et de benchmarks privés, et qu'une politique de client mystère empêche un fournisseur d'identifier les comptes de test. Les chiffres auto-déclarés des laboratoires sont écartés. Une part croissante des évaluations reste privée, ce qui protège du surapprentissage et empêche toute reproduction externe.
Que contient le Coding Agent Index ?
326 tâches réparties entre DeepSWE (113 tâches d'ingénierie logicielle), Terminal-Bench v2.1 (89 tâches de terminal) et SWE-Atlas-QnA (124 questions sur dépôt). Chaque ligne décrit un couple modèle plus harnais, avec un coût par tâche au tarif API. Lancé en mai 2026, en version 1.4 depuis août 2026, ses scores changent de version en version.
Sources
- Artificial Analysis — page « About » : fondateurs, siège, investisseurs, périmètre (chiffres auto-déclarés) · 2026-09-06
- Artificial Analysis — page de l'Intelligence Index v4.2 au relevé du 7 septembre 2026 : Fable 5.1 à 57 et 56, GPT-6 Astra (max) à 55 · 2026-09-07
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) scores the highest on Artificial Analysis Intelligence Index with a score of 57
- Artificial Analysis — fiche Claude Opus 5 : score 54 sur l'Intelligence Index v4.2, sixième sur 202 modèles au 7 septembre 2026 · 2026-09-07
Claude Opus 5 (Adaptive Reasoning, Max Effort) scores 54 on the Artificial Analysis Intelligence Index
- Artificial Analysis — méthodologie de l'Intelligence Index v4.2 : dix évaluations, pondérations, conditions d'exécution, intervalle de confiance · 2026-09-06
All evaluations are conducted independently by Artificial Analysis.
- Artificial Analysis — Announcing Intelligence Index v4.2 : ajouts, retrait de GPQA Diamond, 40 % de jeux privés · 2026-09-04
40% of our Index weighting is now private, held-out test sets - double the figure from v4.1.
- Artificial Analysis — Benchmarking GPT-6 Astra : scores v4.1.1 (Astra 61, Sol 61, Fable 5.1 66), Coding Agent Index, prix · 2026-09-03
- Artificial Analysis — méthodologie du Coding Agent Index : composantes, 326 tâches, coût par tâche, versions · 2026-09-06
- Latent Space — entretien avec George Cameron et Micah Hill-Smith : origine du projet, modèle économique, politique de client mystère · 2026-01-08
No one pays to be on the website.
- The Decoder — Artificial Analysis overhauls its Intelligence Index after GPT-6 Astra scoring drew skepticism · 2026-09-05
Articles liés
GPT-6 Astra : un vrai saut sur les agents, un récit d'AGI taillé pour l'entrée en Bourse
GPT-6 Astra (3 septembre 2026) : gains réels en usage d'ordinateur et en codage, prix aligné sur Fable 5.1, score ARC-AGI-3 qui passe de 99,9 % à 62,7 % selon le harnais. Et un « Welcome to the AGI era » qui arrive six mois après une levée de 122 milliards de dollars.
Claude Opus 5 : l'intelligence quasi-frontier au prix du modèle par défaut
Claude Opus 5, lancé le 24 juillet 2026, « s'approche de l'intelligence frontier de Fable 5 à moitié prix », au tarif inchangé d'Opus 4.8. Et pour une DSI européenne, un détail pèse plus qu'un benchmark : Opus 5 préserve le Zero Data Retention que Fable 5 casse.
Pourquoi le sommet du leaderboard ne vous dit pas quel modèle choisir
À défaut du prix, on arbitre sur les benchmarks. Mauvais réflexe : un classement mesure des capacités moyennes sur des tests standardisés, pas la performance sur votre legacy. La précision plafonne, la variance explose, et l'écart au sommet compte moins que le harnais. Que mesurer à la place.
GLM-5.2 : le modèle open-weights de Z.ai qui défie les modèles fermés pour agentique coding !
Annoncé mi-juin 2026, GLM-5.2 de Z.ai (ex-Zhipu AI) est un modèle open-weights — MoE, 744 milliards de paramètres, contexte 1M, licence MIT — optimisé pour le codage agentique long-horizon. Specs, benchmarks constructeur, prix, et les réactions d'experts comme Jeremy Howard ou Mat Velloso.
GLM 5.3 = GLM 5.2 + une pincée de cyber
Z.ai a annoncé GLM-5.3 le 14 août 2026 sans réentraîner son modèle de base : tous les gains viennent du post-training. Le laboratoire chinois retarde de deux semaines la publication des poids à cause d'une capacité cyber qu'il dit ne pas avoir planifiée. Lecture SFEIR.
GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing
Le 9 juillet 2026, OpenAI a rendu GPT-5.6 généralement disponible, non pas un modèle mais trois : Sol, Terra, Luna. Lecture d'ingénieurs, chiffrée et sans parti pris : ce que la famille change pour le coût d'inférence, le routing entre modèles et l'équilibre concurrentiel avec Claude.
Terminal-Bench et Coding Agent Index : pourquoi GPT-5.6 prend l'avantage sur les agents de coding en production
En production, un agent de coding ne se juge pas à un score mais à sa capacité à terminer le travail : en un minimum d'étapes, d'appels d'outils et de tokens. Sur ce terrain, Terminal-Bench 2.1 et Coding Agent Index, GPT-5.6 prend l'avantage. Voici pourquoi, et où passe la limite.