SFEIR
Technologie

Artificial Analysis

Évaluateur indépendant de modèles IA : Intelligence Index, Coding Agent Index, prix et vitesse mesurés par ses propres runs, sans chiffres d'éditeur.

SFEIR AI · Mis à jour le 7 septembre 2026

Un évaluateur tiers qui refait toutes les mesures

Artificial Analysis est une société de San Francisco fondée par Micah Hill-Smith (directeur général) et George Cameron (directeur produit), avec un bureau à Melbourne. Le projet démarre en 2023 comme un outil interne, pendant que Hill-Smith construit un assistant juridique à base de LLM, et ouvre au public en janvier 2024. Les investisseurs cités sur la page « about » comptent Nat Friedman, Daniel Gross, Andrew Ng, Adam D'Angelo, Clem Delangue, Guillermo Rauch, Shawn Wang et Charlie Songhurst. La société ne publie ni son effectif ni son montant levé ; les chiffres qui circulent viennent d'annuaires et ne sont pas repris ici.

Le site revendique plus de 500 modèles évalués, plus de 100 fournisseurs d'inférence et plus de 1 000 endpoints testés, chiffres auto-déclarés par l'éditeur. Le périmètre couvre les modèles de langage, d'image, de vidéo et de parole, les clouds qui les servent et les accélérateurs (GPU Nvidia et AMD, TPU Google).

Le modèle économique repose sur un abonnement entreprise et sur des benchmarks privés à la demande. Les fondateurs affirment que personne ne paie pour figurer sur le site et appliquent une politique de client mystère : les comptes utilisés pour les tests sont créés hors de leur domaine, afin qu'un fournisseur ne puisse pas servir un modèle différent à l'évaluateur. Les chiffres publiés par les laboratoires sont écartés, au motif que chaque éditeur formule ses prompts à sa manière et choisit ses exemples.

Intelligence Index et Coding Agent Index : ce qu'ils agrègent

L'Intelligence Index v4.2, publié le 4 septembre 2026, combine dix évaluations en un score unique, réparties en quatre familles : agents (30 %, avec AA-Briefcase, GDPval-AA v2 et τ³-Banking), code (20 %, avec Terminal-Bench v2.1 et SciCode), capacités générales (30 %, avec AA-Omniscience, GDP.pdf et AA-LCR v1.1) et raisonnement scientifique (20 %, avec Humanity's Last Exam et CritPt). Cette version retire GPQA Diamond, jugé saturé, et porte à 40 % la part des jeux de test privés, le double de la v4.1. Au relevé du 7 septembre 2026, la page de l'index place en tête Claude Fable 5.1 à 57 (effort maximal) et 56 (effort xhigh), puis GPT-6 Astra (max) à 55, troisième sur 202 modèles classés ; Claude Opus 5 (max) obtient 54 et se classe sixième. La v4.2 arrive huit mois après le lancement de la v4 en janvier 2026 et ajoute GDP.pdf, une évaluation de raisonnement sur 4 592 pages de documents.

Le Coding Agent Index, lancé en mai 2026 avec SWE-Bench-Pro-Hard-AA et Terminal-Bench v2, a changé de composition à chaque version : DeepSWE remplace SWE-Bench-Pro-Hard-AA en v1.1 (juin 2026), la notation de SWE-Atlas-QnA devient binaire en v1.2 puis s'aligne sur la méthode Task Resolve Rate de Scale AI en v1.3, et la v1.4 (août 2026) passe à Terminal-Bench v2.1 et ajoute une détection du contournement de récompense. Cette v1.4 évalue un couple modèle plus harnais sur 326 tâches : 113 tâches d'ingénierie logicielle longues (DeepSWE), 89 tâches de terminal vérifiées par suites de tests (Terminal-Bench v2.1) et 124 questions sur dépôt de code (SWE-Atlas-QnA). Chaque ligne du classement décrit une variante d'agent, pas seulement un modèle, ce qui rejoint la logique du harness engineering. Le coût par tâche est calculé au tarif API par token du fournisseur, en tenant compte des tokens en cache.

Les mesures de performance suivent le même principe : le temps jusqu'au premier token et le débit de sortie (tokens par seconde après le premier) sont relevés sur les API réelles des fournisseurs, pour représenter ce qu'un client observe et non le maximum théorique d'un matériel. Le prix affiché d'un modèle est un prix mélangé selon un ratio 7:2:1 entre tokens lus en cache, tokens d'entrée et tokens de sortie.

Les limites d'un indice agrégé

Un score d'index change avec la version de l'index. Le 3 septembre 2026, l'analyse de GPT-6 Astra sous la v4.1.1 donnait 61 à Astra, 61 à GPT-5.6 Sol et 66 à Claude Fable 5.1 ; le lendemain, la v4.2 ramenait Astra à 55 et Fable 5.1 à 57. Les écarts entre modèles se sont resserrés et le rang d'Astra a monté, sans qu'aucun modèle ait changé. Un chiffre d'Intelligence Index se cite donc avec sa version et sa date, jamais seul. Il se cite aussi avec sa variante : le même modèle apparaît plusieurs fois selon l'effort de raisonnement, et « troisième » n'a pas le même sens selon qu'on compte les lignes du classement ou les modèles distincts.

Artificial Analysis a présenté la v4.2 comme une mise à jour intermédiaire, motivée par la vitesse du front et anticipant sa v5. The Decoder rapporte le 5 septembre 2026 que cette révision suit un désaccord public : plusieurs évaluations, dont celles d'OpenAI, plaçaient Astra nettement devant, là où la v4.1.1 le montrait au niveau de son prédécesseur. L'éditeur explique avoir retenu ses mises à jour pour garder des scores stables pendant les lancements majeurs.

Trois autres réserves tiennent à la construction de l'indice. Une part croissante des évaluations appartient à Artificial Analysis et reste privée (AA-Briefcase, AA-Omniscience, AA-LCR, solutions de CritPt), ce qui protège du surapprentissage mais empêche toute reproduction externe. La suite est principalement textuelle et en anglais, le multilingue et le multimodal étant suivis à part. Les runs varient par réglage d'effort de raisonnement et par harnais, si bien qu'un même modèle occupe plusieurs lignes ; l'intervalle de confiance annoncé sur l'indice est inférieur à ±1 %, mais une évaluation individuelle peut dépasser cette marge. Ces mesures restent indépendantes des éditeurs, et c'est leur valeur ; elles ne remplacent pas un test sur le workload réel.

Questions fréquentes

Que mesure l'Artificial Analysis Intelligence Index ?

Un score unique agrégeant dix évaluations (v4.2 du 4 septembre 2026) en quatre familles : agents 30 %, code 20 %, capacités générales 30 %, raisonnement scientifique 20 %. Toutes les évaluations sont exécutées par Artificial Analysis, sans reprise des chiffres des éditeurs. Le score dépend de la version de l'index : Astra passe de 61 en v4.1.1 à 55 en v4.2 en un jour. Au 7 septembre 2026, Fable 5.1 mène à 57, Astra (max) à 55, Opus 5 (max) à 54.

Artificial Analysis est-il indépendant des laboratoires d'IA ?

Les fondateurs affirment que personne ne paie pour figurer sur le site, que les revenus viennent d'abonnements entreprise et de benchmarks privés, et qu'une politique de client mystère empêche un fournisseur d'identifier les comptes de test. Les chiffres auto-déclarés des laboratoires sont écartés. Une part croissante des évaluations reste privée, ce qui protège du surapprentissage et empêche toute reproduction externe.

Que contient le Coding Agent Index ?

326 tâches réparties entre DeepSWE (113 tâches d'ingénierie logicielle), Terminal-Bench v2.1 (89 tâches de terminal) et SWE-Atlas-QnA (124 questions sur dépôt). Chaque ligne décrit un couple modèle plus harnais, avec un coût par tâche au tarif API. Lancé en mai 2026, en version 1.4 depuis août 2026, ses scores changent de version en version.

Sources

Articles liés

GPT-6 Astra : un vrai saut sur les agents, un récit d'AGI taillé pour l'entrée en Bourse

GPT-6 Astra : un vrai saut sur les agents, un récit d'AGI taillé pour l'entrée en Bourse

GPT-6 Astra (3 septembre 2026) : gains réels en usage d'ordinateur et en codage, prix aligné sur Fable 5.1, score ARC-AGI-3 qui passe de 99,9 % à 62,7 % selon le harnais. Et un « Welcome to the AGI era » qui arrive six mois après une levée de 122 milliards de dollars.

Claude Opus 5 : l'intelligence quasi-frontier au prix du modèle par défaut

Claude Opus 5 : l'intelligence quasi-frontier au prix du modèle par défaut

Claude Opus 5, lancé le 24 juillet 2026, « s'approche de l'intelligence frontier de Fable 5 à moitié prix », au tarif inchangé d'Opus 4.8. Et pour une DSI européenne, un détail pèse plus qu'un benchmark : Opus 5 préserve le Zero Data Retention que Fable 5 casse.

Pourquoi le sommet du leaderboard ne vous dit pas quel modèle choisir

Pourquoi le sommet du leaderboard ne vous dit pas quel modèle choisir

À défaut du prix, on arbitre sur les benchmarks. Mauvais réflexe : un classement mesure des capacités moyennes sur des tests standardisés, pas la performance sur votre legacy. La précision plafonne, la variance explose, et l'écart au sommet compte moins que le harnais. Que mesurer à la place.

GLM-5.2 : le modèle open-weights de Z.ai qui défie les modèles fermés pour agentique coding !

GLM-5.2 : le modèle open-weights de Z.ai qui défie les modèles fermés pour agentique coding !

Annoncé mi-juin 2026, GLM-5.2 de Z.ai (ex-Zhipu AI) est un modèle open-weights — MoE, 744 milliards de paramètres, contexte 1M, licence MIT — optimisé pour le codage agentique long-horizon. Specs, benchmarks constructeur, prix, et les réactions d'experts comme Jeremy Howard ou Mat Velloso.

GLM 5.3 = GLM 5.2 + une pincée de cyber

GLM 5.3 = GLM 5.2 + une pincée de cyber

Z.ai a annoncé GLM-5.3 le 14 août 2026 sans réentraîner son modèle de base : tous les gains viennent du post-training. Le laboratoire chinois retarde de deux semaines la publication des poids à cause d'une capacité cyber qu'il dit ne pas avoir planifiée. Lecture SFEIR.

GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing

GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing

Le 9 juillet 2026, OpenAI a rendu GPT-5.6 généralement disponible, non pas un modèle mais trois : Sol, Terra, Luna. Lecture d'ingénieurs, chiffrée et sans parti pris : ce que la famille change pour le coût d'inférence, le routing entre modèles et l'équilibre concurrentiel avec Claude.

Terminal-Bench et Coding Agent Index : pourquoi GPT-5.6 prend l'avantage sur les agents de coding en production

Terminal-Bench et Coding Agent Index : pourquoi GPT-5.6 prend l'avantage sur les agents de coding en production

En production, un agent de coding ne se juge pas à un score mais à sa capacité à terminer le travail : en un minimum d'étapes, d'appels d'outils et de tokens. Sur ce terrain, Terminal-Bench 2.1 et Coding Agent Index, GPT-5.6 prend l'avantage. Voici pourquoi, et où passe la limite.