SFEIR
Technologie

ARC Prize

Fondation à but non lucratif de François Chollet et Mike Knoop qui édite les benchmarks ARC-AGI et vérifie les scores des modèles frontière.

SFEIR AI · Mis à jour le 7 septembre 2026

Du papier de 2019 à la fondation

ARC (Abstraction and Reasoning Corpus) naît dans le papier de François Chollet On the Measure of Intelligence, déposé sur arXiv le 5 novembre 2019. Chollet y définit l'intelligence comme l'efficacité d'acquisition de compétences sur un ensemble de tâches, rapportée aux connaissances préalables, à l'expérience et à la difficulté de généralisation. Le corpus repose sur des a priori proches de ceux d'un humain, pour comparer machines et personnes sur des problèmes inédits plutôt que sur des compétences mémorisées.

Chollet organise une première compétition sur Kaggle en 2020, suivie des ARCathon 2022 et 2023 (265 équipes de 65 pays). En 2024, Mike Knoop, cofondateur de Zapier, et Chollet créent l'ARC Prize, doté d'un million de dollars : 1 430 équipes soumettent 17 789 entrées. L'état de l'art sur ARC-AGI-1 passe de 33 % à 55,5 % pendant la compétition, mais le grand prix reste non attribué et le meilleur score éligible sur le jeu privé, 53,5 % par l'équipe the ARChitects, tient à l'obligation de publier le code : MindsAI, à 55,5 %, refuse et sort du classement.

Le 8 janvier 2025, l'organisation annonce sa transition vers le statut de fondation 501(c)(3), en précisant qu'elle n'avait jusque-là été financée que par ses deux fondateurs. Greg Kamradt en prend la présidence et siège au conseil avec Knoop et Chollet ; Bryan Landers, membre de l'équipe fondatrice, signe avec eux le rapport technique 2025. La mission affichée : identifier, mesurer et combler l'écart entre humains et machines sur des tâches faciles pour les premiers et encore hors de portée des secondes.

Au 7 septembre 2026, la page de dons de la fondation liste, sans date, ses principaux contributeurs : Ndea, le laboratoire de Knoop et Chollet, pour 2 millions de dollars ; Knoop et Chollet à titre personnel pour 1,1 million ; General Intuition pour 1 001 337 dollars ; xAI pour 1 million ; Y Combinator pour 500 000 dollars ; Google pour 100 000 dollars. La même page propose aux donateurs des rôles consultatifs. Le lecteur qui compare des scores vérifiés par la fondation garde en tête que deux des laboratoires classés, xAI et Google, figurent parmi ses financeurs.

Trois générations de benchmark

ARC-AGI-1 compte 800 tâches sur grilles, 400 d'entraînement et 400 d'évaluation ; chaque tâche fournit environ trois paires entrée-sortie. Le benchmark résiste de 2019 à fin 2024, jusqu'à ce qu'o3-preview d'OpenAI atteigne 75 % à faible calcul et 87 % à calcul élevé en décembre 2024, ce qui déclenche le passage à la génération suivante.

ARC-AGI-2, annoncé le 24 mars 2025, compte 1 360 tâches : 1 000 d'entraînement, puis trois jeux d'évaluation de 120 tâches, public, semi-privé et privé. Chaque tâche a été résolue par au moins deux humains en deux essais au plus. La question posée aux participants reste la même : atteindre 85 %, et à quel coût. L'ARC Prize 2025 sur Kaggle, ouvert du 26 mars au 3 novembre 2025 et plafonné à 0,20 $ par tâche, réunit 1 455 équipes et 15 154 soumissions ; il se termine avec 24,0 % pour NVARC sur le jeu privé, 16,5 % pour the ARChitects et 12,6 % pour MindsAI. Le grand prix reste non attribué. Les 90 papiers soumis, contre 47 en 2024, valent à Alexia Jolicoeur-Martineau le prix papier de 50 000 $ pour Less is More: Recursive Reasoning with Tiny Networks. Le rapport technique, signé Chollet, Knoop, Kamradt et Landers, paraît sur arXiv le 15 janvier 2026.

La dotation de cette édition se lit différemment selon la page de la fondation. Le billet d'annonce du 24 mars 2025 affiche un million de dollars : 125 000 $ de prix de progrès garantis, 700 000 $ de grand prix à débloquer au-delà de 85 %, et 175 000 $ de prix « à annoncer ». La page d'historique, relevée le 7 septembre 2026, parle d'une dotation « de plus de 725 000 $ ». Les deux chiffres sont compatibles si l'on retire les 175 000 $ non attribués, mais aucune page ne fait cette réconciliation ; la fiche les présente donc côte à côte.

ARC-AGI-3, introduit en 2026, change de format : des environnements interactifs où l'agent explore, découvre l'objectif en cours de route et construit un modèle du monde. Environ 500 participants du grand public, sans sélection sur l'aptitude aux énigmes, ont résolu 100 % des environnements avant le lancement ; leur nombre médian d'actions sert de référence d'efficacité. L'ARC Prize 2026, ouvert le 25 mars 2026 avec 2 millions de dollars sur trois pistes (ARC-AGI-3, ARC-AGI-2, prix papier), clôt les soumissions le 2 novembre et publie ses résultats le 4 décembre 2026. Le code doit être publié sous licence permissive (CC0 ou MIT-0) et l'évaluation Kaggle se fait sans accès internet, donc sans API commerciale.

Ce que « vérifié par ARC Prize » veut dire

La fondation teste elle-même les modèles frontière sur le jeu semi-privé, sous accord de non-rétention des données avec chaque fournisseur, et plafonne chaque run à 10 000 $. Un score est « vérifié » quand les jeux semi-privé et public concordent, à ±10 points sur ARC-AGI-1, ±3 sur ARC-AGI-2 et ±15 sur ARC-AGI-3. Sur ARC-AGI-3, le harnais standard offre une interface minimale et neutre : le modèle ne conserve entre deux requêtes que les notes qu'il choisit de garder.

Le 3 septembre 2026, Greg Kamradt publie les résultats de GPT-6 Astra : 62,7 % sur le semi-privé d'ARC-AGI-3 avec le harnais standard à effort maximal, pour 26 098 $, et 99,9 % à effort élevé avec un harnais « Provider Adapter » fourni par OpenAI, qui préserve l'état de raisonnement opaque entre requêtes et compacte les longues conversations, pour 18 817 $. Astra a utilisé moins d'actions que la médiane humaine sur 96 % des niveaux. La page ARC-AGI-2 lui attribue 95,0 % à effort maximal. La fondation écrit qu'elle ne revendique pas l'AGI et que saturer le benchmark n'en serait pas la preuve.

Ces deux chiffres pour un même modèle illustrent la règle de lecture d'ARC-AGI-3 : le score dépend du harnais autant que du modèle, un point que le harness engineering a rendu familier aux équipes de développement. Pour comparaison, Claude Opus 5 obtenait 30,16 % le 24 juillet 2026 à effort élevé, et GPT-5.6 Sol 7,78 % à effort maximal le 9 juillet 2026, à harnais standard dans les deux cas.

Questions fréquentes

Qu'est-ce que l'ARC Prize ?

Une compétition créée en 2024 par François Chollet et Mike Knoop, dotée d'un million de dollars, devenue fondation à but non lucratif en 2025 sous la présidence de Greg Kamradt. Elle édite les benchmarks ARC-AGI, organise les compétitions Kaggle annuelles (2 millions de dollars en 2026) et vérifie elle-même les scores des modèles frontière.

Quelle différence entre ARC-AGI-1, ARC-AGI-2 et ARC-AGI-3 ?

ARC-AGI-1 (2019) : 800 tâches statiques sur grilles, résolu par o3-preview en décembre 2024. ARC-AGI-2 (2025) : 1 360 tâches, chacune résolue par au moins deux humains, cible de 85 %. ARC-AGI-3 (2026) : environnements interactifs où l'agent découvre l'objectif et où l'efficacité se mesure en nombre d'actions par rapport à la médiane humaine.

Combien la compétition 2025 était-elle dotée ?

Le billet d'annonce du 24 mars 2025 affiche un million de dollars (125 000 $ garantis, 700 000 $ de grand prix, 175 000 $ à annoncer) ; la page d'historique de la fondation parle de « plus de 725 000 $ ». Le grand prix n'a pas été attribué : le meilleur score privé, 24,0 % par NVARC, reste loin des 85 % requis.

GPT-6 Astra a-t-il résolu ARC-AGI-3 ?

Le 3 septembre 2026, ARC Prize a mesuré 62,7 % avec le harnais standard commun à tous les modèles et 99,9 % avec un harnais fourni par OpenAI qui conserve l'état de raisonnement entre requêtes. La fondation précise qu'elle ne revendique pas l'AGI. Le score se lit avec son harnais, jamais seul.

Qui finance la fondation ?

Sa page de dons, relevée le 7 septembre 2026, cite Ndea (2 M$), Knoop et Chollet (1,1 M$), General Intuition (1 001 337 $), xAI (1 M$), Y Combinator (500 000 $) et Google (100 000 $), sans dater ces contributions. En janvier 2025, la fondation indiquait n'avoir été financée que par ses deux fondateurs.

Sources

Articles liés