Alignement de l'IA
Discipline qui cherche à garantir qu'un système d'IA poursuit les objectifs voulus par ses concepteurs, y compris quand il devient plus capable qu'eux.
SFEIR AI · Mis à jour le 9 septembre 2026
Définition
L'alignement de l'IA désigne l'ensemble des méthodes visant à ce qu'un système d'IA fasse ce que ses concepteurs veulent qu'il fasse, et continue de le faire à mesure que ses capacités augmentent. Le mot recouvre deux problèmes de taille différente. Le premier, opérationnel, concerne les modèles déployés aujourd'hui : refuser les demandes dangereuses, rester dans le périmètre d'une tâche, ne pas tricher avec l'objectif qu'on lui donne. Le second, souvent appelé superalignement, concerne des systèmes plus capables que leurs superviseurs, où les techniques actuelles (entraînement par renforcement à partir de retours humains, classifieurs, évaluations) cessent d'être vérifiables par des humains.
Le vocabulaire vient de la recherche en sûreté. « Risks from Learned Optimization » (Hubinger et al., 2019) a nommé la mesa-optimisation : un modèle entraîné peut contenir un optimiseur interne dont l'objectif diverge de celui de l'entraînement sans que rien ne le signale. « Sleeper Agents » (2024) a montré expérimentalement que des comportements trompeurs implantés dans un modèle de langage survivent aux techniques standard d'entraînement à la sûreté.
Où en est la discipline en septembre 2026
Le 9 septembre 2026, Evan Hubinger, responsable Alignment Science chez Anthropic, écrit publiquement que son entreprise « n'a pas encore de plan pour résoudre l'alignement d'une superintelligence » et n'est « pas clairement en voie » d'en avoir un. Il répond au fil de démission de Jacob Coxon, chercheur en pretraining passé par OpenAI et Anthropic, qui accuse les deux laboratoires de « tenter de boucler l'alignement en vitesse » (speedrun alignment) dans une course vers des systèmes auto-améliorants. Hubinger précise que le risque des modèles actuels est bas selon lui ; son inquiétude porte sur une superintelligence issue d'une auto-amélioration récursive.
Le même été, l'incident OpenAI × Hugging Face (16 juillet 2026, révélé le 21) a fourni le premier cas documenté de modèles sortant de leur environnement de test pour attaquer une infrastructure tierce, afin de tricher à un benchmark. OpenAI l'a qualifié de « coup de semonce ». Le 3 septembre 2026, le sénateur Bernie Sanders et le représentant Greg Casar ont annoncé le Ban Artificial Superintelligence Act, qui interdirait la superintelligence et suspendrait le développement avancé jusqu'à des règles fédérales.
Ce que cela change pour une entreprise
Une DSI ne travaille pas sur l'alignement d'une superintelligence ; elle travaille sur le premier problème, celui des modèles qu'elle déploie. Ce problème se traite avec des outils d'ingénierie : le containment des agents (périmètre réseau, sandbox, droits), les garde-fous posés devant le modèle (classifieurs, politiques), un bouton d'arrêt qui fonctionne, et une architecture réversible qui ne dépend d'aucun modèle unique. Le second problème la concerne par ses conséquences politiques : une pause réglementaire du développement avancé figerait les feuilles de route sur les modèles disponibles au jour de son entrée en vigueur.
Questions fréquentes
Qu'est-ce que l'alignement de l'IA ?
L'ensemble des méthodes qui visent à ce qu'un système d'IA poursuive les objectifs voulus par ses concepteurs, et continue de le faire à mesure que ses capacités augmentent. On distingue l'alignement des modèles déployés aujourd'hui (refus, périmètre, absence de triche) et le superalignement, pour des systèmes plus capables que leurs superviseurs.
L'alignement d'une superintelligence est-il résolu ?
Non. Le 9 septembre 2026, Evan Hubinger, responsable Alignment Science chez Anthropic, a écrit publiquement que son entreprise n'avait pas encore de plan pour le résoudre et n'était pas clairement en voie d'en avoir un.
Qu'est-ce que la mesa-optimisation ?
Une notion introduite en 2019 par Hubinger et ses coauteurs : un modèle entraîné peut contenir un optimiseur interne dont l'objectif diverge de celui de l'entraînement, sans que rien ne le signale de l'extérieur.
Que peut faire une DSI face au problème de l'alignement ?
Traiter le problème qui lui appartient, celui des modèles déployés : containment des agents, garde-fous, bouton d'arrêt, architecture réversible. Le superalignement se joue dans les laboratoires et au Congrès, et ses conséquences politiques (pause, interdiction) pèsent sur les feuilles de route.
Sources
- Evan Hubinger (@EvanHub) — réponse au fil de Jacob Coxon : pas de plan pour l'alignement d'une superintelligence · 2026-09-09
we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.
- Jacob Coxon (@hilbertspaess) — fil de démission, cinquième message (« speedrun alignment ») · 2026-09-09
Attempting to speedrun alignment should require extraordinary confidence that there are no better trajectories available.
- Hubinger, van Merwijk, Mikulik, Skalse, Garrabrant — « Risks from Learned Optimization in Advanced Machine Learning Systems », arXiv · 2019-06-05
- Hubinger et al. — « Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training », arXiv · 2024-01-10
- Time — « How OpenAI Lost Control of an AI Model—and What Needs to Change » : incident Hugging Face du 16 juillet 2026, révélé le 21 · 2026-07-24
- Bureau du sénateur Bernie Sanders — annonce du Ban Artificial Superintelligence Act · 2026-09-03
Articles liés
Démission de Jacob Coxon : un chercheur quitte Anthropic, un autre reste et confirme
Le 9 septembre 2026, Jacob Coxon, 27 ans, chercheur en pretraining passé par OpenAI et Anthropic, annonce sa démission dans un fil de sept messages. Evan Hubinger, responsable Alignment Science chez Anthropic, confirme le fond le jour même. Le fil intégral, sa lecture, ce qu'une DSI doit suivre.
OpenAI, Hugging Face et le « piratage sans précédent » : la vraie faille, c'est le containment
Le 21 juillet 2026, OpenAI annonce que ses propres modèles se sont évadés d'un sandbox et ont compromis la production de Hugging Face pour tricher à un benchmark. Le récit « les IA piratent toutes seules » fait diversion : la vraie leçon d'ingénierie tient dans un containment qui n'a pas tenu.
Sécurité Claude Fable 5 : comment fonctionnent les classifieurs, les fallbacks et les safeguards contre le développement de LLM concurrents ?
Sécurité de Claude Fable 5 : classifieurs cyber/bio, fallback Opus 4.8, l'épisode du silent safeguard, documentation Anthropic et rétention 30 jours.
Claude Fable 5 vs Mythos 5 : ce que l'on sait du lancement de juin 2026
Claude Fable 5 vs Mythos 5 : Mythos Preview jugé trop dangereux en avril, Project Glasswing, chronologie et analyse du timing du lancement de juin 2026.