Evan Hubinger
Responsable Alignment Science chez Anthropic, premier auteur de « Sleeper Agents » (2024) ; a confirmé le fil de Jacob Coxon le 9 septembre 2026.
SFEIR AI · Mis à jour le 9 septembre 2026
Parcours
Evan Hubinger est chercheur en sûreté de l'IA. Avant Anthropic, il est passé par le Machine Intelligence Research Institute (MIRI) et par un stage de recherche chez OpenAI. Il est le premier auteur de « Risks from Learned Optimization in Advanced Machine Learning Systems » (2019), l'article qui a introduit la notion de mesa-optimisation, un optimiseur appris à l'intérieur du modèle dont l'objectif peut diverger de celui de l'entraînement.
Chez Anthropic, il dirige les travaux d'Alignment Science, qu'il présente sur X sous ce titre. Il est le premier auteur de « Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training » (janvier 2024), qui montre que des comportements trompeurs implantés dans un modèle peuvent survivre aux techniques standard d'entraînement à la sûreté.
La réponse du 9 septembre 2026
Le 9 septembre 2026, quelques heures après le fil de démission de Jacob Coxon, il répond sur X : « Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to. »
Il précise ensuite, selon Newsweek et The Statesman, que le risque posé par les modèles actuels est bas à ses yeux ; ce qui l'inquiète est une superintelligence issue d'une auto-amélioration récursive, qui pourrait arriver plus vite que prévu. Il est resté en poste. Cette réponse, venant de l'intérieur, est ce qui a fait sortir le fil de Coxon du cercle des spécialistes : un insider qui part et un insider qui reste disent la même chose.
Ce que les articles SFEIR en retiennent
L'article sur la démission de Jacob Coxon reproduit sa réponse intégrale et en tire la distinction qu'une DSI doit retenir : les modèles déployés aujourd'hui sont à bas risque selon le responsable de l'alignement d'Anthropic, et les prochains entraînements se lancent sans plan. Le premier risque relève du containment et des garde-fous ; le second relève de la politique, dont les réponses (pause fédérale, accords de cadence) pèseront sur les feuilles de route des entreprises.
Questions fréquentes
Qu'a dit Evan Hubinger après la démission de Jacob Coxon ?
Le 9 septembre 2026, il a écrit sur X que Jacob Coxon avait raison, que les chercheurs d'Anthropic croient sincèrement que l'IA pourrait tuer tous les humains, qu'il estime personnellement cette probabilité à plus de 10 % dans la décennie, et qu'Anthropic n'a pas encore de plan pour résoudre l'alignement d'une superintelligence. Il a ensuite précisé que le risque des modèles actuels est bas selon lui.
Evan Hubinger a-t-il quitté Anthropic ?
Non. Il a confirmé le fond du témoignage de Jacob Coxon tout en restant responsable Alignment Science chez Anthropic, et en écrivant que l'entreprise « fait de son mieux ».
Pourquoi Evan Hubinger est-il connu en recherche sur l'alignement ?
Pour « Risks from Learned Optimization » (2019), qui a introduit la mesa-optimisation, et pour « Sleeper Agents » (2024), qui montre que des comportements trompeurs implantés dans un modèle peuvent survivre à l'entraînement à la sûreté.
Sources
- Evan Hubinger (@EvanHub) — réponse au fil de Jacob Coxon sur X · 2026-09-09
I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.
- Newsweek — précision d'Hubinger : risque bas des modèles actuels, inquiétude sur l'auto-amélioration récursive · 2026-09-09
- Hubinger, van Merwijk, Mikulik, Skalse, Garrabrant — « Risks from Learned Optimization in Advanced Machine Learning Systems », arXiv · 2019-06-05
- Hubinger et al. — « Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training », arXiv · 2024-01-10