Chercheur allemand en sécurité de l’IA, responsable de l’équipe Alignment Science chez Anthropic, connu pour avoir co-prototypé l’apprentissage par renforcement à partir de feedback humain et pour son départ public d’OpenAI en raison de préoccupations de sécurité.
Profil
| Naissance | 1986 ou 1987, Allemagne |
| Nationalité | Allemande |
| Institution actuelle | Anthropic (responsable de l’équipe Alignment Science) |
| Domaines de recherche | Alignement de l’IA, Apprentissage par renforcement à partir de feedback humain (RLHF), Supervision scalable, Généralisation faible-à-forte, Recherche automatisée sur l’alignement |
| Directeur de thèse | Marcus Hutter |
| Thèse de doctorat | Nonparametric General Reinforcement Learning (Australian National University, 2016) |
| Site web personnel | jan.leike.name |
| Blog | aligned.substack.com |
| X / Twitter | @janleike |
| GitHub | janleike |
| Google Scholar | Jan Leike |
Aperçu
Jan Leike est l’un des chercheurs les plus importants de l’histoire de l’alignement de l’IA, occupant une position rare à l’intersection de la théorie fondamentale et du travail sur les systèmes de pointe. En tant que chercheur chez DeepMind, il a co-prototypé l’apprentissage par renforcement à partir de feedback humain (RLHF) — la technique qui est devenue la colonne vertébrale des modèles de langage modernes alignés. Chez OpenAI, il a co-dirigé l’équipe Superalignment aux côtés d’Ilya Sutskever, supervisé l’alignement d’InstructGPT, ChatGPT et GPT-4, et co-écrit la feuille de route de recherche la plus en vue du domaine pour aligner les systèmes superintelligents. Sa démission d’OpenAI en mai 2024 — accompagnée d’une déclaration publique selon laquelle la culture de la sécurité était „passée au second plan derrière les produits clinquants“ — est devenue l’un des moments déterminants de l’histoire publique de la sécurité de l’IA. Il a rejoint Anthropic peu après, où il dirige l’équipe Alignment Science. Le magazine TIME l’a classé parmi les 100 personnes les plus influentes dans le domaine de l’IA en 2023 et 2024.
Jeunesse et éducation
Leike a grandi en Allemagne. Il a obtenu son diplôme de premier cycle à l’Université de Fribourg, et après avoir obtenu un master en informatique, a poursuivi un doctorat en apprentissage automatique à l’Australian National University sous la supervision de Marcus Hutter. Hutter est le créateur d’AIXI, un modèle théorique d’agent universellement intelligent, et le cadre intellectuel du travail doctoral de Leike — l’apprentissage par renforcement général non paramétrique — est ancré dans la tradition de la théorie algorithmique de l’information que Hutter a pionnière. Sa thèse, Nonparametric General Reinforcement Learning (2016), abordait des questions fondamentales sur les limites théoriques des agents RL dans des environnements sans hypothèses paramétriques.
Après son doctorat, Leike a effectué un stage postdoctoral de six mois au Future of Humanity Institute à Oxford avant de rejoindre DeepMind pour se concentrer sur la recherche empirique en sécurité de l’IA.
Carrière
DeepMind (vers 2016–2021)
Au sein de l’équipe de sécurité de DeepMind à Londres, Leike a prototypé l’apprentissage par renforcement à partir de feedback humain. L’article fondateur, Deep Reinforcement Learning from Human Preferences (NeurIPS 2017), co-écrit avec Paul Christiano, Tom Brown, Miljan Martic, Shane Legg et Dario Amodei, proposait d’entraîner des agents RL en utilisant des comparaisons humaines non expertes entre segments de trajectoire plutôt que des fonctions de récompense spécifiées à la main. L’article démontrait que des comportements nouveaux et complexes pouvaient être appris avec environ une heure de temps humain, dans des environnements considérablement plus complexes que tout ce qui avait été appris auparavant à partir de feedback humain. Ce travail a établi le RLHF comme une technique d’alignement pratique et deviendrait plus tard le noyau méthodologique d’InstructGPT, ChatGPT et Claude.
Au cours de cette période, Leike a également publié Scalable Agent Alignment via Reward Modeling: A Research Direction (2018), co-écrit avec David Krueger, Tom Everitt et Shane Legg, qui décrivait un programme de recherche pour faire évoluer l’alignement via la modélisation itérative des récompenses — une formulation formelle précoce de ce qui deviendrait l’agenda Superalignment.
OpenAI (2021–mai 2024)
Leike a rejoint OpenAI en 2021 en tant que responsable de l’alignement. Il a participé au développement d’InstructGPT, ChatGPT et à l’alignement de GPT-4, et est co-auteur de l’article InstructGPT (NeurIPS 2022), qui a introduit le fine-tuning supervisé suivi d’un entraînement RLHF pour produire un modèle suivant mieux les instructions humaines.
En juin 2023, lui et Ilya Sutskever sont devenus co-responsables du projet Superalignment nouvellement introduit, qui visait à déterminer comment aligner les futures superintelligences artificielles en quatre ans. Le projet a été annoncé avec un engagement public selon lequel OpenAI consacrerait 20 % de sa puissance de calcul à la recherche sur le superalignement. Leike a également développé l’approche d’OpenAI en matière de recherche sur l’alignement et a co-écrit la feuille de route de recherche de l’équipe Superalignment.
Démission. En mai 2024, Leike a démissionné d’OpenAI, quelques heures après le départ d’Ilya Sutskever. Sa déclaration publique de démission sur X était exceptionnellement directe. Il a accusé OpenAI et ses dirigeants de négliger la culture de la sécurité au profit de produits clinquants, et a déclaré qu’il „était en désaccord avec la direction d’OpenAI sur les priorités fondamentales de l’entreprise depuis un certain temps, jusqu’à ce que nous atteignions finalement un point de rupture.“ Il a écrit que „construire des machines plus intelligentes que l’homme est une entreprise intrinsèquement dangereuse“ et qu’„OpenAI doit devenir une entreprise d’AGI qui place la sécurité en premier.“ Il a noté que son équipe avait „navigué contre le vent“ et avait du mal à obtenir des ressources informatiques malgré les engagements publics d’OpenAI. En quelques jours, OpenAI a complètement dissous l’équipe Superalignment, redistribuant ses membres dans d’autres groupes de recherche.
Anthropic (mai 2024–présent)
En mai 2024, Leike a rejoint Anthropic, une entreprise d’IA fondée par d’anciens employés d’OpenAI. Il dirige l’équipe Alignment Science, qui s’attaque aux problèmes ouverts les plus difficiles pour faire en sorte que les systèmes d’IA se comportent comme prévu sur des tâches où l’évaluation humaine est difficile ou insuffisante. Son équipe recherche comment aligner un chercheur en alignement automatisé, en travaillant sur la supervision scalable, la généralisation faible-à-forte et la robustesse face aux jailbreaks.
Contributions clés
-
Deep Reinforcement Learning from Human Preferences (NeurIPS 2017) — Co-écrit avec Paul Christiano, Tom Brown, Miljan Martic, Shane Legg et Dario Amodei chez DeepMind. L’article a introduit la version pratique du RLHF, entraînant des agents à partir de comparaisons humaines non expertes de segments de trajectoire. Il est devenu le fondement méthodologique pour l’alignement des grands modèles de langage modernes, y compris InstructGPT, ChatGPT, Claude, et d’autres.
-
Scalable Agent Alignment via Reward Modeling (2018) — Co-écrit avec Krueger, Everitt, Martic, Maini et Legg. Définit un programme de recherche systématique pour la modélisation itérative des récompenses comme voie vers un alignement scalable ; un premier plan pour ce qui allait plus tard sous-tendre le programme Superalignment.
-
InstructGPT — Training Language Models to Follow Instructions with Human Feedback (NeurIPS 2022) — Auteur senior de l’article présentant InstructGPT, qui combinait le fine-tuning supervisé et le RLHF pour produire des modèles de langage bien mieux alignés sur l’intention humaine. Ce travail a directement permis le développement de ChatGPT.
-
Feuille de route de recherche sur le Superalignment (2023) — Co-dirigée avec Ilya Sutskever ; co-écriture du plan technique pour aligner des systèmes superintelligents en quatre ans en utilisant l’IA actuelle ou à court terme pour automatiser la recherche sur l’alignement. Introduction du concept de généralisation faible-à-forte comme approche technique centrale.
-
Généralisation faible-à-forte (ICML 2024) — Co-écrit avec Collin Burns, Pavel Izmailov, Jan Hendrik Kirchner, et d’autres incluant Ilya Sutskever. Proposition et démonstration empirique que la supervision d’un modèle faible peut être utilisée pour susciter des capacités fortes d’un modèle plus puissant — un mécanisme clé pour aligner des systèmes plus intelligents que leurs superviseurs.
-
LLM Critics Help Catch LLM Bugs (2024) — Premier travail de l’équipe d’alignement d’OpenAI démontrant que GPT-4 peut identifier des erreurs dans ses propres résultats à des taux significatifs, contribuant au programme de recherche sur la supervision scalable.
-
Aligned Substack — Un blog de recherche actif où Leike publie des traitements accessibles des concepts d’alignement, y compris des essais fondamentaux sur „le problème difficile de l’alignement,“ la supervision scalable et la recherche automatisée sur l’alignement ; influent dans la formation du vocabulaire conceptuel du domaine.
Prix et reconnaissance
- TIME100 AI (2023 et 2024) — L’un des très rares chercheurs listés dans les deux éditions ; cité pour ses contributions à la recherche sur l’alignement de l’IA et pour sa franchise publique sur les risques de sécurité.
- Déclaration publique de démission (mai 2024) — Largement décrite comme un moment charnière dans l’histoire publique de la sécurité de l’IA ; couverte mondialement par les grands médias et créditée d’avoir accru la visibilité des débats sur la culture de la sécurité au sein des laboratoires d’IA de pointe.
Relations clés
- Marcus Hutter — Directeur de thèse à l’Australian National University ; créateur d’AIXI et du cadre d’intelligence universelle théorique qui a façonné les premières recherches de Leike sur le RL général non paramétrique.
- Paul Christiano — Co-auteur principal de l’article RLHF de 2017 ; a ensuite fondé l’Alignment Research Center (ARC) puis l’équipe Mechanistic Interpretability and Alignment. L’un des collaborateurs intellectuels les plus proches dans la carrière de Leike.
- Shane Legg — Co-auteur de l’article RLHF de 2017 et de l’article sur la modélisation des récompenses de 2018 ; co-fondateur de DeepMind. Le travail de Leike chez DeepMind s’est déroulé au sein de l’orbite de sécurité de Legg.
- Dario Amodei — Co-auteur de l’article RLHF de 2017 (alors chez OpenAI) ; maintenant PDG d’Anthropic, l’organisation que Leike a rejointe après son départ d’OpenAI. Leur collaboration de recherche encadre ainsi l’histoire de la sécurité de l’IA de la décennie.
- Ilya Sutskever — Co-responsable de l’équipe Superalignment ; leurs départs simultanés d’OpenAI en mai 2024 ont marqué l’exode le plus médiatisé lié à la sécurité d’un laboratoire d’IA de pointe dans l’histoire du domaine.
- Sam Altman — PDG d’OpenAI avec lequel Leike a atteint un „point de rupture“ concernant les priorités de sécurité de l’entreprise ; le désaccord public a cristallisé un débat plus large sur la gouvernance et les valeurs dans les laboratoires de pointe.
Style personnel
La voix publique de Leike est inhabituellement directe et fondée sur des principes pour une figure senior dans une industrie commercialement concurrentielle. Sa déclaration de démission de 2024 — rare par sa volonté de nommer des défaillances institutionnelles spécifiques sous une forme publique et non anonymisée — reflétait un schéma cohérent : il présente l’alignement de l’IA non pas comme une préoccupation technique de niche mais comme une obligation civilisationnelle, et traite la crédibilité institutionnelle en matière de sécurité comme quelque chose qui doit être gagné par une action cohérente plutôt qu’affirmé par des déclarations de mission. Ses écrits de recherche sont techniquement précis mais accessibles, et son blog Substack articule les concepts d’alignement pour un public allant des praticiens du ML aux lecteurs intéressés par les politiques. Sa carrière a suivi un fil cohérent, des fondements théoriques du RL sous Marcus Hutter au prototypage empirique du RLHF chez DeepMind, en passant par l’alignement au niveau des systèmes chez OpenAI et maintenant Anthropic — toujours à la frontière où les questions abstraites de sécurité rencontrent les systèmes déployés.
Références
- Site web personnel : jan.leike.name
- Wikipédia : en.wikipedia.org/wiki/Jan_Leike
- Google Scholar : scholar.google.com — Jan Leike
- Blog sur l’alignement : aligned.substack.com
- Profil X : digg.com/u/x/janleike
- TIME100 AI 2024 : time.com/7012867/jan-leike
- Article RLHF (arXiv 1706.03741) : arxiv.org/abs/1706.03741
- Crypto Briefing — „Jan Leike dirige l’équipe de science de l’alignement d’Anthropic“ (mai 2026) : cryptobriefing.com/jan-leike-anthropic-alignment-science
- Annonce du Superalignment d’OpenAI (juin 2023) : openai.com/blog/introducing-superalignment
- Fast Company — reportage sur la démission (mai 2024) : fastcompany.com/91127491