Sergey Levine

Professeur associé à l’UC Berkeley et co-fondateur et scientifique en chef de Physical Intelligence, ses recherches sur l’apprentissage par renforcement profond, le RL hors ligne et l’apprentissage de politiques visuomotrices ont fait de lui l’un des chercheurs les plus cités en robotique et en apprentissage automatique, avec plus de 247 000 citations sur Google Scholar.


Profil

Domaine Détail
Nom complet Sergey Levine
Date de naissance Non disponible publiquement
Nationalité Américaine
Institution principale UC Berkeley, EECS
Rôle actuel Professeur associé ; Co-fondateur et scientifique en chef, Physical Intelligence
Domaines de recherche Apprentissage par renforcement profond, RL hors ligne, apprentissage robotique, apprentissage par imitation, politique visuomotrice, modèles de fondation pour la robotique
Thèse de doctorat Informatique, Université de Stanford, 2014
Directeur de thèse Vladlen Koltun
Groupe de recherche RAIL Lab (Robotic Artificial Intelligence and Learning)
Site web personnel people.eecs.berkeley.edu/~svlevine
Substack Learning and Control
X/Twitter @svlevine
Google Scholar 8R35rCwAAAAJ

Présentation générale

Sergey Levine est professeur associé de génie électrique et d’informatique à l’UC Berkeley et co-fondateur et scientifique en chef de Physical Intelligence (pi.ai), la startup leader construisant des modèles de fondation pour la robotique polyvalente. Son programme de recherche couvre l’apprentissage par renforcement profond pour le contrôle robotique, le RL hors ligne, le méta-apprentissage et l’entraînement de politiques visuomotrices à grande échelle, et a produit une série d’algorithmes et de benchmarks largement adoptés – notamment le guided policy search, les politiques visuomotrices de bout en bout, le Soft Actor-Critic (SAC), le Conservative Q-Learning (CQL) et la suite de benchmarks D4RL – qui définissent collectivement le paysage moderne de l’apprentissage robotique. Avec plus de 247 000 citations Google Scholar en 2026, il fait partie des chercheurs les plus cités travaillant à l’intersection de l’apprentissage automatique et de la robotique. À Berkeley, il dirige le RAIL Lab et enseigne le cours très suivi CS 285 : Deep Reinforcement Learning. Il a co-fondé Physical Intelligence en mars 2024 avec Chelsea Finn, Karol Hausman, Brian Ichter et d’autres ; l’entreprise a levé plus de 1,1 milliard de dollars au total et développe des modèles de fondation robotiques inter-embodiments.


Jeunesse et formation

Levine a obtenu sa licence et son master en informatique à l’Université de Stanford en 2009, puis est resté à Stanford pour son doctorat. Son doctorat en informatique a été achevé en 2014 sous la direction de Vladlen Koltun (alors professeur assistant d’informatique à Stanford et chercheur chez Adobe Research). Sa thèse de doctorat a développé le cadre du guided policy search, qui utilise l’optimisation de trajectoire comme mécanisme pour guider et stabiliser l’apprentissage de politiques dans des systèmes robotiques complexes. Après son doctorat, il a effectué des recherches postdoctorales au Robot Learning Lab de l’UC Berkeley avec Pieter Abbeel, où il a développé le travail sur la politique visuomotrice de bout en bout qui est devenu l’un des premiers articles les plus influents en apprentissage robotique profond. Il a également effectué un stage précoce chez NVIDIA pendant ses études de premier cycle.


Carrière

Google Brain – Chercheur scientifique (2015–c. 2021)

Levine a rejoint Google Brain en tant que chercheur scientifique à temps partiel en 2015, tout en terminant son postdoctorat, et a maintenu une affiliation conjointe après avoir rejoint le corps professoral de Berkeley en 2016. Chez Google Brain, il a collaboré à l’apprentissage robotique à grande échelle, contribuant au projet Learning Hand-Eye Coordination (une flotte de 14 bras robotisés collectant des données de préhension simultanément), à la lignée de travaux Robotics Transformer (RT-1, RT-2) et à plusieurs articles fondamentaux sur le RL profond, dont Soft Actor-Critic. Son affiliation simultanée à l’industrie et au monde universitaire durant cette période a été productive dans les deux sens, apportant échelle et accès au matériel aux recherches menées à Berkeley et rigueur théorique aux efforts de robotique appliquée de Google.

UC Berkeley, EECS – Professeur associé (automne 2016–présent)

Levine a rejoint le corps professoral de Berkeley à l’automne 2016, créant le RAIL Lab (Robotic Artificial Intelligence and Learning Lab). Le laboratoire a produit un volume considérable de recherches dans les domaines du RL profond, du méta-apprentissage, du RL hors ligne et de l’apprentissage robotique à grande échelle. Parmi les doctorants notables figure Chelsea Finn (aujourd’hui professeure associée à Stanford et co-fondatrice de Physical Intelligence), qui a co-développé MAML sous la direction de Levine. Levine enseigne CS 285 : Deep Reinforcement Learning, l’un des cours ouverts les plus suivis dans le domaine, dont les enregistrements de cours sont disponibles sur YouTube. Il enseigne également CS 182 : Deep Learning. Il est titulaire d’une bourse NSF CAREER et d’une bourse de recherche Sloan (2019), et a reçu le Presidential Early Career Award for Scientists and Engineers (PECASE).

Physical Intelligence (pi.ai) – Co-fondateur et scientifique en chef (mars 2024–présent)

Physical Intelligence a été fondée au début de l’année 2024 par Levine aux côtés de Karol Hausman (PDG, auparavant à Google DeepMind), Chelsea Finn (Responsable de la recherche, Stanford), Brian Ichter (auparavant à Google Research), Lachy Groom (ancien cadre de Stripe), Adnan Esmail et Quan Vuong. L’entreprise a levé un tour de table de 70 millions de dollars en mars 2024 auprès de Thrive Capital, Khosla Ventures, Lux Capital, OpenAI et Sequoia Capital. Un tour de série A de 400 millions de dollars (valorisation : 2,4 milliards de dollars) a suivi fin 2024, et un tour de série B de 600 millions de dollars mené par CapitalG s’est clôturé en novembre 2025, portant le financement total à plus de 1,1 milliard de dollars. La mission de Physical Intelligence est de construire des modèles de fondation inter-embodiments – une politique généraliste unique capable de contrôler n’importe quel robot pour n’importe quelle tâche physique – en combinant la collecte de données robotiques à grande échelle, les avancées algorithmiques et les techniques d’entraînement des modèles de fondation. Levine occupe le poste de scientifique en chef, guidant la direction scientifique des modèles de fondation tout en conservant son poste de professeur à Berkeley.


Contributions clés

  • Guided Policy Search (GPS) (Levine et Koltun ; ICML 2013) – A introduit l’optimisation de trajectoire comme stratégie d’exploration et de supervision fondée sur des principes pour l’apprentissage de politiques, en utilisant la programmation dynamique différentielle pour générer des échantillons de guidage et l’apprentissage supervisé pour entraîner la politique. GPS est devenue la première méthode de RL profond passant à l’échelle pour des systèmes robotiques réels et a sous-tendu plusieurs années de travaux ultérieurs sur l’apprentissage robotique.

  • End-to-End Training of Deep Visuomotor Policies (Levine, Finn, Darrell, Abbeel ; Journal of Machine Learning Research, 2016) – A démontré que des politiques de réseaux de neurones convolutifs profonds mappant des observations d’images brutes directement aux couples moteurs du robot pouvaient être entraînées de bout en bout en utilisant le guided policy search, permettant aux robots d’apprendre des tâches de manipulation guidées visuellement sans modules de perception conçus à la main. L’un des articles les plus cités en apprentissage robotique profond.

  • Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection (Levine et al. ; International Journal of Robotics Research, 2018) – A déployé une flotte de 14 bras robotisés qui ont collecté de manière autonome environ 800 000 tentatives de préhension, entraînant un réseau de neurones profond à prédire le succès de la préhension à partir d’images. A démontré que l’échelle et la collecte de données auto-supervisées pouvaient remplacer l’ingénierie manuelle dans la perception robotique.

  • Model-Agnostic Meta-Learning (MAML) (Finn, Abbeel, Levine ; ICML 2017) – Co-développé avec la doctorante Chelsea Finn ; a proposé un algorithme de méta-apprentissage qui optimise l’adaptation rapide à de nouvelles tâches via un petit nombre d’étapes de gradient, applicable à tout modèle basé sur le gradient. Parmi les articles les plus cités en méta-apprentissage, avec une large influence sur l’apprentissage en quelques coups (few-shot learning) et la robotique.

  • Soft Actor-Critic (SAC) (Haarnoja, Zhou, Abbeel, Levine ; ICML 2018) – A introduit un cadre d’apprentissage par renforcement à entropie maximale avec un algorithme acteur-critique hors politique qui stabilise l’entraînement et améliore l’efficacité d’échantillonnage. SAC est devenu l’algorithme de base par défaut pour les tâches de contrôle continu en RL profond et fait partie des algorithmes de RL les plus utilisés tant dans la recherche que dans les applications.

  • Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems (Levine, Kumar, Tucker, Fu ; 2020) – Étude canonique qui a formalisé le RL hors ligne en tant que domaine, articulé le problème du décalage distributionnel et organisé les travaux antérieurs et futurs sous un cadre unifié. Citée comme la référence standard pour le RL hors ligne.

  • D4RL: Datasets for Deep Data-Driven Reinforcement Learning (Fu, Kumar, Nachum, Tucker, Levine ; 2020) – A publié la suite de benchmarks standard pour le RL hors ligne, fournissant des ensembles de données reflétant les défis de distribution des données du monde réel – démonstrations humaines, données de qualité mixte, structures de tâches diverses – qui manquaient auparavant d’une couverture systématique. D4RL est devenu le cadre d’évaluation canonique pour les algorithmes de RL hors ligne.

  • Conservative Q-Learning (CQL) (Kumar, Zhou, Tucker, Levine ; NeurIPS 2020) – A proposé un algorithme de RL hors ligne basé sur le pessimisme qui régularise les valeurs Q pour être conservatrices sur les actions hors distribution, résolvant de manière prouvable la surestimation dans les contextes hors ligne. CQL a établi des résultats de pointe sur D4RL et a influencé une génération de méthodes de RL hors ligne ultérieures.

  • Implicit Q-Learning (IQL) (Kostrikov, Nair, Levine ; ICLR 2022) – A introduit un algorithme de RL hors ligne qui évite complètement d’interroger les actions hors distribution en apprenant une fonction de valeur sur les données dans la distribution, combinant simplicité et performances empiriques solides sur D4RL et des tâches robotiques réelles.

  • RT-2: Vision-Language-Action Models (Brohan et al. dont Levine ; CoRL 2023) – Co-développé chez Google avec une grande équipe ; a démontré que des modèles de vision-langage pré-entraînés pouvaient être affinés directement en tant que politiques d’action robotiques, permettant une généralisation à de nouveaux objets et instructions via un raisonnement émergent de type chaîne de pensée. Un article fondateur dans le paradigme VLA (Vision-Language-Action) désormais poursuivi par Physical Intelligence et d’autres.


Prix et reconnaissances

  • Presidential Early Career Award for Scientists and Engineers (PECASE) – Décerné par la NSF pour des recherches révolutionnaires faisant progresser l’innovation américaine
  • Bourse de recherche Sloan (2019) – Fondation Alfred P. Sloan
  • Bourse NSF CAREER
  • Citations Google Scholar : 247 000+ (en mai 2026), le plaçant parmi les chercheurs les plus cités en ML et robotique

Relations clés

  • Vladlen Koltun – Directeur de thèse à Stanford ; informaticien qui a co-écrit le guided policy search et façonné la réflexion précoce de Levine sur la combinaison de l’optimisation de trajectoire et de l’apprentissage de politiques.

  • Pieter Abbeel – Hôte postdoctoral à Berkeley et collaborateur de longue date ; l’article sur la politique visuomotrice de bout en bout et SAC ont été produits en collaboration conjointe ; le Robot Learning Lab d’Abbeel et le RAIL Lab de Levine représentent des programmes de recherche complémentaires à Berkeley.

  • Chelsea Finn – La plus éminente doctorante de Levine ; co-développeuse de MAML et de la lignée de recherche sur la politique visuomotrice de bout en bout ; aujourd’hui professeure associée à Stanford, co-fondatrice et responsable de la recherche chez Physical Intelligence. La relation intellectuelle et institutionnelle entre Levine et Finn est la lignée académique au cœur de Physical Intelligence.

  • Karol Hausman – Co-fondateur et PDG de Physical Intelligence ; anciennement chercheur chez Google DeepMind qui a co-fondé l’entreprise avec Levine et Finn.

  • Aviral Kumar – Doctorant à Berkeley, premier auteur sur CQL et D4RL ; représente le volet du RL hors ligne du laboratoire de Levine, devenu l’une de ses directions de recherche les plus influentes.

  • Tuomas Haarnoja – Collaborateur et premier auteur sur Soft Actor-Critic ; faisait partie de l’environnement de recherche conjoint Berkeley-Google qui a produit SAC ; aujourd’hui chercheur chez Google DeepMind.

  • Vladlen Koltun (voir ci-dessus) et la généalogie plus large de Sergey à Stanford – Koltun lui-même a été conseillé à Stanford ; la chaîne d’influence relie Levine à une lignée de pensée informatique rigoureuse sur l’optimisation et la géométrie adaptée au contrôle robotique.


Style personnel

Les recherches de Levine sont caractérisées par une ambition constante de remplacer l’ingénierie manuelle par des systèmes d’apprentissage généraux – une conviction exprimée depuis le guided policy search en 2013 jusqu’aux modèles de fondation inter-embodiments en 2024. Il a décrit le défi central de la robotique non pas comme un problème matériel mais comme un problème de données et d’apprentissage, arguant à plusieurs reprises dans des cours, des articles de blog et son Substack (« Learning and Control ») que les mêmes dynamiques de passage à l’échelle des données qui ont transformé le TALN et la vision transformeront la robotique, étant donné les bons algorithmes et la bonne infrastructure de données. C’est un communicateur scientifique exceptionnellement actif : le cours CS 285 attire des centaines de milliers de vues sur YouTube et est largement utilisé comme cours de troisième cycle dans d’autres institutions ; son Substack et ses articles Medium offrent des explications accessibles du RL hors ligne et de l’apprentissage robotique à de larges publics techniques. Sur X (@svlevine), ses publications reflètent une ambiance d’information et d’enseignement, cohérente avec quelqu’un qui considère l’éducation du public comme faisant partie intégrante de la mission de recherche plutôt que comme accessoire.


Références