Сергей Левин

Доцент Калифорнийского университета в Беркли, сооснователь и главный научный сотрудник Physical Intelligence. Его исследования в области глубокого обучения с подкреплением (deep reinforcement learning), офлайн-обучения с подкреплением (offline RL) и обучения визомоторной политике (visuomotor policy learning) сделали его одним из самых цитируемых исследователей в робототехнике и машинном обучении — более 247 000 цитирований по данным Google Scholar.


Профиль

Поле Сведения
Полное имя Сергей Левин (Sergey Levine)
Дата рождения Не разглашается
Гражданство США
Основное место работы Калифорнийский университет в Беркли, факультет электротехники и компьютерных наук (EECS)
Текущая должность Доцент; сооснователь и главный научный сотрудник Physical Intelligence
Области исследований Глубокое обучение с подкреплением, офлайн RL, обучение роботов, имитационное обучение, визомоторная политика, фундаментальные модели для робототехники
Тема докторской диссертации Компьютерные науки, Стэнфордский университет, 2014 г.
Научный руководитель Владлен Колтун (Vladlen Koltun)
Исследовательская группа Лаборатория RAIL (Robotic Artificial Intelligence and Learning)
Личный сайт people.eecs.berkeley.edu/~svlevine
Substack Learning and Control
X / Twitter @svlevine
Google Scholar 8R35rCwAAAAJ

Обзор

Сергей Левин — доцент кафедры электротехники и компьютерных наук Калифорнийского университета в Беркли, сооснователь и главный научный сотрудник Physical Intelligence (pi.ai) — ведущего стартапа, создающего фундаментальные модели для роботов общего назначения. Его исследовательская программа охватывает глубокое обучение с подкреплением для управления роботами, офлайн RL, мета-обучение и крупномасштабное обучение визомоторной политике. Он является автором ряда широко используемых алгоритмов и эталонных тестов, включая guided policy search, сквозные визомоторные политики, Soft Actor-Critic (SAC), Conservative Q-Learning (CQL) и набор тестов D4RL, которые в совокупности определяют современный ландшафт обучения роботов. Имея более 247 000 цитирований в Google Scholar по состоянию на 2026 год, он входит в число самых цитируемых исследователей, работающих на стыке машинного обучения и робототехники. В Беркли он руководит лабораторией RAIL Lab и читает популярный курс CS 285: «Глубокое обучение с подкреплением». В марте 2024 года он стал сооснователем Physical Intelligence вместе с Челси Финн (Chelsea Finn), Каролем Хаусманом (Karol Hausman), Брайаном Ихтером (Brian Ichter) и другими. Компания привлекла более 1,1 миллиарда долларов инвестиций и разрабатывает кросстемпоральные фундаментальные модели для роботов.


Ранние годы и образование

Левин получил степень бакалавра и магистра компьютерных наук в Стэнфордском университете в 2009 году, после чего продолжил обучение в докторантуре там же. Кандидатскую диссертацию по компьютерным наукам он защитил в 2014 году под руководством Владлена Колтуна (в то время доцента компьютерных наук в Стэнфорде и исследователя Adobe Research). В своей докторской диссертации он разработал фреймворк guided policy search, который использует оптимизацию траекторий для направления и стабилизации обучения политике в сложных роботизированных системах. После получения докторской степени он прошёл постдокторантуру в Robot Learning Lab в Беркли под руководством Питера Аббила (Pieter Abbeel), где разработал метод сквозного обучения визомоторной политике, ставший одной из самых влиятельных ранних работ в области глубокого обучения роботов. Во время учёбы на бакалавриате он также проходил стажировку в NVIDIA.


Карьера

Google Brain — научный сотрудник (2015 – ок. 2021)

Левин присоединился к Google Brain в 2015 году в качестве внештатного научного сотрудника, ещё во время постдокторантуры, и сохранял эту связь после перехода на факультет Беркли в 2016 году. В Google Brain он участвовал в крупномасштабном обучении роботов, внёс вклад в проект Learning Hand-Eye Coordination (парк из 14 роботизированных рук, одновременно собиравших данные о захвате), в серию работ Robotics Transformer (RT-1, RT-2) и в создание нескольких основополагающих работ по глубокому RL, включая Soft Actor-Critic. Этот параллельный опыт работы в индустрии и академической науке был плодотворным в обоих направлениях: он привнёс масштаб и доступ к оборудованию в исследования Беркли, а в прикладные робототехнические проекты Google — теоретическую строгость.

Калифорнийский университет в Беркли, EECS — доцент (осень 2016 — наст. время)

Левин присоединился к факультету Беркли осенью 2016 года и основал Лабораторию RAIL (Robotic Artificial Intelligence and Learning Lab). Лаборатория выполнила огромный объём исследований в области глубокого RL, мета-обучения, офлайн RL и масштабного обучения роботов. Среди известных выпускников докторантуры — Челси Финн (ныне доцент Стэнфорда и сооснователь Physical Intelligence), которая под руководством Левина разработала MAML. Левин преподаёт CS 285: Deep Reinforcement Learning — один из самых популярных открытых курсов в этой области, записи лекций доступны на YouTube. Он также ведёт курс CS 182: Deep Learning. Он является лауреатом премии NSF CAREER Award и стипендии Sloan Research Fellowship (2019), а также получил президентскую награду для молодых учёных и инженеров (PECASE).

Physical Intelligence (pi.ai) — сооснователь и главный научный сотрудник (март 2024 — наст. время)

Physical Intelligence была основана в начале 2024 года Левиным вместе с Каролем Хаусманом (CEO, ранее Google DeepMind), Челси Финн (руководитель исследований, Стэнфорд), Брайаном Ихтером (ранее Google Research), Лэйчи Грумом (бывший руководитель Stripe), Аднаном Эсмаилом и Куаном Вуонгом. Компания привлекла $70 млн на посевном раунде (Seed) в марте 2024 года от Thrive Capital, Khosla Ventures, Lux Capital, OpenAI и Sequoia Capital. Затем последовали Раунд А на $400 млн (оценка $2,4 млрд) в конце 2024 года и Раунд B на $600 млн под руководством CapitalG, закрытый в ноябре 2025 года, что довело общий объём финансирования до более чем $1,1 млрд. Миссия Physical Intelligence — создание кросстемпоральных фундаментальных моделей: единой политики общего назначения, способной управлять любым роботом для выполнения любой физической задачи. Это достигается за счёт сочетания крупномасштабного сбора данных с роботов, алгоритмических достижений и методов обучения фундаментальных моделей. Левин занимает должность главного научного сотрудника, определяя научное направление разработки фундаментальных моделей, сохраняя при этом свою профессорскую позицию в Беркли.


Ключевые вклады

  • Guided Policy Search (GPS) (Левин и Колтун; ICML 2013) — Внедрена оптимизация траекторий как принципиальная стратегия исследования и контроля для обучения политике. Используется дифференциальное динамическое программирование для создания направляющих примеров и обучение с учителем для обучения самой политике. GPS стал первым масштабируемым методом глубокого RL для реальных робототехнических систем и лёг в основу нескольких последующих лет исследований в области обучения роботов.

  • End-to-End Training of Deep Visuomotor Policies (Левин, Финн, Даррелл, Аббил; Journal of Machine Learning Research, 2016) — Продемонстрирована возможность сквозного обучения глубоких свёрточных нейронных сетей, отображающих сырые изображения непосредственно в крутящие моменты двигателей робота, с использованием guided policy search. Это позволило роботам обучаться выполнению задач манипулирования, управляемых визуально, без ручной разработки модулей восприятия. Одна из самых цитируемых статей в области глубокого обучения роботов.

  • Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection (Левин и др.; International Journal of Robotics Research, 2018) — Развёрнут парк из 14 роботизированных рук, которые автономно собрали около 800 000 попыток захвата, обучив глубокую нейронную сеть предсказывать успешность захвата по изображениям. Показано, что масштаб и самоконтролируемый сбор данных могут заменить ручную инженерию в роботизированном восприятии.

  • Model-Agnostic Meta-Learning (MAML) (Финн, Аббил, Левин; ICML 2017) — Разработан совместно с докторанткой Челси Финн; предложен алгоритм мета-обучения, оптимизирующий быструю адаптацию к новым задачам с помощью небольшого числа шагов градиентного спуска, применимый к любой модели, основанной на градиенте. Одна из самых цитируемых статей по мета-обучению, оказавшая широкое влияние на обучение с немногими примерами и робототехнику.

  • Soft Actor-Critic (SAC) (Хаарнойя, Чжоу, Аббил, Левин; ICML 2018) — Представлен фреймворк обучения с подкреплением на основе максимума энтропии с офлайн-алгоритмом актор-критик, стабилизирующий обучение и повышающий эффективность использования выборки. SAC стал базовым алгоритмом для задач непрерывного управления в глубоком RL и одним из наиболее широко используемых RL-алгоритмов как в исследованиях, так и в приложениях.

  • Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems (Левин, Кумар, Такер, Фу; 2020) — Классический обзор, формализовавший офлайн RL как область, сформулировавший проблему смещения распределения и организовавший предыдущие и будущие работы в единую структуру. Цитируется как стандартный справочный источник по офлайн RL.

  • D4RL: Datasets for Deep Data-Driven Reinforcement Learning (Фу, Кумар, Нахум, Такер, Левин; 2020) — Выпущен стандартный набор тестов для офлайн RL, предоставляющий наборы данных, отражающие реальные проблемы распределения данных: демонстрации человека, данные смешанного качества, разнообразные структуры задач. D4RL стал канонической средой оценки для алгоритмов офлайн RL.

  • Conservative Q-Learning (CQL) (Кумар, Чжоу, Такер, Левин; NeurIPS 2020) — Предложен алгоритм офлайн RL, основанный на пессимизме, который регуляризирует Q-значения, делая их консервативными для действий вне распределения, что доказуемо решает проблему переоценки в офлайн-сценариях. CQL установил современные результаты на D4RL и повлиял на целое поколение последующих методов офлайн RL.

  • Implicit Q-Learning (IQL) (Костриков, Нэр, Левин; ICLR 2022) — Представлен алгоритм офлайн RL, который полностью избегает запросов к действиям вне распределения, изучая функцию ценности на основе данных внутри распределения. Сочетает простоту с высокой эмпирической производительностью на D4RL и реальных задачах роботов.

  • RT-2: Vision-Language-Action Models (Брохан и др., включая Левина; CoRL 2023) — Совместная разработка в Google с большой командой; продемонстрирована возможность точной настройки предварительно обученных моделей «зрение-язык» непосредственно в качестве политик действий робота, что позволяет обобщать на новые объекты и инструкции благодаря эмерджентным рассуждениям в стиле «цепочки мыслей». Основополагающая работа в парадигме VLA (Vision-Language-Action), которую сейчас развивают Physical Intelligence и другие.


Награды и признание

  • Президентская награда для молодых учёных и инженеров (PECASE) — Присуждена NSF за новаторские исследования, продвигающие американские инновации
  • Стипендия Sloan Research Fellowship (2019) — Фонд Альфреда П. Слоуна
  • Премия NSF CAREER Award
  • Цитирования в Google Scholar: более 247 000 (на май 2026 г.), что ставит его в число самых цитируемых исследователей в области машинного обучения и робототехники

Ключевые связи

  • Владлен Колтун — Научный руководитель докторской диссертации в Стэнфорде; учёный в области компьютерных наук, соавтор guided policy search, сформировавший раннее мышление Левина о сочетании оптимизации траекторий и обучения политике.

  • Питер Аббил — Руководитель постдокторантуры в Беркли и многолетний соавтор; работа по сквозной визомоторной политике и SAC были выполнены в совместных проектах; Лаборатория обучения роботов Аббила и Лаборатория RAIL Левина представляют взаимодополняющие исследовательские программы в Беркли.

  • Челси Финн — Самый известный докторант Левина; соавтор MAML и направления исследований по сквозной визомоторной политике; ныне доцент Стэнфорда, сооснователь и руководитель исследований в Physical Intelligence. Интеллектуальные и институциональные отношения между Левиным и Финн являются академической линией, лежащей в основе Physical Intelligence.

  • Кароль Хаусман — Сооснователь и CEO Physical Intelligence; ранее исследователь в Google DeepMind, вместе с Левиным и Финн основавший компанию.

  • Авирал Кумар — Докторант в Беркли, первый автор CQL и D4RL; представляет направление офлайн RL в лаборатории Левина, ставшее одним из самых влиятельных исследовательских направлений.

  • Туомас Хаарнойя — Соавтор и первый автор Soft Actor-Critic; участник совместной исследовательской среды Беркли и Google, в которой был создан SAC; ныне исследователь в Google DeepMind.

  • Владлен Колтун (см. выше) и более широкая стэнфордская генеалогия Сергея — Сам Колтун был научным руководителем в Стэнфорде; эта линия влияния связывает Левина с традицией вычислительно строгого мышления об оптимизации и геометрии, адаптированной для управления роботами.


Личный стиль

Исследования Левина характеризуются последовательным стремлением заменить ручную инженерию общими обучающимися системами — убеждением, которое он выражает, начиная с guided policy search в 2013 году и заканчивая кросстемпоральными фундаментальными моделями в 2024 году. Он описал центральную проблему робототехники не как проблему оборудования, а как проблему данных и обучения, неоднократно утверждая в лекциях, сообщениях в блогах и в своём Substack («Learning and Control»), что те же механизмы масштабирования данных, которые преобразовали NLP и компьютерное зрение, преобразуют и робототехнику, если будут созданы правильные алгоритмы и инфраструктура данных. Он необычайно активный популяризатор науки: курс CS 285 собирает сотни тысяч просмотров на YouTube и широко используется в качестве курса для аспирантов в других вузах; его статьи на Substack и в Medium предлагают доступные объяснения офлайн RL и обучения роботов для широкой технической аудитории. В X (@svlevine) его посты отражают стиль информирования и обучения, что согласуется с его взглядом на публичное образование как на неотъемлемую часть исследовательской миссии, а не как на её побочный продукт.


Ссылки