Доцент Калифорнийского университета в Беркли, сооснователь и главный научный сотрудник Physical Intelligence. Его исследования в области глубокого обучения с подкреплением (deep reinforcement learning), офлайн-обучения с подкреплением (offline RL) и обучения визомоторной политике (visuomotor policy learning) сделали его одним из самых цитируемых исследователей в робототехнике и машинном обучении — более 247 000 цитирований по данным Google Scholar.
Профиль
| Поле | Сведения |
|---|---|
| Полное имя | Сергей Левин (Sergey Levine) |
| Дата рождения | Не разглашается |
| Гражданство | США |
| Основное место работы | Калифорнийский университет в Беркли, факультет электротехники и компьютерных наук (EECS) |
| Текущая должность | Доцент; сооснователь и главный научный сотрудник Physical Intelligence |
| Области исследований | Глубокое обучение с подкреплением, офлайн RL, обучение роботов, имитационное обучение, визомоторная политика, фундаментальные модели для робототехники |
| Тема докторской диссертации | Компьютерные науки, Стэнфордский университет, 2014 г. |
| Научный руководитель | Владлен Колтун (Vladlen Koltun) |
| Исследовательская группа | Лаборатория RAIL (Robotic Artificial Intelligence and Learning) |
| Личный сайт | people.eecs.berkeley.edu/~svlevine |
| Substack | Learning and Control |
| X / Twitter | @svlevine |
| Google Scholar | 8R35rCwAAAAJ |
Обзор
Сергей Левин — доцент кафедры электротехники и компьютерных наук Калифорнийского университета в Беркли, сооснователь и главный научный сотрудник Physical Intelligence (pi.ai) — ведущего стартапа, создающего фундаментальные модели для роботов общего назначения. Его исследовательская программа охватывает глубокое обучение с подкреплением для управления роботами, офлайн RL, мета-обучение и крупномасштабное обучение визомоторной политике. Он является автором ряда широко используемых алгоритмов и эталонных тестов, включая guided policy search, сквозные визомоторные политики, Soft Actor-Critic (SAC), Conservative Q-Learning (CQL) и набор тестов D4RL, которые в совокупности определяют современный ландшафт обучения роботов. Имея более 247 000 цитирований в Google Scholar по состоянию на 2026 год, он входит в число самых цитируемых исследователей, работающих на стыке машинного обучения и робототехники. В Беркли он руководит лабораторией RAIL Lab и читает популярный курс CS 285: «Глубокое обучение с подкреплением». В марте 2024 года он стал сооснователем Physical Intelligence вместе с Челси Финн (Chelsea Finn), Каролем Хаусманом (Karol Hausman), Брайаном Ихтером (Brian Ichter) и другими. Компания привлекла более 1,1 миллиарда долларов инвестиций и разрабатывает кросстемпоральные фундаментальные модели для роботов.
Ранние годы и образование
Левин получил степень бакалавра и магистра компьютерных наук в Стэнфордском университете в 2009 году, после чего продолжил обучение в докторантуре там же. Кандидатскую диссертацию по компьютерным наукам он защитил в 2014 году под руководством Владлена Колтуна (в то время доцента компьютерных наук в Стэнфорде и исследователя Adobe Research). В своей докторской диссертации он разработал фреймворк guided policy search, который использует оптимизацию траекторий для направления и стабилизации обучения политике в сложных роботизированных системах. После получения докторской степени он прошёл постдокторантуру в Robot Learning Lab в Беркли под руководством Питера Аббила (Pieter Abbeel), где разработал метод сквозного обучения визомоторной политике, ставший одной из самых влиятельных ранних работ в области глубокого обучения роботов. Во время учёбы на бакалавриате он также проходил стажировку в NVIDIA.
Карьера
Google Brain — научный сотрудник (2015 – ок. 2021)
Левин присоединился к Google Brain в 2015 году в качестве внештатного научного сотрудника, ещё во время постдокторантуры, и сохранял эту связь после перехода на факультет Беркли в 2016 году. В Google Brain он участвовал в крупномасштабном обучении роботов, внёс вклад в проект Learning Hand-Eye Coordination (парк из 14 роботизированных рук, одновременно собиравших данные о захвате), в серию работ Robotics Transformer (RT-1, RT-2) и в создание нескольких основополагающих работ по глубокому RL, включая Soft Actor-Critic. Этот параллельный опыт работы в индустрии и академической науке был плодотворным в обоих направлениях: он привнёс масштаб и доступ к оборудованию в исследования Беркли, а в прикладные робототехнические проекты Google — теоретическую строгость.
Калифорнийский университет в Беркли, EECS — доцент (осень 2016 — наст. время)
Левин присоединился к факультету Беркли осенью 2016 года и основал Лабораторию RAIL (Robotic Artificial Intelligence and Learning Lab). Лаборатория выполнила огромный объём исследований в области глубокого RL, мета-обучения, офлайн RL и масштабного обучения роботов. Среди известных выпускников докторантуры — Челси Финн (ныне доцент Стэнфорда и сооснователь Physical Intelligence), которая под руководством Левина разработала MAML. Левин преподаёт CS 285: Deep Reinforcement Learning — один из самых популярных открытых курсов в этой области, записи лекций доступны на YouTube. Он также ведёт курс CS 182: Deep Learning. Он является лауреатом премии NSF CAREER Award и стипендии Sloan Research Fellowship (2019), а также получил президентскую награду для молодых учёных и инженеров (PECASE).
Physical Intelligence (pi.ai) — сооснователь и главный научный сотрудник (март 2024 — наст. время)
Physical Intelligence была основана в начале 2024 года Левиным вместе с Каролем Хаусманом (CEO, ранее Google DeepMind), Челси Финн (руководитель исследований, Стэнфорд), Брайаном Ихтером (ранее Google Research), Лэйчи Грумом (бывший руководитель Stripe), Аднаном Эсмаилом и Куаном Вуонгом. Компания привлекла $70 млн на посевном раунде (Seed) в марте 2024 года от Thrive Capital, Khosla Ventures, Lux Capital, OpenAI и Sequoia Capital. Затем последовали Раунд А на $400 млн (оценка $2,4 млрд) в конце 2024 года и Раунд B на $600 млн под руководством CapitalG, закрытый в ноябре 2025 года, что довело общий объём финансирования до более чем $1,1 млрд. Миссия Physical Intelligence — создание кросстемпоральных фундаментальных моделей: единой политики общего назначения, способной управлять любым роботом для выполнения любой физической задачи. Это достигается за счёт сочетания крупномасштабного сбора данных с роботов, алгоритмических достижений и методов обучения фундаментальных моделей. Левин занимает должность главного научного сотрудника, определяя научное направление разработки фундаментальных моделей, сохраняя при этом свою профессорскую позицию в Беркли.
Ключевые вклады
-
Guided Policy Search (GPS) (Левин и Колтун; ICML 2013) — Внедрена оптимизация траекторий как принципиальная стратегия исследования и контроля для обучения политике. Используется дифференциальное динамическое программирование для создания направляющих примеров и обучение с учителем для обучения самой политике. GPS стал первым масштабируемым методом глубокого RL для реальных робототехнических систем и лёг в основу нескольких последующих лет исследований в области обучения роботов.
-
End-to-End Training of Deep Visuomotor Policies (Левин, Финн, Даррелл, Аббил; Journal of Machine Learning Research, 2016) — Продемонстрирована возможность сквозного обучения глубоких свёрточных нейронных сетей, отображающих сырые изображения непосредственно в крутящие моменты двигателей робота, с использованием guided policy search. Это позволило роботам обучаться выполнению задач манипулирования, управляемых визуально, без ручной разработки модулей восприятия. Одна из самых цитируемых статей в области глубокого обучения роботов.
-
Learning Hand-Eye Coordination for Robotic Grasping with Deep Learning and Large-Scale Data Collection (Левин и др.; International Journal of Robotics Research, 2018) — Развёрнут парк из 14 роботизированных рук, которые автономно собрали около 800 000 попыток захвата, обучив глубокую нейронную сеть предсказывать успешность захвата по изображениям. Показано, что масштаб и самоконтролируемый сбор данных могут заменить ручную инженерию в роботизированном восприятии.
-
Model-Agnostic Meta-Learning (MAML) (Финн, Аббил, Левин; ICML 2017) — Разработан совместно с докторанткой Челси Финн; предложен алгоритм мета-обучения, оптимизирующий быструю адаптацию к новым задачам с помощью небольшого числа шагов градиентного спуска, применимый к любой модели, основанной на градиенте. Одна из самых цитируемых статей по мета-обучению, оказавшая широкое влияние на обучение с немногими примерами и робототехнику.
-
Soft Actor-Critic (SAC) (Хаарнойя, Чжоу, Аббил, Левин; ICML 2018) — Представлен фреймворк обучения с подкреплением на основе максимума энтропии с офлайн-алгоритмом актор-критик, стабилизирующий обучение и повышающий эффективность использования выборки. SAC стал базовым алгоритмом для задач непрерывного управления в глубоком RL и одним из наиболее широко используемых RL-алгоритмов как в исследованиях, так и в приложениях.
-
Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems (Левин, Кумар, Такер, Фу; 2020) — Классический обзор, формализовавший офлайн RL как область, сформулировавший проблему смещения распределения и организовавший предыдущие и будущие работы в единую структуру. Цитируется как стандартный справочный источник по офлайн RL.
-
D4RL: Datasets for Deep Data-Driven Reinforcement Learning (Фу, Кумар, Нахум, Такер, Левин; 2020) — Выпущен стандартный набор тестов для офлайн RL, предоставляющий наборы данных, отражающие реальные проблемы распределения данных: демонстрации человека, данные смешанного качества, разнообразные структуры задач. D4RL стал канонической средой оценки для алгоритмов офлайн RL.
-
Conservative Q-Learning (CQL) (Кумар, Чжоу, Такер, Левин; NeurIPS 2020) — Предложен алгоритм офлайн RL, основанный на пессимизме, который регуляризирует Q-значения, делая их консервативными для действий вне распределения, что доказуемо решает проблему переоценки в офлайн-сценариях. CQL установил современные результаты на D4RL и повлиял на целое поколение последующих методов офлайн RL.
-
Implicit Q-Learning (IQL) (Костриков, Нэр, Левин; ICLR 2022) — Представлен алгоритм офлайн RL, который полностью избегает запросов к действиям вне распределения, изучая функцию ценности на основе данных внутри распределения. Сочетает простоту с высокой эмпирической производительностью на D4RL и реальных задачах роботов.
-
RT-2: Vision-Language-Action Models (Брохан и др., включая Левина; CoRL 2023) — Совместная разработка в Google с большой командой; продемонстрирована возможность точной настройки предварительно обученных моделей «зрение-язык» непосредственно в качестве политик действий робота, что позволяет обобщать на новые объекты и инструкции благодаря эмерджентным рассуждениям в стиле «цепочки мыслей». Основополагающая работа в парадигме VLA (Vision-Language-Action), которую сейчас развивают Physical Intelligence и другие.
Награды и признание
- Президентская награда для молодых учёных и инженеров (PECASE) — Присуждена NSF за новаторские исследования, продвигающие американские инновации
- Стипендия Sloan Research Fellowship (2019) — Фонд Альфреда П. Слоуна
- Премия NSF CAREER Award
- Цитирования в Google Scholar: более 247 000 (на май 2026 г.), что ставит его в число самых цитируемых исследователей в области машинного обучения и робототехники
Ключевые связи
-
Владлен Колтун — Научный руководитель докторской диссертации в Стэнфорде; учёный в области компьютерных наук, соавтор guided policy search, сформировавший раннее мышление Левина о сочетании оптимизации траекторий и обучения политике.
-
Питер Аббил — Руководитель постдокторантуры в Беркли и многолетний соавтор; работа по сквозной визомоторной политике и SAC были выполнены в совместных проектах; Лаборатория обучения роботов Аббила и Лаборатория RAIL Левина представляют взаимодополняющие исследовательские программы в Беркли.
-
Челси Финн — Самый известный докторант Левина; соавтор MAML и направления исследований по сквозной визомоторной политике; ныне доцент Стэнфорда, сооснователь и руководитель исследований в Physical Intelligence. Интеллектуальные и институциональные отношения между Левиным и Финн являются академической линией, лежащей в основе Physical Intelligence.
-
Кароль Хаусман — Сооснователь и CEO Physical Intelligence; ранее исследователь в Google DeepMind, вместе с Левиным и Финн основавший компанию.
-
Авирал Кумар — Докторант в Беркли, первый автор CQL и D4RL; представляет направление офлайн RL в лаборатории Левина, ставшее одним из самых влиятельных исследовательских направлений.
-
Туомас Хаарнойя — Соавтор и первый автор Soft Actor-Critic; участник совместной исследовательской среды Беркли и Google, в которой был создан SAC; ныне исследователь в Google DeepMind.
-
Владлен Колтун (см. выше) и более широкая стэнфордская генеалогия Сергея — Сам Колтун был научным руководителем в Стэнфорде; эта линия влияния связывает Левина с традицией вычислительно строгого мышления об оптимизации и геометрии, адаптированной для управления роботами.
Личный стиль
Исследования Левина характеризуются последовательным стремлением заменить ручную инженерию общими обучающимися системами — убеждением, которое он выражает, начиная с guided policy search в 2013 году и заканчивая кросстемпоральными фундаментальными моделями в 2024 году. Он описал центральную проблему робототехники не как проблему оборудования, а как проблему данных и обучения, неоднократно утверждая в лекциях, сообщениях в блогах и в своём Substack («Learning and Control»), что те же механизмы масштабирования данных, которые преобразовали NLP и компьютерное зрение, преобразуют и робототехнику, если будут созданы правильные алгоритмы и инфраструктура данных. Он необычайно активный популяризатор науки: курс CS 285 собирает сотни тысяч просмотров на YouTube и широко используется в качестве курса для аспирантов в других вузах; его статьи на Substack и в Medium предлагают доступные объяснения офлайн RL и обучения роботов для широкой технической аудитории. В X (@svlevine) его посты отражают стиль информирования и обучения, что согласуется с его взглядом на публичное образование как на неотъемлемую часть исследовательской миссии, а не как на её побочный продукт.
Ссылки
- Личная страница в Беркли: people.eecs.berkeley.edu/~svlevine
- Лаборатория RAIL: rail.eecs.berkeley.edu
- Substack: sergeylevine.substack.com
- X: x.com/svlevine
- Google Scholar: scholar.google.com/citations?user=8R35rCwAAAAJ
- LinkedIn: linkedin.com/in/sergey-levine-5a31a24
- Анонс Physical Intelligence (март 2024): techstartups.com
- TechCrunch о Physical Intelligence (январь 2026): techcrunch.com/2026/01/30/physical-intelligence
- Анонс CapitalG о раунде B (ноябрь 2025): capitalg.com/insights/physical-intelligence
- Профиль Digg: digg.com/u/x/svlevine