加州大学伯克利分校EECS教授、Covariant与Gradescope联合创始人、2021年ACM计算奖得主,也是现代人工智能领域最具影响力的博士生导师之一——其学生共同创立了OpenAI、Physical Intelligence、Perplexity等十余家公司。
个人资料
| 领域 | 详情 |
|---|---|
| 出生 | 1977年,比利时安特卫普 |
| 国籍 | 比利时裔美国籍 |
| 现任职务 | 加州大学伯克利分校EECS教授;亚马逊学者(AGI/LLM);BAIR联合主任 |
| 研究方向 | 机器人学习、深度强化学习、学徒学习、模仿学习、机器人基础模型 |
| 博士导师 | 吴恩达(斯坦福大学) |
| 博士论文 | Apprenticeship Learning and Reinforcement Learning with Application to Robotic Control(斯坦福,2008年) |
| 学术网站 | people.eecs.berkeley.edu/~pabbeel |
| X / Twitter | @pabbeel |
| GitHub | @pabbeel |
| Google Scholar | scholar.google.com |
简介
Pieter Abbeel是加州大学伯克利分校电气工程与计算机科学系的比利时裔美国教授、伯克利人工智能研究(BAIR)实验室联合主任,也是过去二十年间机器人学习领域最具影响力的人物之一。他于2021年获得ACM计算奖——这是该领域最具声望的早期至中期职业生涯奖项之一——以表彰其在机器人控制的学徒学习和深度强化学习方面的开创性贡献。他的方法性贡献横跨强化学习的经典与深度学习时代:从通过逆强化学习进行的学徒学习(2004年),到TRPO(2015年)、MAML(2017年)、Soft Actor-Critic、Domain Randomization和Hindsight Experience Replay。他联合创立了Gradescope(2018年被Turnitin收购)和Covariant,一家机器人基础模型公司,其技术于2024年被亚马逊收购;2025年12月,他被任命领导亚马逊AGI组织内的LLM工作。他最持久的制度性贡献或许是其学生谱系:其实验室的校友共同创立了OpenAI、Physical Intelligence、Perplexity、Skild、Ideogram、Genmo等十余家人工智能公司。
早年生活与教育
Abbeel于1977年出生在安特卫普,在附近的郊区Brasschaat长大。在Sint-Michielscollege读高中时,他参加了俱乐部篮球队——这项运动他延续到了大学阶段。他曾提到,早年认识到人工智能可以作为跨学科的通用工具,以及智能是区分人类与其他物种的关键因素,这成为他进入该领域的动力。
B.S. 和 M.S.,电气工程——比利时荷语鲁汶大学,2000年
Abbeel在比利时领先的研究型大学荷语鲁汶大学完成了这两个学位,期间一直参加大学篮球队。
Ph.D.,计算机科学——斯坦福大学,2008年
Abbeel是吴恩达的第一位博士生,当时吴恩达刚在斯坦福担任助理教授。他的博士论文《面向机器人控制的学徒学习与强化学习》奠定了从示范中学习的理论和实证基础——特别是通过逆强化学习从专家行为中推断奖励函数的框架。该论文证明了直升机可以通过观察专家飞行员的操作,而非手动编程所需的控制规则,来学习达到与人类专家飞行员相当的技巧水平。他最初只打算攻读硕士学位,但由于斯坦福在吴恩达领导下集中了大量人工智能项目,他留下来完成了博士学位。
职业生涯
加州大学伯克利分校——教授(2008年至今)
Abbeel于2008年加入伯克利,担任EECS助理教授,一到任便创立了伯克利机器人学习实验室,并于2017年晋升为终身正教授。2016年,他成为BAIR的联合主任。
学徒学习与机器人操作(2008-2015年)
Abbeel的伯克利团队将直升机学徒学习成果扩展到了广泛的操作任务。其中最受公众瞩目的是布料和衣物折叠——展示了机器人能够通过结合新颖的视觉感知、基于物理的追踪和从示范中学习,来感知和操作可变形物体。折叠衣物的机器人成为科普报道中机器人学习的标志性形象,被包括BBC、《纽约时报》和《滚石》在内的众多媒体报道。伯克利的其他早期成果还包括手术缝合和打结。
OpenAI——同期研究角色(2016年)
在与伯克利教职重叠的时期,Abbeel与OpenAI有关联,并与John Schulman及其他OpenAI研究员共同发表了关于强化学习和控制的研究。他团队在这一时期对深度强化学习的贡献,特别是TRPO和GAE,是在其伯克利实验室与早期OpenAI环境的交叉点上发展起来的。
TRPO 和 GAE(2015年)
Trust Region Policy Optimization(TRPO),与John Schulman、Sergey Levine、Philipp Moritz和Michael Jordan合作,引入了一种理论上严谨的策略梯度更新约束,使得稳定的大规模深度强化学习成为可能——首次在模拟物理中展示了3D运动。Generalized Advantage Estimation(GAE),同样来自此项合作,提供了一个统一的方差减少框架。这两篇论文都成为深度强化学习时代的基础。
MAML(2017年)
Model-Agnostic Meta-Learning(Finn, Abbeel, Levine;ICML 2017)引入了一种基于梯度的元学习算法,实现了少样本快速适应;是十年来被引用次数最多的机器学习论文之一。
Domain Randomization, SAC, Hindsight Experience Replay, Decision Transformer
来自Abbeel团队的更多深度强化学习贡献:Domain Randomization(在随机化模拟中训练以实现模拟到现实的迁移)、Soft Actor-Critic(现已成为最流行的连续控制强化学习算法之一)、Hindsight Experience Replay(在稀疏奖励、目标导向环境中实现强化学习)和Decision Transformer(将强化学习构建为使用Transformer的序列建模)。
深度无监督学习(CS294-158)
Abbeel开发并在伯克利教授了《深度无监督学习》——一门涵盖生成模型的研究生课程,包括VAE、归一化流、GAN、扩散模型和自监督学习。多个版本的讲座视频已公开发布,并被广泛用作参考资料。
Gradescope——联合创始人(2014-2018年)
2014年,Abbeel与伯克利相关的工程师Arjun Singh、Sergey Karayev和Ibrahim Awwal共同创立了Gradescope。Gradescope是一个在线评分平台,利用计算机视觉和人工智能简化手写作业和考试的评分流程;目前美国超过500所大学在使用该平台。该公司于2018年被Turnitin收购。
Covariant——联合创始人(2017-2024年)
2017年10月,Abbeel与他的三位博士生Peter Chen、Rocky Duan和Tianhao Zhang共同创立了Covariant(最初名为Embodied Intelligence)。公司的使命是构建通用人工智能,使机器人能够通过深度模仿和强化学习在仓库和工厂环境中感知和操作物体。Covariant于2020年1月公开启动,并通过多轮融资筹集了约1.47亿美元。其旗舰产品RFM-1(机器人基础模型)将基础模型预训练应用于机器人操作任务——将Covariant定位在大规模人工智能与物理自动化交汇点。
2024年8月,亚马逊同意授权Covariant的机器人基础模型,并聘用了包括Abbeel在内的公司创始人进入亚马逊更广泛的人工智能组织。随后《华盛顿邮报》的一篇报道称,在关键资产和团队被收购后,这一安排使Covariant本身变成了一个“僵尸初创公司”。
亚马逊——亚马逊学者与AGI/LLM角色(2024年至今)
在Covariant被收购后,Abbeel加入亚马逊。2025年12月,他被任命领导亚马逊AGI组织内的LLM工作,同时继续从事机器人研究——这反映了亚马逊将基础模型能力与其物理物流和自动化系统相结合的整合。他作为亚马逊学者保留伯克利教职。
AIX Ventures——投资合伙人(2021年)
Abbeel于2021年加入AIX Ventures担任投资合伙人,该公司是Percy Liang和Richard Socher同为合伙人的聚焦人工智能的风险基金。
The Robot Brains播客
Abbeel主持《The Robot Brains》,一个每周更新的播客,内容涉及与人工智能和机器人研究人员及从业者的对话。该播客已成为面向公众进行机器人学习及其前沿深度讨论的主要平台之一。
主要贡献
-
通过逆强化学习的学徒学习(ICML 2004,与吴恩达)——引入了从专家示范中推断奖励函数并使用它来训练智能体的框架,实现了人类专家水平的直升机特技飞行;是整个模仿学习领域的基础。
-
衣物折叠与布料操作——伯克利实验室证明了机器人能够通过结合新的视觉、物理和学习方法来感知和操作可变形物体;是机器人操作研究的里程碑,也是基于学习的操作的高调概念验证。
-
TRPO (Trust Region Policy Optimization)(ICML 2015,与Schulman, Levine, Moritz, Jordan)——具有信任区域约束的原则性策略梯度更新;实现了稳定的大规模深度强化学习,并产生了首个3D运动结果;另见John Schulman维基百科。
-
MAML (Model-Agnostic Meta-Learning)(ICML 2017,与Finn和Levine)——基于梯度的元学习算法,实现了快速少样本适应;是十年来被引用次数最多的机器学习论文之一。
-
Soft Actor-Critic (SAC)——用于连续控制的最广泛使用的深度强化学习算法之一;将离策略学习与最大熵强化学习相结合,以提高样本效率和稳定性。
-
Domain Randomization——框架表明在多样化的随机模拟条件下进行训练,可以使策略无需明确的模拟到现实迁移工程就能泛化到现实世界;现已成为机器人强化学习的标准实践。
-
Hindsight Experience Replay (HER)——通过在稀疏奖励、目标条件环境中用实际实现的目标重新标记失败的轨迹,实现强化学习;在实际的目标导向环境中实现了操作学习的可能性。
-
Decision Transformer——使用Transformer将强化学习构建为序列建模问题,通过以目标回报为条件实现离线强化学习;在连接强化学习和基础模型研究社区方面具有影响力。
-
扩散模型(通过学生/合作者)——Abbeel的团队为扩散模型在机器人和生成式人工智能背景下的发展做出了贡献。
-
RFM-1 (机器人基础模型)——Covariant的模型,将大规模预训练应用于跨多种物体和环境的工业机器人操作。
-
Gradescope——基于人工智能的评分平台,现已部署在500多所大学;展示了Abbeel致力于构建超越纯研究的有用系统的一贯取向。
-
深度无监督学习课程 (CS294-158)——公开的涵盖生成模型的系列讲座,已成为研究生机器学习教育的标准资源。
奖项与荣誉
- ACM计算奖(2021年)——授予在机器人学习方面的贡献,包括用于机器人控制的学徒学习和深度强化学习;奖金为25万美元。
- 美国总统青年科学家与工程师奖
- 美国国家科学基金会杰出青年学者奖
- 海军研究办公室青年研究员项目
- DARPA青年教授奖
- 麻省理工学院技术评论TR35
- IEEE Fellow
- ACM Fellow(待核实)
学术谱系
以创立公司的数量来衡量,Abbeel的学生指导记录是人工智能历史上最具影响力的之一:
- John Schulman — 博士;共同创立OpenAI;开发了TRPO和PPO;曾任职于Anthropic;现任职于Thinking Machines Lab。
- Chelsea Finn — 博士;开发了MAML;共同创立Physical Intelligence;现为斯坦福大学副教授。
- Aravind Srinivas — 博士;共同创立了人工智能原生搜索引擎Perplexity AI。
- Sergey Levine — 博士(联合指导);共同创立Physical Intelligence;现为加州大学伯克利分校副教授。
- Peter Chen, Rocky Duan, Tianhao Zhang — 与Abbeel共同创立Covariant的博士生。
- Deepak Pathak — 共同创立Skild。
- Jonathan Ho — 共同创立Ideogram;扩散模型研究的关键贡献者。
- Ajay Jain — 共同创立Genmo。
- Misha Laskin — 创立Reflection AI。
- Roshan Rao — 共同创立Evolutionary Scale(蛋白质语言模型)。
关键关系
- 吴恩达 — 斯坦福的博士导师;Abbeel是吴恩达在担任助理教授时的第一位博士生;他们共同开发的学徒学习框架成为Abbeel标志性的早期贡献。
- John Schulman — 博士生和最长久的科研合作者;他们在TRPO和GAE上的联合工作是深度强化学习领域被引用最多的成果之一;Schulman后来借助Abbeel的人脉网络共同创立OpenAI,完成了一个规模空前的师生循环。
- Chelsea Finn — 博士生;MAML是Finn、Abbeel和Levine的三方合作;Finn后来在斯坦福和Physical Intelligence的职业生涯反映了Abbeel实验室制定的研究方向。
- Sergey Levine — 博士校友,现为伯克利同事;Physical Intelligence的创始团队(Finn和Levine)直接来自Abbeel的学术家族;他们在伯克利持续的联合指导关系延续了合作。
- Michael I. Jordan — 伯克利资深同事和TRPO的合著者;Jordan对Abbeel强化学习工作的数学基础的影响连接了两代伯克利机器学习。
- Percy Liang — AIX Ventures的共同投资者;他们在伯克利/斯坦福人工智能社区和AIX Ventures的共享职位反映了湾区人工智能研究密集的机构网络。
个人风格
Abbeel的研究议程以持续推动机器人在物理世界中真正有用为特征,而非在受控的实验室演示中令人印象深刻。他团队的里程碑——直升机特技、衣物折叠、手术缝合、仓库操作——都经过精心挑选,兼顾了公众认知度和技术难度;它们证明了基于学习的方法能够处理物理任务混乱、可变形、部分可观察的现实,而不仅仅是干净、刚性、规定明确的任务。他的机构投资——BAIR、Covariant、Gradescope、深度无监督学习课程、The Robot Brains播客——反映了对基础设施和可访问性的并行承诺:构建研究发生的平台,以及更广泛社区与之互动的平台。他在X/Twitter上的风格(35.8%“告知”,21.5%“宣布”,10%“教学”)以及The Robot Brains播客推广的主导话题,表明他是一位将自己视为生态系统建设者而非单纯初级研究人员的沟通者。
参考资料
- Wikipedia — Pieter Abbeel
- Berkeley EECS profile
- VC Research Berkeley profile
- X / Twitter — @pabbeel
- Digg profile
- Google Scholar
- ACM Prize in Computing — 2021 citation
- Wikipedia — Covariant
- Wikipedia — Gradescope
- FT — Amazon AGI reorganization (2025)
- The Robot Brains Podcast