Jan Leike

德国人工智能安全研究员,领导Anthropic的Alignment Science团队,以共同原型化基于人类反馈的强化学习以及因安全担忧公开离开OpenAI而闻名。


简介

出生 1986年或1987年,德国
国籍 德国
现任机构 Anthropic(Alignment Science团队主管)
研究领域 AI对齐、基于人类反馈的强化学习(RLHF)、可扩展监督、弱到强泛化、自动化对齐研究
博士导师 Marcus Hutter
博士论文 非参数通用强化学习(澳大利亚国立大学,2016年)
个人网站 jan.leike.name
博客 aligned.substack.com
X / Twitter @janleike
GitHub janleike
Google Scholar Jan Leike

概述

Jan Leike是AI对齐史上最重要的研究者之一,处于基础理论与前沿系统工作交汇处的罕见位置。作为DeepMind的研究员,他共同原型化了基于人类反馈的强化学习——这项技术成为现代对齐语言模型的支柱。在OpenAI,他与Ilya Sutskever共同领导Superalignment团队,监督InstructGPT、ChatGPT和GPT-4的对齐工作,并共同撰写了该领域对齐超级智能系统最著名的研究路线图。他于2024年5月从OpenAI辞职——同时公开声明安全文化“已让位于闪亮的产品”——成为AI安全公共史上最具标志性的时刻之一。此后不久,他加入Anthropic,领导Alignment Science团队。《时代》杂志将他列为2023年和2024年AI领域最具影响力的100人之一。


早年生活与教育

Leike在德国长大。他在弗莱堡大学获得本科学位,获得计算机科学硕士学位后,在澳大利亚国立大学师从Marcus Hutter攻读机器学习博士学位。Hutter是AIXI的创建者,这是一个通用智能体的理论模型,而Leike的博士工作——非参数通用强化学习——的知识框架根植于Hutter开创的算法信息论传统。他的论文《非参数通用强化学习》(2016)探讨了在无参数假设环境中RL智能体理论极限的基本问题。

博士毕业后,Leike在牛津大学人类未来研究所做了六个月的博士后研究,随后加入DeepMind专注于实证AI安全研究。


职业生涯

DeepMind(约2016–2021年)

在伦敦DeepMind的安全团队中,Leike原型化了基于人类反馈的强化学习。具有里程碑意义的论文《基于人类偏好的深度强化学习》(NeurIPS 2017)与Paul Christiano、Tom Brown、Miljan Martic、Shane Legg和Dario Amodei共同撰写,提出使用非专家人类对轨迹片段的比较而非手工指定的奖励函数来训练RL智能体。该论文证明,在比以前从人类反馈中学习的任何环境都复杂得多的环境中,大约一小时的训练时间就能学习到复杂的新行为。这项工作将RLHF确立为一种实用的对齐技术,后来成为InstructGPT、ChatGPT和Claude的方法论核心。

在此期间,Leike还与David Krueger、Tom Everitt和Shane Legg共同发表了《通过奖励建模实现可扩展智能体对齐:一个研究方向》(2018),概述了通过迭代奖励建模来扩展对齐的研究项目——这是后来Superalignment议程的早期正式阐述。

OpenAI(2021年–2024年5月)

Leike于2021年加入OpenAI,担任Alignment负责人。他参与了InstructGPT、ChatGPT的开发以及GPT-4的对齐工作,并且是InstructGPT论文(NeurIPS 2022)的合著者之一,该论文引入了监督微调和随后的RLHF训练,以产生更符合人类指令的模型。

2023年6月,他和Ilya Sutskever成为新推出的Superalignment项目的联合负责人,该项目旨在确定如何在四年内对齐未来的人工超级智能。该项目宣布时,OpenAI公开承诺将其20%的计算资源用于超级对齐研究。Leike还制定了OpenAI的对齐研究方法,并共同撰写了Superalignment团队的研究路线图。

辞职 2024年5月,Leike在Ilya Sutskever离职后的数小时内从OpenAI辞职。他在X上的公开辞职声明异常直接。他指责OpenAI及其领导者忽视安全文化而偏爱闪亮的产品,并表示“我长期以来一直不同意OpenAI领导层关于公司核心优先事项的看法,直到我们最终达到了一个临界点。”他写道,“制造比人类更聪明的机器是一项固有的危险事业”,而“OpenAI必须成为一个安全至上的AGI公司。”他指出,尽管OpenAI做出了公开承诺,但他的团队一直在“逆风航行”,并且难以获得计算资源。几天之内,OpenAI完全解散了Superalignment团队,将其成员重新分配到其他研究小组。

Anthropic(2024年5月至今)

2024年5月,Leike加入了由前OpenAI员工创立的AI公司Anthropic。他领导Alignment Science团队,该团队致力于解决使AI系统在人类评估困难或不足的任务上按预期行为的最棘手的开放性问题。他的团队正在研究如何对齐自动化的对齐研究员,致力于可扩展监督、弱到强泛化以及对越狱攻击的鲁棒性。


主要贡献

  • 基于人类偏好的深度强化学习(NeurIPS 2017)——与Paul Christiano、Tom Brown、Miljan Martic、Shane Legg和Dario Amodei在DeepMind共同撰写。该论文引入了RLHF的实用版本,从非专家的人类对轨迹片段的比较中训练智能体。它成为对齐现代大型语言模型(包括InstructGPT、ChatGPT、Claude等)的方法论基础。

  • 通过奖励建模实现可扩展智能体对齐(2018)——与Krueger、Everitt、Martic、Maini和Legg共同撰写。概述了将迭代奖励建模作为可扩展对齐路径的系统性研究议程;是后来支撑Superalignment计划的早期蓝图。

  • InstructGPT——使用人类反馈训练语言模型遵循指令(NeurIPS 2022)——该论文的资深作者,论文介绍了InstructGPT,它结合了监督微调和RLHF,生成了与人类意图对齐得更好的语言模型。这项工作直接促成了ChatGPT的开发。

  • 超级对齐研究路线图(2023)——与Ilya Sutskever共同领导;共同撰写了使用当前或近期AI在四年内对齐超级智能系统的技术计划。引入了弱到强泛化的概念作为核心技术方法。

  • 弱到强泛化(ICML 2024)——与Collin Burns、Pavel Izmailov、Jan Hendrik Kirchner等人(包括Ilya Sutskever)共同撰写。提出并实验证明,弱模型的监督可以用于激发更强大模型的能力——这是对齐比其监督者更智能的系统的一个关键机制。

  • LLM评论员有助于发现LLM错误(2024)——来自OpenAI对齐团队的首批工作之一,证明了GPT-4能够以可观的比率识别其自身输出中的错误,为可扩展监督研究计划做出了贡献。

  • Aligned Substack——一个活跃的研究博客,Leike在此发表关于对齐概念的易读性论述,包括关于“对齐的难题”、可扩展监督和自动化对齐研究的基础性文章;在塑造该领域的概念词汇方面具有影响力。


奖项与认可

  • TIME100 AI(2023年和2024年)——极少数两次入选的研究员之一;因对AI对齐研究的贡献以及公开坦诚安全风险而受到表彰。
  • 公开辞职声明(2024年5月)——被广泛描述为AI安全公共史上的分水岭时刻;被全球主要媒体报道,并被认为提高了前沿AI实验室内部安全文化辩论的可见度。

关键关系

  • Marcus Hutter——澳大利亚国立大学的博士导师;AIXI的创建者,其理论通用智能框架塑造了Leike早期关于非参数通用RL的研究。
  • Paul Christiano——2017年RLHF论文的主要合著者;后来创立了对齐研究中心(ARC),之后创立了机械可解释性和对齐团队。是Leike职业生涯中最密切的智力合作者之一。
  • Shane Legg——2017年RLHF论文和2018年奖励建模论文的合著者;DeepMind联合创始人。Leike在DeepMind的工作是在Legg的安全研究范畴内进行的。
  • Dario Amodei——2017年RLHF论文的合著者(当时在OpenAI);现任Anthropic的CEO,即Leike离开OpenAI后加入的组织。因此,他们的研究合作贯穿了这十年的AI安全故事。
  • Ilya Sutskever——Superalignment团队的联合负责人;他们于2024年5月同时离开OpenAI,标志着该领域历史上最引人注目的聚焦安全的人员从前沿AI实验室离职事件。
  • Sam Altman——OpenAI首席执行官,Leike与其在公司的安全优先事项上达到了“临界点”;这场公开分歧引发了关于前沿实验室治理和价值观的更广泛辩论。

个人风格

对于身处商业竞争激烈的行业中的资深人物而言,Leike的公众声音异常直接且讲求原则。他2024年的辞职声明——因愿意以公开、非匿名的形式明确指出具体的机构失误而罕见——反映了一种一贯的模式:他将AI对齐不仅视为一个技术问题,而是视为一项文明义务,并认为机构在安全方面的可信度必须通过持续的行动来赢得,而非通过使命宣言来声称。他的研究写作技术精确但易于理解,他的Substack博客为包括机器学习从业者和关心政策的读者在内的受众阐述了对齐概念。他的职业生涯遵循了一条从Marcus Hutter的理论RL基础,到DeepMind的实证RLHF原型设计,再到OpenAI的系统级对齐,直至现在Anthropic的一致线索——始终处于抽象安全问题与已部署系统交界的边界。


参考资料