Percy Liang

斯坦福大学计算机科学副教授、CRFM创始主任、提出“基础模型”一词的研究者、SQuAD 和 HELM 的共同创建者,以及 Marin(一项在公众视野中重建基础模型训练的开源科学计划)的创始人。


简介

领域 详情
国籍 美国
现任机构 斯坦福大学——计算机科学系(兼统计学系)
其他职务 斯坦福基础模型研究中心(CRFM)主任;Together AI 联合创始人;Simile AI 联合创始人;Marin 创建者
研究领域 基础模型,自然语言处理,语义解析,机器学习理论,鲁棒性,评估,可复现性
博士导师 Michael I. Jordan;Dan Klein
博士论文 计算语言学/概率模型(加州大学伯克利分校,2011)
学术网站 cs.stanford.edu/~pliang
Marin marin.community
X / Twitter @percyliang
GitHub @percyliang
Google Scholar scholar.google.com

概述

Percy Liang 是一位美国计算机科学家、斯坦福大学计算机科学系副教授,也是基础模型研究中心(CRFM)的创始主任。他通过具有里程碑意义的 2021 年 CRFM 论文提出了“基础模型”这一术语——该论文汇集了百余名斯坦福研究人员,共同绘制大规模预训练模型带来的机遇与风险——并在此后构建了该领域的主要评估框架(HELM),共同创建了自然语言处理领域最具影响力的基准测试之一(SQuAD),并发起了 Marin(一个从原始数据到结果全程公开训练并分享基础模型的开源实验室)。他共同创立了面向开放模型的推理与研究平台 Together AI 以及 Simile AI。除了技术性和机构性的贡献外,Liang 还指导了一个成果极其丰硕的实验室:其校友名单堪称当今顶尖机器学习教授和研究科学家的一幅群像,毕业生在伯克利、普林斯顿、CMU、纽约大学、南加州大学、华盛顿大学、芝加哥大学、哥伦比亚大学和苏黎世联邦理工学院等校拥有终身教职。他这样简单地描述自己的研究导向:„我被简单的事物所吸引,想要深入理解事物,并喜欢构建有用的系统。“


早年经历与教育

Liang 年轻时在编程和数学上的竞赛记录,是本 wiki 系列中最为辉煌的之一。他在 2000 年国际信息学奥林匹克竞赛(IOI)中获得银牌,其团队在 2002 年 ACM ICPC 世界总决赛中获得亚军——这是两项最具竞争力的国际编程竞赛。他还在 2000 年赢得了菲尼克斯青年音乐家钢琴比赛,这早早就奠定了他作为一名竞技程序员和严肃音乐人的双重身份,并贯穿其整个职业生涯。后来他还获得了 KDFC 古典之星大搜索比赛(21岁以上组别,2008 年)和麻省理工学院协奏曲比赛(2004 年)。

麻省理工学院计算机科学理学学士 —— 2004
Liang 在麻省理工学院完成了本科学业。

麻省理工学院计算机科学工程硕士 —— 2005
他的硕士论文由统计自然语言处理领域的顶尖研究者 Michael Collins 指导。

加州大学伯克利分校计算机科学博士 —— 2011
Liang 的博士研究由 Michael I. Jordan(21世纪初至 2010 年代机器学习领域被引用最多的研究者)和 Dan Klein(顶尖计算语言学家和解析研究者)共同指导。他的论文侧重于自然语言处理的概率模型,将统计学习理论与结构化预测相结合——这为他后续在语义解析和语言具身化方面的工作奠定了基础。

谷歌博士后 —— 2012
在完成博士学位后,Liang 在谷歌进行了短期的博士后研究,之后加入斯坦福大学。


职业生涯

斯坦福大学 —— 副教授(2012 年至今)

Liang 以助理教授身份加入斯坦福大学,并晋升为副教授。他在计算机科学和统计学系任职,并隶属于斯坦福 HAI、SAIL、NLP 和 ML 研究组。

语义解析与具身化(2012–2018)
Liang 在斯坦福的早期研究集中于语义解析——即教机器将自然语言翻译成可以在结构化数据库或环境中执行的形式化程序。他的研究组开发了从远程、有噪声的监督信号中学习语义解析器的方法(通过执行程序而非标注逻辑形式),以及组合泛化的方法。这项工作在 ACL、EMNLP 和 ICML 上产生了多篇高被引论文,并培养了他的第一批博士生。

SQuAD —— 斯坦福问答数据集(2016)
Liang 与博士生 Pranav Rajpurkar 等人共同创建了 SQuAD,这是一个基于维基百科段落的阅读理解基准。最初的 SQuAD 数据集(2016 年)及其对抗性扩展 SQuAD 2.0(2018 年,与 Robin Jia 合作)成为 NLP 历史上使用最广泛的基准之一——2016 年的论文获得了数万次引用,使其成为该领域被引次数最多的论文之一。SQuAD 在规模、格式和清晰的评估协议方面的结合,为后续的 NLP 基准设立了模板,并催生了一波机器阅读理解研究的热潮。

阅读理解的对抗性样本(2017)
与 Robin Jia 合作,Liang 证明了在 SQuAD 段落中加入干扰句会导致模型性能急剧下降——这一发现预示着并帮助构筑了之后整个领域对 NLP 中鲁棒性和分布偏移的关注。

机器学习的影响函数(2017)
与 Pang Wei Koh 合作(后有所扩展),这项工作将经典统计影响函数应用于神经网络,以识别对给定预测影响最大的训练样本——这成为了数据归因、模型调试和理解训练动态的基础性工具。

CodaLab Worksheets
Liang 一直是可复现研究的早期且持续的支持者,他开发并维护了 CodaLab Worksheets——一个用于管理具有完整源起轨迹的计算实验的平台,使得论文可以成为“可执行的”,即所有用于复现结果的代码和数据都直接与出版物链接。

CS336:从零构建语言模型
Liang 创建了 CS336,这是斯坦福大学从第一性原理出发教授构建语言模型的课程——涵盖了语言模型实际开发规模下的数据、架构、训练和评估。这门课的独特之处在于要求学生自己实现每一个组件,并且对于确立研究生阶段的语言模型教育内容产生了影响。

CS324 / CS221 / CS229T
Liang 还教授 CS324(基础模型进展)、CS221(人工智能)和 CS229T(统计学习理论),涵盖了人工智能的前沿应用和理论维度。

提出“基础模型”并创立 CRFM(2021)

2021 年 8 月,Liang 在斯坦福 HAI 内部启动了斯坦福基础模型研究中心(CRFM),并共同主导了里程碑式的报告《论基础模型的机遇与风险》——这份 200 页的分析报告涉及百余名斯坦福研究人员,涵盖大规模预训练模型的技术、社会、法律和伦理维度。该论文提出了“基础模型”这一术语,用以描述在广泛数据上进行大规模训练并可适应广泛任务的模型。Liang 后来解释了这一命名:他和同事们„在斯坦福大学里走动,看看谁对这个现象感兴趣“,并且需要使用一个描述性的、在评价上不带有任何方向性偏见的术语。

该术语迅速被全球采纳,并在工业界、政府和学术界的讨论中取代或与先前的术语(„大型语言模型“、„预训练模型“、„基础模型“)竞争。CRFM 报告成为了 2021 年被引用次数最多的人工智能论文之一,并塑造了美国、欧盟和英国人工智能政策讨论的框架。

HELM —— 语言模型的整体评估(2022)

与 CRFM 的同事们合作,Liang 开发了 HELM(语言模型的整体评估),这是一个基于三个原则的基准测试框架:评估场景的系统性分类法而非临时清单;对所有模型在所有场景下进行评估以实现公平的跨模型比较;以及衡量除准确率之外的多个指标(包括校准、鲁棒性、公平性和效率)。初始版本评估了来自 AI21、Anthropic、Cohere、Google、Meta、Microsoft、NVIDIA 和 OpenAI 等十三个组织的三十多个模型——这是当时最全面的语言模型公开比较评估。HELM 此后已扩展至包括视觉-语言模型、代码和推理基准,并在 crfm.stanford.edu/helm 作为一个持续更新的公共资源进行托管。

生成式智能体(2023)

与博士生 Joon Sung Park 和 Michael Bernstein 合作,Liang 共同撰写了《生成式智能体:人类行为的交互式模拟》——这篇论文展示了嵌入在虚拟小镇中的、由大语言模型驱动的智能体能够展现出可信的、涌现性的社会行为:形成记忆、制定计划、传播信息以及组织活动。作为 2023 年被引次数最多的 NLP 论文之一,它确立了„大语言模型社会模拟“这一研究类型,并影响了人工智能研究和游戏设计领域。

前缀微调(2021)

与 Xiang Lisa Li 合作,Liang 共同撰写了前缀微调,这是一种通过向输入上下文添加可训练的连续嵌入而不是更新所有模型权重来进行参数高效微调语言模型的方法——其效果可与全参数微调相媲美,而参数更新量仅为其一小部分。

Together AI —— 联合创始人(2022)

Liang 共同创立了 Together AI(together.ai),这是一个为开源语言模型提供推理 API 和研究基础设施的平台,使得用户能够以有竞争力的成本访问包括 LLaMA 变体在内的模型以及定制训练的模型。Together AI 已被相当大比例的机器学习研究社区用于需要访问大型开放模型的实验。

Simile AI —— 联合创始人

Liang 共同创立了 Simile AI(simile.ai),这是一家较新的企业,其重点领域建立在生成式智能体和人工智能驱动科学的早期研究方向之上。

Marin —— 开放科学基础模型实验室(2025 年至今)

2025 年 5 月,Liang 发起了 Marin(marin.community),这是一个从零开始训练基础模型的开源实验室,每一步都进行完整的公开文档记录:代码、数据、实验、错误和结果都通过 GitHub issues(用于实验预注册)、pull requests(用于代码)和 Weights & Biases 报告(用于结果)实时共享。Marin-8B-Base 在 14/19 个标准基准上击败了 LLaMA 3.1 8B;Marin-32B-Base 在截至 2025 年 10 月的同一基准集上成为最佳开源模型。Marin 的速通排行榜竞赛邀请研究人员在给定的计算预算下寻找更快的训练方法——其灵感来源于 nanogpt 速通——并为顶尖表现者提供免费计算资源。该项目运行在谷歌 TPU 研究云资源上,并被明确组织为一项社区研究工作。


主要贡献

  • 提出“基础模型” —— 2021 年的 CRFM 论文引入并定义了该术语;它已成为人工智能研究、政策和产业界描述大规模预训练可适应模型的主流词汇。

  • SQuAD / SQuAD 2.0 —— 共同创建了斯坦福问答数据集(2016 年)及其对抗性扩展(2018 年);是所有 NLP 论文中被引次数最高的论文之一;塑造了机器阅读理解作为一个子领域,并推动了 NLP 基准测试工作的浪潮。

  • HELM —— 构建了最全面的语言模型比较评估框架,评估了数十个模型和数百个场景;建立了透明度和多维度评估作为负责任模型比较的标准。

  • 生成式智能体 —— 展示了大语言模型驱动的虚拟社会中的涌现社会行为;2023 年被引次数最高的人工智能论文之一;定义了人工智能模拟领域的一个新研究方向。

  • 前缀微调 —— 一种参数高效的微调方法,已成为无需全参数微调即可适配大型语言模型的广泛使用技术。

  • 机器学习的影响函数 —— 将模型预测归因回训练数据的基础性工作;被广泛用于理解模型行为和数据调试。

  • Marin —— 一种新型的开放人工智能科学模式:在公众视野中训练基础模型,并带有完整的程序化文档记录,将科学本身视为一个社区过程而非一系列已发表结果的集合。

  • 对抗性 SQuAD —— 展示了向阅读理解段落添加干扰项会导致模型灾难性失败;这是 NLP 系统在自然分布偏移下脆弱性的最早演示之一。

  • CodaLab Worksheets —— 用于可复现机器学习实验的开放平台;反映了 Liang 在研究基础设施上的持续机构性投入。

  • CRFM —— 创立并领导斯坦福基础模型研究中心,该中心已围绕人工智能产出了有影响力的研究、评估框架和政策参与。


奖项与荣誉

  • 美国总统青年科学家与工程师奖(PECASE)(2019)
  • IJCAI 计算机与思想奖(2016)—— 每两年颁发一次,授予 35 岁以下在人工智能领域做出杰出贡献的研究者;是人工智能领域最负盛名的早期职业奖项之一。
  • NSF CAREER 奖(2016)
  • 斯隆研究奖学金(2015)
  • 微软研究院教师奖学金(2014)
  • AI2050 Schmidt Sciences 研究员(持续中)—— 旨在支持高影响力人工智能研究的奖学金。
  • ACM ICPC 世界总决赛 —— 亚军(2002)—— 代表麻省理工学院团队。
  • 国际信息学奥林匹克竞赛 —— 银牌(2000)
  • 论文奖项 来自 ACL、EMNLP、ICML、COLT、ISMIR、CHI、UIST 和 R(多次获奖)。
  • 研究生奖学金:NSF、NDSEG、GAANN、Siebel 学者。
  • 钢琴:KDFC 古典之星大搜索冠军(21岁以上组别,2008);麻省理工学院协奏曲比赛(2004);菲尼克斯青年音乐家比赛(2000)。

学术谱系

Liang 指导了一个异常庞大且占据要位的博士生和博士后群体。其中最著名的校友包括:

  • Jacob Steinhardt —— 2018 年博士;现任加州大学伯克利分校副教授及 Transluce 创始人;在鲁棒性、人工智能安全和评估方面是领先的研究者。
  • Pranav Rajpurkar —— 2021 年博士(与 Andrew Ng 联合指导);现任哈佛大学副教授;创建了 SQuAD,并领导了人工智能驱动医学的研究。
  • Aditi Raghunathan —— 2021 年博士;现任卡内基梅隆大学助理教授;在鲁棒机器学习方面是领先的研究者。
  • Pang Wei Koh —— 2022 年博士;现任华盛顿大学助理教授;在影响函数和分布偏移方面有影响力的工作。
  • Rishi Bommasani —— 2025 年博士(与 Dan Jurafsky 联合指导);撰写了《论基础模型的机遇与风险》一文,并领导了 HELM 的大部分工作;现任斯坦福 HAI 高级研究学者。
  • Joon Sung Park —— 2025 年博士(与 Michael Bernstein 联合指导);《生成式智能体》的第一作者;现为一家初创公司的创始人。
  • Tatsunori Hashimoto —— 博士后;现任斯坦福大学助理教授;共同指导了多位 Liang 的学生。
  • Robin Jia —— 2020 年博士;现任南加州大学助理教授;创建了对抗性 SQuAD。
  • Mina Lee —— 2023 年博士;现任芝加哥大学助理教授。
  • Yuhuai (Tony) Wu —— 博士后;xAI(埃隆·马斯克的人工智能公司)联合创始人。

关键关系

  • Michael I. Jordan —— 伯克利博士导师;其同代人中最有影响力的机器学习研究者之一;Jordan 对统计严谨性和原则性不确定性量化的强调,贯穿于 Liang 整个职业生涯的研究中。
  • Dan Klein —— 博士联合导师;顶尖计算语言学家;塑造了 Liang 在 NLP 和结构化预测方面的基础。
  • Michael Collins —— 麻省理工学院硕士导师;统计自然语言处理的先驱之一;对 Liang 的语言研究方法产生了最早的影响。
  • 李飞飞 —— 斯坦福 HAI 联合创始人兼亲密同事;他们在斯坦福 HAI 和 CRFM 的机构工作在基础模型的治理与评估方面有显著交集。
  • Christopher Manning —— 斯坦福 NLP 资深同事;Liang 的多位学生由 Manning 联合指导;他们在斯坦福 NLP 生态系统中的共同地位使他们的关系具有特别的机构性分量。
  • Chelsea Finn —— 当前斯坦福同事;Liang 与 Finn 联合指导学生,这反映了他在语言建模方面的工作与她在机器人学方面的视角之间的重叠。

个人风格

Liang 的研究和机构工作一贯倾向于清晰、严谨和公共问责。他用来描述自己研究精神的那句话——„我被简单的事物所吸引,想要深入理解事物,并喜欢构建有用的系统“——同样适用于他的教育方法(CS336 要求学生完全从零开始实现所有内容)、评估方法(HELM 力求详尽且有原则,而非选择性)和开放科学实践(Marin 记录所有实验,包括错误)。他在 CodaLab、HELM、Marin 这些基础设施上的持续投入,反映了他的一种信念:科学累积的可靠性取决于工作是如何被记录和分享的,而不仅仅是得出什么结论。他在担任教职的同时共同创立了 Together AI 和 Simile AI,这代表了他职业生涯中的一种模式:即不仅仅局限于研究成果,而是同时建设机构和平台。他将 Marin 背后的开放科学原则描述为对他在大规模人工智能研究中看到的可复现性危机的直接回应:如果训练前沿模型的实验没有被实时记录下来,那么该领域就失去了在其自身工作基础上进行累积性建设的能力。


参考资料