加拿大概率论学家与深度学习研究员,就职于多伦多大学。其Neural ODE论文奠定了连续深度网络作为一个新类别的地位;其Autograd库催生了自动微分生态系统,后衍生出JAX。此后,他将研究方向转向AGI治理、破坏性评估以及渐进式人类失能所带来的系统性风险。
简介
| 国籍 | 加拿大 |
| 当前机构 | 多伦多大学——计算机科学与统计学系副教授;施瓦茨·赖斯曼技术与社会讲席教授;向量研究所(创始成员) |
| 研究领域 | AGI治理、AI安全、灾难性风险评估、深度概率模型、神经常微分方程、生成模型、自动微分 |
| 博士导师 | Carl Rasmussen;Zoubin Ghahramani |
| 博士论文 | 基于高斯过程的自动模型构建 (剑桥大学,2014年) |
| 个人网站 | cs.toronto.edu/~duvenaud |
| X / Twitter | @DavidDuvenaud |
| GitHub | duvenaud |
| Google Scholar | David Duvenaud |
概述
David Duvenaud是一位加拿大机器学习研究员,是多伦多大学的副教授,担任施瓦茨·赖斯曼技术与社会讲席教授,也是向量研究所的创始成员。他在剑桥大学师从Carl Rasmussen和Zoubin Ghahramani获得博士学位,在哈佛大学跟随Ryan Adams进行博士后研究,自2016年起在多伦多大学任教。他的职业生涯呈现出引人注目的三阶段演化:在剑桥阶段专注于高斯过程理论和概率建模;在多伦多大学阶段致力于连续深度神经网络、自动微分和深度生成模型(其Neural ODEs研究获得NeurIPS 2018最佳论文奖,并对Autograd——JAX的前身——做出了 foundational 贡献);在Anthropic的对齐科学团队进行了一次长期学术休假后,他几乎完全转向了AGI治理、前沿模型评估以及渐进式AI部署可能逐渐削弱人类力量的结构性风险。他继续在多伦多大学指导博士生并授课,目前完全专注于他在Anthropic所从事的对齐与安全议程。
早年经历与教育
不列颠哥伦比亚大学 — 理学硕士 (2010)
Duvenaud在不列颠哥伦比亚大学跟随Kevin Murphy完成了理学硕士学位,研究方向是多尺度条件随机场在半监督图像标注中的应用。他的硕士论文奠定了他对概率图模型和潜变量结构的兴趣。
剑桥大学 — 博士 (2010–2014)
在剑桥大学机器学习小组,Duvenaud与高斯过程研究的两位核心人物——Carl Rasmussen和Zoubin Ghahramani合作,致力于自动模型构建问题。他的博士论文《基于高斯过程的自动模型构建》引入了一种高斯过程核上的语法,程序可以通过搜索该语法来识别数据集中统计上适当的结构,并生成描述拟合模型的人类可读报告。该项目是后来“自动统计学家”研究议程的原型。其关键组成部分——组合核搜索论文(ICML 2013)、非参数回归的自动自然语言描述(AAAI 2014)以及加性高斯过程和深度高斯过程——至今仍被广泛引用。在博士期间,他共同组织了概率数值学研讨会系列,将数值分析与贝叶斯推断联系起来。
哈佛大学HIPS小组 — 博士后 (2014–2016)
在剑桥大学之后,Duvenaud加入了哈佛大学智能概率系统(HIPS)小组,作为Ryan Adams的博士后研究员。这一时期产生了多项持久的贡献。首先是Autograd——主要由Dougal Maclaurin与Duvenaud和Matthew Johnson共同开发——一个用于原生Python和NumPy的逆向模式自动微分库,支持循环、条件语句、闭包和高阶导数。Autograd是JAX(谷歌当前主要的机器学习研究基础设施)的直接前身,并引入了如今在机器学习软件中普遍存在的“对任意Python代码进行微分”的设计理念。哈佛时期的第二个主要贡献是分子指纹图卷积论文(NeurIPS 2015,Duvenaud为第一作者,合作者包括Maclaurin、Gómez-Bombarelli、Adams和Aspuru-Guzik),该论文引入了第一个直接在分子图上运行的端到端学习卷积特征提取器——这是化学领域图神经网络的基础性论文之一。第三个贡献是通过可逆学习进行基于梯度的超参数优化(ICML 2015,与Maclaurin和Adams合作),通过微分整个训练过程,实现了验证损失相对于数千个超参数的精确梯度计算。
职业生涯
多伦多大学 — 副教授 (2016年至今)
Duvenaud于2016年加入多伦多大学计算机科学系,并在统计科学系兼任教职。他是向量研究所(Vector Institute for Artificial Intelligence)的创始成员,并担任施瓦茨·赖斯曼技术与社会讲席教授。他获得了斯隆研究奖学金。他在多伦多大学的职业生涯分为两个截然不同的研究项目。
深度概率模型与连续深度网络 (2016–2021)。 Duvenaud早期在多伦多大学的主要成果是一系列关于微分方程与深度学习交叉领域的论文。核心成果是《神经常微分方程》(NeurIPS 2018,最佳论文奖),与Ricky Tian Qi Chen、Yulia Rubanova和Jesse Bettencourt共同撰写。该论文提出用神经网络参数化网络隐藏状态的导数,而不是指定离散的逐层转换。输出由一个黑箱ODE求解器计算,产生了一个在训练期间内存成本恒定的(通过伴随方法)、具有自适应评估能力的连续深度模型,并为通过连续标准化流进行生成建模提供了优雅的数学结构。该论文立即被公认为开辟了新的研究方向;torchdiffeq(Ricky Chen的相关软件库)在生物学、物理学和机器学习领域得到了广泛应用。该团队开发的扩展包括用于不规则采样时间序列的潜变量ODE(NeurIPS 2019)、可扩展随机微分方程梯度(AISTATS 2020)、带有SDE的无限深贝叶斯神经网络(AISTATS 2022),以及ODE求解器成本的可微分代理(NeurIPS 2020)。
与ODE研究并行,Duvenaud的团队还对标准化流(FFJORD,ICLR 2019口头报告;Residual Flows,NeurIPS 2019;Invertible ResNets,ICML 2019)、基于能量的模型(JEM,ICLR 2020)、大规模基于梯度的超参数优化(AISTATS 2020,与Lorraine和Vicol合作)、带梯度的离散采样(“Oops I Took a Gradient,” ICLR 2021,杰出论文荣誉提名)以及自动化学设计(ACS Central Science 2018,与Gómez-Bombarelli和Aspuru-Guzik合作)做出了贡献。他还共同开发了Dex,一种用于安全数组处理并具有自动并行化功能的函数式编程语言(ICFP 2021,杰出论文奖,与Adam Paszke及Google Brain的同事合作)。
AGI对齐、安全与治理 (2022年至今)。 大约在2022年,Duvenaud将其团队的研究重点几乎完全转向了AI安全与治理。他在Anthropic的对齐科学团队完成了一次长期学术休假,期间共同撰写了一系列与安全相关的技术论文和文章。他的安全工作涵盖了对前沿模型能力和风险的实证评估、关于渐进式AI失能的理论框架,以及关于已部署AI系统如何影响用户自主性的实证研究。
Duvenaud共同撰写了《前沿模型的破坏性评估》(Anthropic,2024年),该论文开发了评估协议来检测能力强大的模型是否可能秘密破坏前沿AI开发商的监督过程——构建了用于评估模型协助规避监控者和颠覆决策者的隐蔽AI协助行为的协议。他是《多次提示越狱》(NeurIPS 2024)的合著者,该论文证明了用数百个不良行为示例提示模型的效果会按照幂律扩展到数百次提示,揭示了长上下文攻击是一个新的攻击面。他领导或共同领导了关于谄媚的研究(“Towards Understanding Sycophancy in Language Models,” ICLR 2024)、认知不确定性量化(“Experts Don’t Cheat,” ICML 2024)以及训练数据验证(“Tools for Verifying Neural Models’ Training Data,” NeurIPS 2023)。
他更广泛的治理贡献包括《渐进式失能:渐进式AI发展带来的系统性生存风险》(2025年,与Jan Kulveit、Raymond Douglas及同事合作)——一份技术报告,论证了即使在能力没有突然跃升的情况下,人类在经济、创意和社会角色中竞争性被替代构成了一条通往永久人类失能的结构性路径,并提出了这是一个独特且被低估的风险类别。2025年,他在《卫报》上发表了一篇面向普通读者的文章阐述这一论点,另一篇相关文章出现在《经济学人》上。一篇2026年的实证论文“Who’s in Charge? Disempowerment Patterns in Real-World LLM Usage”分析了150万次Claude.ai对话,以实证量化失能模式,发现令人担忧的行为(强化阴谋论、逐字撰写并发送关系信息)与更高的用户满意度相关——识别出用户偏好与长期福祉之间的紧张关系。另一篇2026年的论文“The Artificial Self”实证研究了AI身份边界及其行为后果。在多伦多大学,他恢复了指导专注于安全相关课题的学生:目前的学生包括Jesse Bettencourt和Raymond Douglas(后者专注于AI治理)。
主要贡献
-
Autograd (2015) — 与Dougal Maclaurin和Matthew Johnson共同开发。一个用于原生Python和NumPy的自动微分库,支持高阶导数、任意控制流和闭包——是JAX(谷歌主要的机器学习研究基础设施)的直接架构前身。确立了将机器学习程序视为Python上的可微函数,而非原语上的计算图的范式。
-
基于图卷积的分子指纹 (NeurIPS 2015) — 第一作者发表了用于分子属性预测的基础性图神经网络论文,用端到端学习的、在分子图结构上运行的特征取代了手工制作的圆形指纹。确立了化学领域的图神经网络,并促成了一篇相关的《自然·材料》论文和更广泛的分子机器学习领域。
-
基于梯度的超参数优化 (ICML 2015) — 与Maclaurin和Adams合作。通过微分整个训练过程,实现了验证损失相对于数千个超参数的精确梯度计算,展示了步长、权重初始化和正则化方案的优化——这是通过可微训练进行元学习的早期演示。
-
神经常微分方程 (NeurIPS 2018 最佳论文) — 与Ricky Tian Qi Chen、Yulia Rubanova和Jesse Bettencourt合作。引入了由ODE参数化的隐藏状态动态定义的连续深度神经网络,通过伴随方法以恒定内存进行训练,应用于连续标准化流、潜变量时间序列模型和可逆生成建模。是2018年最具影响力的机器学习论文之一,也是其后大量文献的基础。
-
FFJORD:面向可扩展可逆生成模型的自由形式连续动态 (ICLR 2019 口头报告) — 与Will Grathwohl、Ricky Chen、Jesse Bettencourt和Ilya Sutskever合作。通过Hutchinson迹估计器将神经常微分方程扩展到具有无偏密度估计的生成建模,消除了先前标准化流模型的架构约束。
-
前沿模型的破坏性评估 (Anthropic, 2024) — 开发了首个评估套件,用于测试前沿模型能否秘密破坏人类对AI开发的监督,包括评估模型协助规避监控、破坏决策和隐藏能力的协议——为Anthropic的负责任扩展政策做出了贡献。
-
渐进式失能 (2025) — 与Jan Kulveit、Raymond Douglas等人合作。一个技术和概念框架,论证了渐进式AI能力发展——无需任何单一戏剧性事件——通过在经济、创意和社会角色中的竞争性替代,构成了永久人类失能的结构性风险,无论AI系统是否怀有不符合人类的目标。
-
Dex语言 (ICFP 2021, 杰出论文) — 与Adam Paszke、Daniel D. Johnson及同事共同撰写。一种函数式数组编程语言,支持安全的隐式并行化和细粒度类型化效应,是JAX的Dex研究项目中概念的原型。
奖项与认可
- NeurIPS 2018 最佳论文奖 — 获奖作品《神经常微分方程》。
- 斯隆研究奖学金 — 阿尔弗雷德·P·斯隆基金会为早期职业研究人员设立的奖学金。
- 施瓦茨·赖斯曼技术与社会讲席教授 — 多伦多大学命名教授席位。
- ICFP 2021 杰出论文奖 — 获奖作品Dex数组编程语言论文。
- ICLR 2021 杰出论文荣誉提名 — 获奖作品“Oops I Took a Gradient: Scalable Sampling for Discrete Distributions.”
- 向量研究所创始成员 — 加拿大国家AI研究所创始团队成员之一。
关键人际关系
- Carl Rasmussen — 剑桥大学博士导师;高斯过程理论家及高斯过程经典教材的合著者;塑造了Duvenaud的基础概率取向。
- Zoubin Ghahramani — 剑桥大学博士联合导师;贝叶斯机器学习先驱及剑桥大学机器学习小组主任;核语法和自动统计学家的工作完全属于Ghahramani的学术传统。
- Ryan P. Adams — 哈佛大学博士后导师;HIPS小组是Autograd、图指纹和超梯度的直接环境;Adams和Duvenaud都认同将开发研究工具作为一种贡献形式。
- Dougal Maclaurin — Autograd的主要架构师,哈佛时期最密切的研究合作者;现任谷歌JAX团队负责人;Autograd的传承贯穿他们二人。
- Ricky Tian Qi Chen — Duvenaud在多伦多大学小组中最多产的博士生;Neural ODEs、FFJORD、Residual Flows及相关工作的第一作者;现任Meta FAIR研究科学家。
- Roger Grosse — 多伦多大学计算机科学系同事及向量研究所成员;在贝叶斯深度学习、解缠和Fisher信息方法方面的合作者。
- Chris Maddison — 多伦多大学同事,在离散采样和基于能量的模型方面的密切合作者。
- Mrinank Sharma — Anthropic对齐科学家,关于失能、谄媚和多次提示越狱论文的合著者;是Duvenaud安全研究的核心合作者。
- Jan Kulveit — AI安全研究员,渐进式失能框架的合著者;为Duvenaud的实证取向带来了对齐理论视角。
个人风格
Duvenaud是机器学习领域最清晰的例子之一,表明研究人员从根本上改变了研究重点,而不是仅仅扩展它——并且他公开地这样做,解释了每一步的推理。他从概率建模转向神经常微分方程是方法论上的(连续数学为手头的问题提供了更好的工具);他从神经常微分方程转向AI安全是规范性的(他得出结论,他的研究技能最重要的用途是减少灾难性风险)。他对于不确定性异常坦诚:他的个人网站现在将过去的研究亮点描述为“过去”,并将他当前的兴趣围绕AGI治理和风险展开,没有保留。他的写作——无论是技术性的还是面向公众的——都精确而不正式,并且他表现出了一贯的兴趣,即让机器学习基础设施更加原理化(Autograd,Dex),而不仅仅是为了更快。他网站上的匿名反馈按钮和详细的加入说明反映了一种指导理念,即把工作文化的透明度视为一种职业义务,而不是事后想法。
参考文献
- 个人网站: cs.toronto.edu/~duvenaud
- 向量研究所简介: vectorinstitute.ai
- 多伦多大学统计系简介: statistics.utoronto.ca
- Google Scholar: scholar.google.co.kr
- Neural ODE代码: github.com/rtqichen/torchdiffeq
- Autograd: github.com/HIPS/autograd
- 渐进式失能: gradual-disempowerment.ai
- 《卫报》文章 (2025年5月): theguardian.com
- Digg简介: digg.com/u/x/davidduvenaud