Diederik P. (Durk) Kingma

荷兰机器学习研究员,共同发明了变分自编码器(Variational Autoencoder)和Adam优化器——深度学习历史上最具基础性和被引用次数最多的两项贡献——此后还推进了归一化流、变分扩散模型,并在OpenAI、Google Brain和Anthropic公司从事负责任的人工智能开发。


个人简介

出生 荷兰(出生日期未公开)
国籍 荷兰
当前机构 Anthropic(研究科学家,2024年至今)
研究领域 生成式建模、变分推断、优化、归一化流、扩散模型、大规模机器学习
博士导师 Max Welling
博士论文 《变分推断与深度学习:一种新的综合》(阿姆斯特丹大学,2017年,优等学位)
个人网站 dpkingma.com
X / Twitter @dpkingma
GitHub dpkingma
Google Scholar Diederik P. Kingma

概述

Diederik P. Kingma——以弗里斯兰语昵称Durk闻名,发音类似Dirk——是一位荷兰机器学习研究员。他最受认可的两项贡献——变分自编码器(VAE,2013年)和Adam优化器(2014年)——是计算机科学史上被引用次数最多的论文之一。VAE将重参数化技巧和证据下界确立为实现可扩展潜变量深度学习的关键机制;Adam优化器则成为2015年后几乎所有神经网络训练的默认算法。Kingma是OpenAI的创始团队成员兼算法负责人(2015–2018年),在Google Brain和Google DeepMind担任了六年研究科学家(2018–2024年),并于2024年10月加入Anthropic,在荷兰远程工作。他在阿姆斯特丹大学师从Max Welling于2017年以优等成绩获得博士学位,这是该校计算机科学系三十年来首次有人获得优等学位。他的Google Scholar页面引用量达数十万次,主要来自Adam论文——这是所有科学学科中被引用最多的著作之一。


早年生活与教育

Kingma在荷兰出生并长大。2009年,他作为初级研究科学家在纽约大学Yann LeCun的实验室开始研究——这是在深度学习成为主流之前与深度学习研究项目的早期接触。2012年,他再次回到LeCun的实验室。在这两段经历之间,他与他人共同创立了荷兰科技公司Advanza,并于2010至2012年期间担任技术负责人;Advanza于2016年被成功收购。

Kingma于2013年在阿姆斯特丹大学开始攻读博士学位,师从Max Welling,研究方向为深度学习与生成模型。在读博期间,他还于2014年和2015年暑期在伦敦的DeepMind进行合作研究,并于2015年获得谷歌欧洲首届深度学习博士奖学金。他于2017年以优等成绩完成博士学位——这是荷兰体系中的最高荣誉,也是阿姆斯特丹大学计算机科学系三十年来首次获得该荣誉。他的论文《变分推断与深度学习:一种新的综合》将他基于重参数化的变分推断框架与更广泛的深度生成建模处理相结合。


职业生涯

纽约大学 / Advanza(2009–2013年)

Kingma在Yann LeCun实验室的早期研究职位让他接触到了神经网络传统,这一传统不久后便成为机器学习的主导范式。在此期间,他共同创立了Advanza,这为他的背景增添了早期创业和产品构建的维度,使他与纯粹学术背景的研究人员区别开来。

阿姆斯特丹大学——博士阶段(2013–2017年)

Kingma在博士期间发表的两篇论文改变了整个领域。

变分自编码器(ICLR 2014)。 与Max Welling合著的《自动编码变分贝叶斯》引入了VAE:一种用于学习深度潜变量模型的神经网络架构,其中编码器将输入映射到潜空间的一个分布,解码器则根据采样的潜表示重建输入。关键的技术贡献是重参数化技巧,它允许梯度通过随机采样操作流通,并使编码器和解码器的随机梯度下降联合训练变得可行。VAE首次将概率生成式建模与可扩展深度学习统一起来,将证据下界(ELBO)确立为深度生成模型的训练目标,并成为包括Stable Diffusion在内的潜扩散模型的概念基础。同时,Danilo Rezende、Shakir Mohamed和Daan Wierstra也发表了一种密切相关的方法(SGVB)。VAE论文获得了ICLR 2024年时间考验奖——该奖项设立的第一年——以表彰其持久的影响。

Adam优化器(ICLR 2015)。 与Jimmy Ba合著的《Adam:一种随机优化方法》介绍了Adam算法:一种自适应学习率优化器,它维护每个参数的一阶和二阶矩估计,并应用偏差校正。Adam将AdaGrad(对稀疏梯度的适应性)和RMSProp(在非平稳环境中的有效性)的优点结合在一个具有直观超参数的单一算法中。它立即被用作几乎所有领域训练神经网络的默认优化器,并在此后十年中一直如此。Adam论文成为整个计算机科学乃至所有科学学科中被引用最多的论文之一,引用量达数十万次。它(与Jimmy Ba一起)获得了ICLR 2025年时间考验奖。

OpenAI——创始团队、研究科学家、算法团队负责人(2015–2018年)

Kingma于2015年作为创始团队成员加入OpenAI,担任研究科学家和算法团队负责人,专注于生成式AI方法的基础研究。在此期间,他继续发展变分推断框架(《使用逆自回归流改进变分推断》,NIPS 2016,与Tim Salimans、Rafal Jozefowicz、Xi Chen、Ilya Sutskever和Max Welling合著——引入归一化流作为更具表现力近似后验的途径),并为半监督学习和表示学习做出了贡献。他于2018年离开OpenAI。

Google Brain / Google DeepMind——研究科学家(2018–2024年)

在短暂担任兼职天使投资人和顾问后,Kingma于2018年7月重新加入谷歌的研究组织,从Google Brain开始。他领导了文本、图像和视频生成模型的研究项目。

Glow(NeurIPS 2018)。 与Prafulla Dhariwal合著的《Glow:使用可逆1×1卷积的生成流》引入了一种使用可逆1×1卷积作为核心架构元素的归一化流模型。Glow生成了高分辨率、照片级真实感的人脸图像,并提供了一个可处理的确切似然模型——证明了流可以在保持基于似然的同时达到与GAN相当的视觉质量。Glow演示作为一个交互式网站发布,成为最早公开展示高保真、照片级真实感AI图像生成的演示之一。

变分扩散模型(NeurIPS 2021)。 与Tim Salimans、Ben Poole和Jonathan Ho合著的《变分扩散模型》将VAE和扩散模型框架统一起来,证明可以将扩散模型视为具有特定噪声调度的无限深度VAE。该论文展示了这些模型可以在图像密度估计基准上达到最先进的似然度,通过信噪比公式简化了对扩散模型的理论理解,并证明了几个先前不同的方法之间的等价性。它为大多数当代图像和视频生成系统所基于的扩散模型范式提供了理论基础。

在谷歌期间,Kingma还为大型语言模型和其他文本与视频生成模型的研究做出了贡献,这与Google Brain日益关注基础模型的趋势一致。

Anthropic——研究科学家(2024年至今)

2024年10月,Kingma宣布加入Anthropic,主要在荷兰远程工作,并定期访问旧金山湾区。在宣布这一变动时,他写道,Anthropic的人工智能开发方法与他对负责任开发强大AI系统的信念产生了共鸣。他的加入延续了Anthropic从OpenAI和谷歌招募与其安全导向研究文化相符的知名研究人员的模式。


主要贡献

  • 变分自编码器(VAE,ICLR 2014)——《自动编码变分贝叶斯》,与Max Welling合著。引入了重参数化技巧和证据下界,作为深度潜变量模型可扩展训练的关键机制。确立了深度生成式建模和表示学习的经典框架;是包括Stable Diffusion在内的潜扩散模型的概念基础。获得首届ICLR 2024年时间考验奖。引用量超35,000次。

  • Adam优化器(ICLR 2015)——《Adam:一种随机优化方法》,与Jimmy Ba合著。引入自适应矩估计以实现带偏差校正的每参数学习率。十年间成为几乎所有领域训练深度神经网络的默认优化器。是所有科学学科中被引用最多的科学论文之一,引用量超200,000次。获得ICLR 2025年时间考验奖。

  • 逆自回归流(NIPS 2016)——《使用逆自回归流改进变分推断》,与Tim Salimans、Rafal Jozefowicz、Xi Chen、Ilya Sutskever和Max Welling合著。通过组合灵活的归一化流来丰富近似后验,从而扩展了VAE框架,显著提高了潜变量模型变分推断的表现力和性能。

  • 权重归一化(NIPS 2016)——《权重归一化:一种加速深度神经网络训练的简单重参数化方法》,与Tim Salimans合著。引入通过其幅度和方向对权重向量进行重参数化的方法,加速了收敛,并在某些场景下提供了批归一化的更简单替代方案。

  • Glow(NeurIPS 2018)——《Glow:使用可逆1×1卷积的生成流》,与Prafulla Dhariwal合著。展示了使用归一化流进行高保真、确切似然图像生成;生成了第一个被广泛看到的、可公开访问的照片级真实感人脸生成演示,早于公众对图像合成技术的广泛接触。

  • 变分扩散模型(NeurIPS 2021)——《变分扩散模型》,与Tim Salimans、Ben Poole和Jonathan Ho合著。提供了一个统一VAE和扩散模型的原则性变分框架,在图像基准测试上实现了最先进的似然度,并为构成现代文本到图像系统基础的扩散过程的信噪比公式提供了理论清晰度。


奖项与荣誉

  • ICLR 2025年时间考验奖——因其Adam优化器论文(与Jimmy Ba共同获得)。
  • ICLR 2024年时间考验奖(首届)——因其VAE论文(与Max Welling共同获得),在该会议引入此奖项的第一年颁发。
  • 荷兰数据科学奖(2019年)——来自荷兰皇家科学与人文学院,表彰其对机器学习研究的贡献。
  • ELLIS博士奖(2019年)——来自欧洲学习与智能系统实验室,表彰其在论文阶段取得的杰出研究成果。
  • 阿姆斯特丹大学优等博士学位(2017年)——荷兰最高博士荣誉;阿姆斯特丹大学计算机科学系三十年来首次。
  • 谷歌欧洲深度学习博士奖学金(2015年)——谷歌在欧洲颁发的首个此类奖学金。

重要关系

  • Max Welling——阿姆斯特丹大学的博士导师和VAE论文合著者;是Kingma职业生涯中最重要的学术伙伴。Welling的概率机器学习方向塑造了整个VAE体系及其与贝叶斯推断的联系。
  • Jimmy Ba——Adam优化器的合著者;该论文的影响是两作者作品重塑整个领域最显著的例子之一。
  • Tim Salimans——Kingma工业界时期最亲密的长期合作者;在OpenAI和Google Brain期间合著了权重归一化、逆自回归流和变分扩散模型。
  • Prafulla Dhariwal——Google Brain和OpenAI同事;Glow合著者;后来以DALL-E和OpenAI的扩散模型进展而闻名。
  • Jonathan Ho——变分扩散模型合著者;另以DDPM(去噪扩散概率模型)的主要作者而闻名,该论文奠定了现代扩散模型范式的基础。
  • Yann LeCun——2009年和2012年在纽约大学实验室的早期导师;是少数在Kingma读博前就为其提供研究经验的高级研究员之一。
  • Ilya Sutskever——OpenAI创始团队成员及逆自回归流论文的合著者。
  • Dario Amodei——Anthropic首席执行官兼前OpenAI研究副总裁;他将Kingma招募至Anthropic反映了来自OpenAI时期的共同历史和价值观。

个人风格

Kingma的研究实践围绕少数基础性思想展开,这些思想以数学深度而非广泛的实证覆盖来探索。为重参数化技巧(为VAE引入)是其典型特征:一个概念上简单的操作,解决了通过梯度下降训练潜变量模型的长期障碍,随后被证明适用于广泛的问题。Adam也是类似构建的——一个直观、动机明确的算法,其广泛的适用性并非显而易见的,但其引用积累的速度超过了大多数理论结果。他在四个机构(OpenAI、Google Brain、Google DeepMind、Anthropic)的轨迹反映了他更偏好将基础研究本身视为目的而非产品发布手段的环境。他很少发表公开声明,但那些他发表的声明——包括他加入Anthropic的理由——强调了机构价值观与他个人对负责任AI发展的信念之间的一致性。他继续在荷兰工作,这在以美国为中心的人工智能行业中,对于他这种认可度的研究人员来说,其欧洲基地显得不同寻常。


参考资料