Shixiang Shane Gu

出生于日本、华裔加拿大的研究者,其职业生涯涵盖贝叶斯推断、样本高效的深度强化学习、机器人学习以及大语言模型推理——最广为人知的是作为“让我们一步步思考”零样本思维链论文的合著者。


个人简介

出生 日本(具体日期未公开)
国籍 加拿大籍华人(出生于日本)
目前所属机构 Google DeepMind(资深员工研究科学家,Gemini Thinking 团队)
研究领域 强化学习、深度学习、机器人学、概率机器学习、大语言模型、推理
博士导师 Richard E. Turner; Zoubin Ghahramani; Bernhard Schölkopf
博士论文 机器学习博士——剑桥大学 & 马普智能系统研究所(剑桥-图宾根奖学金)
网站 sites.google.com/view/gugurus
X / Twitter @shaneguML(英文);@shanegJP(日文)
Google Scholar Shixiang Shane Gu —— 引用数超过72,000

概述

Shixiang Shane Gu 是 Google DeepMind 的资深员工研究科学家,目前就职于 Gemini Thinking 团队。他出生于日本,是华裔加拿大人,能流利使用英语、日语和普通话。他的研究生涯横跨多个非同寻常的广泛子领域:博士期间研究贝叶斯推断和概率机器学习;在 Google Brain 研究样本高效的深度强化学习;作为 Google Brain 机器人团队的创始成员之一参与大规模机器人学习;在 OpenAI 的 ChatGPT 团队工作期间致力于大语言模型的对齐与推理,并为 GPT-4 做出贡献;在 Google DeepMind 研究多语言的后训练和思维链推理。他在人工智能界最为人所知的身份是《Large Language Models are Zero-Shot Reasoners》(NeurIPS 2022)一文的合著者,该论文提出了“让我们一步步思考”这一提示,并证明了零样本思维链推理是大语言模型的一种涌现能力。他还共同发明了 Gumbel-Softmax——现已成为处理离散潜变量的标准可微技术——并为 Gumbel-Softmax、Q-Prop 及相关算法做出贡献,这些工作塑造了深度强化学习中关于样本效率的研究议程。他曾担任东京大学(客座副教授)和斯坦福大学的访问职位,并领导了 OpenAI 在日本市场的业务拓展。


早期生活与教育

顾出生于日本的一个华人家庭,后来定居加拿大,自我认同为出生于日本的华裔加拿大人。他在多伦多大学攻读工程科学本科,导师是 Geoffrey E. Hinton——在当时是机器学习领域最具影响力的导师之一。多伦多的 Hinton 研究组是深度学习的熔炉,顾在此接受的教育使他从研究生涯伊始便处于该网络的核心。

博士阶段,顾获得了剑桥-图宾根博士奖学金——这是剑桥大学机器学习课题组与马普智能系统研究所之间的一项竞争激烈的联合项目——并在 Richard E. Turner、Zoubin Ghahramani(剑桥)以及 Bernhard Schölkopf(马普所)的指导下完成了机器学习博士学位。他的博士研究聚焦于概率机器学习和贝叶斯推断,包括对神经自适应顺序蒙特卡洛方法和随机网络梯度估计器的贡献。在此期间,他还获得了加拿大自然科学与工程研究理事会奖学金。


职业生涯

Google Brain —— 研究科学家,Google Brain 机器人团队创始成员(约 2016–2022)

顾加入 Google Brain 担任研究科学家,常驻美国和日本,并成为 Google Brain 机器人团队的创始成员之一——该团队是最早将深度学习应用于物理机器人控制的专门工业研究团队之一。在此期间,他并行推进了两条均具有持久影响力的研究方向。

样本高效的深度强化学习。顾的强化学习工作针对他认为是实际机器人领域核心瓶颈的问题:深度强化学习算法过高的样本复杂度。他与 Timothy Lillicrap、Sergey Levine、Zoubin Ghahramani 和 Richard Turner 等合作,开发了一系列效果递增的算法。NAF(归一化优势函数,ICML 2016)通过使用二次优势表示引入了一种连续 Q 学习方法,从而实现了连续动作空间中的离线策略训练。Q-Prop(ICLR 2017 Oral)通过将离线策略评估量的泰勒展开作为控制变量,结合了在线策略的稳定性与离线策略的效率——这一技术显著提升了相比 TRPO 和 DDPG 在 MuJoCo 基准上的样本效率。IPG(插值策略梯度,NIPS 2017)从理论和实证上统一了在线/离线策略的谱系。异步多机器人深度强化学习(ICRA 2017)工作证明了将离线策略学习并行化到多台物理机器人上能够实现复杂的操控技能——该结果受到《MIT Technology Review》和 Google 研究博客的报道,也是首批在大规模真实机器人硬件上直接进行深度强化学习训练的演示之一。

Gumbel-Softmax(ICLR 2017)。在强化学习之外,顾还与 Eric Jang 和 Ben Poole 共同发明了 Gumbel-Softmax 重参数化方法(与 Maddison 等人几乎同时提出的密切相关的“具体分布”方法同期发表)。该技术为分类采样提供了一种可微近似,使得反向传播能够通过离散潜变量进行。它迅速且持久地成为了变分自编码器、离散生成模型和神经架构搜索中的标准方法。

零样本思维链(“让我们一步步思考”,NeurIPS 2022)。在 Google Brain 期间,顾与 Takeshi Kojima、Machel Reid、Yutaka Matsuo 和 Yusuke Iwasawa 合著了论文《Large Language Models are Zero-Shot Reasoners》。该论文证明了在大语言模型的答案前附加一个单一的通用提示——“让我们一步步思考”——能够引发多步推理,而无需任何任务特定的示例或微调。在 GSM8K 上,该技术将 PaLM 540B 的零样本准确率从 17.9% 提升至 58.1%;在 MultiArith 上,InstructGPT 从 17.7% 提升至 78.7%。该论文成为大语言模型提示工程领域被引用最多的研究之一,并被广泛认为是思维链研究计划的基础性贡献。

OpenAI —— 资深研究员,ChatGPT 团队;日本市场准入负责人(约 2022–2023)

顾在 OpenAI 担任了一段时间的资深研究员,隶属于 ChatGPT 团队,并为 GPT-4 技术报告做出了贡献。他还领导了 OpenAI 的日本市场准入计划——旨在建立 OpenAI 在日本商业和研究存在的战略努力,最终促成了 OpenAI 东京办事处于 2024 年 4 月成立。他的三语能力和在日本的专业关系网络使他成为这项工作的自然领导者。

Google DeepMind —— 资深员工研究科学家(2023 年至今)

在 2023 年 Google Brain 与 DeepMind 合并为 Google DeepMind 之后,顾重新加入了合并后的组织。他领导了 Gemini 后训练的多语言团队——负责在后训练流程中将 Gemini 的语言能力扩展到英语以外的团队——之后转入目前的 Gemini Thinking 团队,该团队专注于前沿模型的推理能力。

东京大学 —— 客座副教授(持续中)

在工业界角色之外,顾还在东京大学担任客座副教授(兼职)职位,与 Matsuo 实验室及相关课题组保持研究合作。他在 2021–2023 年间的多篇 NeurIPS 和 ICLR 论文是与东京大学的博士生和研究人员合著的。

斯坦福大学 —— 访问学者

顾还曾在斯坦福大学计算机科学系担任访问学者,为其工业研究与学术界之间建立了富有成效的联系。


主要贡献

  • Gumbel-Softmax(ICLR 2017) —— “Categorical Reparameterization with Gumbel-Softmax”,与 Eric Jang 和 Ben Poole 合著。提供了离散分类分布的可微、可重参数化的近似,使得能够通过分类潜变量进行端到端的基于梯度的训练。现已成为变分推断、离散生成模型和可微架构搜索的标准方法。

  • Q-Prop(ICLR 2017 Oral) —— “Sample-Efficient Policy Gradient with An Off-Policy Critic”。使用从离线策略评估量导出的控制变量统一了在线与离线策略梯度估计,在提供偏差理论保证的同时,显著提升了相比 TRPO 和 DDPG 的样本效率。

  • 异步多机器人深度强化学习(ICRA 2017) —— “Deep Reinforcement Learning for Robotic Manipulation with Asynchronous Off-Policy Updates”。证明了通过在多台机器上并行化更新,离线策略深度强化学习可以直接在真实物理机器人上进行训练——这是无需演示或手工设计奖励就在真实机器人硬件上进行深度强化学习的首批实践演示之一。被《MIT Technology Review》报道。

  • 零样本思维链 / “让我们一步步思考”(NeurIPS 2022) —— “Large Language Models are Zero-Shot Reasoners”,与 Takeshi Kojima、Machel Reid、Yutaka Matsuo、Yusuke Iwasawa 合著。展示了单一通用零样本提示便能引发大语言模型在多种算术、符号和常识推理基准上准确的多步推理。是大语言模型推理文献中被引用最多的论文之一;“让我们一步步思考”这一短语已成为人工智能文化中广泛复制的标志。

  • NAF(ICML 2016) —— “Continuous Deep Q-Learning with Model-Based Acceleration”。引入了归一化优势函数表示用于连续动作 Q 学习,使得在不使用演员-评论家架构的情况下,能够在连续控制任务中进行稳定的离线策略训练。

  • IPG(NIPS 2017) —— “Interpolated Policy Gradient: Merging On-Policy and Off-Policy Gradient Estimation for Deep Reinforcement Learning”。提供了在线/离线策略梯度方法的理论统一,并在连续控制基准上实现了实证改进。

  • 对 GPT-4 和 Gemini 的贡献 —— 被列为 GPT-4 技术报告(OpenAI,2023)以及 Gemini 和 Gemini 1.5 模型论文(Google DeepMind,2023–2024)的贡献者,反映了他参与了两个最重要前沿模型开发工作。


奖项与荣誉

  • CoRL 2019 最佳论文奖 —— 因论文“A Divergence Minimization Perspective on Imitation Learning Methods”(与 Seyed Kamyar Seyed Ghasemipour 和 Richard Zemel 合著)获得,授予机器人学习会议中前 0.25% 的投稿。
  • Google 聚焦研究奖 —— 在其 Google Brain 期间获得。
  • 剑桥-图宾根博士奖学金 —— 剑桥大学与马普智能系统研究所之间竞争激烈的联合奖学金。
  • NSERC 奖学金 —— 加拿大国家级博士奖学金,授予优秀研究生研究。
  • 《MIT Technology Review》报道 —— 其多机器人深度强化学习工作被《MIT Technology Review》重点报道,展示了一种机器人技能习得的新方法。

关键关系

  • Geoffrey E. Hinton —— 多伦多大学本科导师;通过 Hinton 的学术谱系,顾直接与深度学习传统相连,该谱系产生了 Sutskever、Krizhevsky 等许多人。
  • Richard E. Turner —— 剑桥大学机器学习课题组的主要博士导师;塑造了顾的概率论与贝叶斯基础。
  • Zoubin Ghahramani —— 剑桥大学博士联合导师;贝叶斯机器学习领域的领军人物,其概率论视角影响了顾的早期研究。
  • Bernhard Schölkopf —— 图宾根马普所博士联合导师;核方法与因果推断先驱。
  • Sergey Levine —— Google Brain 时期在深度强化学习和机器人学方面的主要合作者;合著多篇论文,包括 Q-Prop、IPG 及若干强化学习机器人学工作。
  • Timothy Lillicrap —— Google DeepMind 研究员,NAF、Q-Prop 和 IPG 论文的关键合著者。
  • Eric Jang —— Google Brain 期间 Gumbel-Softmax 的合著者;Jang 同时独立提交的(独立开发的)方法在 ICLR 2017 上与顾的版本同时发表。
  • Yutaka Matsuo —— 东京大学教授;为顾与东京博士生在零样本思维链及相关大语言模型论文方面的合作搭建了研究桥梁。
  • Takeshi Kojima —— 东京大学博士生, “让我们一步步思考” 论文的第一作者;代表日本与 Google Brain 的研究合作。

个人风格

顾在人工智能研究领域中占据着罕见的地位:他至少在三个不同的技术范式——贝叶斯推断、深度强化学习和大语言模型推理——中都做出了实质性的贡献,而不是仅仅深化一个专门领域。他的研究轨迹与该领域本身的代际变迁高度吻合:从概率机器学习(2014–2016)到深度强化学习和机器人学时代(2016–2020),再到大语言模型时代(2020年至今),并且在每次转型中都产出了富有成效的成果。他分别运营英文和日文专业社区的 Twitter 账号,这一做法反映了他真正的三语、三文化身份——出生于日本,在加拿大接受教育,工作跨越美国、日本和英国。他的合作范围涵盖东京的学术团体,他参与 OpenAI 的日本市场准入计划表明他持续致力于连接东亚和西方的人工智能生态系统。他还正式活跃于学术界,担任 TMLR 的行动编辑以及 NeurIPS 和 ICML 的区域主席。


参考资料