Shixiang Shane Gu

日本生まれの中国系カナダ人研究者。ベイズ推論、サンプル効率的な深層強化学習、ロボット学習、LLMの推論にわたるキャリアを持ち、"Let’s think step by step"というゼロショット連鎖思考(CoT)論文の共著者として最も広く知られている。


プロフィール

生誕 日本(生年月日は非公開)
国籍 中国系カナダ人(日本生まれ)
現在の所属機関 Google DeepMind(シニアスタッフリサーチサイエンティスト、Gemini Thinkingチーム)
研究分野 強化学習、深層学習、ロボティクス、確率的機械学習、大規模言語モデル、推論
博士課程指導教員 Richard E. Turner、Zoubin Ghahramani、Bernhard Schölkopf
博士論文 機械学習博士号 — ケンブリッジ大学 & マックス・プランク知能システム研究所(Cambridge-Tübingenフェローシップ)
ウェブサイト sites.google.com/view/gugurus
X / Twitter @shaneguML(英語); @shanegJP(日本語)
Google Scholar Shixiang Shane Gu — 72,000件以上の被引用数

概要

Shixiang Shane GuはGoogle DeepMindのシニアスタッフリサーチサイエンティストで、現在はGemini Thinkingチームに所属している。日本生まれの中国系カナダ人で、英語、日本語、中国語に堪能。その研究キャリアは異常なまでに広範なサブフィールドを網羅している。博士課程ではベイズ推論と確率的機械学習、Google Brainではサンプル効率的な深層強化学習、Google Brain Roboticsチームの創設メンバーとして大規模ロボット学習、OpenAIのChatGPTチームとGPT-4への貢献を通じたLLMのアライメントと推論、そしてGoogle DeepMindでの多言語ポストトレーニングと連鎖思考推論に携わってきた。AIコミュニティ一般には、論文「Large Language Models are Zero-Shot Reasoners」(NeurIPS 2022)の共著者として最もよく知られており、この論文は「Let’s think step by step」というプロンプトを導入し、ゼロショット連鎖思考推論が大規模言語モデルの創発的能力であることを示した。また、Gumbel-Softmax(現在は離散潜在変数のための標準的な微分可能手法)を共同発明し、Gumbel-Softmax、Q-Prop、および関連アルゴリズムに貢献して、深層強化学習におけるサンプル効率化の課題を形成した。東京大学(客員准教授)とスタンフォード大学で客員職を歴任し、OpenAIの日本市場参入を主導した。


生い立ちと教育

Guは日本の中国人家庭に生まれ、後にカナダに移住し、日本生まれの中国系カナダ人と自認している。トロント大学で工学科学の学士号を取得。その指導教員はGeoffrey E. Hintonであり、当時の機械学習分野で最も重要な指導関係の一つであった。トロントのHintonグループは深層学習革命の多くが生まれたるつぼであり、Guがそこで研鑽を積んだことは、彼の研究キャリアの初期からそのネットワークの中心に彼を位置づけた。

博士課程では、Cambridge-Tübingen博士研究フェローシップ(ケンブリッジ大学機械学習グループとマックス・プランク知能システム研究所との競争力の高い共同プログラム)を獲得し、ケンブリッジではRichard E. TurnerとZoubin Ghahramani、MPIではBernhard Schölkopfの指導の下で機械学習の博士号を取得した。博士研究は確率的機械学習とベイズ推論に焦点を当てており、Neural Adaptive Sequential Monte Carloや確率的ネットワークのための勾配推定器への貢献が含まれる。この期間中、カナダ自然科学・工学研究審議会(NSERC)奨学金も受給した。


キャリア

Google Brain — 研究員、Google Brain Robotics創設メンバー(c. 2016–2022)

GuはGoogle Brainに研究員として入社し、米国と日本の両方で活動。物理的なロボット制御に深層学習を適用する最初の専任産業研究グループの一つである、Google Brain Roboticsチームの創設メンバーとなった。この時期、彼はそれぞれが永続的な影響を与えた2つの並行研究の方向性を追求した。

サンプル効率的な深層強化学習。 Guの強化学習に関する研究は、現実世界のロボット工学における中核的なボトルネックとして彼が特定したもの、すなわち深層強化学習アルゴリズムの法外なサンプル複雑性に取り組んだ。主にTimothy Lillicrap、Sergey Levine、Zoubin Ghahramani、Richard Turnerと協力し、一連のますます効果的なアルゴリズムを開発した。NAF(Normalized Advantage Functions、ICML 2016)は、二次的なアドバンテージ表現を用いた連続的なQ学習アプローチを導入し、連続行動空間でのオフポリシー学習を可能にした。Q-Prop(ICLR 2017 Oral)は、オフポリシー批評家のテイラー展開を制御変数として使用することで、オンポリシーの安定性とオフポリシーの効率性を組み合わせ、MuJoCoベンチマークにおいてTRPOやDDPGよりもサンプル効率を大幅に向上させた。IPG(Interpolated Policy Gradient、NIPS 2017)は、理論的および実証的にオン/オフポリシーのスペクトルを一般化した。非同期マルチロボット深層強化学習の研究(ICRA 2017)は、複数の物理ロボットにわたってオフポリシー学習を並列化することで複雑な操作スキルを達成できることを実証し、その成果はMIT Technology ReviewやGoogle Research Blogの記事で紹介され、実際のロボットハードウェアで深層強化学習を大規模に直接トレーニングした最初の実証例の一つとなった。

Gumbel-Softmax(ICLR 2017)。 強化学習と並行して、GuはEric Jang、Ben PooleとともにGumbel-Softmax再パラメータ化法を共同発明した(Maddisonらによる密接に関連する手法「Concrete Distribution」と同時発表)。この手法は、カテゴリカルサンプリングの微分可能な近似を提供し、離散潜在変数を介した誤差逆伝播を可能にする。これは、変分オートエンコーダー、離散生成モデル、ニューラルアーキテクチャ探索において、即座にかつ永続的に標準的な手法となった。

ゼロショット連鎖思考(「Let’s think step by step」、NeurIPS 2022)。 Google Brain時代に、GuはTakeshi Kojima、Machel Reid、Yutaka Matsuo、Yusuke Iwasawaとともに論文「Large Language Models are Zero-Shot Reasoners」を共著した。この論文は、LLMの回答の前に単一の普遍的なプロンプト「Let’s think step by step」を追加することで、タスク固有の例や追加学習なしに多段階の推論を引き出せることを実証した。GSM8Kでは、この手法によりPaLM 540Bの精度がゼロショット設定で17.9%から58.1%に向上。MultiArithでは、InstructGPTが17.7%から78.7%に向上した。この論文はLLMプロンプティング研究の中で最も引用された研究の一つとなり、連鎖思考研究プログラムへの基礎的な貢献として広く認識されている。

OpenAI — シニアリサーチャー、ChatGPTチーム; 日本市場参入責任者(c. 2022–2023)

GuはOpenAIでシニアリサーチャーとしてChatGPTチームに所属し、GPT-4のテクニカルレポートにも貢献した。また、日本市場参入イニシアチブ(OpenAIの日本における商業的および研究的プレゼンスを確立するための戦略的取り組み)を主導し、これは2024年4月のOpenAI東京オフィス開設へと結実した。彼の3カ国語能力と日本に基盤を持つプロフェッショナルな関係性が、この取り組みの自然なリーダーとなった。

Google DeepMind — シニアスタッフリサーチサイエンティスト(2023年–現在)

2023年にGoogle BrainとDeepMindがGoogle DeepMindに統合された後、Guは統合組織に復帰した。彼はGeminiポストトレーニングの多言語チーム(Geminiの言語能力を英語以外にも拡張するためのパイプラインを担当)を率い、その後、現在の役職であるフロンティアモデルの推論能力に焦点を当てるGemini Thinkingチームに異動した。

東京大学 — 客員准教授(継続中)

産業界での役割と並行して、Guは東京大学で客員准教授(非常勤)の地位を保持し、松尾研究室および関連グループとの研究協力を維持している。2021年から2023年にかけての彼のNeurIPSおよびICLRの論文のいくつかは、東京大学の博士課程学生や研究者との共著である。

スタンフォード大学 — 客員研究員

Guはスタンフォード大学コンピュータサイエンス学科の客員研究員も務めており、彼の産業研究と学界との間の生産的なインターフェースに貢献している。


主な貢献

  • Gumbel-Softmax(ICLR 2017) — Eric Jang、Ben Pooleとの共著「Categorical Reparameterization with Gumbel-Softmax」。離散カテゴリカル分布に対する微分可能で再パラメータ化可能な近似を提供し、カテゴリカル潜在変数を介したエンドツーエンドの勾配ベース学習を可能にした。現在では変分推論、離散生成モデル、微分可能アーキテクチャ探索の標準的手法。

  • Q-Prop(ICLR 2017 Oral) — 「Sample-Efficient Policy Gradient with An Off-Policy Critic」。オフポリシー批評家から導出された制御変数を用いてオンポリシーとオフポリシーの政策勾配推定を統合し、導入されるバイアスに関する理論的保証を伴ってTRPOやDDPGよりもサンプル効率を大幅に改善。

  • 非同期マルチロボット深層強化学習(ICRA 2017) — 「Deep Reinforcement Learning for Robotic Manipulation with Asynchronous Off-Policy Updates」。複数のロボット間で更新を並列化することで、オフポリシー深層強化学習が実ロボット上で直接トレーニングできることを実証 — 実ロボットハードウェア上で、実演や手設計の報酬なしに深層強化学習を実践した最初の事例の一つ。MIT Technology Reviewで紹介された。

  • ゼロショット連鎖思考 / 「Let’s think step by step」(NeurIPS 2022) — Takeshi Kojima、Machel Reid、Yutaka Matsuo、Yusuke Iwasawaとの共著「Large Language Models are Zero-Shot Reasoners」。単一の普遍的なゼロショットプロンプトが、多様な算術、記号、常識的推論ベンチマークにおいてLLMに正確な多段階推論を誘発することを示した。LLM推論研究において最も引用された論文の一つ。フレーズ「Let’s think step by step」はAI文化の広く複製されたアーティファクトとなった。

  • NAF(ICML 2016) — 「Continuous Deep Q-Learning with Model-Based Acceleration」。連続行動Q学習のためのNormalized Advantage Function表現を導入し、アクタークリティックアーキテクチャなしで連続制御タスクにおける安定したオフポリシー学習を可能にした。

  • IPG(NIPS 2017) — 「Interpolated Policy Gradient: Merging On-Policy and Off-Policy Gradient Estimation for Deep Reinforcement Learning」。オン/オフポリシー政策勾配法の理論的统一と、連続制御ベンチマーク全体での実証的改善を提供。

  • GPT-4とGeminiへの貢献 — GPT-4テクニカルレポート(OpenAI、2023)およびGemini、Gemini 1.5モデル論文(Google DeepMind、2023–2024)の共著者として記載されており、2つの最も重要なフロンティアモデル開発の取り組みへの参加を反映している。


受賞歴と認知

  • Best Paper Award、CoRL 2019 — Seyed Kamyar Seyed Ghasemipour、Richard Zemelとの共著「A Divergence Minimization Perspective on Imitation Learning Methods」に対し、Conference on Robot Learningで投稿上位0.25%に授与。
  • Google Focused Research Award — Google Brain時代に受賞。
  • Cambridge-Tübingen博士研究フェローシップ — ケンブリッジ大学とマックス・プランク知能システム研究所との競争力の高い共同フェローシップ。
  • NSERC奨学金 — 優秀な大学院研究に対するカナダ国家博士課程奨学金。
  • MIT Technology Review特集 — 彼のマルチロボット深層強化学習の研究は、ロボットスキル獲得への新しいアプローチを示すものとしてMIT Technology Reviewで取り上げられた。

主な関係者

  • Geoffrey E. Hinton — トロント大学での学部指導教官。Guを深層学習の伝統に結びつける知的系譜は、Sutskever、Krizhevsky、その他多くの人材を輩出したHintonのグループに直接由来する。
  • Richard E. Turner — ケンブリッジ大学機械学習グループでの博士課程主要指導教官。Guの確率的およびベイズ的基盤を形成。
  • Zoubin Ghahramani — ケンブリッジでの博士課程共同指導教官。ベイズ機械学習の第一人者であり、その確率的視点はGuの初期研究に影響を与えた。
  • Bernhard Schölkopf — チュービンゲンMPIでの博士課程共同指導教官。カーネル法と因果推論の先駆者。
  • Sergey Levine — Google Brainでの深層強化学習とロボット工学における主要な協力者。Q-Prop、IPG、および複数のロボット工学強化学習研究を含む多数の共著論文。
  • Timothy Lillicrap — Google DeepMind研究員。NAF、Q-Prop、IPG論文の主要な共著者。
  • Eric Jang — Google BrainでのGumbel-Softmaxの共著者。Jangによる同時提出(独立に開発)は、GuのバージョンとともにICLR 2017で共同発表された。
  • Yutaka Matsuo — 東京大学教授。Guが東京ベースの博士課程学生とゼロショットCoTおよび関連LLM論文で協力することを可能にした研究の橋渡し役。
  • Takeshi Kojima — 東京大学博士課程学生で「Let’s think step by step」論文の筆頭著者。日本とGoogle Brainの研究協力を代表する人物。

人物像

Guは、単一の専門性を深めるのではなく、ベイズ推論、深層強化学習、LLM推論という少なくとも3つの異なる技術的パラダイムにおいて実質的な貢献をしてきた人物として、AI研究の風景の中で稀有な地位を占めている。彼の研究の軌跡は、確率的機械学習(2014–2016)から深層強化学習とロボット工学の時代(2016–2020)、そしてLLMの時代(2020–現在)へと、分野そのものの世代交代を密接に反映しており、それぞれの移行期に生産的な成果を上げている。英語と日本語のプロフェッショナルコミュニティー向けに別々のTwitterアカウントを維持しており、これは彼の真のトリリンガルで三文化(日本生まれ、カナダ育ち、米国・日本・英国で活動)のアイデンティティーを反映している。東京のアカデミックグループとの協力関係やOpenAIの日本市場参入への参加は、東アジアと西洋のAIエコシステムを橋渡しすることへの一貫した関心を示唆している。彼はTMLRのAction EditorやNeurIPS、ICMLのArea Chairとしてアカデミックコミュニティーでも正式に活動している。


参考文献