Shixiang Shane Gu

In Japan geborene chinesisch-kanadische Forscherin, deren Karriere Bayes’sche Inferenz, probeneffizientes Deep Reinforcement Learning, Robotik-Lernen und LLM-Reasoning umfasst — am bekanntesten als Koautorin des „Let’s think step by step“-Papers zur Zero-Shot-Chain-of-Thought.


Profil

Geboren Japan (Datum nicht öffentlich bekannt)
Nationalität Chinesisch-kanadisch (geboren in Japan)
Derzeitige Institution(en) Google DeepMind (Senior Staff Research Scientist, Gemini Thinking Team)
Forschungsbereiche Reinforcement Learning, Deep Learning, Robotik, Probabilistisches Maschinelles Lernen, Large Language Models, Reasoning
Doktorvater Richard E. Turner; Zoubin Ghahramani; Bernhard Schölkopf
Doktorarbeit Promotion in Maschinellem Lernen — University of Cambridge & Max-Planck-Institut für Intelligente Systeme (Cambridge-Tübingen Fellowship)
Webseite sites.google.com/view/gugurus
X / Twitter @shaneguML (Englisch); @shanegJP (Japanisch)
Google Scholar Shixiang Shane Gu — 72.000+ Zitationen

Überblick

Shixiang Shane Gu ist Senior Staff Research Scientist bei Google DeepMind und arbeitet derzeit im Gemini Thinking Team. Als in Japan geborene chinesisch-kanadische Wissenschaftlerin, die fließend Englisch, Japanisch und Mandarin spricht, erstreckt sich ihre Forschungskarriere über ein ungewöhnlich breites Spektrum an Teilbereichen: Bayes’sche Inferenz und probabilistisches maschinelles Lernen während ihrer Promotion, probeneffizientes Deep Reinforcement Learning bei Google Brain, groß angelegtes robotisches Lernen als Gründungsmitglied des Google Brain Robotics Teams, LLM-Ausrichtung und Reasoning während ihrer Tätigkeit im ChatGPT-Team von OpenAI und als Mitwirkende an GPT-4 sowie mehrsprachiges Post-Training und Chain-of-Thought-Reasoning bei Google DeepMind. Der KI-Community ist sie vor allem als Koautorin von „Large Language Models are Zero-Shot Reasoners“ (NeurIPS 2022) bekannt, dem Paper, das den Prompt „Let’s think step by step“ einführte und zeigte, dass Zero-Shot-Chain-of-Thought-Reasoning eine emergente Fähigkeit großer Sprachmodelle ist. Sie hat auch Gumbel-Softmax mitentwickelt — heute eine Standard-Differenzierungstechnik für diskrete latente Variablen — und zu Gumbel-Softmax, Q-Prop und verwandten Algorithmen beigetragen, die die Agenda der Probeneffizienz im Deep RL geprägt haben. Sie hatte Gastprofessuren an der Universität Tokio (Gastprofessorin) und der Stanford University inne und leitete den Markteintritt von OpenAI in Japan.


Frühes Leben & Ausbildung

Gu wurde in Japan in eine chinesische Familie geboren und ließ sich später in Kanada nieder. Sie identifiziert sich als in Japan geborene chinesisch-kanadische Wissenschaftlerin. Sie absolvierte ihr Grundstudium in Ingenieurwissenschaften an der University of Toronto, wo Geoffrey E. Hinton ihr Betreuer war — eine der bedeutendsten Mentorenschaften im damaligen maschinellen Lernen. Die Hinton-Gruppe in Toronto war die Keimzelle eines Großteils der Deep-Learning-Revolution, und Gus Ausbildung dort platzierte sie von Beginn ihrer Forschungskarriere an im Zentrum dieses Netzwerks.

Für ihre Doktorarbeit erhielt Gu ein Cambridge-Tübingen-PhD-Fellowship — ein wettbewerbsorientiertes gemeinsames Programm der Machine Learning Group der University of Cambridge und des Max-Planck-Instituts für Intelligente Systeme — und schloss eine Promotion im maschinellen Lernen unter der Betreuung von Richard E. Turner und Zoubin Ghahramani in Cambridge sowie Bernhard Schölkopf am MPI ab. Ihre Doktorforschung konzentrierte sich auf probabilistisches maschinelles Lernen und Bayes’sche Inferenz, darunter Beiträge zum Neural Adaptive Sequential Monte Carlo und zu Gradientenschätzern für stochastische Netzwerke. Während dieser Zeit erhielt sie außerdem ein NSERC-Stipendium (Natural Sciences and Engineering Research Council of Canada).


Karriere

Google Brain — Research Scientist, Gründungsmitglied von Google Brain Robotics (ca. 2016–2022)

Gu kam als Research Scientist zu Google Brain, war zwischen den USA und Japan tätig und wurde Gründungsmitglied des Google Brain Robotics Teams — einer der ersten dedizierten industriellen Forschungsgruppen, die Deep Learning auf die Steuerung physischer Roboter anwandten. In dieser Zeit verfolgte sie zwei parallele Forschungsstränge, die beide nachhaltige Wirkung hatten.

Probeneffizientes Deep Reinforcement Learning. Gus RL-Arbeit befasste sich mit dem, was sie als den Kernengpass für reale Robotik identifizierte: die prohibitive Probenkomplexität von Deep-RL-Algorithmen. Hauptsächlich in Zusammenarbeit mit Timothy Lillicrap, Sergey Levine, Zoubin Ghahramani und Richard Turner entwickelte sie eine Reihe zunehmend effektiverer Algorithmen. NAF (Normalized Advantage Functions, ICML 2016) führte einen kontinuierlichen Q-Learning-Ansatz unter Verwendung quadratischer Advantage-Darstellungen ein, der Off-Policy-Training in kontinuierlichen Aktionsräumen ermöglichte. Q-Prop (ICLR 2017 Oral) kombinierte On-Policy-Stabilität mit Off-Policy-Effizienz, indem eine Taylor-Entwicklung eines Off-Policy-Critics als Kontrollvariante verwendet wurde — eine Technik, die die Probeneffizienz gegenüber TRPO und DDPG auf MuJoCo-Benchmarks erheblich verbesserte. IPG (Interpolated Policy Gradient, NIPS 2017) verallgemeinerte das On/Off-Policy-Spektrum theoretisch und empirisch. Die asynchrone Multi-Roboter-Deep-RL-Arbeit (ICRA 2017) zeigte, dass die Parallelisierung des Off-Policy-Lernens über mehrere physische Roboter hinweg komplexe Manipulationsfähigkeiten erreichen konnte — ein Ergebnis, das im MIT Technology Review und in einem Google Research Blog Beitrag vorgestellt wurde, und eine der ersten Demonstrationen von Deep-RL-Training direkt auf realer Roboterhardware in großem Maßstab.

Gumbel-Softmax (ICLR 2017). Parallel zum RL entwickelte Gu den Gumbel-Softmax-Neuparametrisierungsansatz (mit Eric Jang und Ben Poole) mit, der gleichzeitig mit einer eng verwandten Methode (Concrete Distribution) von Maddison et al. veröffentlicht wurde. Die Technik bietet eine differenzierbare Approximation des kategorialen Samplings und ermöglicht die Rückwärtspropagation durch diskrete latente Variablen. Sie wurde sofort und dauerhaft zum Standard in variational autoencodern, diskreten generativen Modellen und der neuronalen Architektursuche.

Zero-Shot-Chain-of-Thought („Let’s think step by step“, NeurIPS 2022). Während seiner Zeit bei Google Brain war Gu Koautor des Papers „Large Language Models are Zero-Shot Reasoners“ mit Takeshi Kojima, Machel Reid, Yutaka Matsuo und Yusuke Iwasawa. Das Paper zeigte, dass das Anhängen eines einzigen universellen Prompts — „Let’s think step by step“ — vor der Antwort eines LLM mehrschrittiges Reasoning auslöst, ohne aufgabenspezifische Beispiele oder Feintuning. Bei GSM8K verbesserte die Technik die Genauigkeit von PaLM 540B von 17,9% auf 58,1% im Zero-Shot-Setting; bei MultiArith verbesserte sich InstructGPT von 17,7% auf 78,7%. Das Paper wurde zu einem der am häufigsten zitierten Werke in der LLM-Prompting-Literatur und gilt weithin als grundlegender Beitrag zum Chain-of-Thought-Forschungsprogramm.

OpenAI — Senior Researcher, ChatGPT Team; Leiterin des Markteintritts in Japan (ca. 2022–2023)

Gu verbrachte eine Zeit bei OpenAI als Senior Researcher im ChatGPT-Team und als Mitwirkende am GPT-4 Technical Report. Sie leitete auch die Initiative von OpenAI für den Markteintritt in Japan — die strategische Anstrengung, die kommerzielle und Forschungpräsenz von OpenAI in Japan aufzubauen, die mit der Eröffnung des OpenAI-Büros in Tokio im April 2024 gipfelte. Ihre Dreisprachigkeit und ihre in Japan ansässigen beruflichen Beziehungen machten sie zur natürlichen Leiterin dieser Bemühungen.

Google DeepMind — Senior Staff Research Scientist (2023–heute)

Nach der Fusion von Google Brain und DeepMind zu Google DeepMind im Jahr 2023 kehrte Gu in die kombinierte Organisation zurück. Sie leitete das Multilinguality Team für Gemini Post-Training — das Team, das für die Erweiterung der Sprachfähigkeiten von Gemini über Englisch hinaus in der gesamten Post-Training-Pipeline verantwortlich ist — bevor sie in ihre derzeitige Rolle im Gemini Thinking Team wechselte, das sich auf die Reasoning-Fähigkeiten von Frontier-Modellen konzentriert.

Universität Tokio — Gastprofessorin (laufend)

Parallel zu ihren Industrierollen hatte Gu eine Gastprofessur (Adjunct) an der Universität Tokio inne und pflegte Forschungskooperationen mit dem Matsuo Lab und angeschlossenen Gruppen. Mehrere ihrer NeurIPS- und ICLR-Papiere aus den Jahren 2021–2023 wurden gemeinsam mit Doktoranden und Forschern der Universität Tokio verfasst.

Stanford University — Gastwissenschaftlerin

Gu hatte auch eine Gastwissenschaftlerstelle am Department of Computer Science der Stanford University inne und trug zu einer produktiven Schnittstelle zwischen ihrer Industrieforschung und der akademischen Gemeinschaft bei.


Wichtigste Beiträge

  • Gumbel-Softmax (ICLR 2017) — „Categorical Reparameterization with Gumbel-Softmax“, mit Eric Jang und Ben Poole. Bereitstellung einer differenzierbaren, neuparametrisierbaren Approximation diskreter kategorialer Verteilungen, die end-to-end-gradientenbasiertes Training durch kategoriale latente Variablen ermöglicht. Heute Standard in variational inference, diskreten generativen Modellen und differenzierbarer Architektursuche.

  • Q-Prop (ICLR 2017 Oral) — „Sample-Efficient Policy Gradient with An Off-Policy Critic“. Vereinigung von On-Policy- und Off-Policy-Policy-Gradientenschätzung unter Verwendung einer aus einem Off-Policy-Critic abgeleiteten Kontrollvariante, mit erheblicher Verbesserung der Probeneffizienz gegenüber TRPO und DDPG bei theoretischen Garantien bezüglich des eingeführten Bias.

  • Asynchrones Multi-Roboter-Deep-RL (ICRA 2017) — „Deep Reinforcement Learning for Robotic Manipulation with Asynchronous Off-Policy Updates“. Zeigte, dass Off-Policy-Deep-RL direkt auf realen physischen Robotern trainieren kann, indem Aktualisierungen über mehrere Maschinen parallelisiert werden — eine der ersten praktischen Demonstrationen von Deep-RL auf echter Roboterhardware ohne Demonstrationen oder handgefertigte Belohnungen. Vorgestellt im MIT Technology Review.

  • Zero-Shot-Chain-of-Thought / „Let’s think step by step“ (NeurIPS 2022) — „Large Language Models are Zero-Shot Reasoners“, mit Takeshi Kojima, Machel Reid, Yutaka Matsuo, Yusuke Iwasawa. Zeigte, dass ein einzelner universeller Zero-Shot-Prompt genaues mehrschrittiges Reasoning in LLMs über verschiedene arithmetische, symbolische und gesunde-Menschenverstand-Benchmarks auslöst. Eines der am häufigsten zitierten Papiere in der LLM-Reasoning-Literatur; der Satz „Let’s think step by step“ wurde zu einem weit verbreiteten Artefakt der KI-Kultur.

  • NAF (ICML 2016) — „Continuous Deep Q-Learning with Model-Based Acceleration“. Einführung der Normalized Advantage Function-Darstellung für kontinuierliches Action-Q-Learning, die stabiles Off-Policy-Training in kontinuierlichen Steuerungsaufgaben ohne Actor-Critic-Architekturen ermöglicht.

  • IPG (NIPS 2017) — „Interpolated Policy Gradient: Merging On-Policy and Off-Policy Gradient Estimation for Deep Reinforcement Learning“. Bereitstellung einer theoretischen Vereinheitlichung von On/Off-Policy-Policy-Gradientenmethoden und empirischer Verbesserung auf kontinuierlichen Steuerungs-Benchmarks.

  • Beiträge zu GPT-4 und Gemini — Als Beitragende zum GPT-4 Technical Report (OpenAI, 2023) und sowohl zum Gemini- als auch zum Gemini 1.5-Modellpaper (Google DeepMind, 2023–2024) aufgeführt, was ihre Teilnahme an zwei der bedeutendsten Frontier-Modellentwicklungsbemühungen widerspiegelt.


Auszeichnungen & Anerkennungen

  • Best Paper Award, CoRL 2019 — Für „A Divergence Minimization Perspective on Imitation Learning Methods“ (mit Seyed Kamyar Seyed Ghasemipour und Richard Zemel), vergeben an die besten 0,25% der Einreichungen der Conference on Robot Learning.
  • Google Focused Research Award — Verliehen während ihrer Zeit bei Google Brain.
  • Cambridge-Tübingen PhD Fellowship — Wettbewerbsorientiertes gemeinsames Stipendium der University of Cambridge und des Max-Planck-Instituts für Intelligente Systeme.
  • NSERC-Stipendium — Kanadisches nationales Promotionsstipendium für herausragende Graduiertenforschung.
  • Feature im MIT Technology Review — Ihre Multi-Roboter-Deep-RL-Arbeit wurde im MIT Technology Review als Demonstration eines neuartigen Ansatzes zum Erlernen robotischer Fähigkeiten hervorgehoben.

Wichtige Beziehungen

  • Geoffrey E. Hinton — Betreuer im Grundstudium an der University of Toronto; die intellektuelle Linie, die Gu mit der Deep-Learning-Tradition verbindet, verläuft direkt durch Hintons Gruppe, die Sutskever, Krizhevsky und viele andere hervorbrachte.
  • Richard E. Turner — Hauptbetreuer der Promotion an der Machine Learning Group der University of Cambridge; prägte Gus probabilistische und Bayes’sche Grundlagen.
  • Zoubin Ghahramani — Ko-Betreuer der Promotion in Cambridge; eine führende Figur im Bayes’schen maschinellen Lernen, dessen probabilistische Perspektive Gus frühe Forschung beeinflusste.
  • Bernhard Schölkopf — Ko-Betreuer der Promotion am MPI Tübingen; Pionier der Kernel-Methoden und der kausalen Inferenz.
  • Sergey Levine — Hauptkooperationspartner bei Google Brain für Deep RL und Robotik; mehrere gemeinsam verfasste Papiere, darunter Q-Prop, IPG und verschiedene RL-Robotik-Arbeiten.
  • Timothy Lillicrap — Google DeepMind-Forscher und wichtiger Koautor der NAF-, Q-Prop- und IPG-Papiere.
  • Eric Jang — Google Brain-Koautor von Gumbel-Softmax; Jangs gleichzeitige Einreichung (unabhängig entwickelt) wurde zusammen mit Gus Version auf der ICLR 2017 veröffentlicht.
  • Yutaka Matsuo — Professor an der Universität Tokio; die Forschungsbrücke, die Gus Kooperationen mit Doktoranden in Tokio bei den Zero-Shot CoT und verwandten LLM-Papieren ermöglichte.
  • Takeshi Kojima — Doktorand an der Universität Tokio und Erstautor des „Let’s think step by step“-Papers; ein Vertreter der Forschungskooperation zwischen Japan und Google Brain.

Persönlicher Stil

Gu nimmt in der KI-Forschungslandschaft eine seltene Position ein, da sie substanzielle Beiträge in mindestens drei verschiedenen technischen Paradigmen geleistet hat — Bayes’sche Inferenz, Deep RL und LLM-Reasoning — anstatt eine einzelne Spezialität zu vertiefen. Ihr Forschungsbogen bildet die Generationswechsel des Fachgebiets selbst genau ab: vom probabilistischen maschinellen Lernen (2014–2016) über die Deep-RL- und Robotik-Ära (2016–2020) bis zur LLM-Ära (2020–heute), mit produktiven Ergebnissen in jedem Übergang. Sie unterhält separate Twitter-Konten für englisch- und japanischsprachige Fachgemeinschaften, eine Praxis, die ihre authentische drei- und multikulturelle Identität widerspiegelt — in Japan geboren, in Kanada ausgebildet, tätig in den USA, Japan und Großbritannien. Ihre Kooperationen erstrecken sich über akademische Gruppen in Tokio, und ihre Beteiligung am Markteintritt von OpenAI in Japan deutet auf ein konsequentes Interesse an der Brückenbildung zwischen den ostasiatischen und westlichen KI-Ökosystemen hin. Sie ist formell in der akademischen Gemeinschaft aktiv als Action Editor für TMLR und als Area Chair für NeurIPS und ICML.


Referenzen