Shixiang Shane Gu

일본 출생 중국계 캐나다인 연구원으로, 베이즈 추론, 샘플 효율적 심층 강화 학습, 로봇 학습, LLM 추론 분야를 아우르는 경력을 가졌으며, 가장 널리 알려진 업적은 「단계별로 생각해 봅시다」(Let’s think step by step) 제로샷 사고 사슬 논문의 공동 저자라는 점입니다.


프로필

출생 일본 (생년월일 비공개)
국적 중국계 캐나다인 (일본 출생)
현 소속 Google DeepMind (시니어 스태프 리서치 사이언티스트, Gemini Thinking 팀)
연구 분야 강화 학습, 딥러닝, 로보틱스, 확률적 머신러닝, 대규모 언어 모델, 추론
박사 지도 교수 Richard E. Turner; Zoubin Ghahramani; Bernhard Schölkopf
박사 학위 논문 머신러닝 박사 — 케임브리지 대학교 및 막스 플랑크 지능형 시스템 연구소 (Cambridge-Tübingen Fellowship)
웹사이트 sites.google.com/view/gugurus
X / 트위터 @shaneguML (영어); @shanegJP (일본어)
Google 학술 검색 Shixiang Shane Gu — 72,000회 이상 인용

개요

Shixiang Shane Gu는 Google DeepMind의 시니어 스태프 리서치 사이언티스트로, 현재 Gemini Thinking 팀에서 일하고 있습니다. 일본 출생 중국계 캐나다인으로 영어, 일본어, 중국어에 능통하며, 그의 연구 경력은 비정상적으로 넓은 하위 분야를 아우릅니다: 박사 과정에서의 베이즈 추론 및 확률적 머신러닝, Google Brain에서의 샘플 효율적 심층 강화 학습, Google Brain Robotics 팀의 창립 멤버로서의 대규모 로봇 학습, OpenAI의 ChatGPT 팀과 GPT-4 기여자로서의 LLM 정렬 및 추론, 그리고 Google DeepMind에서의 다국어 후처리 및 사고 사슬 추론이 그것입니다. 일반 AI 커뮤니티에는 「Large Language Models are Zero-Shot Reasoners」(NeurIPS 2022)의 공동 저자로 가장 잘 알려져 있으며, 이 논문은 「단계별로 생각해 봅시다」(Let’s think step by step)라는 프롬프트를 도입하고 제로샷 사고 사슬 추론이 대규모 언어 모델의 창발적 능력임을 입증했습니다. 또한 이산 잠재 변수를 위한 표준 미분 가능 기법이 된 Gumbel-Softmax를 공동 발명했으며, Q-Prop 및 관련 알고리즘에 기여하여 심층 강화 학습의 샘플 효율성 의제를 형성했습니다. 도쿄 대학 (객원 부교수)과 스탠포드 대학에서 방문 직위를 역임했으며, OpenAI의 일본 시장 진출을 주도했습니다.


초기 생애 및 교육

Gu는 일본에서 중국인 가정에서 태어나 후에 캐나다로 이주하여 일본 출생 중국계 캐나다인으로 정체성을 형성했습니다. 토론토 대학교에서 공학 과학 학부 과정을 밟았으며, 그의 지도 교수는 당시 머신러닝 분야에서 가장 영향력 있는 멘토십 중 하나였던 Geoffrey E. Hinton이었습니다. 토론토의 Hinton 그룹은 딥러닝 혁명의 중요한 요람이었으며, Gu가 그곳에서 형성된 것은 그의 연구 경력 초기부터 그 네트워크의 중심에 서게 했습니다.

박사 과정을 위해 Gu는 Cambridge-Tübingen PhD Fellowship — 케임브리지 대학교 머신러닝 그룹과 막스 플랑크 지능형 시스템 연구소 간의 경쟁력 있는 공동 프로그램 — 을 받았으며, 케임브리지에서 Richard E. Turner와 Zoubin Ghahramani, MPI에서 Bernhard Schölkopf의 지도 아래 머신러닝 박사 학위를 마쳤습니다. 그의 박사 연구는 확률적 머신러닝과 베이즈 추론에 초점을 맞추었으며, Neural Adaptive Sequential Monte Carlo 및 확률적 네트워크를 위한 그래디언트 추정기에 대한 기여가 포함됩니다. 또한 이 기간 동안 NSERC (캐나다 자연과학 및 공학 연구 위원회) 장학금을 받았습니다.


경력

Google Brain — 연구 과학자, Google Brain Robotics 창립 멤버 (약 2016–2022)

Gu는 연구 과학자로 Google Brain에 합류하여 미국과 일본을 오가며 근무했으며, Google Brain Robotics 팀의 창립 멤버가 되었습니다. 이는 물리적 로봇 제어에 딥러닝을 적용하는 최초의 전담 산업 연구 그룹 중 하나였습니다. 이 기간 동안 그는 각각 지속적인 영향을 미친 두 가지 병행 연구를 추구했습니다.

샘플 효율적 심층 강화 학습. Gu의 강화 학습 연구는 그가 실제 로봇 공학의 핵심 병목 현상으로 식별한 문제, 즉 심층 강화 학습 알고리즘의 엄청난 샘플 복잡성을 해결했습니다. 주로 Timothy Lillicrap, Sergey Levine, Zoubin Ghahramani, Richard Turner와 협력하여 점점 더 효과적인 일련의 알고리즘을 개발했습니다. NAF (Normalized Advantage Functions, ICML 2016)는 2차 이점 표현을 사용한 연속 Q-러닝 접근 방식을 도입하여 연속 행동 공간에서 정책 외 훈련을 가능하게 했습니다. Q-Prop (ICLR 2017 Oral)은 정책 외 비평가의 테일러 전개를 제어 변량으로 사용하여 정책 내 안정성과 정책 외 효율성을 결합함으로써 MuJoCo 벤치마크에서 TRPO 및 DDPG보다 샘플 효율성을 크게 향상시켰습니다. IPG (Interpolated Policy Gradient, NIPS 2017)는 정책 내/외 스펙트럼을 이론적 및 경험적으로 일반화했습니다. 비동기 다중 로봇 심층 강화 학습 연구 (ICRA 2017)는 여러 물리적 로봇에서 정책 외 학습을 병렬화하여 복잡한 조작 기술을 달성할 수 있음을 보여주었습니다. 이 결과는 MIT Technology Review와 Google Research Blog 게시물에 소개되었으며, 실제 로봇 하드웨어에서 딥 RL 훈련을 대규모로 직접 시연한 최초의 사례 중 하나입니다.

Gumbel-Softmax (ICLR 2017). 강화 학습과 함께 Gu는 Eric Jang 및 Ben Poole과 함께 Gumbel-Softmax 재매개변수화를 공동 발명했으며, 이는 Maddison 등의 밀접하게 관련된 방법 (Concrete Distribution)과 동시에 발표되었습니다. 이 기술은 범주형 샘플링에 대한 미분 가능한 근사를 제공하여 이산 잠재 변수를 통한 역전파를 가능하게 합니다. 이는 변분 오토인코더, 이산 생성 모델 및 신경 아키텍처 검색에서 즉시 그리고 지속적으로 표준이 되었습니다.

제로샷 사고 사슬 (「단계별로 생각해 봅시다」, NeurIPS 2022). Google Brain 시기 동안 Gu는 Takeshi Kojima, Machel Reid, Yutaka Matsuo, Yusuke Iwasawa와 함께 논문 「Large Language Models are Zero-Shot Reasoners」를 공동 저술했습니다. 이 논문은 LLM의 답변 앞에 단일 범용 프롬프트인 「단계별로 생각해 봅시다」를 추가하면 작업별 예시나 미세 조정 없이도 다단계 추론을 이끌어낼 수 있음을 보여주었습니다. GSM8K에서 이 기술은 제로샷 환경에서 PaLM 540B 정확도를 17.9%에서 58.1%로 향상시켰습니다. MultiArith에서는 InstructGPT가 17.7%에서 78.7%로 향상되었습니다. 이 논문은 LLM 프롬프팅 문헌에서 가장 많이 인용된 연구 중 하나가 되었으며, 사고 사슬 연구 프로그램에 대한 기초적인 기여로 널리 간주됩니다.

OpenAI — 선임 연구원, ChatGPT 팀; 일본 시장 진출 책임자 (약 2022–2023)

Gu는 OpenAI에서 ChatGPT 팀의 선임 연구원이자 GPT-4 기술 보고서의 기여자로 활동했습니다. 또한 OpenAI의 일본 시장 진출 이니셔티브를 주도했습니다. 이는 OpenAI의 일본 내 상업 및 연구 입지를 구축하기 위한 전략적 노력으로, 2024년 4월 OpenAI 도쿄 사무소 개소로 이어졌습니다. 그의 3개 국어 능력과 일본 기반의 전문 관계는 그를 이 노력의 자연스러운 리더로 만들었습니다.

Google DeepMind — 시니어 스태프 리서치 사이언티스트 (2023–현재)

2023년 Google Brain과 DeepMind가 Google DeepMind로 합병된 후, Gu는 통합 조직에 재합류했습니다. 그는 Gemini Post-Training의 다국어 팀을 이끌었습니다. 이 팀은 후처리 파이프라인 전반에 걸쳐 Gemini의 언어 능력을 영어 이상으로 확장하는 책임을 맡았습니다. 이후 현재 역할인 Gemini Thinking 팀으로 이동하여 프런티어 모델의 추론 능력에 초점을 맞추고 있습니다.

도쿄 대학 — 객원 부교수 (진행 중)

산업계 역할과 병행하여 Gu는 도쿄 대학에서 객원 부교수 (겸임)직을 맡아 Matsuo 연구실 및 관련 그룹과 연구 협력을 유지하고 있습니다. 2021~2023년 동안 그의 NeurIPS 및 ICLR 논문 중 다수는 도쿄 대학 박사 과정 학생 및 연구원들과 공동 저술되었습니다.

스탠포드 대학 — 방문 학자

Gu는 또한 스탠포드 대학 컴퓨터 과학과의 방문 학자 직위를 역임하여 그의 산업 연구와 학계 간의 생산적인 인터페이스에 기여했습니다.


주요 기여

  • Gumbel-Softmax (ICLR 2017) — 「범주형 재매개변수화 with Gumbel-Softmax」(Eric Jang, Ben Poole과 공동). 이산 범주형 분포에 대한 미분 가능하고 재매개변수화 가능한 근사를 제공하여 범주형 잠재 변수를 통한 종단 간 그래디언트 기반 훈련을 가능하게 했습니다. 현재 변분 추론, 이산 생성 모델 및 미분 가능 아키텍처 검색에서 표준으로 사용됩니다.

  • Q-Prop (ICLR 2017 Oral) — 「정책 외 비평가를 사용한 샘플 효율적 정책 그래디언트」(Sample-Efficient Policy Gradient with An Off-Policy Critic). 정책 외 비평가에서 파생된 제어 변량을 사용하여 정책 내 및 정책 외 정책 그래디언트 추정을 통합하고, 도입된 편향에 대한 이론적 보장과 함께 TRPO 및 DDPG보다 샘플 효율성을 크게 향상시켰습니다.

  • 비동기 다중 로봇 심층 강화 학습 (ICRA 2017) — 「비동기 정책 외 업데이트를 사용한 로봇 조작을 위한 심층 강화 학습」(Deep Reinforcement Learning for Robotic Manipulation with Asynchronous Off-Policy Updates). 여러 머신에서 업데이트를 병렬화하여 정책 외 딥 RL이 실제 물리적 로봇에서 직접 훈련될 수 있음을 보여주었습니다. 이는 시연이나 수동 설계 보상 없이 실제 로봇 하드웨어에서 딥 RL을 실제로 시연한 최초의 사례 중 하나입니다. MIT Technology Review에 소개되었습니다.

  • 제로샷 사고 사슬 / 「단계별로 생각해 봅시다」(NeurIPS 2022) — 「대규모 언어 모델은 제로샷 추론자」(Large Language Models are Zero-Shot Reasoners, Takeshi Kojima, Machel Reid, Yutaka Matsuo, Yusuke Iwasawa와 공동). 단일 범용 제로샷 프롬프트가 다양한 산술, 기호 및 상식 추론 벤치마크에서 LLM의 정확한 다단계 추론을 이끌어낸다는 것을 보여주었습니다. LLM 추론 문헌에서 가장 많이 인용된 논문 중 하나입니다. 「단계별로 생각해 봅시다」라는 문구는 AI 문화의 널리 재현된 유물이 되었습니다.

  • NAF (ICML 2016) — 「모델 기반 가속을 사용한 연속 심층 Q-러닝」(Continuous Deep Q-Learning with Model-Based Acceleration). 연속 행동 Q-러닝을 위한 정규화 이점 함수 표현을 도입하여 행위자-비평가 아키텍처 없이 연속 제어 작업에서 안정적인 정책 외 훈련을 가능하게 했습니다.

  • IPG (NIPS 2017) — 「내삽 정책 그래디언트: 심층 강화 학습을 위한 정책 내 및 정책 외 그래디언트 추정 병합」(Interpolated Policy Gradient: Merging On-Policy and Off-Policy Gradient Estimation for Deep Reinforcement Learning). 정책 내/외 정책 그래디언트 방법의 이론적 통일과 연속 제어 벤치마크 전반에 걸친 경험적 개선을 제공했습니다.

  • GPT-4 및 Gemini에 기여 — GPT-4 기술 보고서(OpenAI, 2023)와 Gemini 및 Gemini 1.5 모델 논문(Google DeepMind, 2023–2024)에 기여자로 등재되어, 가장 중요한 두 프런티어 모델 개발 노력에 참여했음을 반영합니다.


수상 및 인정

  • 최우수 논문상, CoRL 2019 — 「모방 학습 방법에 대한 발산 최소화 관점」(A Divergence Minimization Perspective on Imitation Learning Methods, Seyed Kamyar Seyed Ghasemipour, Richard Zemel과 공동)으로 로봇 학습 컨퍼런스(Conference on Robot Learning)에서 상위 0.25%의 제출물에 수여됨.
  • Google Focused Research Award — Google Brain 시기 수상.
  • Cambridge-Tübingen PhD Fellowship — 케임브리지 대학교와 막스 플랑크 지능형 시스템 연구소 간의 경쟁력 있는 공동 펠로우십.
  • NSERC 장학금 — 뛰어난 대학원 연구에 대한 캐나다 국립 박사 장학금.
  • MIT Technology Review 소개 — 그의 다중 로봇 심층 강화 학습 연구가 로봇 기술 습득에 대한 새로운 접근 방식을 시연하는 것으로 MIT Technology Review에 조명됨.

주요 관계

  • Geoffrey E. Hinton — 토론토 대학교 학부 지도 교수; Gu를 딥러닝 전통에 연결하는 지적 계보는 Sutskever, Krizhevsky 및 다른 많은 사람들을 배출한 Hinton의 그룹을 통해 직접 이어집니다.
  • Richard E. Turner — 케임브리지 대학교 머신러닝 그룹의 주요 박사 지도 교수; Gu의 확률적 및 베이지안 기초를 형성했습니다.
  • Zoubin Ghahramani — 케임브리지에서 박사 공동 지도 교수; 베이지안 머신러닝의 선도적 인물로, 그의 확률적 관점은 Gu의 초기 연구에 영향을 미쳤습니다.
  • Bernhard Schölkopf — MPI Tübingen에서 박사 공동 지도 교수; 커널 방법 및 인과 추론의 선구자.
  • Sergey Levine — Google Brain에서 딥 RL 및 로보틱스에 대한 주요 협력자; Q-Prop, IPG 및 여러 RL 로보틱스 연구를 포함한 여러 공동 저술 논문.
  • Timothy Lillicrap — Google DeepMind 연구원이자 NAF, Q-Prop 및 IPG 논문의 주요 공동 저자.
  • Eric Jang — Gumbel-Softmax의 Google Brain 공동 저자; Jang의 동시 제출(독립적으로 개발됨)은 Gu의 버전과 함께 ICLR 2017에서 공동 발표되었습니다.
  • Yutaka Matsuo — 도쿄 대학 교수; Gu가 제로샷 CoT 및 관련 LLM 논문에서 도쿄 기반 박사 과정 학생들과 협력할 수 있게 한 연구 다리 역할.
  • Takeshi Kojima — 도쿄 대학 박사 과정 학생이자 「단계별로 생각해 봅시다」 논문의 제1 저자; 일본-Google Brain 연구 협력의 대표.

개인적 스타일

Gu는 단일 전문 분야를 심화하기보다는 베이즈 추론, 딥 RL, LLM 추론이라는 최소한 세 가지 뚜렷한 기술 패러다임에서 실질적인 기여를 한 사람으로서 AI 연구 환경에서 드문 위치를 차지합니다. 그의 연구 궤적은 확률적 머신러닝(2014~2016)에서 딥 RL 및 로보틱스 시대(2016~2020)를 거쳐 LLM 시대(2020~현재)에 이르기까지, 각 전환점에서 생산적인 결과물을 내며 해당 분야의 세대적 전환과 밀접하게 일치합니다. 그는 영어와 일본어 전문 커뮤니티를 위해 별도의 트위터 계정을 유지하고 있으며, 이는 그의 진정한 3개 국어, 3개 문화 정체성(일본 출생, 캐나다 교육, 미국·일본·영국 전역에서 활동)을 반영하는 관행입니다. 그의 협력은 도쿄의 학술 그룹과 OpenAI의 일본 시장 진출 참여에 걸쳐 있으며, 이는 동아시아와 서양 AI 생태계를 연결하려는 일관된 관심을 시사합니다. 그는 TMLR의 Action Editor와 NeurIPS 및 ICML의 Area Chair로서 공식적으로 학계에서 활동하고 있습니다.


참고 자료