ポーランド人の数学者・計算機科学者。OpenAIを共同設立し、敵対的例を共同発見し、ルービックキューブを片手で解くロボットハンドの構築に貢献し、Codex、GitHub Copilot、ChatGPTの基盤となるRLHFインフラを生み出したチームを率いた。
プロフィール
| 生年月日 | 1988年11月30日、ポーランド、クルチュボルク |
| 国籍 | ポーランド |
| 現在の所属 | OpenAI(共同設立者、研究員) |
| 研究分野 | 深層学習、リカレントニューラルネットワーク、強化学習、ロボティクス、プログラム合成、大規模言語モデル、RLHF |
| 博士課程指導教官 | ヤン・ルカン、ロブ・ファーガス |
| 博士論文 | Learning Algorithms from Data(ニューヨーク大学、2016年) |
| ウェブサイト | wojzaremba.com |
| X / Twitter | @woj_zaremba |
| GitHub | wojzaremba |
| Google Scholar | Wojciech Zaremba |
概要
ヴォイチェフ・ザレンバはポーランドの計算機科学者・数学者で、2015年にOpenAIを共同設立し、非営利の研究ラボからChatGPTやGPT-4の開発企業に至るまでの全軌跡にわたって同組織に在籍し続けている。元国際数学オリンピック銀メダリストであり、NYUクーラン研究所でヤン・ルカンとロブ・ファーガスの指導の下で博士号を取得する間、Google BrainとFacebook AI Researchでインターンとして深層学習研究に数学を優先する姿勢をもたらした。ニューラルネットワークにコンピュータプログラムの実行やアルゴリズムの学習を訓練するという彼の博士研究は、ニューラルネットワークのパターンマッチングと記号計算との間のギャップを埋めるための最も初期の体系的な取り組みの一つであった。OpenAIでは、ロボティクスチーム(強化学習と自動ドメインランダム化を用いてルービックキューブを解くロボットハンドを生み出した)、CodexとGitHub Copilotを開発したチーム、そしてChatGPTを人間の好みに合わせて調整するための人間データとRLHFインフラを率いた。彼は、コラボレーションの促進(技術、研究、エンジニアリング、アクセシビリティの作業を組み合わせること)を自身の最も重要な専門的スキルであると述べている。
幼少期と教育
ザレンバは1988年11月30日、ポーランド南部のオポーレ地方にある小さな都市、クルチュボルクで生まれた。幼い頃から数学、化学、計算機科学、物理学のすべてにおいて並外れた才能を示し、これら4分野すべての地域大会で優勝した。2000年から2007年まではポーランド児童基金奨学生であり、これは才能ある生徒を特定し支援する国家的プログラムである。2007年、18歳でベトナムで開催された第48回国際数学オリンピックにポーランド代表として出場し、世界で最も競争の激しい数学コンテストの一つで銀メダルを獲得した。
ザレンバはワルシャワ大学で数学と計算機科学を学び、同時にパリのエコール・ポリテクニークで修士課程を修了し、2013年に数学の2つの修士号を取得した。また、深層学習時代以前の学部時代にNVIDIAで短期間働き、GPUアクセラレーションコンピューティングに早期に触れた。
2013年、ニューヨーク大学クーラン数理科学研究所で計算機科学の博士号取得を開始し、ロブ・ファーガスのCILVR研究所で学び、ヤン・ルカンが共同指導教官を務めた。彼は、2012年時点で深層学習を本格的に育成していた大学はトロント大学、モントリオール大学、NYUの3つだけであると結論づけたため、NYUを選択した。博士課程のインターンとして、Google Brainで1年、Facebook AI Researchで1年を過ごした。ザレンバは2016年に博士号を取得し、その前年に学位取得中にしてOpenAIの共同設立者に指名されていた。2015年にはGoogle Fellowshipを受賞した。
経歴
NYUクーラン研究所 — 博士研究(2013–2016年)
ザレンバの博士研究は、論文『データからのアルゴリズム学習』にまとめられており、中心的な問いを追求した。それは、ニューラルネットワークがプログラム可能なコンピュータのアルゴリズム的な振る舞いをエミュレートすることを学習できるのか、単に統計的なパターンを近似するだけではないのか、というものである。この研究はいくつかの影響力のある成果を生んだ。
敵対的例(Google Brainインターンシップ、2013年)。Google Brainでのインターンシップ中、ザレンバはクリスチャン・セゲディ、イリヤ・サツケヴァー、ジョアン・ブルナ、ドゥミトル・エルハン、イアン・グッドフェロー、ロブ・ファーガスと共に「ニューラルネットワークの興味深い性質」という論文(2013年、ICLR 2014)を共著した。この論文は、入力画像に対する知覚できない摂動が最先端のニューラルネットワークで高い信頼度の誤分類を引き起こすこと、そしてこれらの敵対的摂動がアーキテクチャ間で転移することを発見し、敵対的機械学習分野の基盤を確立した。
リカレントニューラルネットワークの正則化(FAIRインターンシップ、2014年)。LSTMのための原理に基づいたドロップアウト手法を開発した論文で、LSTMの訓練の不安定性が大きな障害となっていた時期に、リカレントネットワーク訓練のための影響力のある実用的ガイドとなった。
実行の学習(2014年、イリヤ・サツケヴァーと共著)。LSTMが入出力例から単純なコンピュータプログラムを評価することを学習できることを実証した体系的な研究で、ループ、条件分岐、変数バインディングを含む短いプログラムの正しい出力を予測できることを示した。この論文は、ニューラルネットワークのプログラム実行を研究するためのベンチマークと方法論を確立し、ニューラルプログラム合成の文献に影響を与えた。
OpenAI — 共同設立者兼研究員(2015年–現在)
ザレンバは2015年12月にOpenAIの11名の創設メンバーの一人として発表され、GoogleやFacebookからのオファー(彼の言葉を借りれば「常軌を逸した」給与)を断り、非営利団体に加わった。彼はその後も組織のすべての変遷を通じて在籍し続けている。
OpenAI Gym(2016年)。ザレンバはOpenAI Gymへの貢献者の一人であり、これは強化学習研究のためのオープンソースツールキットで、RLコミュニティのデフォルトのベンチマーク環境となり、連続制御、Atariゲーム、ロボットタスクにわたるアルゴリズム間の比較を標準化した。
ロボティクス研究マネージャー(2015–2020年)。OpenAIでの最初の5年間、ザレンバはロボティクス研究プログラムを率いた。チームの最も広く知られた成果はDactylシステム(2019年)であり、これは自動ドメインランダム化(ADR)を用いてシミュレーション内で完全に5本指の人間型ロボットハンドを訓練し、学習したポリシーを物理的なハンドに転送してルービックキューブを片手で解くことを可能にした。Dactylの成果は、これまで達成されたことのないレベルの巧みさでのシミュレーションから現実への転送の実証と、手動で設計されたコントローラではなくLSTMベースのポリシーの使用で注目された。ロボティクスチームは、言語モデルへのより広範な戦略的転換の中で2020年に解散した。
CodexとGitHub Copilot(2020–2021年)。ロボティクスチームの解散後、ザレンバはCodexの開発を主導した。これはGitHubの公開コードで微調整されたGPTモデルである。結果として得られたモデルは、「コードで訓練された大規模言語モデルの評価」(2021年)で説明され、HumanEvalベンチマーク(ドキュメント文字列からのプログラム合成の機能的正しさを測定)の問題の28.8%を解決し、GPT-3の0%を上回った。ザレンバは2021年8月にCodexのローンチを公に発表した。Codexのプロダクションバージョンは、GitHub Copilotを動かすエンジンとなり、これは世界的に最も広く使用されているAI支援開発者ツールの一つとなり、数千万人のユーザーを抱えている。
GPTモデルと人間データ/RLHF(2021年–現在)。ザレンバはその後、ChatGPTの基盤となるGPTモデルシリーズの動作と安全性を形成した人間のフィードバックインフラ(データ収集、ラベリング業務、人間からのフィードバックを用いた強化学習パイプライン)を担当するチームを率いた。これには、報酬モデルの訓練とRLHFによるGPT-4の微調整に使用される嗜好データを生成した人間データ領域の管理が含まれ、これはChatGPTの会話品質と指示追従動作の基礎となるプロセスである。2023年のNYUクーラン研究所のインタビュー時点で、彼はこのチームを率いており、自身の執筆や構成に毎日ChatGPTを使用していると述べている。
主な貢献
-
敵対的例(ICLR 2014) — クリスチャン・セゲディ、イリヤ・サツケヴァー、ジョアン・ブルナ、ドゥミトル・エルハン、イアン・グッドフェロー、ロブ・ファーガスとの共著「ニューラルネットワークの興味深い性質」。ニューラルネットワークにおける確信度の高い誤分類を引き起こす敵対的摂動と、それらのアーキテクチャ間での転移可能性の最初の体系的な発見と特徴づけ。敵対的機械学習サブ分野の創設。
-
LSTMドロップアウト/リカレントニューラルネットワークの正則化(2014年) — LSTMのための実用的なドロップアウト手法を開発し、過学習を減らし訓練を安定化させ、リカレントネットワーク訓練の標準的な手法となり、博士時代から最も応用された技術的成果の一つとなった。
-
実行の学習(arXiv 2014年、イリヤ・サツケヴァーと共著) — LSTMが短いコンピュータプログラムを評価するように訓練できることを実証し、ニューラルプログラム合成分野のためのベンチマーク方法論を確立し、その後のCodexの研究に直接影響を与えた。
-
OpenAI Gym(2016年) — RL研究コミュニティの標準的な評価フレームワークとなったオープンソースの強化学習ベンチマーク環境への貢献著者。
-
ルービックキューブをロボットハンドで解く/Dactyl(2019年) — OpenAIロボティクスチームの取り組みを共同主導し、シミュレーション内で自動ドメインランダム化を介して完全に学習されたポリシーを使用して物理的な5本指ロボットハンドにルービックキューブを解かせることに成功。前例のない巧みさでのシミュレーションから現実への転送の実証。
-
Codex / GitHub Copilot(2021年) — GitHubのコードで微調整されたCodex言語モデルの開発を主導し、GitHub Copilotを動かし、数千万人のソフトウェア開発者にAI支援コード補完を導入。GPTクラスモデルの最も広く展開された実用的アプリケーションの一つ。
-
ChatGPTのためのRLHFインフラ — OpenAIで、GPT-4とChatGPTを人間の好みに合わせて調整する人間データと人間からのフィードバックを用いた強化学習パイプラインを主導し、ChatGPTの会話品質の基盤となるデータラベリングと報酬モデル訓練業務を管理。
受賞と栄誉
- 国際数学オリンピック銀メダル(2007年) — ベトナム・ハノイで開催された第48回IMOにポーランド代表として出場。高校生が達成できる最も競争の激しい数学の成果の一つ。
- ポーランド児童基金奨学生(2000–2007年) — 複数のSTEM分野における才能ある学生のためのポーランド国家奨学金。
- Google Fellowship(2015年) — 北米Google博士課程フェローシップ。NYU博士課程在籍中に授与。
- Forbes Poland 30 Under 30(2017年) — ポーランド版Forbes誌による、30歳未満の最も影響力のあるポーランド人に選出。
- MIT Technology Review Innovators Under 35 — AIへの貢献により、影響力のある革新者に選出。
主な関係者
- イリヤ・サツケヴァー — 博士課程時代の最も緊密な研究協力者。「実行の学習」および関連するいくつかのプログラム合成論文を共著。OpenAI共同設立者兼元チーフサイエンティスト。ニューラル計算とアルゴリズム学習への共通の関心が、ザレンバの博士研究の知的核を定義した。
- ロブ・ファーガス — NYUクーラン研究所CILVRラボでの主たる博士課程指導教官。博士課程時代のザレンバを「眩しい」と評し、明らかに「AIの未来における大きな役割」を運命づけられていると述べた。
- ヤン・ルカン — NYUでの博士課程共同指導教官。ルカングループのより広い知的枠組み(知覚と表現のための深層学習)が、ザレンバが発展した環境を形成した。
- クリスチャン・セゲディ — Google Brainインターンシップ中の敵対的例の論文の共著者。セゲディ-ザレンバの協力は、深層学習史上最も重要な安全性関連の結果の一つを生み出した。
- サム・アルトマン — OpenAI CEO兼共同設立者。ザレンバがその専門的キャリアを通じて活動してきた設立パートナーシップ。
- グレッグ・ブロックマン — OpenAI共同設立者兼元社長。組織の技術インフラと研究プログラム全体にわたる緊密な同僚。
個人的スタイル
ザレンバは、深い数学的基盤(オリンピックレベルの問題解決、数学の2つの修士号)と、研究の組織的および人的側面への明示的なコミットメントを組み合わせている点で、AI研究者の中でも異彩を放っている。彼は「コラボレーションの促進」を自身の中核的な専門的スキルとして特定し、AIの進歩は単一の賢いアイデアからではなく、エンジニアリング、研究、プロダクト、アクセシビリティの作業の組み合わせから生じるという誤解について公に語っている。彼の述べる研究ビジョンは広大かつ楽観的であり、AIを文明への影響において電気に匹敵すると説明し、AI支援療法、個別化医療、学際的科学統合といった特定の応用分野について、彼の技術レベルにある研究者としては異例の具体的な熱意を持って議論している。彼は多言語話者(ポーランド語、英語、フランス語)であり、言語学習を、非典型的な背景が適応力を生むという彼のより広い信念に結びつけている。彼はQualia Research InstituteとGrowbotsの諮問委員会に引き続き所属しており、睡眠研究から人間関係におけるAI仲介紛争解決に至るまで、個人的な関心について率直に語っている。
参考文献
- ウィキペディア: Wojciech Zaremba
- NYUクーラン研究所同窓生Q&A: cims.nyu.edu
- Google Scholar: scholar.google.com
- IMO公式結果: imo-official.org
- 個人ウェブサイト: wojzaremba.com
- OpenAI設立発表: openai.com
- ワルシャワ大学訪問プロフィール: en.uw.edu.pl
- Diggプロフィール: digg.com/u/x/woj_zaremba