Nathan Lambert

バークレーでロボティクスのPhDを取得後、アレン人工知能研究所(AI2)でポストトレーニング責任者を務める。オープンソースモデル、RLHFの書籍、ニュースレター「Interconnects」を通じて、LLMのアライメントとポストトレーニングに関する最もアクセスしやすい情報発信者の一人として知られている。


プロフィール

国籍 アメリカ
現在の所属機関 アレン人工知能研究所(Ai2)(シニアリサーチサイエンティスト、ポストトレーニング責任者)
研究分野 RLHF、ポストトレーニング、オープン言語モデル、モデルベース強化学習、ロボティクス制御
博士課程指導教官 Kristofer S.J. Pister、Roberto Calandra(共同指導教官、Meta AI Research)
博士論文 Synergy of Prediction and Control in Model-based Reinforcement Learning (UC Berkeley、2022年)
ウェブサイト natolambert.com
ブログ interconnects.ai — 購読者60,000人以上
X / Twitter @natolambert
GitHub natolambert
Google Scholar Nathan Lambert

概要

Nathan Lambertは、バークレーでのマイクロロボティクス制御から、オープンソースLLMのポストトレーニングにおける最重要人物の一人へと進化したアメリカの機械学習研究者である。アレン人工知能研究所(Ai2)のポストトレーニング責任者として、彼は、最初期の完全オープンプレトレーニング言語モデルの一つであるOLMoと、少人数のオープンチームがMeta社の独自ポストトレーニングと同等の指示追従品質を同じベースモデル上で達成できることを示したTüluポストトレーニングレシピシリーズの推進力となってきた。同時に、Lambertは、購読者6万人以上に成長し、LLM研究、政策、オープンvsクローズドモデル論争について、この分野で最も技術的に根拠のある一般向け解説の一つとして機能しているSubstackニュースレター「Interconnects」を運営している。彼は『RLHF Book』の単独著者でもあり、これは近日中にrlhfbook.comから印刷版が出版される予定で、現在は自由に入手可能なarXiv文書として流通し、実務家の参考書として広く使用されている。


生い立ちと学歴

Lambertは、電気工学とコンピュータサイエンスの学部および大学院初期の研究を修了した。カリフォルニア大学バークレー校の電気工学・コンピュータサイエンス学科で博士号を取得し、Kristofer Pister教授の下でバークレー自律マイクロシステム研究所に所属、Meta AI ResearchのRoberto Calandraの共同指導も受けた。彼の博士論文『Synergy of Prediction and Control in Model-based Reinforcement Learning』(2022年)は、モデルベースRLとマイクロロボティクス制御の交差点に位置するもので、RLの理論的基盤と現実の物理システムに対する工学的要件の両方に対する初期の経験を与える珍しい組み合わせであった。博士課程在籍中、Facebook AI ResearchとDeepMindで、制御のためのモデルベースRLに関するインターンシップを経験し、コミュニティの規範改善と下級生の指導への貢献により、UC Berkeley EECS Demetri Angelakos Memorial Achievement Award for Altruismを受賞した。


経歴

UC Berkeley — 博士課程(2018–2022年)

Lambertの博士研究は、モデルベースの予測と閉ループ制御を組み合わせ、マイクロロボティクスプラットフォームのためのサンプル効率の高い学習コントローラを構築するという課題に取り組んだ。この間のFacebook AI ResearchとDeepMindでのインターンシップは、彼の視野をハードウェアに制約されたロボティクスから大規模RLシステムへと広げた。この経験は、主張を物理的現実に基づかせることへのエンジニアとしての敬意と、RLの理論的機構への研究者としての欲求という二重の視点を彼に残し、後にRLHFとポストトレーニングへのアプローチを形成することになる。

Hugging Face(2022–2023年)

卒業後、LambertはHugging Faceに入社し、同社のRLHF研究機能をほぼゼロから立ち上げる手助けをした。この役割は、ChatGPTがRLHFを一般名詞にしたまさにその時に、新興分野の中心に彼を置くことになった。彼は報酬モデリングと選好学習に関するオープンソースのツールと教育リソースに貢献し、急速に進化する文献をより広い聴衆にアクセスしやすくするためのニュースレターとしてInterconnectsを開始した。HuggingFace時代は、RLHFの仕組みについて、最大の公共的関心が集まった瞬間に信頼できる解説者としての地位を確立した。

アレン人工知能研究所 — Ai2(2023年–現在)

LambertはAi2にシニアリサーチサイエンティストとして入社し、ポストトレーニング責任者に任命された。彼の主なプロジェクトは、Ai2の完全にオープンなプレトレーニング言語モデルシリーズ(重み、学習データ、学習コードが公開されている)であるOLMoと、対応するポストトレーニングレシピであるTüluである。Tülu 3(2024年)は、オープンレシピのポストトレーニングが共有のLLaMAベース上でMetaの指示チューニング品質に匹敵することを実証し、オープンモデルエコシステムの実現可能性に対する具体的な概念実証として特に注目を集めた。彼は、OLMoをAi2に入社した最大の理由として挙げており、完全な公開(データ、コード、重み)がAIをより監査可能で競争力のあるものにするための最も扱いやすい手段であると考えている。また、Group Relative Policy Optimization(GRPO)を介して検証可能報酬による強化学習(RLVR)を統合したTülu 3.1を開発し、OLMo 2 32Bにスケールアップした。2026年4月には中国を訪れ、Moonshot AI、Z.ai、01.ai、Meituan、Xiaomiなど主要なAI研究所のほとんどを訪問し、中国とアメリカの研究環境の文化的・組織的差異について広く circulated された旅行報告書を発表した。


主な貢献

  • OLMo (Open Language Model) — Ai2の主力である完全にオープンなプレトレーニング言語モデルシリーズへの中核的貢献者。重み、学習データ(Dolma)、学習コードを公開。一部の学術コンソーシアムを除けば、最も包括的なオープンレシピ大規模言語モデルの取り組み。
  • Tülu / Tülu 3 — 同じLLaMAベースを使用してMetaの指示追従品質に匹敵する、完全に再現可能なポストトレーニングレシピを主導。Tülu 3.1ではRLVR/GRPOをさらに組み込み、OLMo 2 32Bが学術ベンチマークでGPT-3.5 Turboを上回り、完全オープンモデルとして初めてこれを達成した。
  • Interconnectsニュースレター — LLMポストトレーニング、オープンソースAI、およびこの分野の政治経済学を扱うSubstackニュースレターを創設・執筆。購読者60,000人以上に成長し、Substackのテクノロジー部門で39位にランクインし、最も広く読まれている技術系MLニュースレターの一つとなっている。
  • RLHF Book (Reinforcement Learning from Human Feedback, rlhfbook.com / arXiv 2504.12501) — 指示チューニング、報酬モデリング、PPO、DPO、RLVR、未解決の研究課題など、RLHFとポストトレーニングのパイプライン全体をカバーする単著の書籍。生きているarXiv文書として自由に入手可能で、近日中に印刷版が出版される予定。
  • SAIL (Substack Artificial Intelligence Library) — AI研究のための厳選された読書リソース、readsail.comを共同設立。
  • Interconnects Interviews — 主要なAI研究者に技術動向についてインタビューするポッドキャストシリーズを主催。執筆するニュースレターを補完する。
  • China AI Lab旅行報告書(2026年5月) — 中国の主要LLM研究所(Moonshot、Z.ai、01.ai、Meituan、Xiaomi、Tsinghua)訪問の一人称視点による記録。貴重な直接取材に基づく組織・文化分析を提供。政策・研究コミュニティで広く読まれた。

受賞と認知

  • UC Berkeley EECS Demetri Angelakos Memorial Achievement Award for Altruism — 博士課程在籍中、コミュニティ規範と下級生指導への貢献に対して授与。
  • Lex Fridman Podcastへの出演(2025年2月、2026年2月) — 最も視聴されているAIポッドキャストの一つに2度招待される。最初はDeepSeekとその米中AI競争への影響について、2度目は2026年のAI最先端に関する幅広い概観について議論。
  • Interconnects — Substackテクノロジー部門39位 — このランキングは、組織的なバックアップやプロモーション費用なしに、技術的・分析的なコンテンツのみによって推進された有機的な購読者増加を反映している。

主要な関係

  • Kristofer S.J. Pister — 博士課程指導教官。バークレーにおけるスマートダストとマイクロロボティクスのパイオニア。Lambertに物理システムとハードウェア制約付きRLの基礎を与えた。
  • Roberto Calandra — Meta AI Researchからの博士課程共同指導教官。Lambertのマイクロロボティクス研究を大規模モデルベースRLの文献に橋渡しした。
  • Liam Fedus / OpenAI ポストトレーニングコミュニティ — LambertのTüluに関する研究は、OpenAIのポストトレーニング研究を直接ベンチマークしている。彼のニュースレターは頻繁にOpenAIのリリースを分析・文脈化しており、ポストトレーニング手法におけるコミュニティの重複について発言している。
  • Yann Dubois & HuggingFace RLHFチーム — オープンなRLHFツールが構築されていたHuggingFace時代の同僚。
  • Ai2 / OLMoチーム — OLMoパイプライン全体における緊密な共同研究者。チームはフロンティア研究室よりも意図的に小規模(約10~15人)で運営されており、Lambertはこれを制約であると同時に機動性の源として挙げている。
  • Jordan Schneider (ChinaTalk) — 頻繁な協力者でありポッドキャストホスト。Lambertの中国出張はChinaTalkエコシステムと協力して組織され、AI技術分析と地政学的枠組みを橋渡しした。

個人的スタイル

Lambertの声は、多くのAI解説に見られる誇大広告のサイクルに対して意図的に調整されている。すなわち、他の人がマーケティング用語を使うところで、彼は正確な技術的定義に到達しようと努め、オープンベンチマークで検証できない主張に対しては公然と懐疑的である。サンフランシスコの外に拠点を置くという彼の決断は、Noe Valleyのコーヒーミーティングへの近接性がほぼ職業的に必須となっている分野では注目に値し、自身の分析の独立性を守るためのものとして位置づけられている。彼の著作は、チュートリアルレベルの技術解説と、誰がAIインフラを支配しているかに関する政治経済学的解説を混ぜ合わせたものであり、この組み合わせはこの分野では十分に稀であり、大規模な学際的読者層を築いてきた。研究以外では、彼は競争力のあるマウンテンランナーであり、自己紹介(「マウンテンランナー、犬のパパ」)は彼が書くほとんどすべての経歴に現れており、研究者が通常所属機関を先頭に置く分野としては珍しい個人的な要素である。


参考文献