네이선 램버트

UC Berkeley에서 로봇 공학 박사 학위를 받고 Allen Institute for AI에서 포스트 트레이닝 리더로 활동 중입니다. 그의 오픈소스 모델 작업, RLHF 서적, 그리고 Interconnects 뉴스레터는 그를 LLM 정렬(alignment) 및 포스트 트레이닝 분야에서 가장 접근하기 쉬운 대중적 목소리 중 하나로 만들었습니다.


프로필

국적 미국
현 재직 기관 Allen Institute for AI — Ai2 (선임 연구 과학자, 포스트 트레이닝 리더)
연구 분야 RLHF, 포스트 트레이닝, 오픈 언어 모델, 모델 기반 강화 학습, 로봇 공학 제어
박사 지도 교수 Kristofer S.J. Pister; Roberto Calandra (공동 지도, Meta AI Research)
박사 학위 논문 모델 기반 강화 학습에서 예측과 제어의 시너지 (UC Berkeley, 2022)
웹사이트 natolambert.com
블로그 interconnects.ai — 60,000명 이상 구독자
X / Twitter @natolambert
GitHub natolambert
Google Scholar Nathan Lambert

개요

Nathan Lambert은 미국의 머신러닝 연구자로, 버클리에서의 마이크로 로봇 공학 제어 연구에서 출발하여 오픈소스 LLM 포스트 트레이닝 분야의 가장 중요한 역할 중 하나로 경력을 발전시켰습니다. Allen Institute for AI(Ai2)의 포스트 트레이닝 리더로서 그는 최초의 완전 오픈 프리트레인드 언어 모델 중 하나인 OLMo와 Tülu 포스트 트레이닝 레시피 시리즈의 원동력이었습니다. Tülu 시리즈는 소규모 오픈 팀이 동일한 기본 모델에서 Meta의 독점 포스트 트레이닝과 동등한 명령어 수행 품질을 달성할 수 있음을 보여주었습니다. 이와 동시에 Lambert는 60,000명 이상의 구독자를 보유한 Substack 뉴스레터인 Interconnects를 운영하며, 이 분야에서 가장 기술적으로 기반이 탄탄한 LLM 연구, 정책, 오픈 대 클로즈드 모델 논쟁에 대한 대중 논평을 제공하고 있습니다. 그는 RLHF 서적의 단독 저자로, rlhfbook.com에서 곧 인쇄본으로 출간될 예정이며, 현재 arXiv 문서로 무료 배포되어 실무자 참고 자료로 널리 사용되고 있습니다.


초기 생애 및 교육

Lambert은 전기 공학 및 컴퓨터 과학 학부 및 대학원 초기 과정을 마쳤습니다. 그는 UC Berkeley 전기 공학 및 컴퓨터 과학 학과에서 박사 학위를 취득했으며, Kristofer Pister 교수의 Berkeley 자율 마이크로 시스템 연구실에서 Roberto Calandra(Meta AI Research)의 공동 지도 아래 연구했습니다. 그의 박사 논문인 모델 기반 강화 학습에서 예측과 제어의 시너지(2022)는 모델 기반 RL과 마이크로 로봇 공학 제어의 교차점에 있으며, 이는 RL의 이론적 기초와 실제 물리 시스템의 엔지니어링 요구 사항을 모두 경험할 수 있는 특이한 조합이었습니다. 박사 과정 중 그는 Facebook AI Research와 DeepMind에서 모두 제어를 위한 모델 기반 RL 관련 인턴십을 했으며, 커뮤니티 규범 개선 및 후배 학생 멘토링 노력을 인정받아 UC Berkeley EECS Demetri Angelakos 기념 자선 공로상을 수상했습니다.


경력

UC Berkeley — 박사 과정 (2018–2022)

Lambert의 박사 연구는 모델 기반 예측과 폐쇄 루프 제어를 결합하여 마이크로 로봇 플랫폼을 위한 샘플 효율적인 학습 기반 컨트롤러를 구축하는 문제를 다루었습니다. 이 기간 동안 Facebook AI Research와 DeepMind에서의 인턴십은 그의 연구 범위를 하드웨어 제약적 로봇 공학에서 대규모 RL 시스템으로 넓혔습니다. 이 경험은 그에게 두 가지 관점, 즉 주장을 물리적 현실에 기반하려는 엔지니어의 존중과 RL의 이론적 메커니즘에 대한 연구자의 식욕을 남겼으며, 이는 이후 RLHF 및 포스트 트레이닝에 대한 그의 접근 방식을 형성했습니다.

Hugging Face (2022–2023)

졸업 후 Lambert는 Hugging Face에 합류하여 회사의 RLHF 연구 기능을 거의 처음부터 구축하는 데 기여했습니다. 이 역할은 ChatGPT가 RLHF를 가정에서도 아는 용어로 만든 바로 그 시점에 그를 떠오르는 분야의 중심에 두었습니다. 그는 보상 모델링 및 선호 학습에 관한 오픈소스 도구와 교육 자료 개발에 기여했으며, 빠르게 진화하는 문헌을 더 많은 청중이 접근할 수 있도록 하기 위해 뉴스레터로 Interconnects를 시작했습니다. HuggingFace 시기는 대중의 관심이 절정에 달했을 때 RLHF 메커니즘에 대한 신뢰할 수 있는 설명자로서의 그의 입지를 다졌습니다.

Allen Institute for AI — Ai2 (2023–현재)

Lambert는 Ai2에 선임 연구 과학자로 합류하여 포스트 트레이닝 리더로 임명되었습니다. 그의 주요 프로젝트는 Ai2의 완전 오픈 프리트레인드 언어 모델 시리즈인 OLMo(가중치, 훈련 데이터 및 훈련 코드 공개)와 이에 상응하는 포스트 트레이닝 레시피인 Tülu입니다. Tülu 3(2024)는 오픈 레시피 포스트 트레이닝이 공유된 LLaMA 기반에서 Meta의 명령어 튜닝 품질과 일치할 수 있음을 보여주며 오픈 모델 생태계의 실행 가능성에 대한 구체적인 개념 증명을 제공하여 특히 주목을 받았습니다. 그는 OLMo를 자신이 Ai2에 합류한 핵심 이유로 설명하며, 데이터, 코드, 가중치를 완전히 공개하는 것이 AI를 더 감사 가능하고 경쟁력 있게 만드는 가장 다루기 쉬운 지렛대라고 봅니다. 또한 그는 그룹 상대 정책 최적화(GRPO)를 통해 검증 가능한 보상(RLVR)을 통합하고 OLMo 2 32B로 확장한 Tülu 3.1을 개발했습니다. 2026년 4월 그는 중국으로 건너가 Moonshot AI, Z.ai, 01.ai, Meituan, Xiaomi를 포함한 대부분의 주요 AI 연구소를 방문했으며, 중국과 미국 연구 환경 간의 문화적, 조직적 차이에 대한 널리 회람된 여행 보고서를 발간했습니다.


주요 기여

  • OLMo (Open Language Model) — Ai2의 대표적인 완전 오픈 프리트레인드 언어 모델 시리즈에 핵심 기여자; 가중치, 훈련 데이터(Dolma), 훈련 코드 공개; 소수의 학술 컨소시엄 외에는 가장 포괄적인 오픈 레시피 대규모 언어 모델 작업.
  • Tülu / Tülu 3 — 동일한 LLaMA 기반에서 Meta의 명령어 수행 품질과 일치하고 완전히 재현 가능한 포스트 트레이닝 레시피 주도; Tülu 3.1은 RLVR/GRPO를 추가로 통합하여 OLMo 2 32B가 학술 벤치마크에서 GPT-3.5 Turbo를 능가하는 최초의 완전 오픈 모델이 되도록 함.
  • Interconnects 뉴스레터 — LLM 포스트 트레이닝, 오픈소스 AI, 그리고 이 분야의 정치 경제를 다루는 Substack 뉴스레터 창간 및 운영; 60,000명 이상의 구독자로 성장했으며 Substack 기술 부문 39위를 기록하여 가장 널리 읽히는 기술 ML 뉴스레터 중 하나가 됨.
  • RLHF 서적 (인간 피드백으로부터의 강화 학습, rlhfbook.com / arXiv 2504.12501) — 명령어 튜닝, 보상 모델링, PPO, DPO, RLVR 및 공개 연구 질문을 포함한 전체 RLHF 및 포스트 트레이닝 파이프라인을 다루는 단독 저서; arXiv 문서로 무료 제공되며 곧 인쇄본 출간 예정.
  • SAIL (Substack 인공지능 도서관) — AI 연구를 위한 큐레이팅된 읽기 자료 사이트인 readsail.com 공동 창립.
  • Interconnects 인터뷰 — 주요 AI 연구자들을 인터뷰하여 기술 동향을 논의하는 팟캐스트 시리즈를 진행하며, 서면 뉴스레터를 보완.
  • 중국 AI 연구소 방문 보고서 (2026년 5월) — 주요 중국 LLM 연구소(Moonshot, Z.ai, 01.ai, Meituan, Xiaomi, 칭화대) 방문에 대한 1인칭 기록, 드문 직접 경험 기반 조직 및 문화 분석 제공; 정책 및 연구 커뮤니티 전반에 걸쳐 널리 읽힘.

수상 및 인정

  • UC Berkeley EECS Demetri Angelakos 기념 자선 공로상 — 박사 과정 중 커뮤니티 규범 기여 및 후배 학생 멘토링에 대해 수상.
  • Lex Fridman 팟캐스트 출연 (2025년 2월, 2026년 2월) — 가장 트래픽이 많은 AI 팟캐스트 중 하나에 두 번 초청: 처음에는 DeepSeek와 미국-중국 AI 경쟁에 미치는 영향에 대해 논의했고, 두 번째는 2026년 AI 최첨단 기술에 대한 광범위한 개요 제공.
  • Interconnects — Substack 기술 부문 39위 — 순위는 기관의 지원이나 프로모션 지출 없이 기술 및 분석 콘텐츠에 의해 전적으로 추진된 유기적 구독자 성장을 반영.

주요 관계

  • Kristofer S.J. Pister — 박사 지도 교수; 버클리에서 스마트 더스트 및 마이크로 로봇 공학의 선구자; Lambert에게 물리 시스템 및 하드웨어 제약 RL에 대한 기초를 제공.
  • Roberto Calandra — Meta AI Research의 박사 공동 지도 교수; Lambert의 마이크로 로봇 공학 연구를 대규모 모델 기반 RL 문헌으로 연결.
  • Liam Fedus / OpenAI 포스트 트레이닝 커뮤니티 — Tülu에 대한 Lambert의 작업은 OpenAI의 포스트 트레이닝 작업을 직접 벤치마킹; 그의 뉴스레터는 OpenAI 릴리스를 자주 분석하고 맥락화하며, 포스트 트레이닝 방법론의 커뮤니티 중복에 대해 언급.
  • Yann Dubois 및 HuggingFace RLHF 팀 — 오픈 RLHF 도구가 구축되던 HuggingFace 시절 동료.
  • Ai2 / OLMo 팀 — 전체 OLMo 파이프라인에 대한 긴밀한 협력자; 팀은 의도적으로 프론티어 연구소(~10–15명)보다 작은 규모로 운영되며, Lambert는 이를 제약이자 민첩성의 원천으로 언급.
  • Jordan Schneider (ChinaTalk) — 반복적인 협력자 및 팟캐스트 호스트; Lambert의 중국 여행은 ChinaTalk 생태계와 협력하여 조직되었으며, AI 기술 분석과 지정학적 프레이밍을 연결.

개인 스타일

Lambert의 목소리는 많은 AI 논평을 특징짓는 과대 광고 사이클에 대해 의도적으로 조정되어 있습니다. 그는 다른 사람들이 마케팅 언어를 사용할 때 정확한 기술적 정의를 사용하는 경향이 있으며, 공개 벤치마크로 테스트할 수 없는 주장에 대해 공개적으로 회의적입니다. 샌프란시스코 밖에 기반을 두기로 한 결정(Noe Valley 커피 미팅에 대한 근접성이 거의 직업적으로 의무화된 분야에서 주목할 만함)은 자신의 분석 독립성을 보호하기 위한 것으로 설명했습니다. 그의 글쓰기는 튜토리얼 수준의 기술적 설명과 AI 인프라를 누가 통제하는지에 대한 정치 경제 논평을 혼합하며, 이는 이 분야에서 드물게 큰 학제 간 독자층을 구축했습니다. 연구 외에는 경쟁적인 산악 러너이며, 그의 자기 소개(„산악 러너, 개 아빠“)는 거의 모든 약력에 등장하는데, 이는 연구자들이 일반적으로 소속 기관을 먼저 내세우는 분야에서 이례적으로 개인적인 메모입니다.


참고 자료