Войцех Заремба

Польский математик и специалист по информатике, сооснователь OpenAI, соавтор открытия состязательных примеров, участник создания роботизированной руки, которая одной рукой собрала кубик Рубика, и руководитель команд, разработавших Codex, GitHub Copilot и инфраструктуру RLHF, лежащую в основе ChatGPT.


Профиль

Дата рождения 30 ноября 1988 г., Ключборк, Польша
Гражданство Польша
Текущее место работы OpenAI (сооснователь, научный сотрудник)
Области исследований Глубокое обучение, рекуррентные нейронные сети, обучение с подкреплением, робототехника, синтез программ, большие языковые модели, RLHF
Научный руководитель Ян Лекун; Роб Фергус
Докторская диссертация Learning Algorithms from Data (Нью-Йоркский университет, 2016)
Веб-сайт wojzaremba.com
X / Twitter @woj_zaremba
GitHub wojzaremba
Google Scholar Wojciech Zaremba

Общие сведения

Войцех Заремба — польский специалист по информатике и математик, который в 2015 году стал сооснователем OpenAI и оставался в организации на протяжении всего ее пути от некоммерческой исследовательской лаборатории до разработчика ChatGPT и GPT-4. Будучи серебряным призером Международной математической олимпиады, он привнес математический подход в исследования глубокого обучения, проходя стажировки в Google Brain и Facebook AI Research во время работы над докторской диссертацией в Нью-Йоркском университете под руководством Яна Лекана и Роба Фергуса. Его докторские исследования, посвященные обучению нейронных сетей выполнению компьютерных программ и изучению алгоритмов, были одними из первых систематических попыток преодолеть разрыв между распознаванием образов нейронными сетями и символьными вычислениями. В OpenAI он последовательно руководил командой робототехники (кульминацией которой стала роботизированная рука, собравшая кубик Рубика с помощью обучения с подкреплением и автоматической рандомизации среды), командой, разработавшей Codex и GitHub Copilot, а также инфраструктурой человеческих данных и RLHF, которая согласовывала ChatGPT с человеческими предпочтениями. Он описывает умение налаживать сотрудничество — объединяя техническую, исследовательскую, инженерную работу и работу по обеспечению доступности — как свой самый важный профессиональный навык.


Ранние годы и образование

Заремба родился 30 ноября 1988 года в Ключборке, небольшом городе в Опольском воеводстве на юге Польши. С раннего возраста он проявлял исключительные способности одновременно в математике, химии, информатике и физике, побеждая в местных соревнованиях по всем четырем дисциплинам. С 2000 по 2007 год он был стипендиатом Польского детского фонда — национальной программы по выявлению и поддержке одаренных учащихся. В 2007 году, в возрасте 18 лет, он представлял Польшу на 48-й Международной математической олимпиаде во Вьетнаме, завоевав серебряную медаль на одном из самых престижных математических соревнований в мире.

Заремба изучал математику и информатику в Варшавском университете и одновременно проходил магистерскую программу в Политехнической школе Парижа, получив в 2013 году две степени магистра математики. Во время учебы на бакалавриате он также недолго работал в NVIDIA — еще до эры глубокого обучения — получив ранний опыт работы с вычислениями на GPU.

В 2013 году он начал докторантуру по информатике в Институте математических наук Куранта при Нью-Йоркском университете, работая в лаборатории CILVR (Computational Intelligence, Learning, Vision, and Robotics) Роба Фергуса, а Ян Лекун был соруководителем. Он выбрал Нью-Йоркский университет, придя к выводу, что в 2012 году только три университета серьезно занимались глубоким обучением: Университет Торонто, Монреальский университет и Нью-Йоркский университет. Во время докторантуры он провел год в Google Brain и еще один в Facebook AI Research (FAIR) в качестве стажировок. Заремба получил докторскую степень в 2016 году, а в предыдущем году, еще продолжая обучение, был назначен сооснователем OpenAI. В 2015 году он получил стипендию Google.


Карьера

Институт Куранта, Нью-Йоркский университет — докторские исследования (2013–2016)

Докторская работа Зарембы, обобщенная в диссертации Learning Algorithms from Data, была посвящена центральному вопросу: могут ли нейронные сети научиться имитировать алгоритмическое поведение программируемых компьютеров, а не просто аппроксимировать статистические закономерности? Эта работа привела к нескольким влиятельным результатам.

Состязательные примеры (стажировка в Google Brain, 2013). Во время стажировки в Google Brain Заремба стал соавтором статьи «Intriguing Properties of Neural Networks» (2013, ICLR 2014) вместе с Кристианом Сегеди, Ильёй Суцкевером, Жоаном Бруной, Думитру Эрханом, Иэном Гудфеллоу и Робом Фергусом. В статье было обнаружено, что незаметные возмущения входных изображений могут приводить к высоконадежным ошибочным классификациям в самых современных нейронных сетях, и что эти состязательные возмущения переносятся между архитектурами — это заложило основу области состязательного машинного обучения.

Регуляризация рекуррентных нейронных сетей (стажировка в FAIR, 2014). Статья, в которой были разработаны принципиальные методы dropout для LSTM, ставшие влиятельным практическим руководством по обучению рекуррентных сетей в то время, когда нестабильность обучения LSTM была серьезным препятствием.

Learning to Execute (2014, с Ильёй Суцкевером). Систематическое исследование, демонстрирующее, что LSTM могут научиться выполнять простые компьютерные программы на основе примеров входных-выходных данных, предсказывая правильный вывод коротких программ с циклами, условиями и связыванием переменных. Статья установила эталон и методологию для изучения выполнения программ нейронными сетями, что повлияло на область нейронного синтеза программ.

OpenAI — сооснователь и научный сотрудник (2015–настоящее время)

В декабре 2015 года Заремба был объявлен одним из одиннадцати членов-основателей OpenAI, отказавшись от предложений Google и Facebook — а также, по его словам, от «совершенно безумных» зарплат — чтобы присоединиться к некоммерческой организации. Он оставался в организации на протяжении всех последующих трансформаций.

OpenAI Gym (2016). Заремба был в числе авторов OpenAI Gym — набора инструментов с открытым исходным кодом для исследований в области обучения с подкреплением, который стал стандартной средой для тестирования в сообществе RL, стандартизируя сравнения алгоритмов в задачах управления с непрерывным действиями, играх Atari и задачах робототехники.

Руководитель исследований в области робототехники (2015–2020). В течение первых пяти лет в OpenAI Заремба руководил программой исследований в области робототехники. Самым известным результатом команды стала система Dactyl (2019), которая обучила пятиручную гуманоидную роботизированную руку полностью в симуляции, используя автоматическую рандомизацию среды (ADR) — метод, который автоматически генерирует растущее распределение рандомизированных симулированных сред — и перенесла обученную политику на физическую руку, способную одной рукой собрать кубик Рубика. Результат Dactyl был примечателен демонстрацией переноса из симуляции в реальность на уровне ловкости, ранее не достигнутом, и использованием политик на основе LSTM, а не созданных вручную контроллеров. Команда робототехники была распущена в 2020 году в ходе более широкого стратегического поворота в сторону языковых моделей.

Codex и GitHub Copilot (2020–2021). После закрытия команды робототехники Заремба руководил разработкой Codex — модели GPT, дообученной на общедоступном коде из GitHub. Полученная модель, описанная в статье «Evaluating Large Language Models Trained on Code» (2021), решила 28,8% задач на эталоне HumanEval, который измеряет функциональную корректность синтеза программ по строковым документациям, по сравнению с 0% для GPT-3. Заремба публично объявил о запуске Codex в августе 2021 года. Производственная версия Codex стала движком, питающим GitHub Copilot — инструмент AI-дополнения кода, ставший одним из самых широко используемых инструментов для разработчиков с поддержкой AI в мире, насчитывающий десятки миллионов пользователей.

Модели GPT и человеческие данные / RLHF (2021–настоящее время). Впоследствии Заремба руководил командами, отвечающими за инфраструктуру обратной связи от человека — конвейер сбора данных, разметки и обучения с подкреплением на основе обратной связи от человека (RLHF), который формировал поведение и безопасность серии моделей GPT, лежащих в основе ChatGPT. Это включало управление областью Human Data, которая производила данные предпочтений, используемые для обучения моделей вознаграждения и точной настройки GPT-4 с помощью RLHF — процесса, фундаментального для качества диалога и способности следовать инструкциям ChatGPT. Во время своего интервью Институту Куранта Нью-Йоркского университета в 2023 году он описал руководство этой командой и ежедневное использование ChatGPT для собственного написания текстов и структурирования.


Ключевые вклады

  • Состязательные примеры (ICLR 2014) — «Intriguing Properties of Neural Networks» с Кристианом Сегеди, Ильёй Суцкевером, Жоаном Бруной, Думитру Эрханом, Иэном Гудфеллоу и Робом Фергусом. Первое систематическое обнаружение и характеристика состязательных возмущений, вызывающих уверенную ошибочную классификацию в нейронных сетях, и их переносимость между архитектурами. Заложило основы подполя состязательного машинного обучения.

  • LSTM Dropout / Регуляризация рекуррентных нейронных сетей (2014) — Разработал практические методы dropout для LSTM, которые уменьшили переобучение и стабилизировали обучение, став стандартной практикой для обучения рекуррентных сетей и одним из наиболее применяемых технических результатов его докторского периода.

  • Learning to Execute (arXiv 2014, с Ильёй Суцкевером) — Продемонстрировал, что LSTM можно обучить выполнять короткие компьютерные программы, установив эталонную методологию для области нейронного синтеза программ и напрямую повлияв на более позднюю работу Зарембы над Codex.

  • OpenAI Gym (2016) — Соавтор эталонной среды обучения с подкреплением с открытым исходным кодом, которая стала стандартной средой оценки для исследовательского сообщества RL.

  • Решение кубика Рубика с помощью роботизированной руки / Dactyl (2019) — Соруководитель команды робототехники OpenAI, которая обучила физическую пятиручную роботизированную руку собирать кубик Рубика, используя политики, полностью изученные в симуляции с помощью автоматической рандомизации среды — демонстрация переноса из симуляции в реальность с беспрецедентной ловкостью.

  • Codex / GitHub Copilot (2021) — Руководил разработкой языковой модели Codex, дообученной на коде GitHub, которая стала движком GitHub Copilot и представила AI-ассистированное дополнение кода десяткам миллионов разработчиков программного обеспечения. Одно из наиболее широко развернутых практических применений моделей класса GPT.

  • Инфраструктура RLHF для ChatGPT — Руководил конвейером человеческих данных и обучения с подкреплением на основе обратной связи от человека в OpenAI, который согласовал GPT-4 и ChatGPT с человеческими предпочтениями, управляя операциями по разметке данных и обучению моделей вознаграждения, лежащими в основе качества диалога ChatGPT.


Награды и признание

  • Серебряная медаль, Международная математическая олимпиада (2007) — Представлял Польшу на 48-й IMO в Ханое, Вьетнам; одно из высших достижений в соревновательной математике, доступных школьнику.
  • Стипендиат Польского детского фонда (2000–2007) — Польская национальная стипендия для одаренных учащихся по нескольким дисциплинам STEM.
  • Стипендия Google (2015) — Североамериканская докторская стипендия Google, присужденная во время его докторантуры в Нью-Йоркском университете.
  • Forbes Poland «30 до 30» (2017) — Включен в список наиболее влиятельных поляков в возрасте до 30 лет по версии польского издания Forbes.
  • Инноваторы моложе 35 лет по версии MIT Technology Review — Назван в числе влиятельных новаторов за вклад в развитие ИИ.

Ключевые связи

  • Илья Суцкевер — Самый близкий научный сотрудник Зарембы в годы докторантуры; соавтор статьи «Learning to Execute» и нескольких смежных работ по синтезу программ; сооснователь OpenAI и бывший главный научный сотрудник. Их общий интерес к нейронным вычислениям и алгоритмическому обучению определил интеллектуальное ядро докторской работы Зарембы.
  • Роб Фергус — Основной научный руководитель докторантуры в лаборатории CILVR Института Куранта Нью-Йоркского университета; описывал Зарембу как «ослепительного» в годы его докторантуры и как явно предназначенного для «большой роли в будущем ИИ».
  • Ян Лекун — Соруководитель докторантуры в Нью-Йоркском университете; более широкая интеллектуальная рамка группы Лекана — глубокое обучение для восприятия и представления — сформировала среду, в которой развивался Заремба.
  • Кристиан Сегеди — Соавтор статьи о состязательных примерах во время стажировки в Google Brain; сотрудничество Сегеди и Зарембы привело к одному из наиболее значимых результатов в области безопасности в истории глубокого обучения.
  • Сэм Альтман — Генеральный директор и сооснователь OpenAI; партнерство-основание, в рамках которого Заремба действовал на протяжении всей своей профессиональной карьеры.
  • Грег Брокман — Сооснователь OpenAI и бывший президент; близкий коллега по технической инфраструктуре и исследовательским программам организации.

Личный стиль

Заремба необычен среди исследователей ИИ тем, что сочетает глубокий математический фундамент — решение задач на олимпиадном уровне, две степени магистра математики — с явной приверженностью организационным и человеческим аспектам исследований. Он назвал «умение налаживать сотрудничество» своим основным профессиональным навыком и публично говорил о заблуждении, что прогресс в ИИ является результатом отдельных блестящих идей, а не сочетания инженерной, исследовательской, продуктовой работы и работы по обеспечению доступности. Его заявленное исследовательское видение масштабно и оптимистично: он описывает ИИ как сопоставимый по своему цивилизационному влиянию с электричеством и обсуждал конкретные области применения — терапия с помощью ИИ, персонализированная медицина, междисциплинарный научный синтез — с более конкретным энтузиазмом, чем это типично для исследователя его технического уровня. Он многоязычен (польский, английский, французский) и связывает изучение языков со своим более широким убеждением, что нетипичное происхождение порождает адаптивность. Он остается в консультативных советах Qualia Research Institute и Growbots и открыто рассказывал о личных интересах, начиная от исследований сна и заканчивая разрешением конфликтов с помощью ИИ в личных отношениях.


Ссылки