Американский исследователь машинного обучения, который в 2015 году изобрел диффузионные генеративные модели — математическую основу Stable Diffusion, DALL-E 2, Sora и практически всех остальных крупных систем генеративного ИИ для изображений и видео — после карьеры, начавшейся с управления марсоходами, и включавшей глубокий вклад в теорию нейронных сетей, метаобучение и оценку LLM.
Краткая информация
| Гражданство | Американец |
| Текущее место работы (институт) | Anthropic (член технического персонала) |
| Области исследований | Генеративные модели, диффузионные модели, статистическая физика, теория нейронных сетей, метаобучение, бесконечно-широкие сети, оценка LLM |
| Научный руководитель | Бруно Олсхаузен |
| Докторская диссертация | PhD, Центр теоретической нейронауки Редвуда, Калифорнийский университет в Беркли (2012) |
| Веб-сайт | sohldickstein.com |
| Блог | sohl-dickstein.github.io |
| X / Twitter | @jaschasd |
| GitHub | Sohl-Dickstein |
| Google Scholar | Jascha Sohl-Dickstein |
Обзор
Джаша Соль-Дикштайн — американский исследователь машинного обучения, в настоящее время член технического персонала Anthropic, наиболее известный как изобретатель диффузионных генеративных моделей. В его статье 2015 года на ICML (он был первым автором) — «Deep Unsupervised Learning using Nonequilibrium Thermodynamics» — была представлена математическая основа итеративного прямого зашумления и обученного обратного шумоподавления, заимствованная из неравновесной статистической физики, которая лежит в основе всего современного семейства диффузионных моделей: DDPM, score matching, латентных диффузионных моделей, Stable Diffusion, DALL-E 2, Imagen и Sora. В течение пяти лет на статью почти не обращали внимания, пока статья Джонатана Хо и коллег о DDPM (2020) не продемонстрировала ее практический потенциал в масштабе, после чего все поле задним числом признало формулировку Соль-Дикштайна 2015 года основополагающим вкладом. Помимо диффузионных моделей, он внес значительный вклад в теорию перепараметризованных и бесконечно-широких нейронных сетей (включая соавторство библиотеки Neural Tangents), метаобучение обученных оптимизаторов и бенчмарк BIG-Bench для оценки больших языковых моделей. Его багаж знаний необычайно широк для исследователя машинного обучения: он изучал физику и теоретическую нейробиологию, работал над миссией Mars Exploration Rover в JPL (где некоторое время жил по марсианскому времени), провел время в качестве академического резидента в Академии Хана, был приглашенным исследователем в Стэнфордской лаборатории Сурьи Гангули, а затем в течение десяти лет работал главным научным сотрудником в Google Brain и Google DeepMind.
Ранние годы и образование
Mars Exploration Rover — JPL (до PhD)
До того, как заняться академическим машинным обучением, Соль-Дикштайн работал в Лаборатории реактивного движения НАСА над миссией Mars Exploration Rover — проектом двух марсоходов-близнецов, которые высадились на Марсе в январе 2004 года (Spirit и Opportunity). Его роль требовала работы по «марсианскому времени»: поскольку марсианские сутки длятся примерно 24 часа 37 минут, руководители миссии должны были синхронизировать свои циклы сна и бодрствования с марсианским восходом и закатом, сдвигая свой земной график на 37 минут каждый день. Он описывал это как самое необычное профессиональное требование в своей карьере, и оно продолжалось три месяца.
PhD — Центр теоретической нейронауки Редвуда, Калифорнийский университет в Беркли (–2012)
Соль-Дикштайн завершил докторскую работу в Центре теоретической нейронауки Редвуда при Калифорнийском университете в Беркли — центре, специализирующемся на вычислительных и математических моделях биологических нейронных систем, — под руководством Бруно Олсхаузена. Его диссертация находилась на стыке физики, нейронауки и машинного обучения и разрабатывала вероятностные модели для распределений данных, берущие начало в статистической физике. Ключевым ранним результатом стала работа «Minimum Probability Flow Learning» (ICML 2011, с Питером Баттаглино и Майклом ДеВизе), в которой был предложен новый метод оценки параметров, позволяющий избежать вычисления неподдающихся обработке нормировочных констант или выборки из равновесных распределений за счет использования неравновесной динамики потоков — это предвосхитило термодинамические интуиции, которые позже определили структуру диффузионных моделей.
После PhD: Стэнфорд и Академия Хана
После Беркли Соль-Дикштайн был приглашенным исследователем в лаборатории теоретической нейронауки Сурьи Гангули в Стэнфорде, где работал на стыке статистической физики и машинного обучения, что впоследствии привело к созданию статьи о диффузионных моделях. Он также провел некоторое время в качестве академического резидента в некоммерческой образовательной организации Академия Хана, что отражает его интерес к применению машинного обучения в образовательных технологиях.
Карьера
Google Brain — главный научный сотрудник (примерно 2015–2023)
Соль-Дикштайн присоединился к Google Brain вскоре после публикации статьи о диффузионных моделях в 2015 году, став главным научным сотрудником и проработав около восьми лет до слияния Brain-DeepMind в 2023 году. Его работа в Google Brain охватывала несколько параллельных направлений исследований.
Диффузионные модели (2015, признание 2020–). Статья 2015 года на ICML «Deep Unsupervised Learning using Nonequilibrium Thermodynamics», написанная в соавторстве с Эриком Вайссом, Ниру Махешваранатаном и Сурьей Гангули, представила структуру диффузионных вероятностных моделей. Ключевая идея, заимствованная из неравновесной термодинамики, элегантна: прямая цепь Маркова постепенно разрушает структуру в распределении данных, шаг за шагом добавляя гауссов шум; обратная цепь Маркова, параметризованная глубокой нейронной сетью, обучается обращать этот процесс вспять, восстанавливая структуру из шума. Поскольку каждый шаг в обратном процессе представляет собой небольшую, хорошо обусловленную операцию шумоподавления, модель проста в обучении и выборке, несмотря на высокую гибкость изучаемого распределения. В статье метод был продемонстрирован на наборах данных MNIST, CIFAR-10 и других, но в течение пяти лет получал ограниченное количество цитирований и внимание сообщества. В 2020 году Джонатан Хо, Аджайн Джейн и Питер Аббиль опубликовали статью «Denoising Diffusion Probabilistic Models» (DDPM) на NeurIPS, масштабировав подход до высококачественного синтеза изображений и явно указав формулировку Соль-Дикштайна 2015 года как основополагающую предыдущую работу. Последующий взрыв в этой области — Stable Diffusion, DALL-E 2, Imagen, score-based модели, латентные диффузионные модели, Sora — напрямую восходит к статье 2015 года. К 2025 году на нее было получено более 20 000 цитирований, что делает ее одной из самых значимых статей по генеративному моделированию в истории.
Теория нейронных сетей — перепараметризация и бесконечно-широкие сети. Работая в основном с Сэмюэлом Шенхольцем, Соль-Дикштайн разработал серию статей о теоретических свойствах глубоких нейронных сетей, включая «Deep Information Propagation» (ICLR 2017), характеризующую распространение сигналов и свойства градиентного потока, которые определяют, можно ли обучить очень глубокие сети, а также серию статей, устанавливающих соответствие между бесконечно-широкими нейронными сетями и гауссовскими процессами (соответствие NNGP). Эта работа внесла вклад в формальный анализ пространства функций нейронной сети при бесконечной ширине, который впоследствии был синтезирован в структуре Neural Tangent Kernel (NTK).
Neural Tangents (2020). Соль-Дикштайн был соавтором Neural Tangents — библиотеки с открытым исходным кодом на JAX, которая позволяет точно вычислять ядро гауссовского процесса нейронной сети (NNGP) и нейронное касательное ядро (NTK) для конечных сетей и аналитически для бесконечно-широких сетей произвольной глубины и архитектуры. Библиотека стала стандартным инструментом для изучения перепараметризованных нейронных сетей с точки зрения ядер и байесовского подхода и широко использовалась в эмпирических исследованиях динамики обучения нейронных сетей.
BIG-Bench: Beyond the Imitation Game (2022). Соль-Дикштайн был одним из основных участников BIG-Bench — совместного бенчмарка для оценки возможностей и ограничений языковых моделей, в котором приняли участие 444 автора из более чем 130 учреждений. BIG-Bench собрал 204 задачи, предназначенных для исследования аспектов рассуждений, знаний о мире и понимания языка, выходящих за рамки того, что могут оценить стандартные бенчмарки, и протестировал такие модели, как GPT-3, предшественники GPT-4, PaLM и другие. Полученная статья предоставила одну из наиболее полных общедоступных характеристик возможностей передовых LLM на момент публикации и широко использовалась в последующих работах по законам масштабирования и анализу возможностей.
Обученные оптимизаторы (2022). Соль-Дикштайн был соавтором статьи «Learned Optimizers that Outperform Adam on Wall-Clock and Test Loss» (2022), в которой было продемонстрировано, что метаобученные оптимизаторы на основе нейронных сетей могут превосходить Adam как по скорости сходимости, так и по итоговому качеству модели на различных задачах. Работа расширила более ранние результаты по метаобучению алгоритмов оптимизации и решила практические препятствия, которые ранее мешали масштабному развертыванию обученных оптимизаторов.
Линейная модовая связность. В соавторстве с Джонатаном Франклом, Гинтаре Каролиной Дзюгайте, Дэниелом Роем и Майклом Карбином Соль-Дикштайн написал статью «Linear Mode Connectivity and the Lottery Ticket Hypothesis» (ICML 2020), в которой охарактеризовал геометрическую структуру ландшафтов потерь нейронных сетей и показал, что решения, найденные стохастическим градиентным спуском, линейно связаны в весовом пространстве после короткого начального периода обучения — с выводами для гипотезы лотерейного билета и стабильности модели.
Google DeepMind (2023)
После слияния Google Brain и DeepMind в 2023 году Соль-Дикштайн недолго занимал должность главного научного сотрудника объединенной организации, после чего ушел в Anthropic.
Anthropic — член технического персонала (примерно 2024–настоящее время)
Соль-Дикштайн присоединился к Anthropic в качестве члена технического персонала. Его личный веб-сайт, обновленный в январе 2024 года, подтверждает эту принадлежность. Учитывая направленность Anthropic на безопасность ИИ, интерпретируемость и разработку передовых моделей, его приход принес изобретателя диффузионных моделей и десятилетний опыт в теории нейронных сетей крупного масштаба в исследовательскую среду, ориентированную на безопасность.
Ключевые вклады
-
Диффузионные вероятностные модели (ICML 2015) — «Deep Unsupervised Learning using Nonequilibrium Thermodynamics», с Эриком Вайссом, Ниру Махешваранатаном и Сурьей Гангули. Введена структура прямого зашумления и обученного обратного шумоподавления как парадигма генеративного моделирования, опирающаяся на неравновесную термодинамику. Фундаментальная статья для всего семейства диффузионных моделей, которые сейчас лежат в основе Stable Diffusion, DALL-E 2, Imagen и Sora. Накопила более 20 000 цитирований. Широко описывается как «главный источник известности» Соль-Дикштайна — по его собственным словам.
-
Minimum Probability Flow Learning (ICML 2011) — Разработан метод оценки параметров для вероятностных моделей, который избегает вычисления статистических сумм за счет использования неравновесной динамики — первая демонстрация отличительного подхода Соль-Дикштайна по импорту концепций статистической физики в машинное обучение, который позже определил вклад в диффузионные модели.
-
Библиотека Neural Tangents (2020) — Соавторство в создании стандартной библиотеки с открытым исходным кодом для вычисления ядер NNGP и NTK для бесконечно-широких и конечных нейронных сетей на JAX. Стала эталонным инструментом для исследований бесконечно-широких нейронных сетей.
-
Deep Information Propagation (ICLR 2017) — С Сэмюэлом Шенхольцем. Охарактеризована теория среднего поля распространения сигналов в глубоких сетях, предоставившая первую обоснованную основу для анализа обучаемости как функции глубины, инициализации и архитектуры — что напрямую повлияло на последующее понимание взрыва и затухания градиентов в очень глубоких сетях.
-
BIG-Bench: Beyond the Imitation Game (2022) — Основной участник совместного бенчмарка с 444 авторами, предоставившего наиболее полную на тот момент оценку возможностей передовых языковых моделей по 204 разнообразным задачам, требующим рассуждений и знаний.
-
Обученные оптимизаторы (2022) — Соавторство в работе, демонстрирующей, что метаобученные оптимизаторы на нейронных сетях могут превосходить Adam в масштабе, продвигая практическую осуществимость обученной оптимизации.
Награды и признание
- Кандидат на лучшую статью ICML 2015 — Статья о диффузионных моделях была представлена на ICML 2015; ее ретроактивное признание как одной из самых значимых статей по машинному обучению за десятилетие отражено в более чем 20 000 цитирований по состоянию на 2025 год.
- Выдающаяся статья NeurIPS 2022 (BIG-Bench) — Статья BIG-Bench получила награду за выдающуюся работу.
- Идентификация Semantic Scholar — Стабильно входит в число наиболее цитируемых исследователей в области генеративного моделирования.
Ключевые связи
- Бруно Олсхаузен — Научный руководитель PhD в Центре теоретической нейронауки Редвуда в Калифорнийском университете в Беркли; пионер в области разреженного кодирования и вычислительной нейронауки, который сформировал подход Соль-Дикштайна к машинному обучению, основанный на физике.
- Сурья Гангули — Профессор теоретической нейронауки в Стэнфорде и соавтор; соавтор оригинальной статьи о диффузионных моделях 2015 года; Соль-Дикштайн был приглашенным исследователем в его лаборатории, и их объединяет стремление связать статистическую физику с теорией машинного обучения.
- Эрик Вайсс и Ниру Махешваранатана — Соавторы оригинальной статьи о диффузионных моделях 2015 года; оба были частью лаборатории Гангули или сети Центра Редвуда.
- Джонатан Хо — Ведущий автор DDPM (2020), которая напрямую основывалась на статье Соль-Дикштайна 2015 года и привела диффузионные модели к практической полезности в масштабе; статья Хо является связующим звеном между основополагающим вкладом Соль-Дикштайна и современной экосистемой диффузионных моделей.
- Сэмюэл Шенхольц — Коллега по Google Brain и ближайший соавтор в области теории нейронных сетей; работа по глубокому распространению информации и теории перепараметризации была продолжительным сотрудничеством.
- Джонатан Франкл, Гинтаре Каролина Дзюгайте, Дэниел Рой, Майкл Карбин — Соавторы статьи о линейной модовой связности; межведомственное сотрудничество, связавшее Google Brain с MIT, Университетом Торонто и академическими исследованиями гипотезы лотерейного билета.
Личный стиль
Интеллектуальный профиль Соль-Дикштайна поистине необычен: это исследователь, чья самая известная работа опирается на термодинамику XIX века (равенство Яржинского и неравновесную статистическую механику) для решения задачи машинного обучения XXI века, и который провел месяцы, буквально живя по марсианскому времени, прежде чем получить степень PhD по теоретической нейронауке. Его личный веб-сайт описывает его интересы как «машинное обучение, нейронаука, статистическая физика, динамические системы» — и, в отличие от многих подобных списков, этот точен. Его блог, который он описывает как пространство для «идей, которые слишком странны, незавершены или не по теме, чтобы превратить их в академическую статью», отражает предпочтение делиться наполовину сформированными, но потенциально важными идеями, а не ждать отшлифованных результатов. Его отношение к наследию диффузионных моделей характерно иронично: на его сайте сказано, что он «наиболее (печально) известен изобретением диффузионных моделей», а страница «О блоге» называет это его «главной претензией на славу», отмечая при этом, что сам блог намерен быть о вещах, не связанных ни с машинным обучением, ни с поддержанием странного режима.
Ссылки
- Личный веб-сайт: sohldickstein.com
- Блог: sohl-dickstein.github.io
- Google Scholar: scholar.google.com
- Оригинальная статья о диффузионных моделях (arXiv, март 2015): arxiv.org/abs/1503.03585
- Библиотека Neural Tangents: github.com/google/neural-tangents
- BIG-Bench: github.com/google/BIG-bench
- Learned Optimizers: arxiv.org/abs/2211.09760
- Digg профиль: digg.com/u/x/jaschasd