Исследователь механистической интерпретируемости и сооснователь Anthropic — канадец-самоучка, который придумал термин «механистическая интерпретируемость», превратил блог colah.github.io в самый читаемый образовательный ресурс по машинному обучению 2010-х годов и потратил пятнадцать лет на поиск ответа на один вопрос: что именно вычисляют нейронные сети?
Общая информация
| Поле | Подробности |
|---|---|
| Гражданство | Канада |
| Текущее место работы | Anthropic (сооснователь; исследователь интерпретируемости) |
| Области исследований | Механистическая интерпретируемость, интерпретируемость нейронных сетей, визуализация признаков, схемы, суперпозиция, разреженные автоэнкодеры, безопасность ИИ |
| Образование | Школа Абеляра, Торонто (выпускник National AP Scholar, 2010); ушел из университета без диплома; стипендия Тиля (2012) |
| Блог | colah.github.io |
| Исследовательские публикации | transformer-circuits.pub |
| X / Twitter | @ch402 |
| GitHub | @colah |
| Google Scholar | scholar.google.com |
Обзор
Крис Ола — канадский исследователь машинного обучения и сооснователь Anthropic, посвятивший всю свою карьеру одному вопросу: что на самом деле происходит внутри нейронных сетей? Он придумал термин «механистическая интерпретируемость» в 2020 году, возглавил команду OpenAI, опубликовавшую серию статей Circuits на Distill, и с тех пор руководит исследованиями интерпретируемости в Anthropic, в результате которых появились работы «Toy Models of Superposition», «Towards Monosemanticity», «Scaling Monosemanticity» и «Circuit Tracing» — совокупность трудов, определяющая современный передовой край этой области. У него нет формального академического образования: он ушел из университета в 18 лет, чтобы заниматься независимыми исследованиями при поддержке стипендии Тиля, а его технический блог (colah.github.io) стал одним из самых читаемых ресурсов по обучению машинному обучению в 2010-х годах, прежде чем он переключился на публикацию исследований. Он стал сооснователем Distill (2017) — научного журнала, посвященного выдающейся коммуникации в ML, — а позже соосновал Anthropic (2021) вместе с Дарио Амодеем, Ильей Суцкевером и другими, ушедшими из OpenAI. Журнал Time включил его в список 100 самых влиятельных людей в сфере ИИ в 2024 году.
Ранние годы и образование
Ола вырос в Канаде и окончил школу Абеляра в Торонто, получив звание National AP Scholar в 2010 году. Он поступил в университет, но ушел в 18 лет, не получив диплом, увлекшись самостоятельными исследованиями в математике и программировании. Примерно в 2012 году он получил стипендию Тиля — грант в размере 100 000 долларов от фонда Питера Тиля, предназначенный для поддержки одаренных молодых людей, которые хотят заниматься исследованиями или предпринимательством вместо традиционного университетского образования, — что обеспечило финансовую поддержку его ранним самостоятельным работам.
В этот период Ола вел ранний блог (christopherolah.wordpress.com / colah.ca), посвященный математическим темам, включая топологию, математический анализ и компьютерное зрение. Стиль письма, который он выработал — ясный, с большим количеством диаграмм, построенный от первого принципа, — заложил привычки, которые впоследствии сделали его более поздний блог об ML одним из самых влиятельных учебных ресурсов в этой области.
Карьера
Независимые исследования и colah.github.io (2012–2014)
Еще до прихода в какую-либо организацию Ола самостоятельно, путем чтения, программирования и написания текстов, глубоко разобрался в нейронных сетях. Его блог colah.github.io стал местом, где можно было найти доступные объяснения тем, которые тогда считались непроницаемыми: сверточные сети, рекуррентные сети, механизм внимания, векторные представления слов, обратное распространение ошибки. Такие посты, как «Understanding LSTM Networks» (2015) и «Deep Learning, NLP, and Representations» (2014), набрали миллионы просмотров и стали стандартными ссылками в университетских курсах по всему миру, вписав его имя в процесс обучения целого поколения специалистов по машинному обучению. Он описывал свою личную миссию как желание «ясно понимать вещи и хорошо их объяснять» — эта фраза фигурирует в его профиле на GitHub и отражает всю его карьеру.
Google Brain (примерно 2014–2019)
Ола присоединился к Google Brain в качестве исследователя, где в основном работал над пониманием того, что именно изучают нейронные сети — в то время это было нишевым и несколько недооцененным направлением исследований. Его самым публично заметным вкладом в этот период стало соавторство в DeepDream (2015, совместно с Александром Мордвинцевым и Майком Тыкой) — технике, усиливающей паттерны, которые нейронная сеть научилась распознавать, путем оптимизации входных изображений для достижения высокой активации целевых нейронов. Получившиеся психоделические визуализации стали вирусными далеко за пределами сообщества ML и наглядно продемонстрировали широкой аудитории, что нейронные сети строят богатые внутренние представления о мире, а не просто выполняют статистический поиск шаблонов на поверхности.
Более технически значимой была его работа по визуализации признаков — систематическим методам понимания того, на что реагируют отдельные нейроны и каналы в сети, — которую он разработал в сотрудничестве с Шаном Картером и другими и опубликовал через основанный им журнал Distill. Статья «Feature Visualization» (2017) и статья «Building Blocks of Interpretability» (2018) заложили словарь и методологию для структурированного анализа внутреннего устройства сетей, которые непосредственно предшествовали работе Circuits.
Distill (сооснован в 2017 году): Вместе с Шаном Картером и другими Ола стал сооснователем Distill — научного журнала, основанного на убеждении, что представление и ясность в научной коммуникации — это не украшение, а суть. Статьи Distill сочетали интерактивные визуализации, анимированные диаграммы и понятный текст для объяснения концепций ML; журнал привлекал заметные вклады по таким темам, как механизм внимания, GAN и визуализация признаков. Хотя Distill приостановил выпуск новых публикаций в 2021 году из-за нагрузки по поддержке, его эстетика повлияла на целое поколение исследователей ML и установила стандарт того, какой может быть тщательная научная коммуникация в этой области. Поток публикаций transformer-circuits.pub, который Ола позже запустил в Anthropic, продолжает ту же этику.
OpenAI — Clarity Team (примерно 2019–2021)
Ола присоединился к OpenAI, чтобы возглавить ее команду Clarity, занимающуюся интерпретируемостью. Самым значительным результатом этого периода стала серия Circuits — последовательность статей, опубликованных на Distill начиная с 2020 года, в которых изучалась модель компьютерного зрения InceptionV1 на уровне отдельных нейронов и связей между ними. Первая статья, «Zoom In: An Introduction to Circuits» (2020, в соавторстве с Ником Каммаратой и другими), продемонстрировала, что отдельные нейроны соответствуют узнаваемым концепциям (детекторы кривых, детекторы текстур и даже «детектор висячих ушей»), а связи между нейронами образуют осмысленные алгоритмы — предполагая, что нейронные сети в принципе можно декомпозировать на интерпретируемые компоненты. Статья ввела термин «механистическая интерпретируемость» и предложила три свойства нейронных сетей — признаки, схемы и универсальность — как организующие принципы для этой области.
Activation Atlases (2019): В соавторстве с Шаном Картером из Google и OpenAI, Activation Atlases предоставили глобальную карту пространства признаков нейронной сети, агрегируя миллионы векторов активации и визуализируя их структуру, что позволило получить «вид с высоты 10 000 футов» на то, что выучила сеть, вместо понейронного обследования.
Anthropic — сооснователь и руководитель направления интерпретируемости (2021–настоящее время)
Ола стал сооснователем Anthropic в 2021 году вместе с Дарио Амодеем, Даниэлой Амодей, Томом Брауном, Крисом Джонсом, Сэмом Маккендлишем, Джеком Кларком и Джаредом Капланом — группой, ушедшей из OpenAI главным образом из-за опасений по поводу темпов работы над безопасностью относительно развития возможностей. В Anthropic интерпретируемость является одним из ключевых исследовательских приоритетов компании, и Ола руководит командой интерпретируемости, которая произвела самые влиятельные работы 2020-х годов в этой области:
«Toy Models of Superposition» (2022): В этой статье исследовалось, почему нейроны в нейронных сетях кажутся «полисемантичными» — реагирующими на несколько не связанных между собой признаков, — и была разработана теоретическая и эмпирическая основа, центрированная на «суперпозиции»: феномене, при котором нейронная сеть с $n$ нейронами может представлять более $n$ признаков, упаковывая их в перекрывающиеся направления в пространстве активации. Статья заложила математическую основу для понимания того, почему механистическая интерпретируемость трудна (признаки не приписаны четко к нейронам) и почему разреженные методы могут помочь их разложить.
«Towards Monosemanticity: Decomposing Language Models with Dictionary Learning» (2023): Применила разреженные автоэнкодеры (SAE) к нейронам MLP трансформера для извлечения большого словаря интерпретируемых признаков — решая проблему суперпозиции путем поиска пространства более высокой размерности, в котором отдельные направления соответствуют узнаваемым человеком концепциям. Эта работа сместила исследовательскую программу механистической интерпретируемости в сторону словарного обучения как основного инструмента декомпозиции признаков.
«Scaling Monosemanticity» (2024): Масштабировала подход разреженных автоэнкодеров для Claude Sonnet, обнаружив миллионы интерпретируемых признаков в языковой модели производственного масштаба — включая признаки, соответствующие персонажам, концепциям и удивительно человекообразным абстракциям, в том числе признаки, связанные с эмоциональными состояниями и интроспективными концепциями.
Circuit Tracing и Attribution Graphs (2025): Представила кросс-слойные транс кодеры (CLT) как новую форму разреженных автоэнкодеров, которая заменяет слои MLP интерпретируемыми компонентами, позволяя строить «графы атрибуции» — причинно-следственные карты того, какие признаки повлияли на какие выходные данные при конкретном прямом проходе модели. Этот подход был применен к Claude 3.5 Haiku в производственной среде, а кодовая база была опубликована в открытом доступе, что сделало инфраструктуру трассировки схем доступной для более широкого исследовательского сообщества.
Transformer Circuits Thread (transformer-circuits.pub): Ола организовал результаты исследовательской работы Anthropic по интерпретируемости в этот публичный поток публикаций, который фактически стал основным местом публикаций в этой области, в духе Distill.
Ключевые вклады
-
Ввел термин «механистическая интерпретируемость» — И сам термин, и названная им исследовательская программа берут начало в статье Олы Circuits 2020 года; область, выросшая вокруг него, теперь охватывает десятки исследовательских групп и сотни исследователей по всему миру.
-
«Zoom In: An Introduction to Circuits» (2020) — Основополагающая статья современной механистической интерпретируемости; показала, что отдельные нейроны и их связи в модели зрения могут быть декомпозированы в интерпретируемые алгоритмы; представила признаки, схемы и универсальность как организующие принципы.
-
«Toy Models of Superposition» (2022) — Предоставила теоретическую основу для понимания полисемантичности и гипотезы суперпозиции; перенаправила исследования интерпретируемости в сторону методов разреженного разложения.
-
«Towards Monosemanticity» (2023) и «Scaling Monosemanticity» (2024) — Продемонстрировали, что разреженные автоэнкодеры могут разлагать языковые модели производственного масштаба на миллионы интерпретируемых признаков; самые цитируемые статьи по механистической интерпретируемости в эти годы.
-
Circuit Tracing / Attribution Graphs (2025) — Представили единую структуру для трассировки причинно-следственных путей через вычисления модели; выпустили инструментарий в открытый доступ; впервые применили к Claude в производственной среде.
-
DeepDream (2015) — Соавтор техники, которая сделала внутренние представления нейронных сетей публично видимыми и понятными; культурная и научная веха, изменившая то, как широкая публика понимает, что изучают нейронные сети.
-
Блог colah.github.io — Посты, включая «Understanding LSTM Networks», «Calculus on Computational Graphs», «Neural Networks, Types, and Functional Programming» и «Visual Information Theory», стали стандартными образовательными источниками; блог прочитали миллионы читателей и обучили целое поколение специалистов по ML.
-
Distill (сооснован в 2017 году) — Сооснователь научного журнала по ML, ориентированного на выдающуюся коммуникацию, установившего стандарт для интерактивных, управляемых диаграммами статей по ML, который повлиял на то, как область публикует и объясняет себя.
-
Визуализация признаков (2017, с Шаном Картером) — Систематическая методология понимания того, для чего оптимизируются отдельные нейроны; основополагающая для всех последующих работ по внутреннему устройству нейронных сетей.
Награды и признание
- TIME100 AI — Самые влиятельные люди в сфере ИИ (2024) — Отмечен как пионер механистической интерпретируемости.
- Стипендия Тиля (2012) — Грант в размере 100 000 долларов, отмечающий выдающихся молодых исследователей и предпринимателей.
- National AP Scholar (2010) — Академическое отличие при окончании школы Абеляра.
Ключевые связи
- Дарио Амодей — Генеральный директор и сооснователь Anthropic; интерпретируемость является явным стратегическим приоритетом в Anthropic отчасти из-за взгляда самого Дарио на нее как на «одну из лучших ставок для ответственного развития ИИ»; общий акцент Олы и Амодея на важности понимания систем ИИ перед их развертыванием определяет культуру безопасности Anthropic.
- Шан Картер — Долгосрочный исследовательский сотрудник; соавтор работ по визуализации признаков, Building Blocks of Interpretability и Activation Atlases; сооснователь Distill вместе с Олой; сочетание теоретического драйва Олы с дизайнерским и коммуникационным чутьем Картера определило эстетику Distill.
- Ник Каммарата — Ключевой сотрудник по первоначальной серии Circuits в OpenAI; соавтор «Zoom In».
- Том Браун — Сооснователь Anthropic; коллега по OpenAI; главный автор GPT-3, привнесший экспертизу в языковое моделирование, которая дополняет направленность Олы на интерпретируемость.
- Андрей Карпатый — Один из самых известных последователей Олы; оба разделяют приверженность построению публичного понимания того, как работают нейронные сети, но разными способами (Карпатый через курсы и код, Ола через визуальные эссе и теорию).
Личный стиль
Интеллектуальную идентичность Олы можно выразить просто, потому что он сам повторял это неоднократно: «Я хочу ясно понимать вещи и хорошо их объяснять». Эта двойная приверженность — подлинному пониманию и подлинной коммуникации — не риторическая; она предсказывает как форму, так и содержание его работы. Его посты в блоге отличаются тем, что строятся от первого принципа, используют тщательно продуманные диаграммы вместо уравнений, где это возможно, и настаивают на том, что понимание означает умение построить объяснение, которое заставляет вещь казаться очевидной задним числом. Его исследовательские статьи в Anthropic имеют ту же эстетику: поток transformer-circuits больше похож на терпеливое, накопительное научное повествование, чем на последовательность вкладов в конференционные статьи.
Его подход к безопасности ИИ также отличается в этой области: вместо того чтобы начинать с теории согласования или управления, он начинает с эмпирического вопроса о том, что на самом деле происходит внутри нейронных сетей, — рассматривая интерпретируемость как предварительное условие для всего остального. Он описывал чувство неуверенности по поводу многих спорных вопросов в безопасности ИИ, но уверен, что «каким бы ни оказался ответ, понимание того, что делают нейронные сети, будет иметь значение». Его профиль в стиле Digg (37% механистической интерпретируемости, доминируют «Информирование» и «Обучение») точно отражает коммуникатора, чье публичное присутствие носит в основном педагогический характер — меньше озабочен дебатами, чем построением общего понимания действительно сложной эмпирической проблемы.
Ссылки
- Wikipedia — Chris Olah
- Personal blog — colah.github.io
- About page — colah.github.io/about
- Transformer Circuits Thread — transformer-circuits.pub
- X / Twitter — @ch402
- GitHub — @colah
- Digg profile
- Google Scholar
- TIME100 AI 2024 — Chris Olah
- Wired — «AI Is a Black Box. Anthropic Figured Out a Way to Look Inside» (2024)
- Wired — «Why AI Breaks Bad» (2025)
- 80,000 Hours — Chris Olah interview
- Distill — distill.pub