Тим Детмерс

Немецкий исследователь и доцент Университета Карнеги — Меллона, чьи алгоритмы квантизации — LLM.int8(), QLoRA и библиотека bitsandbytes — устранили аппаратные ограничения, которые ранее не позволяли заниматься исследованиями больших языковых моделей учреждениям, не имеющим кластеров GPU масштаба суперкомпьютеров.


Краткая информация

Гражданство Немецкое
Текущее(ие) место(а) работы Университет Карнеги — Меллона (доцент, факультеты машинного обучения и компьютерных наук); Институт искусственного интеллекта Аллена (научный сотрудник)
Области исследований Квантизация моделей, параметро-эффективная тонкая настройка, распределённое обучение, открытые агентные системы, доступность фундаментальных моделей
Научный руководитель докторской диссертации Люк Цетлемойер
Тема докторской диссертации Доступные фундаментальные модели: системы, алгоритмы и научные основы (Вашингтонский университет, 2024)
Веб-сайт timdettmers.com
X / Twitter @Tim_Dettmers
GitHub timdettmers
Google Scholar Тим Деттмерс

Обзор

Тим Деттмерс — немецкий научный сотрудник и доцент на факультетах машинного обучения и компьютерных наук Университета Карнеги — Меллона, также занимающий должность научного сотрудника в Институте искусственного интеллекта Аллена (Ai2). Он известен как создатель и сопровождающий библиотеки bitsandbytes — решения с открытым исходным кодом для эффективного по памяти глубокого обучения, которое устанавливается 2,2 миллиона раз в месяц, а также как ведущий автор работ LLM.int8() и QLoRA — двух алгоритмов, которые в совокупности впервые позволили запускать и дообучать большие языковые модели на оборудовании потребительского класса. Его докторская диссертация в Вашингтонском университете, завершённая в 2024 году под руководством Люка Цетлемойера, стала той исследовательской средой, в которой сформировалась программа по квантизации. Его центральный тезис — что вычислительно эффективные методы ускорят и демократизируют прогресс в глубоком обучении — реализован на трёх уровнях: новые алгоритмы (квантизация, параметро-эффективная тонкая настройка), практическое программное обеспечение (bitsandbytes) и публичное образование (блог и руководства по оборудованию GPU, которые читают сотни тысяч практикующих специалистов). Он удостоен наград за статьи на конференциях ICLR и NeurIPS, премии Google Open Source Award, награды Фонда PyTorch, а также стипендии AI2050 Early Career Fellowship. В настоящее время его исследования сосредоточены на открытых агентных системах, конкурентоспособных с моделями с закрытым весом.


Ранние годы и образование

Деттмерс вырос в Германии и начал заниматься ранними исследованиями в области глубокого обучения в европейских институтах ИИ до прибытия в Соединённые Штаты. В начале 2010-х годов он начал вести на своём блоге timdettmers.com практические руководства по оборудованию GPU для глубокого обучения — это занятие сделало его одним из самых авторитетных технических коммуникаторов в сообществе машинного обучения ещё до официального начала его академической карьеры. Он получил стипендию Jeff Dean – Heidi Hopper Endowed Regental Fellowship в Вашингтонском университете в 2018–2019 годах и стипендию Google Scholarship в 2016–2017 годах, что свидетельствует о раннем внешнем признании в годы его докторантуры. В 2024 году он получил степень доктора философии в Школе компьютерных наук и инженерии имени Пола Г. Аллена Вашингтонского университета под руководством Люка Цетлемойера.


Карьера

Вашингтонский университет — докторские исследования (приблизительно 2016–2024)

Докторская работа Деттмерса имела чёткую объединяющую задачу: устранение вычислительных барьеров, которые мешали академическим исследователям и учёным из других областей, не имеющим больших бюджетов на GPU, изучать, адаптировать или обучать большие языковые модели.

8-битные оптимизаторы (ICLR 2022, устный доклад). Его первый крупный результат — работа «8-битные оптимизаторы с поблочной квантизацией» (совместно с Майком Льюисом, Сэмом Шлейфером и Люком Цетлемойером), которая показала, что оптимизаторы времени обучения, такие как Adam, могут быть квантизированы до 8-битной точности с использованием схемы поблочной квантизации, что сокращает их потребление памяти на 75% без ухудшения качества модели. Статья была представлена в виде устного доклада на ICLR 2022.

LLM.int8() (NeurIPS 2022). В работе «LLM.int8(): 8-битное умножение матриц для трансформеров в масштабе» (совместно с Майком Льюисом, Юнесом Белькадой и Люком Цетлемойером) было исследовано, почему наивная 8-битная квантизация больших языковых моделей даёт сбой в масштабе, и обнаружена причина: небольшая часть скрытых размерностей — так называемые выбросы-признаки — появляются в моделях размером примерно от 6,7 миллиарда параметров и несут непропорционально большую полезную нагрузку в активациях. Стандартная 8-битная проекция уничтожает эти признаки. LLM.int8() решает эту проблему, обнаруживая размерности-выбросы и сохраняя их в 16-битном формате, в то время как остальная часть квантизируется до 8 бит. Результатом стал первый метод инференсной квантизации, который соответствовал полной точности во всех масштабах вплоть до 175 миллиардов параметров, был непосредственно интегрирован в библиотеки Hugging Face Transformers и bitsandbytes и впервые позволил запускать модели с миллиардами параметров на потребительских GPU.

Масштабирующие законы для k-битного инференса (2022). В сопутствующем исследовании была охарактеризована взаимосвязь между оптимальной битовой шириной квантизации, размером модели и аппаратными ограничениями, что привело к созданию масштабирующих законов для k-битного инференса, которые впоследствии повлияли на проектирование аппаратного обеспечения: в одном из эссе 2026 года Деттмерс отметил, что результаты масштабирующих законов для k-битного инференса в конечном итоге были реализованы на аппаратном уровне в GPU NVIDIA Blackwell.

QLoRA (NeurIPS 2023). Работа «QLoRA: Эффективная тонкая настройка квантизированных LLM» (совместно с Артидоро Паньони, Ари Хольцманом и Люком Цетлемойером) объединила квантизацию с низкоранговой адаптацией (LoRA) новым способом: базовая модель хранится в новом 4-битном формате NormalFloat (NF4) — теоретико-информационно оптимальном для нормально распределённых весов — и замораживается; обучается только небольшой набор дополнительных низкоранговых адаптерных параметров. QLoRA позволила выполнить тонкую настройку модели LLaMA с 65 миллиардами параметров на одном потребительском GPU (NVIDIA RTX 3090), что ранее требовало кластеров A100. Сопутствующее семейство моделей Guanaco — выпущенное как первые общедоступные модели с тонкой настройкой на основе RLHF, обученные с помощью QLoRA, — достигло производительности, близкой к GPT-3.5 на публичных бенчмарках, при оценке на одном GPU. QLoRA стала доминирующим подходом для доступной тонкой настройки в сообществе LLM с открытым исходным кодом и была отмечена в награде PyTorch Foundation Award и Google Open Source Award 2023 года.

SWARM Parallelism и Petals (ICML 2023, NAACL 2023). Деттмерс выступил соавтором двух статей, решающих проблему обучения и инференса с распределённой точки зрения, а не с точки зрения сжатия. SWARM Parallelism (ICML 2023) продемонстрировал совместное обучение больших моделей на разнородных устройствах через стандартную интернет-инфраструктуру, достигнув примерно 80% эффективности специализированных суперкомпьютерных аппаратных средств. Petals (NAACL 2023) развил этот подход для инференса, позволив распределённый совместный инференс больших моделей (включая BLOOM-176B) на добровольных машинах, соединённых через интернет, — доказательство концепции полностью децентрализованного развёртывания больших моделей.

Институт искусственного интеллекта Аллена — научный сотрудник (2024 – настоящее время)

После получения докторской степени Деттмерс присоединился к Ai2 в качестве научного сотрудника, одновременно начав свою преподавательскую деятельность в CMU. В Ai2 он продолжил исследования квантизации и перешёл в область агентных систем. Его текущие исследования сосредоточены на открытых кодовых агентах, конкурентоспособных с системами с закрытым весом, локальных смесях экспертов и иерархических архитектурах LLM — инфраструктуре для автоматизации научных исследований на основе агентов на потребительском оборудовании.

Университет Карнеги — Меллона — доцент (2025 – настоящее время)

Деттмерс присоединился к факультету машинного обучения и факультету компьютерных наук CMU в качестве доцента начиная с осени 2025 года. Его группа в CMU продолжает работу над доступностью моделей, включая текущих аспирантов Ыльрана Чо и Чанг Нгуен. В своей научной программе он связывает вычислительную эффективность с убеждением, что разнообразие исследователей, способных экспериментировать с ИИ, напрямую определяет качество и направление прогресса в этой области.


Ключевые вклады

  • bitsandbytes — Библиотека CUDA с открытым исходным кодом, предоставляющая 8-битное умножение матриц, поблочную квантизацию, 8-битные оптимизаторы (Adam, AdamW, LARS, LAMB, Lion) и 4-битные примитивы квантизации для PyTorch. При 2,2 миллиона установок в месяц и интеграции в Hugging Face Transformers она стала де-факто стандартом для эффективного по памяти инференса и тонкой настройки. Удостоена премий Google Open Source Award и PyTorch Foundation Award (2023).

  • LLM.int8(): 8-битное умножение матриц для трансформеров в масштабе (NeurIPS 2022) — Обнаружено, что «выбросы-признаки» — размерности активаций с высокими значениями — появляются в моделях размером более ~6,7 миллиарда параметров и препятствуют наивной 8-битной квантизации. Предложено смешанное разложение, сохраняющее каналы-выбросы в 16-битном формате, что позволяет выполнять 8-битный инференс с полной точностью для моделей вплоть до 175 миллиардов параметров. Первый практически применимый метод квантизации LLM для потребительского оборудования.

  • QLoRA: Эффективная тонкая настройка квантизированных LLM (NeurIPS 2023) — Представлен формат NF4, теоретико-информационно оптимальный 4-битный формат с плавающей точкой для нормально распределённых весов модели, в сочетании с адаптерами LoRA, обучаемыми в 16-битном формате. Позволил выполнять тонкую настройку моделей с 65 миллиардами параметров на одном потребительском GPU. Выпущена модель Guanaco, первая широко загружаемая модель с тонкой настройкой RLHF, созданная с помощью QLoRA, достигшая производительности, близкой к ChatGPT на бенчмарках, при минимальных вычислительных затратах. Одна из наиболее влиятельных статей в экосистеме LLM с открытым исходным кодом в 2023 году.

  • 8-битные оптимизаторы с поблочной квантизацией (ICLR 2022, устный доклад) — Продемонстрировано, что состояния оптимизаторов времени обучения (Adam, AdamW) могут быть безопасно квантизированы до 8 бит с использованием поблочной схемы, что сокращает память оптимизатора на 75% без потерь. Позволило использовать большие размеры батчей и большие модели на фиксированном оборудовании.

  • Масштабирующие законы для k-битного инференса (2022) — Охарактеризована взаимосвязь между размером модели, оборудованием и оптимальной битовой шириной инференсной квантизации, что привело к созданию масштабирующих законов, предсказывающих требования к проектированию аппаратного обеспечения в масштабе. Результаты, по словам Деттмерса, повлияли на дизайн GPU NVIDIA Blackwell.

  • SWARM Parallelism (ICML 2023) — В соавторстве разработан протокол для совместного обучения больших моделей на разнородных и географически распределённых устройствах через потребительскую интернет-инфраструктуру, достигнувший ~80% эффективности суперкомпьютера.

  • Petals (NAACL 2023) — В соавторстве создана система для распределённого совместного инференса очень больших языковых моделей (BLOOM-176B) на добровольных машинах, соединённых через интернет, расширяющая открытый доступ к инференсу передовых моделей.

  • Блог timdettmers.com — Регулярно обновляемый блог, который является одним из самых читаемых практических руководств по оборудованию GPU в сообществе глубокого обучения («Какой GPU выбрать для глубокого обучения»), с публикациями по руководствам по оборудованию, поступлениям в докторантуру и методологии исследований, которые читает глобальная аудитория практикующих специалистов.


Награды и признание

  • Google ML and Systems Junior Faculty Award (2025) — Присуждена выдающимся молодым преподавателям на стыке машинного обучения и системных исследований.
  • Стипендиат программы AI2050 Early Career Fellow (2024) — Отобран программой AI2050 фонда Schmidt Sciences за исследования, направленные на то, чтобы сделать фундаментальные модели доступными для учёных, не являющихся специалистами в области ИИ, в экспертных областях.
  • Премия Madrona Prize (2023) — Сиэтлская награда за выдающиеся докторские исследования в области ИИ.
  • Премия Google Open Source Award (2023) — За библиотеку bitsandbytes.
  • Награда Фонда PyTorch (2023) — За вклад в экосистему PyTorch через bitsandbytes и QLoRA.
  • Премия Martin & Beate Block Award (2023) — За выдающиеся диссертационные исследования.
  • Награда лучшему рецензенту NeurIPS (2021) — Признан одним из лучших рецензентов на NeurIPS 2021.
  • Стипендия Jeff Dean – Heidi Hopper Endowed Regental Fellowship, UW (2018–2019) — Именная стипендия для выдающихся аспирантов UW в области машинного обучения.
  • Стипендия Google Scholarship (2016–2017) — Присуждена в начале докторских исследований.
  • Устный доклад на ICLR (2022) — За статью о 8-битных оптимизаторах.
  • Выделенный доклад на NeurIPS (2022) — За работу LLM.int8().

Ключевые связи

  • Люк Цетлемойер — Научный руководитель докторской диссертации в Вашингтонском университете; исследователь NLP и LLM в UW и Meta; академическое партнёрство, которое привело к созданию LLM.int8(), QLoRA, 8-битных оптимизаторов, SWARM и Petals.
  • Майк Льюис — Исследователь Meta AI и соавтор как LLM.int8(), так и 8-битных оптимизаторов; сыграл важную роль в интеграции работы Деттмерса по квантизации в крупномасштабные промышленные языковые модели.
  • Артидоро Паньони — Соавтор QLoRA; аспирант UW, внёсший вклад в эксперименты по тонкой настройке Guanaco.
  • Ари Хольцман — Соавтор QLoRA; исследователь NLP в UW, известный исследованиями nucleus sampling и качества генерации.
  • Натан Ламберт — Коллега по Ai2 и ведущий подкаста (Interconnects); близкий интеллектуальный соавтор в сообществе LLM с открытым исходным кодом в Ai2.
  • Юнес Белькада — Инженер Hugging Face и соавтор LLM.int8(); интеграция bitsandbytes-Transformers, сделавшая LLM.int8() доступным миллионам практиков, была результатом их совместной работы.

Личный стиль

Исследования Деттмерса сочетают инстинкты системного инженера — глубокое понимание реальных ограничений памяти, задержки и стоимости оборудования — с rigor исследователя алгоритмов. Его центральное убеждение, открыто высказанное на его веб-сайте, заключается в том, что вычислительная эффективность является не второстепенной задачей по отношению к исследованиям возможностей, а необходимым условием для них: разнообразие исследователей, способных экспериментировать с ИИ, определяет разнообразие идей, влияющих на его развитие. Это проявляется на практике в необычном сочетании публикуемых алгоритмических результатов (QLoRA, LLM.int8()) и производственного программного обеспечения с открытым исходным кодом (bitsandbytes), при этом оба получают академическое и промышленное признание одновременно. Его блог, существующий более десяти лет, уделяет решениям о покупке оборудования и стратегии поступления в докторантуру такое же тщательное эмпирическое внимание, как и теории квантизации, — последовательный сигнал того, что доступность и коммуникация не являются второстепенными задачами в его исследовательской программе. Он необычайно откровенен в публичных высказываниях, включая эссе 2025 года, в котором он выступает против возникновения AGI в ближайшем будущем, и пост 2026 года, в котором он подробно описывает неудачи и итерации при создании своего первого кодового агента (SERA).


Ссылки