Investigador em ML, ex-Professor Associado na Cornell Tech (2016–2026), cofundador da COLM, e autor do Transformer Anotado, GPU-Puzzles e OpenNMT — um dos mais prolíficos criadores de ferramentas de PLN de código aberto e código educacional na área, agora trabalhando em pós-treinamento para IA de codificação na Cursor.
Perfil
| Campo | Detalhe |
|---|---|
| Nome completo | Alexander “Sasha” Rush |
| Nacionalidade | Americano |
| Função atual | Pesquisador em ML, Cursor |
| Funções anteriores | Professor Associado, Cornell Tech (2021–2026); Professor Assistente, Harvard SEAS (2016–2021); Pesquisador, Hugging Face (2019–2024) |
| Áreas de pesquisa | Pós-treinamento, Modelos de Linguagem, Geração de Texto, Inferência Eficiente, Geração Controlável, Predição Estruturada, Ferramentas Educacionais de ML |
| Orientador de doutorado | Michael Collins (MIT) |
| Site pessoal | rush-nlp.com |
| YouTube | @srush_nlp |
| X/Twitter | @srush_nlp |
| GitHub | @srush |
| Google Scholar | scholar.google.com |
Visão Geral
Sasha Rush (Alexander M. Rush) é um pesquisador americano de ML conhecido tanto por suas contribuições técnicas quanto por construir a infraestrutura educacional e de código aberto através da qual uma geração de profissionais aprendeu a trabalhar com transformadores e modelos de linguagem. De 2016 a 2026, foi membro do corpo docente de Harvard e Cornell Tech; durante essa década, ele cocriou o Transformer Anotado — provavelmente a implementação em PyTorch mais lida do artigo original do Transformer —, construiu os GPU-Puzzles e Tensor-Puzzles como currículos interativos de programação em GPU, co-liderou o OpenNMT como um dos primeiros sistemas de MT neural de código aberto com qualidade de produção, e foi pesquisador de meio período na Hugging Face, onde contribuiu para os primeiros trabalhos abertos de LLM. Ele cofundou a COLM (Conference on Language Modeling) em 2024 e atua como seu presidente. Saiu da academia em 2026 para se juntar à Cursor como pesquisador, focando em pós-treinamento de sistemas de IA para codificação. Sua linhagem acadêmica inclui doutorado pelo MIT sob orientação de Michael Collins e um pós-doutorado no Facebook AI Research sob orientação de Yann LeCun.
Formação
Ph.D., Ciência da Computação — MIT, 2014
Rush concluiu seu doutorado no MIT sob orientação de Michael Collins, um dos principais pesquisadores da área em PLN estatístico e predição estruturada. Seu trabalho de tese focou em modelos probabilísticos e predição estruturada para tarefas de PLN, incluindo parsing e tradução automática. Sua pesquisa no MIT recebeu o Prêmio de Melhor Artigo do NAACL 2012 (com Slav Petrov, por trabalho em poda de vinhas para parsing de dependência eficiente) e várias menções honrosas em importantes eventos de PLN.
Pós-Doutorando — Facebook AI Research (FAIR), Nova York, 2014–2016
Rush ingressou no Facebook AI Research sob a supervisão de Yann LeCun como pós-doutorando. Este período coincidiu com a primeira onda de aplicações de aprendizado profundo em PLN e produziu alguns de seus primeiros trabalhos mais citados, incluindo o artigo de 2015 sobre sumarização com atenção neural que ajudou a estabelecer o aprendizado sequência-a-sequência como uma ferramenta para geração de texto além da tradução.
Carreira
Harvard School of Engineering and Applied Sciences (2016–2021)
Rush ingressou na Harvard SEAS como professor assistente em 2016, fundando o grupo HarvardNLP (harvardnlp.github.io). Sua pesquisa em Harvard abrangeu geração neural de texto, atenção estruturada, visualização de redes neurais e o início da era dos transformadores. As principais contribuições desse período incluem o kit de ferramentas de tradução de código aberto OpenNMT (2017), o recurso educacional Transformer Anotado (2018) e o LSTMVis (2017), uma ferramenta de visualização para analisar estados ocultos em redes recorrentes que ganhou o Prêmio de Melhor Artigo na conferência IEEE InfoVis.
Durante seus anos em Harvard, Rush desenvolveu uma abordagem distinta para a comunicação de pesquisa — escrevendo implementações executáveis e ricamente comentadas junto com artigos técnicos — que se tornou uma marca registrada de sua produção pública.
Cornell Tech (2021–2026)
Rush mudou-se para a Cornell Tech, na cidade de Nova York, como professor associado, onde foi afiliado ao Cornell Ann S. Bowers College of Computing and Information Science e ao Cornell NLP Group. Ele recebeu o Cornell Tech Student Choice Award de excelência em ensino. Seu foco de pesquisa mudou cada vez mais para a modelagem de linguagem eficiente e generativa, incluindo trabalhos sobre pré-treinamento sem atenção (BiGS, EMNLP 2023), modelos de linguagem de difusão (NeurIPS 2024) e embeddings documentais contextuais (ICLR 2025). Ele continuou publicando ferramentas educacionais voltadas para GPU, incluindo GPU-Puzzles e Tensor-Puzzles.
Hugging Face — Pesquisador (2019–2024)
Paralelamente ao seu cargo docente, Rush trabalhou em meio período como pesquisador na Hugging Face de aproximadamente 2019 a 2024. Ele contribuiu para vários projetos iniciais da Hugging Face: foi autor do artigo original do sistema Transformers (Wolf et al., EMNLP Demos 2020), contribuiu para o projeto BigScience e o modelo multitarefa com prompt T0 (ICLR 2022) através do PromptSource, e foi coautor do Zephyr (COLM 2024) — um modelo leve ajustado por instruções produzido através de destilação direta de alinhamento de LM que se tornou amplamente utilizado como um modelo de referência aberto. Essa dupla nomeação fez dele uma das pontes mais eficazes entre a pesquisa acadêmica em PLN e o ecossistema de código aberto da Hugging Face.
COLM — Cofundador e Presidente (2024–presente)
Em 2024, Rush cofundou e lançou a Conference on Language Modeling (COLM), um evento dedicado especificamente à pesquisa de modelos de linguagem — a primeira grande conferência focada exclusivamente na área que passou a dominar o PLN. Ele atua como presidente da conferência. A COLM preencheu uma lacuna no cenário de conferências, onde o trabalho específico sobre LM estava distribuído por eventos de escopo mais amplo (NeurIPS, ICML, ICLR, ACL) e carecia de um lar dedicado. A COLM inaugural publicou o Zephyr como um de seus primeiros artigos.
Rush também atuou como Secretário e Presidente Geral do ICLR durante seu período acadêmico, desenvolvendo a infraestrutura de software que administrou as operações virtuais da conferência durante o período da COVID-19 (2020–2021).
Cursor — Pesquisador (2026–presente)
Em 2026, Rush deixou a academia para se juntar à Cursor, um editor de código e ferramenta de desenvolvimento nativa em IA. Seu site pessoal descreve seu foco atual como „pós-treinamento de sistemas de IA para codificação e tarefas relacionadas“ e melhoria do raciocínio de modelos para problemas de codificação de longo horizonte. Ele foi coautor do „Composer 2“ (arXiv 2026) com a equipe da Cursor — um artigo sobre geração de código em contexto grande. Ele observou em seu site: „De 2016 a 2026, fui Professor em Harvard e depois em Cornell.“
Principais Contribuições
-
The Annotated Transformer (workshop ACL NLP-OSS, 2018) — Uma implementação em PyTorch ricamente comentada e executável do artigo „Attention Is All You Need“ que percorre cada componente da arquitetura Transformer com código inline e visualizações. Provavelmente a implementação e o tutorial mais lidos do Transformer já escritos, e o ponto de entrada através do qual uma grande fração da comunidade de ML entendeu pela primeira vez a arquitetura em código. Atualizado e mantido no GitHub.
-
GPU-Puzzles (GitHub, 2021) — Uma coleção de 14 quebra-cabeças CUDA interativos implementados usando Numba, projetados para ensinar programação em GPU a partir dos primeiros princípios. Um dos repositórios educacionais de ML com mais estrelas no GitHub; usado em cursos em todo o mundo para ensinar programação paralela para aprendizado profundo. Um complemento para Tensor-Puzzles, que faz o mesmo para operações de tensor em Python.
-
OpenNMT (ACL Demo, 2017) — Codesenvolvido com Guillaume Klein, Yoon Kim e Jean Senellart; um dos primeiros sistemas de tradução automática neural de código aberto com qualidade de produção, lançado em PyTorch e usado tanto em pesquisa quanto em implantação. Tornou-se uma implementação de referência para modelos seq2seq e influenciou o design de frameworks de PLN subsequentes.
-
A Neural Attention Model for Abstractive Sentence Summarization (EMNLP 2015) — Com Sumit Chopra e Jason Weston; um dos primeiros artigos a aplicar atenção neural à sumarização abstrativa, demonstrando que o mecanismo de atenção codificador-decodificador poderia gerar texto de resumo novo em vez de meramente extrair spans. Ajudou a estabelecer a sumarização abstrativa neural como uma direção de pesquisa.
-
Sequence-Level Knowledge Distillation (EMNLP 2016) — Com Yoon Kim; introduziu a ideia de destilar um modelo professor sequência-a-sequência em um modelo aluno menor no nível da sequência, em vez de no nível do token, uma técnica que se tornou amplamente usada para compressão de modelos em PLN.
-
Zephyr: Direct Distillation of LM Alignment (COLM 2024) — Coautor com a equipe de pesquisa da Hugging Face; demonstrou que a destilação a partir do feedback de um modelo mais forte poderia alinhar um modelo aberto leve (7B parâmetros) ao seguimento de instruções em um nível competitivo com modelos muito maiores, usando um pipeline de treinamento mais simples que o RLHF completo. Tornou-se um modelo de referência aberto amplamente adotado para pesquisa em seguimento de instruções.
-
T0 / PromptSource — Multitask Prompted Training (ICLR 2022) — Coautor com Victor Sanh e outros do BigScience; mostrou que o pré-treinamento em uma coleção diversa de prompts escritos por humanos permitia generalização zero-shot para tarefas não vistas sem exemplos no contexto.
-
LSTMVis (IEEE InfoVis 2017) — Com Hendrik Strobelt, Sebastian Gehrmann e Hanspeter Pfister; uma ferramenta de visualização para analisar dinâmicas de estados ocultos em redes recorrentes, premiada com Melhor Artigo no InfoVis.
-
The Annotated S4 — A implementação interativa e executável de Rush do modelo Structured State Space Sequence (S4), continuando sua tradição de produzir implementações ricamente anotadas de artigos arquitetônicos importantes que servem como recursos educacionais para a comunidade.
-
Canal no YouTube (@srush_nlp) — Uma série de palestras técnicas e cursos cobrindo os internals dos modelos de linguagem, programação em GPU e sistemas de aprendizado profundo; um dos recursos de vídeo técnico mais assistidos voltados para profissionais da comunidade de ML.
-
NAACL 2012 Best Paper — „Vine Pruning for Efficient Multi-Pass Dependency Parsing“ (com Slav Petrov); entre os primeiros de vários prêmios de melhor artigo em eventos de PLN.
Prêmios e Reconhecimento
- Sloan Research Fellowship (c. 2018)
- NSF CAREER Award
- Presidential Early Career Award for Scientists and Engineers (PECASE)
- Cornell Tech Student Choice Award for Excellence in Teaching
- Prêmios de Melhor Artigo no NAACL (2012), InfoVis (2017) e eventos focados em hardware
- Secretário e Presidente Geral do ICLR — Liderança institucional de uma das principais conferências da área; desenvolveu infraestrutura de conferência virtual.
- Cofundador e Presidente da COLM (2024–presente)
Relações Chave
- Michael Collins — Orientador de doutorado no MIT; um dos pesquisadores de PLN mais influentes dos anos 2000-2010 em predição estruturada e parsing; o trabalho de Rush em decodificação ótima e parsing eficiente reflete a tradição rigorosa de PLN probabilístico de Collins.
- Yann LeCun — Supervisor de pós-doutorado no FAIR; a orientação de aprendizado profundo do trabalho subsequente de Rush em geração neural de texto foi moldada pelo ambiente do FAIR.
- Yoon Kim — Colaborador de longo prazo de Harvard; coautor de Character-Aware Neural Language Models, Sequence-Level Knowledge Distillation e Compound PCFG com Rush; uma das relações de pesquisa bilaterais mais produtivas em PLN.
- Thomas Wolf — Colaborador da Hugging Face; coautor do artigo do sistema Transformers e do Zephyr; o tempo compartilhado na Hugging Face coincidiu com os anos chave do desenvolvimento aberto de LLM.
- Albert Gu — Colaborador em pré-treinamento sem atenção (BiGS) e trabalhos relacionados a modelos de espaço de estado; a arquitetura S4 de Gu foi o assunto do tutorial Annotated S4 de Rush.
- Stuart Shieber — Colega de Harvard e colaborador em geração de texto baseada em template; também uma referência para o interesse de Rush em programação literária e pesquisa claramente documentada.
Estilo Pessoal
A persona pública de Rush é construída quase inteiramente em torno de uma única convicção: que tornar ideias técnicas complexas maximamente claras e executáveis não é apenas pedagogia, mas uma forma de contribuição de pesquisa por si só. O Transformer Anotado, GPU-Puzzles, Tensor-Puzzles, o Annotated S4 e o canal do YouTube todos incorporam uma filosofia de „programação literária“ — código e explicação intercalados para que entender o algoritmo significa ser capaz de executá-lo, não apenas ler sobre ele. Ele citou Ken Shan e outros defensores da programação literária como influências e descreveu seu interesse neste modo de comunicação como anterior à sua carreira em PLN. O perfil de seu Digg (31,6% „Informando,“ 21,7% „Ensinando,“ 12,6% „Anunciando“) e a descrição „tuíta e bloga, principalmente sobre codificação e ML“ capturam um comunicador principalmente interessado em construir entendimento compartilhado em vez de assumir posições. Sua mudança da academia para a Cursor em 2026 é consistente com uma orientação de carreira que nunca foi puramente acadêmica — o trabalho de infraestrutura de código aberto, a nomeação na Hugging Face e a fundação da COLM apontam para alguém que valoriza construir coisas funcionais e amplamente usadas em vez de acumular produção acadêmica.
Referências
- Site pessoal — rush-nlp.com
- X/Twitter — @srush_nlp
- GitHub — @srush
- YouTube — @srush_nlp
- Perfil no Digg
- Google Scholar
- Perfil na Cornell Tech
- Perfil no Simons Institute (2024–2025)
- The Annotated Transformer — nlp.seas.harvard.edu
- GPU-Puzzles — GitHub
- OpenNMT — opennmt.net
- COLM — colmweb.org
- Podcast CS224U com Chris Potts (2022)