Sasha Rush

Investigador de ML, ex profesor asociado en Cornell Tech (2016–2026), cofundador de COLM y autor de The Annotated Transformer, GPU-Puzzles y OpenNMT — uno de los productores más prolíficos de herramientas educativas y código de código abierto en el campo del PLN, ahora trabajando en post-entrenamiento para IA de codificación en Cursor.


Perfil

Campo Detalle
Nombre completo Alexander “Sasha” Rush
Nacionalidad Estadounidense
Rol actual Investigador de ML, Cursor
Roles anteriores Profesor asociado, Cornell Tech (2021–2026); Profesor asistente, Harvard SEAS (2016–2021); Investigador, Hugging Face (2019–2024)
Áreas de investigación Post-entrenamiento, modelos de lenguaje, generación de texto, inferencia eficiente, generación controlable, predicción estructurada, herramientas educativas de ML
Asesor de doctorado Michael Collins (MIT)
Sitio web personal rush-nlp.com
YouTube @srush_nlp
X / Twitter @srush_nlp
GitHub @srush
Google Scholar scholar.google.com

Resumen

Sasha Rush (Alexander M. Rush) es un investigador estadounidense de ML conocido tanto por sus contribuciones técnicas de investigación como por construir la infraestructura educativa y de código abierto a través de la cual una generación de profesionales aprendió a trabajar con transformers y modelos de lenguaje. De 2016 a 2026 fue miembro del profesorado en Harvard y Cornell Tech; durante esa década cocreó The Annotated Transformer — probablemente la implementación en PyTorch más leída del artículo original del Transformer —, creó GPU-Puzzles y Tensor-Puzzles como currículos interactivos de programación en GPU, codirigió OpenNMT como uno de los primeros sistemas de MT neuronal de código abierto con calidad de producción, y fue investigador a tiempo parcial en Hugging Face, donde contribuyó a los primeros trabajos de LLM de código abierto. Fue cofundador de COLM (Conference on Language Modeling) en 2024 y es su presidente. Dejó la academia en 2026 para unirse a Cursor como investigador, centrándose en el post-entrenamiento de sistemas de IA para codificación. Su linaje académico incluye un doctorado del MIT bajo Michael Collins y un posdoctorado en Facebook AI Research bajo Yann LeCun.


Educación

Ph.D., Ciencias de la Computación — MIT, 2014
Rush completó su doctorado en el MIT bajo la dirección de Michael Collins, uno de los principales investigadores del campo en PLN estadístico y predicción estructurada. El trabajo de su tesis se centró en modelos probabilísticos y predicción estructurada para tareas de PLN, incluidos el análisis sintáctico y la traducción automática. Su investigación en el MIT recibió el Premio al Mejor Artículo de NAACL 2012 (con Slav Petrov, por su trabajo en poda de enredaderas para el análisis de dependencias eficiente) y varias menciones honoríficas en importantes congresos de PLN.

Becario posdoctoral — Facebook AI Research (FAIR), Nueva York, 2014–2016
Rush se unió a Facebook AI Research bajo Yann LeCun como becario posdoctoral. Este período coincidió con la primera ola de aplicaciones de aprendizaje profundo al PLN y produjo algunos de sus primeros trabajos más citados, incluido el artículo de 2015 sobre atención neuronal para resumen, que ayudó a establecer el aprendizaje secuencia a secuencia como una herramienta para la generación de texto más allá de la traducción.


Carrera

Harvard School of Engineering and Applied Sciences (2016–2021)

Rush se unió a Harvard SEAS como profesor asistente en 2016, fundando el grupo HarvardNLP (harvardnlp.github.io). Su investigación en Harvard abarcó la generación de texto neuronal, la atención estructurada, la visualización de redes neuronales y la primera era de los transformers. Los resultados clave de este período incluyen el kit de herramientas de traducción automática de código abierto OpenNMT (2017), el recurso educativo The Annotated Transformer (2018) y LSTMVis (2017), una herramienta de visualización para analizar estados ocultos en redes recurrentes que ganó un Mejor Artículo en la conferencia IEEE InfoVis.

Durante sus años en Harvard, Rush desarrolló un enfoque distintivo para la comunicación de la investigación —escribir implementaciones ejecutables con muchos comentarios junto con artículos técnicos— que se convirtió en un sello distintivo de su producción pública.

Cornell Tech (2021–2026)

Rush se mudó a Cornell Tech en la ciudad de Nueva York como profesor asociado, donde estuvo afiliado a la Cornell Ann S. Bowers College of Computing and Information Science y al Cornell NLP Group. Recibió el Premio de Elección Estudiantil de Cornell Tech por excelencia en la enseñanza. Su enfoque de investigación se desplazó cada vez más hacia el modelado de lenguaje eficiente y generativo, incluido el trabajo en preentrenamiento sin atención (BiGS, EMNLP 2023), modelos de lenguaje de difusión (NeurIPS 2024) e incrustaciones de documentos contextuales (ICLR 2025). Continuó publicando herramientas educativas orientadas a GPU, incluidos GPU-Puzzles y Tensor-Puzzles.

Hugging Face — Investigador (2019–2024)

Además de su rol como profesor, Rush trabajó a tiempo parcial como investigador en Hugging Face desde aproximadamente 2019 hasta 2024. Contribuyó a múltiples proyectos tempranos de Hugging Face: fue autor en el artículo original del sistema Transformers (Wolf et al., EMNLP Demos 2020), contribuyó al proyecto BigScience y al modelo multifuncional incitado T0 (ICLR 2022) a través de PromptSource, y fue coautor de Zephyr (COLM 2024), un modelo ligero ajustado por instrucciones producido mediante destilación directa de la alineación de LM que se convirtió en un modelo de referencia abierto ampliamente utilizado. Este doble nombramiento lo convirtió en uno de los puentes más efectivos entre la investigación académica de PLN y el ecosistema de código abierto de Hugging Face.

COLM — Cofundador y presidente (2024–presente)

En 2024, Rush cofundó y lanzó la Conference on Language Modeling (COLM), un foro dedicado específicamente a la investigación de modelos de lenguaje —la primera conferencia importante centrada exclusivamente en el área que había llegado a dominar el PLN. Se desempeña como presidente de la conferencia. COLM llenó un vacío en el panorama de las conferencias donde el trabajo específico de LM se había distribuido en foros con un alcance más amplio (NeurIPS, ICML, ICLR, ACL) y carecía de un hogar dedicado. La COLM inaugural publicó Zephyr como uno de sus primeros artículos.

Rush también se desempeñó como Secretario y Presidente General de ICLR durante su período académico, desarrollando la infraestructura de software que ejecutó las operaciones virtuales de la conferencia durante el período de la COVID-19 (2020–2021).

Cursor — Investigador (2026–presente)

En 2026, Rush dejó la academia para unirse a Cursor, un editor de código y herramienta de desarrollo nativo de IA. Su sitio web personal describe su enfoque actual como “post-entrenamiento de sistemas de IA para codificación y tareas relacionadas” y mejorar el razonamiento del modelo para problemas de codificación de largo horizonte. Fue coautor de “Composer 2” (arXiv 2026) con el equipo de Cursor — un artículo sobre generación de código de contexto grande. Señaló en su sitio: “De 2016 a 2026, fui profesor en Harvard y luego en Cornell.”


Contribuciones clave

  • The Annotated Transformer (ACL NLP-OSS workshop, 2018) — Una implementación en PyTorch, ejecutable y con muchos comentarios, de “Attention Is All You Need” que recorre cada componente de la arquitectura Transformer con código en línea y visualizaciones. Probablemente la implementación y el tutorial más leídos del Transformer jamás escritos, y el punto de entrada a través del cual una gran fracción de la comunidad de ML entendió por primera vez la arquitectura en código. Actualizado y mantenido en GitHub.

  • GPU-Puzzles (GitHub, 2021) — Una colección de 14 acertijos interactivos de CUDA implementados con Numba, diseñados para enseñar programación en GPU desde los primeros principios. Uno de los repositorios educativos de ML con más estrellas en GitHub; utilizado en cursos de todo el mundo para enseñar programación paralela para aprendizaje profundo. Un complemento de Tensor-Puzzles, que hace lo mismo para las operaciones tensoriales en Python.

  • OpenNMT (ACL Demo, 2017) — Desarrollado conjuntamente con Guillaume Klein, Yoon Kim y Jean Senellart; uno de los primeros sistemas de traducción automática neuronal de código abierto con calidad de producción, lanzado en PyTorch y utilizado tanto en investigación como en implementación. Se convirtió en una implementación de referencia para modelos secuencia a secuencia e influyó en el diseño de marcos posteriores de PLN.

  • Un modelo de atención neuronal para el resumen abstractivo de oraciones (EMNLP 2015) — Con Sumit Chopra y Jason Weston; uno de los primeros artículos en aplicar la atención neuronal al resumen abstractivo, demostrando que el mecanismo de atención codificador-decodificador podía generar texto de resumen novedoso en lugar de simplemente extraer fragmentos. Ayudó a establecer el resumen abstractivo neuronal como una dirección de investigación.

  • Destilación de conocimiento a nivel de secuencia (EMNLP 2016) — Con Yoon Kim; introdujo la idea de destilar un modelo docente secuencia a secuencia en un modelo estudiante más pequeño a nivel de secuencia en lugar de a nivel de token, una técnica que se volvió ampliamente utilizada para la compresión de modelos en PLN.

  • Zephyr: Destilación directa de la alineación de LM (COLM 2024) — Coautor con el equipo de investigación de Hugging Face; demostró que la destilación de la retroalimentación de un modelo más fuerte podía alinear un modelo abierto ligero (7 mil millones de parámetros) para seguir instrucciones a un nivel competitivo con modelos mucho más grandes, utilizando un pipeline de entrenamiento más simple que el RLHF completo. Se convirtió en un modelo de referencia abierto ampliamente adoptado para la investigación de seguimiento de instrucciones.

  • T0 / PromptSource — Entrenamiento multifuncional incitado (ICLR 2022) — Coautor con Victor Sanh y otros de BigScience; demostró que el preentrenamiento en una colección diversa de indicaciones escritas por humanos permitía la generalización de cero disparos a tareas no vistas sin ejemplos en contexto.

  • LSTMVis (IEEE InfoVis 2017) — Con Hendrik Strobelt, Sebastian Gehrmann y Hanspeter Pfister; una herramienta de visualización para analizar la dinámica de los estados ocultos en redes recurrentes, galardonada con el Premio al Mejor Artículo en InfoVis.

  • The Annotated S4 — La implementación interactiva y ejecutable de Rush del modelo Structured State Space Sequence (S4), continuando su tradición de producir implementaciones profusamente anotadas de artículos arquitectónicos clave que sirven como recursos educativos para la comunidad.

  • Canal de YouTube (@srush_nlp) — Una serie de conferencias técnicas y cursos que cubren los aspectos internos de los modelos de lenguaje, la programación en GPU y los sistemas de aprendizaje profundo; uno de los recursos de video técnicos más vistos orientados a profesionales en la comunidad de ML.

  • Mejor artículo de NAACL 2012 — «Vine Pruning for Efficient Multi-Pass Dependency Parsing» (con Slav Petrov); uno de los primeros de varios premios al mejor artículo en conferencias de PLN.


Premios y reconocimientos

  • Beca de Investigación Sloan (c. 2018)
  • Premio CAREER de la NSF
  • Premio Presidencial de Carrera Temprana para Científicos e Ingenieros (PECASE)
  • Premio de Elección Estudiantil de Cornell Tech por Excelencia en la Enseñanza
  • Premios al Mejor Artículo en NAACL (2012), InfoVis (2017) y foros centrados en hardware
  • Secretario y Presidente General de ICLR — Liderazgo institucional de una de las conferencias insignia del campo; desarrolló infraestructura de conferencias virtuales.
  • Cofundador y presidente de COLM (2024–presente)

Relaciones clave

  • Michael Collins — Asesor de doctorado en el MIT; uno de los investigadores de PLN más influyentes de las décadas de 2000 y 2010 en predicción estructurada y análisis sintáctico; el trabajo de Rush sobre decodificación óptima y análisis sintáctico eficiente refleja la rigurosa tradición de PLN probabilístico de Collins.
  • Yann LeCun — Supervisor de posdoctorado en FAIR; la orientación hacia el aprendizaje profundo del trabajo posterior de Rush sobre generación de texto neuronal fue moldeada por el entorno de FAIR.
  • Yoon Kim — Colaborador de largo plazo de Harvard; coautor con Rush de Modelos de lenguaje neuronales conscientes de caracteres, Destilación de conocimiento a nivel de secuencia y PCFG compuesta; una de las relaciones de investigación bilaterales más productivas en PLN.
  • Thomas Wolf — Colaborador de Hugging Face; coautor del artículo del sistema Transformers y Zephyr; su tiempo compartido en Hugging Face se superpuso con los años clave del desarrollo de LLM abiertos.
  • Albert Gu — Colaborador en preentrenamiento sin atención (BiGS) y trabajos relacionados con modelos de espacio de estados; la arquitectura S4 de Gu fue el tema del tutorial The Annotated S4 de Rush.
  • Stuart Shieber — Colega de Harvard y colaborador en generación de texto basada en plantillas; también un punto de referencia para el interés de Rush en la programación literaria y la investigación claramente documentada.

Estilo personal

La persona pública de Rush se construye casi por completo en torno a una sola convicción: que hacer que las ideas técnicas complejas sean máximamente claras y ejecutables no es solo pedagogía, sino una forma de contribución a la investigación por derecho propio. The Annotated Transformer, GPU-Puzzles, Tensor-Puzzles, The Annotated S4 y el canal de YouTube ponen en práctica una filosofía de “programación literaria” —código y explicación entremezclados para que comprender el algoritmo signifique poder ejecutarlo, no solo leer sobre él. Ha citado a Ken Shan y otros defensores de la programación literaria como influencias y ha descrito su interés en este modo de comunicación como anterior a su carrera en PLN. El perfil de su vibra en Digg (31.6 % «Informar», 21.7 % «Enseñar», 12.6 % «Anunciar») y la descripción «tuitea y escribe blogs, principalmente sobre codificación y ML» capturan a un comunicador interesado principalmente en construir una comprensión compartida en lugar de tomar posiciones. Su paso de la academia a Cursor en 2026 es coherente con una orientación profesional que nunca fue del todo puramente académica —el trabajo en infraestructura de código abierto, el nombramiento en Hugging Face y la fundación de COLM apuntan a alguien que valora construir cosas funcionales y ampliamente utilizadas por encima de acumular producción académica.


Referencias