Cientista de pesquisa na OpenAI e contribuidor fundamental dos modelos de raciocínio da série o, cujo programa de pesquisa de uma década sobre raciocínio estratégico sob informação imperfeita produziu três marcos de IA sobre-humana — Libratus, Pluribus e CICERO — em pôquer e no jogo de estratégia Diplomacia, antes de convergir para o problema do raciocínio em modelos de linguagem de grande escala.
Perfil
| Campo | Detalhe |
|---|---|
| Nome completo | Noam Brown |
| Data de nascimento | Não disponível publicamente |
| Nacionalidade | Americano |
| Instituição atual | OpenAI |
| Cargo atual | Cientista de Pesquisa |
| Áreas de pesquisa | Raciocínio, aprendizado por reforço, auto-jogo, IA multiagente, jogos de informação imperfeita, teoria dos jogos computacional |
| Tese de doutorado | Equilibrium Finding in Large Adversarial Imperfect-Information Games (CMU, 2020) |
| Orientador de doutorado | Tuomas Sandholm |
| Site pessoal | noambrown.com |
| X / Twitter | @polynoamial |
| GitHub | noambrown |
| Google Scholar | RLDbLcUAAAAJ |
Visão Geral
Noam Brown é um cientista de pesquisa na OpenAI e uma das figuras mais importantes da história moderna da IA e dos jogos. Trabalhando a partir de uma base teórica unificada — encontrar equilíbrio e busca em cenários de informação imperfeita — ele co-criou três sistemas que representaram marcos inéditos: Libratus (2017), a primeira IA a derrotar profissionais humanos de elite no heads-up no-limit Texas Hold’em; Pluribus (2019), a primeira a vencer os melhores jogadores no pôquer multiplayer de seis jogadores, com resultados publicados na capa da Science; e CICERO (2022), a primeira IA a atingir desempenho de nível humano no jogo de estratégia com linguagem natural Diplomacia, publicado na Science. Após ingressar na OpenAI em 2023, Brown tornou-se um contribuidor fundamental dos modelos de raciocínio da série o (o1, o3), aplicando a mesma percepção de que o desempenho escala com mais computação durante a inferência — extraída diretamente de sua pesquisa em jogos — a modelos de linguagem de grande escala. Ele recebeu três prêmios de dissertação da CMU, a Medalha Marvin Minsky, um Prêmio de Melhor Artigo no NeurIPS e foi nomeado um dos 35 Inovadores com Menos de 35 Anos do MIT Technology Review.
Vida Pessoal e Educação
Brown se formou na Rutgers University com um B.A. em Matemática e Ciência da Computação, summa cum laude, 2005–2008, onde foi membro do Rutgers College Honors Program. Durante e imediatamente após Rutgers, trabalhou como engenheiro de negociação algorítmica no MJM Trading Group em Nova York (2006–2010), uma base inicial em tomada de decisão quantitativa sob incerteza que moldaria seus interesses de pesquisa posteriores. De 2010 a 2012, trabalhou no Federal Reserve Board of Governors na seção de Mercados Financeiros Internacionais, pesquisando negociação algorítmica em mercados financeiros.
Ele se matriculou na Carnegie Mellon University em 2012, concluindo um M.S. em Robótica (2012–2014) e um Ph.D. em Ciência da Computação (2014–2020), ambos orientados por Tuomas Sandholm. Sua tese de doutorado, Equilibrium Finding in Large Adversarial Imperfect-Information Games, desenvolveu um conjunto de avanços algorítmicos — incluindo variantes mais rápidas de minimização de arrependimento contrafactual (CFR), solução de subjogo segura e aninhada e busca com profundidade limitada — que juntos permitiram, pela primeira vez, que uma IA derrotasse profissionais humanos de elite no pôquer em escala real. A tese recebeu o Prêmio de Dissertação Distinta da Escola de Ciência da Computação da CMU, o Prêmio de Dissertação AAAI ACM-SIGAI e o Prêmio de Dissertação Distinta Victor Lesser da IFAAMAS.
Carreira
MJM Trading Group — Engenheiro de Negociação Algorítmica (2006–2010)
Trabalhou em negociação algorítmica em Nova York, desenvolvendo estratégias quantitativas e obtendo exposição inicial à tomada de decisão sob incerteza em mercados financeiros adversários.
Federal Reserve Board of Governors — Assistente de Pesquisa (2010–2012)
Conduziu pesquisas na seção de Mercados Financeiros Internacionais, estudando negociação algorítmica e microestrutura do mercado financeiro. Também organizou divulgação através do FedEd, ensinando educação financeira e política monetária para alunos do ensino médio da área de Washington, D.C.
Carnegie Mellon University — Assistente de Pesquisa, Ph.D. (2012–2020)
Sob a orientação de Tuomas Sandholm, Brown construiu uma sequência de IAs jogadoras de pôquer com capacidade crescente — Tartanian7 (campeão AAAI 2015), Claudico, Baby Tartanian8 (campeão 2016) e, finalmente, Libratus e Pluribus. Suas vitórias anuais no Computer Poker Competition e as duas competições head-to-head marcantes contra jogadores profissionais (janeiro de 2017 para Libratus, julho de 2019 para Pluribus) fizeram dele a figura central na resolução do pôquer como um grande desafio para a IA. Ele também completou um estágio de pesquisa de verão na DeepMind em Londres em 2017.
Facebook AI Research (FAIR / Meta) — Cientista de Pesquisa (2018–2023)
Ingressou na FAIR em Nova York enquanto concluía seu Ph.D., depois continuou em tempo integral. Na FAIR, Brown estendeu sua pesquisa em jogos de informação imperfeita de cenários de soma zero com dois jogadores para jogos cooperativos e de motivação mista. Ele co-desenvolveu uma série de IAs jogadoras de Diplomacia, culminando no CICERO — a primeira IA a atingir desempenho de nível humano em Diplomacia, um jogo que requer planejamento estratégico e comunicação em linguagem natural para formar coalizões, negociar e enganar. O CICERO foi publicado na Science em novembro de 2022 como um artigo conjunto do Fundamental AI Research Diplomacy Team da Meta. Ele também co-desenvolveu o ReBeL (NeurIPS 2020), uma estrutura geral que combina aprendizado por reforço profundo e busca para jogos de informação imperfeita.
OpenAI — Cientista de Pesquisa (2023–presente)
Ingressou na OpenAI em São Francisco em 2023 para trabalhar em raciocínio, aprendizado por reforço, auto-jogo e IA multiagente. Brown se tornou um contribuidor fundamental dos modelos de raciocínio da série o, o primeiro dos quais — o1 (codinome „Strawberry“) — foi lançado publicamente em setembro de 2024. Ele confirmou seu envolvimento publicamente no X no lançamento e desde então apresentou o trabalho da série o em locais como o Simons Institute em Berkeley, o Kempner Institute de Harvard, a Série de Palestras Distintas Katayanagi da CMU e a NUS. A ideia central subjacente à série o — de que o desempenho de LLMs em tarefas complexas de raciocínio escala previsivelmente com mais computação de aprendizado por reforço e mais computação durante a inferência — é uma extensão direta da percepção de escala com busca que Brown demonstrou em seu trabalho com jogos.
Principais Contribuições
-
Libratus (Brown e Sandholm; Science, 2017) — A primeira IA a derrotar profissionais humanos de elite no heads-up no-limit Texas Hold’em, vencendo por uma margem de mais de 14,7 big blinds a cada 100 mãos em 120.000 mãos contra quatro profissionais de alto escalão em janeiro de 2017. Construído com solução de subjogo segura e aninhada e algoritmos CFR aprimorados. Venceu o Prêmio „Best Use of AI“ da HPCWire; nomeado um dos 12 finalistas do Science’s Scientific Breakthrough of the Year 2017. Recebeu a Medalha Marvin Minsky por Realizações Extraordinárias em IA.
-
Pluribus (Brown e Sandholm; Science, 2019, artigo de capa) — A primeira IA a derrotar profissionais humanos de elite no no-limit Texas Hold’em de seis jogadores, alcançando desempenho sobre-humano contra um campo que incluía simultaneamente cinco dos melhores profissionais do mundo. Introduziu a antecipação de profundidade limitada para jogos multiplayer de informação imperfeita. Publicado na capa da Science e nomeado vice-campeão do Science’s Breakthrough of the Year 2019 (um dos nove). Nomeado um dos 10 principais avanços científicos de 2019 da Science.
-
CICERO (Meta FAIR Diplomacy Team incluindo Brown como cientista de pesquisa principal; Science, 2022) — A primeira IA a atingir desempenho de nível humano no jogo de tabuleiro Diplomacia, que requer negociação em linguagem natural, construção de coalizões e engano estratégico entre vários jogadores. O CICERO combinou um modelo de linguagem para comunicação com raciocínio estratégico via busca de equilíbrio, terminando entre os 10% melhores jogadores humanos em jogos online contra oponentes humanos desavisados.
-
Safe and Nested Subgame Solving for Imperfect-Information Games (Brown e Sandholm; NeurIPS 2017) — Prêmio de Melhor Artigo NeurIPS 2017. Introduziu a técnica de solução de subjogo que foi um componente central tanto do Libratus quanto do Pluribus, permitindo planejamento em tempo real e teoricamente fundamentado em grandes jogos de informação imperfeita.
-
Deep Counterfactual Regret Minimization (Brown, Lerer, Gross, Sandholm; ICML 2019) — Estendeu a minimização de arrependimento contrafactual para aproximação de função por redes neurais profundas, permitindo que o CFR escalasse além de árvores de jogo explicitamente enumeradas e tornando-o aplicável às maiores variantes de pôquer e além.
-
ReBeL: Combining Deep Reinforcement Learning and Search for Imperfect-Information Games (Brown, Bakhtin, Lerer, Gong; NeurIPS 2020) — Um algoritmo geral que combina RL profundo com busca em árvore tanto no treinamento quanto no teste para jogos de informação imperfeita, preenchendo a lacuna entre o paradigma de jogos de informação perfeita (estilo AlphaZero) e o cenário de informação imperfeita.
-
Modelos de raciocínio da série o da OpenAI (o1, o3) (OpenAI; 2024–presente) — Contribuidor fundamental da série o da OpenAI, os primeiros LLMs treinados via aprendizado por reforço para gerar uma cadeia de pensamento oculta antes de responder. o1 (lançado em setembro de 2024) marcou 83% no exame de qualificação para a Olimpíada Internacional de Matemática (contra 13% do GPT-4o), excedeu a precisão de nível de doutorado humano em benchmarks científicos e estabeleceu a escala de computação durante a inferência como um novo paradigma para a melhoria da capacidade de IA — um descendente intelectual direto do trabalho de Brown sobre busca em tempo de teste em jogos.
Prêmios e Reconhecimento
- Prêmio de Dissertação AAAI ACM-SIGAI (2020) — Pela melhor dissertação em IA
- Prêmio de Dissertação Distinta Victor Lesser da IFAAMAS (2020) — Melhor dissertação em sistemas multiagente
- Prêmio de Dissertação Distinta da Escola de Ciência da Computação da CMU (2020)
- Medalha Marvin Minsky por Realizações Extraordinárias em IA (2019) — Concedida pela IJCAI pelo Libratus
- MIT Technology Review 35 Inovadores com Menos de 35 Anos (2019)
- Vice-campeão do Breakthrough of the Year da Science (2019) — Pluribus, um dos nove vice-campeões
- Menção Honrosa de Artigo Extraordinário da AAAI (2019) — Um dos quatro artigos a receber reconhecimento especial de 7.095 submissões
- Prêmio de Melhor Artigo NeurIPS (2017) — „Safe and Nested Subgame Solving for Imperfect-Information Games“, um dos três Melhores Artigos de 3.240 submissões
- Prêmio Allen Newell de Excelência em Pesquisa (2017) — Escola de Ciência da Computação da CMU
- Finalista do Scientific Breakthrough of the Year da Science (2017) — Libratus, um dos 12 finalistas
- Bolsa de IA Open Philanthropy (2018) — Um dos sete beneficiários
- Bolsa do Laboratório de IA da Tencent (2018) — Um dos cinco beneficiários
- Competição Anual de Pôquer Computacional — 1º lugar, No-Limit Texas Hold’em (2014, 2016)
- Prêmio „Best Use of AI“ da HPCWire — Pelo Libratus (2017, 2018)
Relacionamentos Chave
-
Tuomas Sandholm — Orientador de doutorado na CMU e co-criador do Libratus e Pluribus; Professor Universitário Angel Jordan de Ciência da Computação na CMU e CEO da Strategy Robot, Inc. A colaboração fundamental que produziu a metodologia central de Brown na resolução de jogos de informação imperfeita.
-
Adam Lerer — Colaborador principal na FAIR na linha de pesquisa de Diplomacia, incluindo CICERO e ReBeL; coautor de vários artigos no NeurIPS, ICLR e ICML com Brown entre 2018 e 2023.
-
Anton Bakhtin — Colíder no CICERO e trabalho em Diplomacia na FAIR; coautor do artigo de 2022 na Science e de vários artigos de conferência relacionados.
-
Jakob Foerster — Colaborador na FAIR em problemas de Hanabi e relacionados à Diplomacia; coautor de vários artigos sobre jogos cooperativos de informação imperfeita.
-
Hengyuan Hu — Colaborador frequente na FAIR em coordenação humano-IA e Hanabi; coautor de vários artigos investigando a distinção entre políticas ótimas de auto-jogo e compatíveis com humanos.
-
Gabriele Farina — Colaborador em teoria de encontrar equilíbrio (ICML 2019 com Sandholm; Menção Honrosa de Melhor Artigo ICLR 2023); representa a vertente teórica dos jogos no trabalho de Brown.
Estilo Pessoal
A carreira de pesquisa de Brown é definida por uma única questão, progressivamente aprofundada: como fazer uma IA raciocinar estrategicamente em cenários onde a informação está oculta e outros agentes estão ativamente tentando explorá-lo? Cada grande projeto — pôquer, Diplomacia, raciocínio de LLM — é um novo domínio onde essa questão é testada em escala e complexidade crescentes. Ele tem sido excepcionalmente explícito em palestras e postagens públicas sobre a continuidade intelectual que conecta a pesquisa de jogos aos modelos de raciocínio, argumentando que o fenômeno de escala com computação de inferência descoberto no pôquer (mais busca = melhores decisões) é o mesmo fenômeno agora observado em modelos de raciocínio de cadeia de pensamento. No X (@polynoamial — um trocadilho com „polynomial“), ele posta substantivamente sobre benchmarks, comportamento de escala, carreiras de pesquisa e as implicações práticas do progresso da IA, com um tom direto e empiricamente fundamentado. Ele continuou a ensinar teoria dos jogos para alunos superdotados do ensino médio através do Rutgers Young Scholars Program todos os verões desde 2009, refletindo um interesse de longa data em divulgação que antecede sua fama em pesquisa.
Referências
- Site pessoal: noambrown.com
- Currículo: noambrown.com/downloads/CV.pdf
- Perfil no X: x.com/polynoamial
- GitHub: github.com/noambrown
- Google Scholar: scholar.google.com/citations?user=RLDbLcUAAAAJ
- LinkedIn: linkedin.com/in/noam-brown-8b785b62
- Perfil no Digg: digg.com/u/x/polynoamial
- Registro de dissertação da CMU: csd.cmu.edu/academics/doctoral/degrees-conferred/noam-brown
- Blog da OpenAI, „Learning to Reason with LLMs“ (setembro de 2024): openai.com/index/learning-to-reason-with-llms
- Palestra no Simons Institute, „Learning to Reason with LLMs“ (setembro de 2024): simons.berkeley.edu/talks/noam-brown-openai-2024-09-26
- Biografia do seminário EE de Stanford (2023): ee-www.stanford.edu/event/10-19-2023/cicero