+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

OpenAI diz ter resolvido Navier–Stokes. Veredito: NEEDS REVIEW.

A OpenAI afirma que um modelo interno, executado com cerca de 10.000 agentes concorrentes durante 88 horas, produziu uma prova verificada em Lean de que as equações de Navier–Stokes explodem em tempo finito — um problema do Prémio Millennium em aberto desde 1934.

A OpenAI afirma que um modelo interno, executado com cerca de 10.000 agentes concorrentes durante 88 horas, produziu uma prova verificada em Lean de que as equações de Navier–Stokes explodem em tempo finito — um problema do Prémio Millennium em aberto desde 1934. Doze horas antes, Tristan Buckmaster da NYU publicou uma declaração de quatro páginas sobre como correu a chamada telefónica de domingo com a OpenAI ("Por que arruinaria a sua carreira?"), Terence Tao escreveu que os problemas em aberto estão agora a ser explorados como um recurso não renovável, e um investigador de pré-treino da Anthropic demitiu-se devido à corrida. Além disso: a Meta lança Muse, um agente pessoal com a sua própria VM. Veredito: NEEDS REVIEW.

Ler a edição escrita (Inglês) ↗

O que este vídeo aborda

  • OpenAI: explosão de Navier–Stokes, ~10.000 agentes, 88 horas, 130 mil milhões de tokens de saída, verificado em Lean
  • Buckmaster e Alpöge: um ano na mesma abordagem, um rumor e uma chamada de domingo com duas ofertas
  • Terence Tao: "mesmo o rumor de alguém a trabalhar num problema pode desencadear uma quantidade massiva de esforço impulsionado por IA para o resolver"
  • Jacob Coxon demite-se da Anthropic: ambos os laboratórios estão "a correr diretamente para a superinteligência autoaperfeiçoável"
  • Meta lança Muse: um agente pessoal na sua própria VM na nuvem, no WhatsApp, apenas nos EUA

Transcrição traduzida

Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.

0:00 Ontem, a OpenAI anunciou que a sua IA resolveu um problema do Prémio Millennium, noventa anos em aberto, um milhão de dólares, em oitenta e oito horas, e os dois matemáticos que passaram um ano no mesmo problema souberam disso numa chamada telefónica de domingo que, segundo um deles, incluiu: por que arruinaria a sua carreira? Foi uma segunda-feira longa. Ao amanhecer, um professor da NYU publicou uma declaração de quatro páginas; dezasseis centenas de pontos no Hacker News. À tarde, a OpenAI publicou a prova.

0:26 À noite, Terence Tao disse que os problemas em aberto são agora explorados como um recurso não renovável, e durante a noite um investigador da Anthropic demitiu-se no X, quarenta e quatro milhões de visualizações, porque ambos os laboratórios estão, cito, a apostar as nossas vidas. Além disso, a Meta lançou um agente pessoal que vive no WhatsApp e tem o seu próprio computador. Neste vídeo: a prova, a chamada telefónica, a nota de rodapé, e a frase que Terence Tao quer que os laboratórios ouçam.

0:49 É quarta-feira, 9 de setembro, e este é O Daily Diff. Primeiro a matemática. Navier–Stokes descreve como os fluidos se movem, e desde 1934 ninguém sabia se um fluido 3D suave pode atingir uma singularidade: velocidade infinita em tempo finito. O sistema da OpenAI diz que sim. Comece em repouso, aplique uma força suave, mantenha a energia finita, e um vórtice espirala para dentro como esparguete até a velocidade explodir. Declarações C e D da formulação de Clay, em Lean,

1:16 dezassete horas de Astra para verificar. Então os fluidos podem explodir, o que qualquer um que derramou café num MacBook sabia, mas agora está em Lean. Como: a OpenAI tem um novo modelo interno que considera significativamente mais capaz do que Astra, e a 1 de setembro ouviram um rumor de que dois problemas do Millennium tinham sido resolvidos, então eles apontaram-no para cada um dos problemas em aberto. O grupo Navier–Stokes: cerca de dez mil agentes concorrentes, cento e trinta mil milhões de tokens de saída; trezentos mil milhões em todos os

1:42 problemas. A preços de tabela da Astra, quinze milhões de dólares em tokens para um prémio de um milhão de dólares que a OpenAI diz que não vai reclamar, e com essa margem, quem o faria. O outro lado. Tristan Buckmaster na NYU e Levent Alpöge, que trabalha na Anthropic, passaram um ano a desenvolver uma abordagem de Córdoba e Martínez-Zoroa com Claude e Codex, pagando à OpenAI com fundos de pesquisa do próprio Buckmaster. A 15 de agosto obtiveram a explosão para as equações de Euler; Buckmaster chama à primeira prova LLM a mais horrenda que alguma vez leu,

2:10 e foi verificada em Lean a 22 de agosto. Depois, um rumor espalhou-se, e a 3 de setembro ele enviou um e-mail à OpenAI: somos nós, é pessoal, vamos publicar em breve. No domingo, às 12:45, a OpenAI pediu para se encontrarem a qualquer momento hoje, e Sébastien Bubeck juntou-se. Buckmaster foi informado de que o modelo tinha provado Navier–Stokes forçado com muito pouca entrada humana, o que durante a chamada se tornou uma equipa inteira, problemas mais fáceis primeiro, um prompt escrito por Codex, e uma quantidade insana de

2:36 computação. Ele perguntou quando o primeiro prompt foi enviado. Eventualmente: nos últimos dias, depois de informações sobre o nosso trabalho terem chegado à OpenAI. Seguiram-se duas ofertas. Uma: vocês publicam Euler, nós publicamos Navier–Stokes no dia seguinte. Dois: Buckmaster sozinho redige a prova da OpenAI, e, ele diz, Bubeck quis duas vezes que Alpöge ficasse de fora do artigo porque ele trabalha na Anthropic. Ele recusou e disse que tornaria a situação pública. A resposta, segundo a declaração: por que arruinaria a sua carreira,

3:00 depois: se não quer que eu seja simpático, não tenho de ser simpático. Normalmente, a frase anterior a uma cabeça de cavalo aparecer numa cama. A versão da OpenAI: ninguém viu o trabalho deles, nenhuns dados de utilizador foram acedidos, e, nota de rodapé, eles não podem descartar que dados desidentificados do uso dos produtos dos professores ajudaram a melhorar o modelo. A avaliação de Alpöge: parabéns a eles por serem diretos. Sam Altman diz que todos agiram com integridade e generosidade e a outra equipa

3:25 ameaçou acusações infundadas de plágio, escrito com um i. Então a posição oficial: não copiámos o vosso trabalho de casa, ouvimos dizer que estavam a fazer o trabalho de casa. Terence Tao chamou o resultado dos professores notável e notou que Buckmaster lhe explicou por telefone, uma mudança refrescante das modalidades de comunicação baseadas em IA. Depois, quatro publicações: bons problemas em aberto são agora explorados como um recurso não renovável, mesmo um rumor de alguém a trabalhar num desencadeia um esforço massivo de IA para o resolver, então o incentivo é parar de partilhar direções de pesquisa,

3:55 invertendo séculos de ciência aberta. Três grupos publicaram a explosão de fluidos num fim de semana; o próximo artigo pode ser um NDA. Que é o ambiente em que Jacob Coxon se demitiu: três anos de pré-treino na OpenAI, depois na Anthropic; nenhuma das empresas está a agir de forma responsável, diz ele, ambas estão a correr para a superinteligência autoaperfeiçoável, e o jogo final não deve ser lançado de um Slack de uma empresa privada. Quarenta e quatro milhões de visualizações, no dia em que um laboratório colocou dez mil agentes num rumor,

4:21 então a thread foi lançada com uma demonstração ao vivo. Enquanto isso, a Meta lançou Muse: um agente pessoal na sua própria VM na nuvem com o seu próprio navegador, e fala-se com ele no WhatsApp. Apenas nos EUA, grátis para a maioria das coisas. A Meta promete uma versão que nem mesmo a Meta pode ler, ainda este ano, uma forma muito específica de descrever este ano. Comentário principal no Hacker News: não quero partilhar a minha vida com a Meta desta forma. Segundo: continua a tentar vender-me um carrinho de bebé.

4:45 Se preferir ler isto em vez de me ouvir dizer, o diff chega à sua caixa de entrada todas as manhãs — grátis em the daily diff dot dev, link abaixo. Então — o veredito de hoje: needs review. A prova compila; a história não. Dez mil agentes a resolver um problema de noventa anos num fim de semana é o resultado de capacidade do ano; anunciá-lo com uma chamada telefónica de domingo às duas pessoas de quem soubeste não é.

5:07 E essa é a diferença de hoje. Sou o Niko da Axrisi. Merge responsavelmente.

Fontes

  1. OpenAI: On the Navier–Stokes Millennium Prize Problemopenai.com
  2. OpenAI Lean formalizationgithub.com
  3. Tristan Buckmaster, statement (PDF)cims.nyu.edu
  4. HN: Buckmaster statementnews.ycombinator.com
  5. HN: OpenAI postnews.ycombinator.com
  6. Terence Tao on the Alpöge–Buckmaster resultmathstodon.xyz
  7. Terence Tao: open problems mined non-renewablymathstodon.xyz
  8. HN: Tao threadnews.ycombinator.com
  9. Clay Mathematics Institute: Navier–Stokes problem statementwww.claymath.org
  10. GPT-6 Astra pricing (used for the token-bill arithmetic)openai.com
  11. Jacob Coxon's resignation threadx.com
  12. HN: I resigned from Anthropic todaynews.ycombinator.com
  13. Meta: Introducing Museabout.fb.com
  14. Museai.meta.com
  15. HN: Musenews.ycombinator.com

Vídeos relacionados