+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

OpenAI afferma di aver risolto Navier–Stokes. Verdetto: NEEDS REVIEW.

OpenAI afferma che un modello interno, eseguito come circa 10.000 agenti concorrenti per 88 ore, ha prodotto una prova verificata da Lean che le equazioni di Navier–Stokes esplodono in tempo finito — un problema del Millennium Prize aperto dal 1934.

OpenAI afferma che un modello interno, eseguito come circa 10.000 agenti concorrenti per 88 ore, ha prodotto una prova verificata da Lean che le equazioni di Navier–Stokes esplodono in tempo finito — un problema del Millennium Prize aperto dal 1934. Dodici ore prima, Tristan Buckmaster della NYU ha pubblicato una dichiarazione di quattro pagine su come è andata la telefonata domenicale con OpenAI ("Perché dovresti rovinarti la carriera?"), Terence Tao ha scritto che i problemi aperti vengono ora estratti come una risorsa non rinnovabile, e un ricercatore di pre-training di Anthropic si è dimesso per la corsa. Inoltre: Meta rilascia Muse, un agente personale con la sua propria VM. Verdetto: NEEDS REVIEW.

Leggi l'edizione scritta (inglese) ↗

Contenuto di questo video

  • OpenAI: esplosione di Navier–Stokes, ~10.000 agenti, 88 ore, 130 miliardi di token di output, verificato da Lean
  • Buckmaster e Alpöge: un anno sullo stesso approccio, una voce, e una chiamata domenicale con due offerte
  • Terence Tao: "anche la voce che qualcuno stia lavorando a un problema può scatenare una massiccia quantità di sforzi basati sull'IA per risolverlo"
  • Jacob Coxon si dimette da Anthropic: entrambi i laboratori stanno "correndo dritti verso la superintelligenza auto-migliorante"
  • Meta rilascia Muse: un agente personale sulla sua propria VM cloud, in WhatsApp, solo negli Stati Uniti

Trascrizione tradotta

Tradotto dalla narrazione originale inglese. L'audio e i sottotitoli disponibili sono controllati da YouTube.

0:00 Ieri, OpenAI ha annunciato che la sua AI ha risolto un problema del Millennium Prize, aperto da novant'anni, da un milione di dollari, in ottantotto ore, e i due matematici che hanno trascorso un anno sullo stesso problema lo hanno saputo durante una telefonata domenicale che, secondo uno di loro, includeva: perché dovresti rovinarti la tua carriera? È stato un lungo lunedì. All'alba un professore della NYU ha pubblicato una dichiarazione di quattro pagine; milleseicento punti su Hacker News. Nel pomeriggio OpenAI ha pubblicato la prova.

0:26 La sera Terence Tao ha detto che i problemi aperti vengono ora estratti come una risorsa non rinnovabile, e durante la notte un ricercatore di Anthropic si è dimesso su X, quarantaquattro milioni di visualizzazioni, perché entrambi i laboratori stanno, cito, giocando d'azzardo con le nostre vite. Inoltre, Meta ha rilasciato un agente personale che vive in WhatsApp e ha il suo proprio computer. In questo video: la prova, la telefonata, la nota a piè di pagina, e la frase che Terence Tao vuole che i laboratori ascoltino.

0:49 È mercoledì 9 settembre, e questo è The Daily Diff. Prima la matematica. Navier–Stokes descrive come si muovono i fluidi, e dal 1934 nessuno sapeva se un fluido 3D liscio potesse raggiungere una singolarità: velocità che diventa infinita in tempo finito. Il sistema di OpenAI dice di sì. Parti da fermo, applica una forza liscia, mantieni l'energia finita, e un vortice si avvita verso l'interno come spaghetti finché la velocità esplode. Dichiarazioni C e D della formulazione di Clay, in Lean,

1:16 diciassette ore di Astra per la verifica. Quindi i fluidi possono esplodere, cosa che chiunque abbia rovesciato il caffè su un MacBook sapeva, ma ora è in Lean. Come: OpenAI ha un nuovo modello interno che definisce significativamente più capace di Astra, e il 1° settembre hanno sentito una voce che due problemi del Millennium erano stati risolti, quindi lo hanno puntato su ogni problema aperto. Il gruppo Navier–Stokes: circa diecimila agenti concorrenti, centotrenta miliardi di token di output; trecento miliardi su tutti

1:42 i problemi. Ai prezzi di listino di Astra, quindici milioni di dollari di token per un premio da un milione di dollari che OpenAI dice di non voler reclamare, e con quel margine, chi lo farebbe. L'altra parte. Tristan Buckmaster alla NYU e Levent Alpöge, che lavora ad Anthropic, hanno passato un anno a portare avanti un approccio di Córdoba e Martínez-Zoroa con Claude e Codex, pagando OpenAI con i fondi di ricerca di Buckmaster. Il 15 agosto hanno ottenuto l'esplosione per le equazioni di Euler; Buckmaster definisce la prima prova LLM la più orrenda che abbia mai letto,

2:10 ed è stata verificata in Lean il 22 agosto. Poi si è diffusa una voce, e il 3 settembre ha scritto a OpenAI: siamo noi, è personale, pubblicheremo presto. Domenica alle 12:45 OpenAI ha chiesto di incontrarsi in qualsiasi momento oggi, e Sébastien Bubeck si è unito. A Buckmaster è stato detto che il modello aveva dimostrato Navier–Stokes forzato con molto poco input umano, che durante la chiamata è diventato un intero team, prima problemi più facili, un prompt scritto da Codex, e una quantità folle di

2:36 calcolo. Ha chiesto quando è stato inviato il primo prompt. Alla fine: negli ultimi giorni, dopo che le informazioni sul nostro lavoro avevano raggiunto OpenAI. Sono seguite due offerte. Una: voi pubblicate Euler, noi pubblichiamo Navier–Stokes il giorno dopo. Due: Buckmaster da solo scrive la prova di OpenAI, e, dice, Bubeck ha voluto due volte Alpöge fuori dal paper perché lavora ad Anthropic. Ha rifiutato e ha detto che sarebbe andato in pubblico. La risposta, secondo la dichiarazione: perché dovresti rovinarti la carriera,

3:00 poi: se non vuoi che sia gentile, non devo essere gentile. Normalmente la frase subito prima che la testa di un cavallo compaia in un letto. La versione di OpenAI: nessuno ha visto il loro lavoro, nessun dato utente è stato acceduto, e, nota a piè di pagina, non possono escludere che dati de-identificati dall'uso dei prodotti dei professori abbiano contribuito a migliorare il modello. La recensione di Alpöge: complimenti a loro per essere stati così onesti. Sam Altman dice che tutti hanno agito con integrità e generosità e l'altro team

3:25 ha minacciato accuse infondate di plagio, scritto con una sola i. Quindi la posizione ufficiale: non abbiamo copiato i vostri compiti, abbiamo sentito che stavate facendo i compiti. Terence Tao ha definito il risultato dei professori notevole e ha notato che Buckmaster glielo ha spiegato al telefono, un cambiamento rinfrescante rispetto alle modalità di comunicazione basate sull'IA. Poi, quattro post: i buoni problemi aperti vengono ora estratti come una risorsa non rinnovabile, anche una voce che qualcuno ci stia lavorando scatena un massiccio sforzo di IA per risolverlo, quindi l'incentivo è smettere di condividere le direzioni della ricerca,

3:55 invertendo secoli di scienza aperta. Tre gruppi hanno pubblicato l'esplosione dei fluidi in un weekend; il prossimo paper potrebbe essere un NDA. Questo è l'umore in cui Jacob Coxon si è dimesso: tre anni di pre-training a OpenAI, poi Anthropic; nessuna delle due aziende sta agendo responsabilmente, dice, entrambe stanno correndo verso la superintelligenza auto-migliorante, e l'epilogo non dovrebbe essere lanciato da uno Slack di un'azienda privata. Quarantaquattro milioni di visualizzazioni, il giorno in cui un laboratorio ha messo diecimila agenti su una voce,

4:21 quindi il thread è stato rilasciato con una demo dal vivo. Nel frattempo, Meta ha rilasciato Muse: un agente personale sulla sua propria VM cloud con il suo proprio browser, e gli si parla in WhatsApp. Solo negli Stati Uniti, gratuito per la maggior parte delle cose. Meta promette una versione che nemmeno Meta può leggere, entro la fine dell'anno, un modo molto specifico di descrivere quest'anno. Il commento principale di Hacker News: non voglio condividere la mia vita con Meta in questo modo. Secondo: continua a cercare di vendermi un passeggino.

4:45 Se preferisci leggere questo anziché sentirmi dirlo, il diff arriva nella tua casella di posta ogni mattina — gratuito su the daily diff dot dev, link qui sotto. Quindi — il verdetto di oggi: needs review. La prova compila; la storia no. Diecimila agenti che risolvono un problema vecchio di novant'anni in un weekend è il risultato di capacità dell'anno; annunciarlo con una telefonata domenicale alle due persone da cui l'hai sentito non lo è.

5:07 E questo è il diff per oggi. Sono Niko di Axrisi. Merge responsabilmente.

Fonti

  1. OpenAI: On the Navier–Stokes Millennium Prize Problemopenai.com
  2. OpenAI Lean formalizationgithub.com
  3. Tristan Buckmaster, statement (PDF)cims.nyu.edu
  4. HN: Buckmaster statementnews.ycombinator.com
  5. HN: OpenAI postnews.ycombinator.com
  6. Terence Tao on the Alpöge–Buckmaster resultmathstodon.xyz
  7. Terence Tao: open problems mined non-renewablymathstodon.xyz
  8. HN: Tao threadnews.ycombinator.com
  9. Clay Mathematics Institute: Navier–Stokes problem statementwww.claymath.org
  10. GPT-6 Astra pricing (used for the token-bill arithmetic)openai.com
  11. Jacob Coxon's resignation threadx.com
  12. HN: I resigned from Anthropic todaynews.ycombinator.com
  13. Meta: Introducing Museabout.fb.com
  14. Museai.meta.com
  15. HN: Musenews.ycombinator.com

Video correlati