+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Gemini 4 Argon è il miglior modello di Google. Non puoi ancora usarlo.

Google ha annunciato Gemini 4 Argon, il suo nuovo modello di frontiera, e solo i cyber-difensori fidati possono usarlo.

Google ha annunciato Gemini 4 Argon, il suo nuovo modello di frontiera, e solo i cyber-difensori fidati possono usarlo. Ecco cosa mostra la tabella benchmark di 19 righe di Google, cosa ha misurato la classifica indipendente e quando gli sviluppatori potrebbero ottenerlo. Verdetto: NEEDS REVIEW.

Leggi l'edizione scritta (inglese) ↗

Contenuto di questo video

  • Gemini 4 Argon: un milione di token di output, $2 in, e non puoi usarlo
  • All'interno di Google: gli agenti Argon portano C++ a Rust
  • La tabella di Google: Argon è il migliore in 13 delle 19 righe
  • Il pitch cibernetico: si auto-patcha, nessun guardrail per i difensori
  • Il numero esterno: Artificial Analysis dice 53, Opus 5.5 ha 58

Trascrizione tradotta

Tradotto dalla narrazione originale inglese. L'audio e i sottotitoli disponibili sono controllati da YouTube.

Gemini 4 Argon: un milione di token di output, $2 in, e non puoi usarlo

0:00 Penseresti che un lancio significhi che ottieni il modello. Google ha appena lanciato Gemini four Argon, e a meno che tu non sia un cyber difensore fidato, non puoi toccarlo. In questo video: cosa mostra la tabella di Google? Cosa hanno misurato i tester esterni? E quando lo otterrai? Probabilmente hai già visto i video di hype. Ho letto invece la tabella dei benchmark, e due righe in essa non sono mai finite nel

0:20 testo del post. Le affronterò alla fine. È giovedì, primo ottobre, e questo è The Daily Diff. Due storie oggi, e quella importante è Gemini four Argon, che Google chiama la sua prossima era di intelligenza di frontiera. Una risposta può ora arrivare a un milione di token, da sessantaquattro mila, che sono diversi romanzi in una singola risposta. Il prezzo di lancio è di due dollari per milione di token in ingresso e dieci in uscita. Questo è esattamente ciò che OpenAI addebita per GPT six point one Sol,

0:48 il modello che ho trattato ieri, e Sol è uno che puoi effettivamente comprare. All'interno di Google, è già al lavoro.

All'interno di Google: gli agenti Argon portano C++ a Rust

0:54 Google afferma che gli agenti Argon stanno portando C e C++ a Rust in tutta l'azienda, fino a ottocentomila righe per il kernel Fuchsia. Su Hacker News, un ingegnere ha ricordato quando il team C++ di Google non avrebbe nemmeno considerato Rust e ha guardato Carbon invece. Ora un modello sta facendo la migrazione di cui hanno discusso.

La tabella di Google: Argon è il migliore in 13 delle 19 righe

1:12 Ora la tabella. Google mette Argon accanto a GPT six Astra, Claude Fable e Claude Opus su diciannove righe, e Argon si classifica primo in tredici di esse. Il titolo è DeepSWE, un lungo benchmark di codifica, al settantotto percento, circa quattro punti di vantaggio. La vittoria più strana è la redazione legale, dove Argon ottiene il venti percento e gli altri rimangono a una cifra singola. È il miglior voto in un test in cui tutti falliscono, e sui benchmark delle slide-deck,

1:38 che sono imbattuti, questo conta.

Il pitch cibernetico: si auto-patcha, nessun guardrail per i difensori

1:41 Il vero argomento è la sicurezza. Google afferma che Argon può trovare, convalidare e applicare patch a vulnerabilità critiche da solo, e che i difensori fidati lo ottengono senza guardrail cibernetici. Wiz lo ha usato per trovare un buco critico in un software ospedaliero che i modelli precedenti avevano mancato. Un piccolo dettaglio. Wiz appartiene a Google, da quando un accordo da trentadue miliardi di dollari si è concluso a marzo. Quindi il test di hacking a scatola nera nel post è una società di Google che valuta un modello di Google. E nella classifica di correzione dei bug, tre modelli condividono il sessantotto percento,

2:10 e la barra all'estrema sinistra appartiene a Grok. Quindi cosa hanno misurato i tester esterni?

Il numero esterno: Artificial Analysis dice 53, Opus 5.5 ha 58

2:15 La classifica indipendente che ho trovato con Argon è Artificial Analysis. Assegna ad Argon cinquantatré nel suo indice di intelligenza, nell'impostazione alta, che lo lega con Astra e Fable. Claude Opus five point five si trova cinque punti avanti. Una settimana fa vi ho detto che Opus aveva preso il primo posto lì, e lo sta ancora mantenendo. La parte equa per Google è il conto. Una esecuzione di Argon costa circa due dollari per compito su quell'indice, circa un terzo di quanto costa Opus.

Quando lo otterrai: "Quindi aspetta"

2:42 E quando lo otterrai? Google non darà una data. Il post promette l'accesso per sviluppatori, aziende e consumatori il prima possibile, con i clienti API a pagamento per primi. Il post di Sundar Pichai su X dice, quindi aspetta. Fino ad allora, l'accesso avviene tramite Fairwind, il programma che Google ha avviato un mese fa con Gemini three point eight Flash Cyber. Ha oltre seicentocinquanta partner, e possono consegnare Argon solo ai loro

3:05 team di sicurezza e devono tracciare chi lo usa. Hacker News l'ha presa bene. Un commentatore ha scritto, Gemini non sta battendo le accuse di non poter rilasciare un modello. Un altro ha previsto che i modelli si trasformino in vaporware, un mucchio di numeri su una tabella. Nel frattempo, Netlify ha ricostruito Edge Functions, che vengono eseguite circa un miliardo

Netlify Edge Functions: da isolati V8 a microVM, circa 5 volte più veloci

3:23 di volte al giorno. Sono passati dagli isolati V8 in un servizio ospitato ai microVM Firecracker all'interno della rete di Netlify, e una chiamata a caldo è scesa da un massimo di quaranta millisecondi a circa sei. Hacker News ha fatto notare che i Cloudflare Workers sono anch'essi isolati V8 e funzionano molto più velocemente, quindi la maggior parte del guadagno sembra che la richiesta non lasci più l'edificio. Un altro commentatore si è preoccupato degli snapshot, perché i microVM clonati possono condividere lo stato dei numeri casuali, che è il modo in cui si ottengono due UUID identici.

3:50 Un avvio a freddo, quando una regione non ha mai visto la tua funzione, colpisce circa l'uno percento delle chiamate e richiede circa nove millisecondi. E il microVM stesso è Firecracker, che Amazon ha costruito per Lambda, quindi un commentatore suggerisce di ricordarlo la prossima volta che maledici AWS.

Le due righe che il post di Google non menziona mai

4:06 Ora, quelle due righe. Su FrontierSWE e Terminal-bench, due test di codifica che il testo del post non menziona mai, Argon arriva ultimo su quattro, nella tabella di Google. Terminal-bench mette un agente in una shell reale, che è il modo in cui la maggior parte di noi lo userebbe, e Opus lo precede di nove punti. Se preferisci leggere questo invece di sentirmi dirlo, il diff arriva nella tua casella di posta ogni mattina, gratuitamente su the daily diff dot dev, link qui sotto.

Verdetto: NEEDS REVIEW, il giorno in cui potrò chiamarlo

4:29 Quindi, il verdetto di oggi su Gemini four Argon. NEEDS REVIEW. Lo timbrerei così perché il numero indipendente che ho trovato lo vede legato al secondo posto, e le due righe di codifica che mi interessano lo vedono ultimo, quindi lo recensirò correttamente il giorno in cui potrò chiamarlo. Iscriviti, premi la campana, e dimmi nei commenti se lo avresti timbrato diversamente. E questo è il diff per oggi. Sono Niko di Axrisi. Merge responsibly.

Fonti

  1. Googleblog.google
  2. Hacker Newsnews.ycombinator.com
  3. Fairwind Programdeepmind.google
  4. Artificial Analysisartificialanalysis.ai
  5. Sundar Pichaix.com
  6. Demis Hassabisx.com
  7. Google completes acquisition of Wizcloud.google.com
  8. Netlifywww.netlify.com
  9. Hacker Newsnews.ycombinator.com

Video correlati