Gemini 4 Argon is Google's beste model. Je kunt het nog niet gebruiken.
Google kondigde Gemini 4 Argon aan, zijn nieuwe grensverleggende model, en alleen vertrouwde cyberverdedigers kunnen het gebruiken.
Google kondigde Gemini 4 Argon aan, zijn nieuwe grensverleggende model, en alleen vertrouwde cyberverdedigers kunnen het gebruiken. Dit is wat de eigen 19-rijen benchmarktabel van Google laat zien, wat het onafhankelijke klassement heeft gemeten en wanneer ontwikkelaars het mogelijk krijgen. Oordeel: NEEDS REVIEW.
Lees de geschreven editie (Engels) ↗
Wat deze video behandelt
- Gemini 4 Argon: een miljoen uitvoer tokens, $2 in, en je kunt het niet gebruiken
- Binnen Google: Argon agents porteren C++ naar Rust
- Google's eigen tabel: Argon bovenaan 13 van de 19 rijen
- De cyber pitch: patchet zichzelf, geen vangrails voor verdedigers
- Het externe getal: Artificial Analysis zegt 53, Opus 5.5 heeft 58
Vertaald transcript
Vertaald vanuit de originele Engelse gesproken tekst. Beschikbare audio en ondertiteling worden beheerd door YouTube.
Gemini 4 Argon: een miljoen uitvoer tokens, $2 in, en je kunt het niet gebruiken
0:00 Je zou denken dat een lancering betekent dat je het model krijgt. Google heeft net Gemini vier Argon gelanceerd, en tenzij je een vertrouwde cyber bent verdediger, kun je het niet aanraken. In deze video: wat laat de tabel van Google zien? Wat hebben externe testers gemeten? En wanneer krijg je het? Je hebt waarschijnlijk de hypevideo's al gezien. Ik las in plaats daarvan de benchmarktabel, en twee rijen daarin zijn nooit in de
0:20 tekst van het bericht terechtgekomen. Ik kom daar aan het einde op terug. Het is donderdag 1 oktober, en dit is The Daily Diff. Twee verhalen vandaag, en de belangrijkste is Gemini vier Argon, dat Google de volgende fase van grensverleggende intelligentie noemt. Eén antwoord kan nu oplopen tot een miljoen tokens, van vierenzestigduizend, wat meerdere romans is in één enkel antwoord. De lanceringsprijs is twee dollar per miljoen tokens in en tien uit. Dat is precies wat OpenAI rekent voor GPT zes punt één Sol,
0:48 het model dat ik gisteren behandelde, en Sol is er een die je daadwerkelijk kunt kopen. Binnen Google is het al aan het werk.
Binnen Google: Argon agents porteren C++ naar Rust
0:54 Google zegt dat Argon agents C en C++ naar Rust porteren binnen het bedrijf, tot achthonderdduizend regels voor de Fuchsia kernel. Op Hacker News herinnerde een engineer zich toen Google's C++ team Rust niet eens zou overwegen en in plaats daarvan naar Carbon keek. Nu doet een model de migratie waarover zij ruzieerden.
Google's eigen tabel: Argon bovenaan 13 van de 19 rijen
1:12 Nu de tabel. Google plaatst Argon naast GPT zes Astra, Claude Fable en Claude Opus op negentien rijen, en Argon komt in dertien daarvan bovenaan. De kop is DeepSWE, een lange coding benchmark, met achtenzeventig procent, ongeveer vier punten voorsprong. De vreemdste overwinning is juridische opstelling, waar Argon twintig procent scoort en de anderen in de enkele cijfers blijven. Het is het beste cijfer op een test die iedereen faalt, en op de slide-deck
1:38 benchmarks, die onverslagen zijn, telt dat mee.
De cyber pitch: patchet zichzelf, geen vangrails voor verdedigers
1:41 De echte insteek is veiligheid. Google zegt dat Argon zelf kritieke kwetsbaarheden kan vinden, valideren en patchen, en dat vertrouwde verdedigers het krijgen zonder cybervangrails. Wiz gebruikte het om een kritiek lek te vinden in ziekenhuissoftware dat eerdere modellen hadden gemist. Eén klein detail. Wiz behoort tot Google, sinds een deal van tweeëndertig miljard dollar in maart werd gesloten. Dus de black-box hackingtest in het bericht is een Google-bedrijf dat een Google-model beoordeelt. En op het bug-fixing klassement delen drie modellen achtentwintig
2:10 procent, en de balk helemaal links behoort tot Grok. Dus wat hebben externe testers gemeten?
Het externe getal: Artificial Analysis zegt 53, Opus 5.5 heeft 58
2:15 Het onafhankelijke klassement dat ik kon vinden met Argon erop is Artificial Analysis. Het scoort Argon drieënvijftig op zijn intelligentie-index, op de hoge instelling, wat het gelijkstelt aan Astra en Fable. Claude Opus vijf punt vijf ligt vijf punten voor. Een week geleden vertelde ik je dat Opus daar de toppositie innam, en het houdt die nog steeds vast. Het eerlijke deel voor Google is de rekening. Een Argon-run kost ongeveer twee dollar per taak op die index, ongeveer een derde van wat Opus kost.
Wanneer krijg je het: "Dus even geduld"
2:42 En wanneer krijg je het? Google geeft geen datum. Het bericht belooft toegang voor ontwikkelaars, bedrijven en consumenten zo snel als mogelijk, met eerst betaalde API-klanten. Sundar Pichai's bericht op X zegt: dus hou je vast. Tot dan verloopt toegang via Fairwind, het programma dat Google een maand geleden startte met Gemini drie punt acht Flash Cyber. Het heeft meer dan zeshonderdvijftig partners, en zij mogen Argon alleen aan hun
3:05 beveiligingsteams geven en moeten bijhouden wie het gebruikt. Hacker News nam het goed op. Een commentator schreef: Gemini verslaat de beschuldigingen dat het geen model kan uitbrengen niet. Een ander voorspelde dat modellen vaporware worden, een reeks getallen op een tabel. Ondertussen heeft Netlify Edge Functions opnieuw opgebouwd, die ongeveer een miljard
Netlify Edge Functions: V8 isolates naar microVM's, ongeveer 5x sneller
3:23 keer per dag draaien. Ze zijn verhuisd van V8-isolaten in een gehoste dienst naar Firecracker microVM's binnen Netlify's eigen netwerk, en een warme aanroep daalde van maximaal veertig milliseconden naar ongeveer zes. Hacker News wees erop dat Cloudflare Workers ook V8-isolaten zijn en veel sneller draaien, dus het grootste deel van de winst lijkt erop dat de aanvraag het gebouw niet meer verlaat. Een andere commentator maakte zich zorgen over de snapshots, omdat gekloonde microVM's willekeurige getalstatus kunnen delen, wat de manier is waarop je twee identieke UUID's krijgt.
3:50 Een koude start, wanneer een regio je functie nog nooit heeft gezien, treft ongeveer één procent van de aanroepen en duurt ongeveer negen milliseconden. En de microVM zelf is Firecracker, dat Amazon bouwde voor Lambda, dus een commentator suggereert dat je dat moet onthouden de volgende keer dat je AWS vervloekt.
De twee rijen die Google's bericht nooit noemt
4:06 Nu, die twee rijen. Op FrontierSWE en Terminal-bench, twee coderingstests die de tekst van het bericht nooit noemt, komt Argon als laatste van de vier, op Google's eigen tabel. Terminal-bench plaatst een agent in een echte shell, wat de manier is waarop de meesten van ons het zouden gebruiken, en Opus leidt het met negen punten. Als je dit liever leest dan mij hoort zeggen, de diff landt elke ochtend in je inbox, gratis op the daily diff dot dev, link hieronder.
Oordeel: NEEDS REVIEW, de dag dat ik het kan noemen
4:29 Dus, het oordeel van vandaag over Gemini vier Argon. NEEDS REVIEW. Ik zou het zo stempelen omdat het onafhankelijke cijfer dat ik vond het op de tweede plaats heeft, en de twee coderingsrijen waar ik om geef, hebben het als laatste, dus ik zal het goed beoordelen de dag dat ik het kan noemen. Abonneer, druk op de bel, en vertel me in de reacties of je het anders zou hebben gestempeld. En dat is de diff voor vandaag. Ik ben Niko van Axrisi. Verantwoord samenvoegen.
Bronnen
- Googleblog.google
- Hacker Newsnews.ycombinator.com
- Fairwind Programdeepmind.google
- Artificial Analysisartificialanalysis.ai
- Sundar Pichaix.com
- Demis Hassabisx.com
- Google completes acquisition of Wizcloud.google.com
- Netlifywww.netlify.com
- Hacker Newsnews.ycombinator.com



