A Gemini 4 Argon a Google legjobb modellje. Még nem használható.
A Google bejelentette a Gemini 4 Argon nevű új, határmezsgyét jelentő modelljét, amelyet csak megbízható kibervédők használhatnak.
A Google bejelentette a Gemini 4 Argon nevű új, határmezsgyét jelentő modelljét, amelyet csak megbízható kibervédők használhatnak. Íme, mit mutat a Google saját 19 soros benchmark táblázata, mit mért a független ranglista, és mikor kaphatják meg a fejlesztők. Ítélet: NEEDS REVIEW.
Olvassa el az írott kiadást (angolul) ↗
Amit ez a videó tartalmaz
- Gemini 4 Argon: egymillió kimeneti token, 2 dollár bemenet, és nem használható
- A Google-n belül: Argon ügynökök portolják a C++-t Rust-ra
- A Google saját táblázata: Argon 13 sorból 19-et vezet
- A kiber-pitch: magától patchel, nincs korlátozás a védőknek
- A külső szám: az Artificial Analysis szerint 53, az Opus 5.5-nek 58
Lefordított átirat
Az eredeti angol narrációból fordítva. A rendelkezésre álló hangot és feliratokat a YouTube vezérli.
Gemini 4 Argon: egymillió kimeneti token, 2 dollár bemenet, és nem használható
0:00 Azt gondolnád, hogy egy bevezetés azt jelenti, hogy megkapod a modellt. A Google épp most indította el a Gemini négy Argont, és hacsak nem vagy egy megbízható kiber- védő, nem nyúlhatsz hozzá. Ebben a videóban: mit mutat a Google táblázata? Mit mértek a külső tesztelők? És mikor kapod meg? Valószínűleg már láttad a hype videókat. Én inkább a benchmark táblázatot olvastam el, és két sor benne soha nem került bele a
0:20 bejegyzés szövegébe. A végén térek rájuk. Csütörtök van, október elseje, és ez a The Daily Diff. Két történet ma, és a nagy a Gemini négy Argon, amit a Google a határmenti intelligencia következő korszakának nevez. Egy válasz most már egymillió tokenre terjedhet, a hatvannégyezer helyett, ami több regény egyetlen válaszban. Az induló ár két dollár egymillió token bemenetért és tíz kimenetért. Ez pontosan az, amit az OpenAI felszámol a GPT hat pont egy Solért,
0:48 a modellért, amit tegnap fedeztem fel, és a Sol az, amit ténylegesen meg is vehetsz. A Google-n belül már működik.
A Google-n belül: Argon ügynökök portolják a C++-t Rust-ra
0:54 A Google szerint az Argon ügynökök C és C++ nyelvet portolnak Rust-ra az egész vállalatnál, akár nyolcszázezer soron keresztül a Fuchsia kernel számára. A Hacker News-on egy mérnök emlékezett rá, amikor a Google C++ csapata még csak meg sem fontolta a Rustot, és inkább a Carbont nézte. Most egy modell végzi a migrációt, amiről vitatkoztak.
A Google saját táblázata: Argon 13 sorból 19-et vezet
1:12 Most a táblázat. A Google az Argont a GPT hat Astra, a Claude Fable és a Claude Opus mellé teszi tizenkilenc sorban, és az Argon tizenháromban áll az élen. A főcím a DeepSWE, egy hosszú kódolási benchmark, hetvennyolc százalékon, körülbelül négy ponttal előnyben. A legfurcsább győzelem a jogi tervezés, ahol az Argon húsz százalékot ér el, a többiek pedig egyszámjegyűek maradnak. Ez a legjobb osztályzat egy olyan teszten, amin mindenki elbukik, és a slide-deck
1:38 benchmarkingokon, amelyek veretlenek, ez számít.
A kiber-pitch: magától patchel, nincs korlátozás a védőknek
1:41 Az igazi előny a biztonság. A Google szerint az Argon önállóan képes kritikus sebezhetőségeket megtalálni, érvényesíteni és javítani, és a megbízható védők kibervédelmi korlátozások nélkül kapják meg. A Wiz felhasználta, hogy kritikus hibát találjon egy kórházi szoftverben, amit korábbi modellek kihagytak. Egy apró részlet. A Wiz a Google-hoz tartozik, mióta márciusban lezárult egy harminckét milliárd dolláros üzlet. Tehát a bejegyzésben szereplő fekete dobozos hackelési teszt egy Google cég, amely egy Google modellt értékel. És a hibajavítási ranglistán három modell osztozik hatvannyolc
2:10 százalékon, és a bal szélső sáv a Grokhoz tartozik. Mit mértek tehát a külső tesztelők?
A külső szám: az Artificial Analysis szerint 53, az Opus 5.5-nek 58
2:15 A független ranglista, amit az Argonnal találtam, az Artificial Analysis. Az Argon ötvenhármat kapott az intelligencia indexén, magas beállításon, ami az Astrával és a Fable-lel azonos szintre helyezi. A Claude Opus öt pont öt öt ponttal előtte van. Egy hete mondtam, hogy az Opus vette át ott a vezető helyet, és még mindig tartja. A Google számára a tisztességes rész a számla. Egy Argon futtatás körülbelül két dollárba kerül feladatonként ezen az indexen, nagyjából harmada annak, amennyibe az Opus kerül.
Mikor kapja meg: „Szóval tartson ki”
2:42 És mikor kapja meg? A Google nem ad meg dátumot. A bejegyzés a lehető leghamarabbi hozzáférést ígéri a fejlesztőknek, vállalatoknak és fogyasztóknak, először a fizetős API ügyfeleknek. Sundar Pichai X-en közzétett bejegyzése szerint, "szóval tartson ki". Addig is a hozzáférés a Fairwind programon keresztül történik, amelyet a Google egy hónapja indított a Gemini három pont nyolc Flash Cyberrel. Több mint hatszázötven partnere van, és ők csak a biztonsági csapatuknak adhatják át az Argont,
3:05 és nyomon kell követniük, ki használja. A Hacker News jól fogadta. Egy hozzászóló azt írta: "Gemini nem veri meg a 'nem tud modellt kiadni' vádakat". Egy másik azt jósolta, hogy a modellek "vaporware"-ré válnak, egy csomó számmá egy táblázaton. Eközben a Netlify újraépítette az Edge Functions-t, amelyek naponta körülbelül egymilliárdszor
Netlify Edge Functions: V8 izolátumok mikrogépekre, körülbelül 5-ször gyorsabb
3:23 futnak le. A V8 izolátumokról egy hosztolt szolgáltatásban Firecracker mikrogépekre tértek át a Netlify saját hálózatán belül, és egy meleg hívás akár negyven milliszekundumról körülbelül hatra csökkent. A Hacker News rámutatott, hogy a Cloudflare Workers is V8 izolátumok, és sokkal gyorsabban futnak, így a nyereség nagy része úgy tűnik, hogy a kérés már nem hagyja el az épületet. Egy másik hozzászóló aggódott a pillanatképek miatt, mert a klónozott mikrogépek megoszthatják a véletlenszám-állapotot, így kaphat két azonos UUID-t. A hidegindítás, amikor egy régió még soha nem látta a funkcióját,
3:50 körülbelül az hívások egy százalékát érinti, és körülbelül kilenc milliszekundumot vesz igénybe. És maga a mikrogép a Firecracker, amit az Amazon épített a Lambda számára, így egy hozzászóló azt javasolja, emlékezzen erre, amikor legközelebb átkozódik az AWS-re. Most az a két sor.
Az a két sor, amit a Google posztja soha nem említ
4:06 A FrontierSWE és Terminal-bench kódolási teszteken, melyeket a bejegyzés szövege soha nem említ, az Argon a négy közül utolsó, a Google saját táblázatában. A Terminal-bench egy ügynököt helyez egy valódi shellbe, ahogyan a legtöbben használnánk, és az Opus kilenc ponttal vezeti. Ha inkább elolvasná, mintsem hallaná tőlem, a "diff" minden reggel megérkezik a postaládájába, ingyenesen a daily diff dot dev címen, link lent. Tehát, a mai ítélet a Gemini négy Argonról.
Ítélet: NEEDS REVIEW, azon a napon, amikor hívhatom
4:29 NEEDS REVIEW. Így bélyegezném, mert a független szám, amit találtam, a második helyre teszi, és a két kódolási sor, ami érdekel, utolsónak mutatja, ezért rendesen átnézem azon a napon, amikor hívhatom. Iratkozz fel, nyomd meg a harangot, és írd meg kommentben, ha másképp bélyegezted volna meg. És ez a mai különbség. Niko vagyok az Axrisitől. Összevonás felelősségteljesen. SHIP IT.
Források
- Googleblog.google
- Hacker Newsnews.ycombinator.com
- Fairwind Programdeepmind.google
- Artificial Analysisartificialanalysis.ai
- Sundar Pichaix.com
- Demis Hassabisx.com
- Google completes acquisition of Wizcloud.google.com
- Netlifywww.netlify.com
- Hacker Newsnews.ycombinator.com



