+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Gemini 4 Argon е най-добрият модел на Google. Все още не можете да го използвате.

Google обяви Gemini 4 Argon, своя нов граничен модел, и само доверени киберзащитници могат да го използват.

Google обяви Gemini 4 Argon, своя нов граничен модел, и само доверени киберзащитници могат да го използват. Ето какво показва собствената 19-редова бенчмарк таблица на Google, какво измери независимата класация и кога разработчиците може да го получат. Присъда: НЕОБХОДИМ Е ПРЕГЛЕД.

Прочетете писменото издание (английски) ↗

Какво обхваща този видеоклип

  • Gemini 4 Argon: един милион изходни токени, $2 вход и не можете да го използвате
  • Вътре в Google: агенти на Argon прехвърлят C++ към Rust
  • Собствената таблица на Google: Argon оглавява 13 от 19 реда
  • Кибер предложението: поправя сам, без предпазни мерки за защитници
  • Външното число: Artificial Analysis казва 53, Opus 5.5 има 58

Преведен препис

Преведено от оригиналния английски разказ. Наличните аудио и субтитри се контролират от YouTube.

Gemini 4 Argon: един милион изходни токени, $2 вход и не можете да го използвате

0:00 Бихте си помислили, че стартирането означава, че получавате модела. Google току-що пусна Gemini four Argon и освен ако не сте доверен кибер защитник, не можете да го докоснете. В това видео: какво показва таблицата на Google? Какво измериха външните тестери? И кога ще го получите? Вероятно вече сте виждали рекламните видеоклипове. Аз прочетох таблицата с бенчмаркове вместо това, и два реда от нея никога не попаднаха в

0:20 текста на публикацията. Ще стигна до тях накрая. Четвъртък е, първи октомври, и това е The Daily Diff. Две истории днес, а голямата е Gemini four Argon, който Google нарича своята следваща ера на гранична интелигентност. Един отговор вече може да достигне до един милион токени, от шейсет и четири хиляди, което са няколко романа в един отговор. Стартовата цена е два долара на милион токени вход и десет изход. Това е точно това, което OpenAI таксува за GPT six point one Sol,

0:48 моделът, който покрих вчера, а Sol е този, който всъщност можете да купите. Вътре в Google, той вече работи.

Вътре в Google: агенти на Argon прехвърлят C++ към Rust

0:54 Google казва, че агентите на Argon пренасят C и C++ към Rust в цялата компания, до осемстотин хиляди реда за ядрото на Fuchsia. В Hacker News един инженер си спомни, когато екипът на Google за C++ дори нямаше да разгледа Rust и вместо това погледна Carbon. Сега модел прави миграцията, за която те спориха.

Собствената таблица на Google: Argon оглавява 13 от 19 реда

1:12 Сега таблицата. Google поставя Argon до GPT six Astra, Claude Fable и Claude Opus на деветнадесет реда, и Argon излиза начело в тринадесет от тях. Заглавието е DeepSWE, дълъг бенчмарк за кодиране, на седемдесет и осем процента, около четири точки по-добър. Най-странната победа е в правното изготвяне, където Argon постига двадесет процента, а другите остават в едноцифрени числа. Това е най-добрата оценка на тест, на който всички се провалят, и на слайд-дек

1:38 бенчмарковете, които са непобедени, това е важно.

Кибер предложението: поправя сам, без предпазни мерки за защитници

1:41 Истинското предложение е сигурността. Google казва, че Argon може сам да намира, валидира и поправя критични уязвимости, и че доверените защитници го получават без киберзащитни мерки. Wiz го използва, за да открие критична дупка в болничен софтуер, която по-ранните модели бяха пропуснали. Един малък детайл. Wiz принадлежи на Google, откакто сделка за тридесет и два милиарда долара беше приключена през март. Така че тестът за хакване на черна кутия в публикацията е компания на Google, оценяваща модел на Google. И в класацията за поправка на бъгове, три модела си поделят шейсет и осем

2:10 процента, а лентата в най-ляво принадлежи на Grok. И така, какво измериха външните тестери?

Външното число: Artificial Analysis казва 53, Opus 5.5 има 58

2:15 Независимата класация, която можах да намеря с Argon в нея, е Artificial Analysis. Тя оценява Argon с петдесет и три по своя индекс за интелигентност, при висока настройка, което го изравнява с Astra и Fable. Claude Opus five point five е пет точки напред. Преди седмица ви казах, че Opus е заел първото място там, и все още го държи. Справедливата част за Google е сметката. Едно изпълнение на Argon струва около два долара на задача по този индекс, грубо една трета от цената на Opus.

Кога ще го получите: „Затова дръжте здраво“

2:42 И кога ще го получите? Google няма да даде дата. Публикацията обещава достъп за разработчици, предприятия и потребители възможно най-скоро, като първи ще са клиентите на платения API. Публикацията на Сундар Пичай в X казва: „Затова дръжте здраво“. Дотогава достъпът преминава през Fairwind, програмата, която Google стартира преди месец с Gemini three point eight Flash Cyber. Има над шестстотин и петдесет партньори и те могат да предадат Argon само на своите

3:05 екипи по сигурността и трябва да следят кой го използва. Hacker News го прие добре. Един коментатор написа: „Gemini не побеждава твърденията, че не може да пусне модел.“ Друг предсказа, че моделите се превръщат във vaporware, куп числа в таблица. Междувременно Netlify преработи Edge Functions, които се изпълняват около един милиард

Netlify Edge Functions: V8 isolates към microVMs, около 5 пъти по-бързи

3:23 пъти на ден. Те преминаха от V8 изолати в хоствана услуга към Firecracker microVMs в собствената мрежа на Netlify, и топлото повикване спадна от до четиридесет милисекунди до около шест. Hacker News посочи, че Cloudflare Workers също са V8 изолати и работят много по-бързо, така че по-голямата част от печалбата изглежда е, че заявката вече не напуска сградата. Друг коментатор се притесни за снимките, защото клонираните microVMs могат да споделят състоянието на произволни числа, което е начинът да получите два идентични UUID.

3:50 Студен старт, когато даден регион никога не е виждал вашата функция, засяга около един процент от обажданията и отнема около девет милисекунди. Самата microVM е Firecracker, която Amazon създаде за Lambda, така че един коментатор предлага да си спомните това следващия път, когато проклинате AWS.

Двата реда, които публикацията на Google никога не споменава

4:06 Сега, тези два реда. На FrontierSWE и Terminal-bench, два теста за кодиране, които текстът на публикацията никога не споменава, Argon е последен от четири, в собствената таблица на Google. Terminal-bench поставя агент в истински шел, което е начинът, по който повечето от нас биха го използвали, и Opus го води с девет точки. Ако предпочитате да прочетете това, отколкото да ме чуете да го казвам, diff-ът пристига във вашата пощенска кутия всяка сутрин, безплатно на the daily diff dot dev, линк по-долу.

Присъда: НЕОБХОДИМ Е ПРЕГЛЕД, в деня, когато мога да го нарека

4:29 И така, днешната присъда за Gemini four Argon. НЕОБХОДИМ Е ПРЕГЛЕД. Бих го отбелязал по този начин, защото независимото число, което намерих, го поставя на второ място, а двата реда за кодиране, които ме интересуват, го поставят последен, така че ще го прегледам правилно в деня, когато мога да го изпробвам. Абонирайте се, натиснете камбанката и ми кажете в коментарите дали бихте го отбелязали по различен начин. И това е diff-ът за днес. Аз съм Нико от Axrisi. Обединявайте отговорно.

Източници

  1. Googleblog.google
  2. Hacker Newsnews.ycombinator.com
  3. Fairwind Programdeepmind.google
  4. Artificial Analysisartificialanalysis.ai
  5. Sundar Pichaix.com
  6. Demis Hassabisx.com
  7. Google completes acquisition of Wizcloud.google.com
  8. Netlifywww.netlify.com
  9. Hacker Newsnews.ycombinator.com

Свързани видеоклипове