Gemini 4 Argon — найкраща модель Google. Ви поки що не можете її використовувати.
Google анонсувала Gemini 4 Argon, свою нову передову модель, і тільки довірені кіберзахисники можуть її використовувати.
Google анонсувала Gemini 4 Argon, свою нову передову модель, і тільки довірені кіберзахисники можуть її використовувати. Ось що показує власна 19-рядкова таблиця тестів Google, що виміряв незалежний лідерборд, і коли розробники можуть отримати до неї доступ. Вирок: ПОТРЕБУЄ ПЕРЕВІРКИ.
Читати письмову версію (англійською) ↗
Що охоплює це відео
- Gemini 4 Argon: мільйон вихідних токенів, $2 вхідних, і ви не можете її використовувати
- Всередині Google: агенти Argon переносять C++ на Rust
- Власна таблиця Google: Argon лідирує в 13 з 19 рядків
- Кібер-пропозиція: патчі самостійно, без захисних механізмів для оборонців
- Зовнішній показник: Artificial Analysis каже 53, Opus 5.5 має 58
Перекладена стенограма
Перекладено з оригінальної англійської розповіді. Доступне аудіо та субтитри контролюються YouTube.
Gemini 4 Argon: мільйон вихідних токенів, $2 вхідних, і ви не можете її використовувати
0:00 Ви могли б подумати, що запуск означає, що ви отримуєте модель. Google щойно запустив Gemini 4 Argon, і якщо ви не довірений кібер- захисник, ви не можете її торкнутися. У цьому відео: що показує таблиця Google? Що виміряли зовнішні тестувальники? І коли ви її отримаєте? Ви, мабуть, вже бачили рекламні відео. Натомість я прочитав таблицю тестів, і два рядки в ній так і не потрапили до
0:20 тексту допису. Я повернуся до них наприкінці. Сьогодні четвер, перше жовтня, і це The Daily Diff. Дві історії сьогодні, і велика — це Gemini 4 Argon, яку Google називає своєю наступною епохою передового інтелекту. Одна відповідь тепер може сягати мільйона токенів, порівняно з шістдесятьма чотирма тисячами, що становить кілька романів в одній відповіді. Ціна запуску — два долари за мільйон токенів на вхід і десять на вихід. Це саме те, що OpenAI стягує за GPT 6.1 Sol,
0:48 модель, яку я розглядав учора, і Sol — це та, яку ви насправді можете купити. Всередині Google вона вже працює.
Всередині Google: агенти Argon переносять C++ на Rust
0:54 Google каже, що агенти Argon переносять C і C++ на Rust по всій компанії, до восьмисот тисяч рядків для ядра Fuchsia. На Hacker News один інженер пригадав, як команда C++ Google навіть не розглядала Rust і замість цього дивилася на Carbon. Тепер модель робить міграцію, про яку вони сперечалися.
Власна таблиця Google: Argon лідирує в 13 з 19 рядків
1:12 Тепер таблиця. Google ставить Argon поруч з GPT 6 Astra, Claude Fable та Claude Opus у дев'ятнадцяти рядках, і Argon виходить на перше місце в тринадцяти з них. Заголовок — DeepSWE, довгий бенчмарк кодування, на сімдесяти восьми відсотках, приблизно на чотири пункти вище. Найдивовижніша перемога — у розробці юридичних документів, де Argon набирає двадцять відсотків, а інші залишаються в однозначних цифрах. Це найкраща оцінка на тесті, який усі провалюють, і на бенчмарках зі слайдів,
1:38 які неперевершені, це має значення.
Кібер-пропозиція: патчі самостійно, без захисних механізмів для оборонців
1:41 Справжня пропозиція — безпека. Google каже, що Argon може самостійно знаходити, перевіряти та виправляти критичні вразливості, і що довірені захисники отримують її без кібер-захисних механізмів. Wiz використала її, щоб знайти критичну діру в програмному забезпеченні лікарні, яку попередні моделі пропустили. Одна маленька деталь. Wiz належить Google, оскільки угода на тридцять два мільярди доларів була закрита в березні. Отже, тест на хакерство за принципом чорного ящика в дописі — це компанія Google, яка оцінює модель Google. І в лідерборді з виправлення помилок три моделі поділяють шістдесят вісім
2:10 відсотків, а стовпець на крайньому лівому краю належить Grok. Отже, що виміряли зовнішні тестувальники?
Зовнішній показник: Artificial Analysis каже 53, Opus 5.5 має 58
2:15 Незалежний лідерборд, який я зміг знайти з Argon, це Artificial Analysis. Він оцінює Argon на п'ятдесят три за своїм індексом інтелекту, на високій позначці, що зрівнює його з Astra та Fable. Claude Opus 5.5 випереджає на п'ять пунктів. Тиждень тому я казав вам, що Opus зайняв там перше місце, і він все ще його утримує. Справедлива частина для Google — це рахунок. Запуск Argon коштує близько двох доларів за завдання за цим індексом, приблизно третину від вартості Opus.
Коли ви її отримаєте: «Тож тримайтеся»
2:42 І коли ви її отримаєте? Google не називає дату. Допис обіцяє доступ для розробників, підприємств і споживачів якомога швидше, спочатку для платних клієнтів API. Допис Сундара Пічаї на X каже: «Тож тримайтеся» (so hold tight). До того часу доступ здійснюється через Fairwind, програму, яку Google запустила місяць тому з Gemini 3.8 Flash Cyber. Вона має понад шістсот п'ятдесят партнерів, і вони можуть передавати Argon лише своїм
3:05 командам безпеки та повинні відстежувати, хто її використовує. Hacker News сприйняли це добре. Один коментатор написав: «Gemini не спростовує звинувачення в тому, що не може випустити модель». Інший передбачив, що моделі перетворюються на vaporware, купу чисел у таблиці. Тим часом Netlify перебудувала Edge Functions, які виконуються близько мільярда
Netlify Edge Functions: від ізолятів V8 до мікро-ВМ, приблизно в 5 разів швидше
3:23 разів на день. Вони перейшли від ізолятів V8 у розміщеному сервісі до мікро-ВМ Firecracker у власній мережі Netlify, і час теплого виклику зменшився з сорока мілісекунд до близько шести. Hacker News зазначив, що Cloudflare Workers також є ізолятами V8 і працюють набагато швидше, тому більша частина переваги виглядає так, ніби запит більше не виходить за межі будівлі. Інший коментатор турбувався про знімки, оскільки клоновані мікро-ВМ можуть спільно використовувати стан генератора випадкових чисел, саме так ви отримуєте два ідентичних UUID.
3:50 Холодний старт, коли регіон ніколи не бачив вашу функцію, відбувається приблизно в одному відсотку викликів і займає близько дев'яти мілісекунд. Сама мікро-ВМ — це Firecracker, яку Amazon створила для Lambda, тому один коментатор пропонує пам'ятати про це наступного разу, коли ви будете лаяти AWS.
Два рядки, які ніколи не згадуються в дописі Google
4:06 Тепер, ті два рядки. На FrontierSWE та Terminal-bench, двох тестах кодування, які ніколи не згадуються в тексті допису, Argon посідає останнє місце з чотирьох, у власній таблиці Google. Terminal-bench розміщує агента в реальній оболонці, саме так більшість із нас використовували б його, і Opus випереджає його на дев'ять пунктів. Якщо ви хочете це прочитати, а не чути від мене, The Daily Diff приходить на вашу поштову скриньку щоранку, безкоштовно на the daily diff dot dev, посилання нижче.
Вирок: ПОТРЕБУЄ ПЕРЕВІРКИ, день, коли я зможу це назвати
4:29 Отже, сьогоднішній вердикт щодо Gemini 4 Argon. ПОТРЕБУЄ ПЕРЕВІРКИ. Я б поставив такий штамп, тому що незалежний показник, який я знайшов, ставить його на друге місце, а два рядки кодування, які мене цікавлять, мають його останнім, тому я перегляну його належним чином того дня, коли зможу його викликати. Підпишіться, натисніть дзвіночок і скажіть мені в коментарях, чи поставили б ви інший штамп. І це The Daily Diff на сьогодні. Я Ніко з Axrisi. Об'єднуйте відповідально.
Джерела
- Googleblog.google
- Hacker Newsnews.ycombinator.com
- Fairwind Programdeepmind.google
- Artificial Analysisartificialanalysis.ai
- Sundar Pichaix.com
- Demis Hassabisx.com
- Google completes acquisition of Wizcloud.google.com
- Netlifywww.netlify.com
- Hacker Newsnews.ycombinator.com



