Gemini 4 Argon 是 Google 最好的模型。你暫時還不能用它。
Google 宣佈推出其全新尖端模型 Gemini 4 Argon,目前只有受信任的網絡防禦者才能使用。
Google 宣佈推出其全新尖端模型 Gemini 4 Argon,目前只有受信任的網絡防禦者才能使用。以下是 Google 自己的 19 行基準測試表所顯示的結果、獨立排行榜的測量結果,以及開發人員何時才能獲得它。判決:NEEDS REVIEW。
本影片涵蓋的內容
- Gemini 4 Argon:百萬輸出代幣,2 美元輸入,但你還不能用它
- Google 內部:Argon 代理將 C++ 移植到 Rust
- Google 自己的表格:Argon 在 19 行中佔據 13 行榜首
- 網絡宣傳:自行修補,防禦者無護欄
- 外部數據:Artificial Analysis 稱 53,Opus 5.5 達到 58
翻譯的文字記錄
從英文原文旁白翻譯。可用的音頻和字幕由 YouTube 控制。
Gemini 4 Argon:百萬輸出代幣,2 美元輸入,但你還不能用它
0:00 你可能會認為發佈就意味著你可以拿到模型。 Google 剛剛發佈了 Gemini 4 Argon,除非你是受信任的網絡 防禦者,否則你還不能接觸它。 在這段影片中:Google 的表格顯示了什麼? 外部測試人員測量了什麼? 以及你何時能拿到它? 你可能已經看過那些炒作影片了。 我反而閱讀了基準測試表格,其中有兩行從未出現在
0:20 文章的文字中。我會在結尾提及它們。 今天是 10 月 1 日星期四,這裡是 The Daily Diff。 今天有兩個故事,其中一個大新聞是 Gemini 4 Argon, Google 稱之為其下一代尖端智慧。 一個答案現在可以運行到一百萬個代幣,從六萬四千個增加, 這相當於單次回覆中包含數本小說。 發佈價格為每百萬個輸入代幣 2 美元,輸出代幣 10 美元。 這與 OpenAI 對 GPT 6.1 Sol 的收費完全相同,
0:48 我昨天介紹的模型,而 Sol 是你真正可以購買的模型。 在 Google 內部,它已經投入使用。
Google 內部:Argon 代理將 C++ 移植到 Rust
0:54 Google 表示 Argon 代理正在將 C 和 C++ 移植到 Rust, 遍及整個公司,Fuchsia 核心有多達八十萬行程式碼。 在 Hacker News 上,一位工程師回憶起 Google 的 C++ 團隊甚至不曾 考慮 Rust,反而選擇了 Carbon。 現在,一個模型正在執行他們曾經爭論的遷移工作。
Google 自己的表格:Argon 在 19 行中佔據 13 行榜首
1:12 現在來看表格。 Google 將 Argon 與 GPT 6 Astra、Claude Fable 和 Claude Opus 在 19 行中進行比較,Argon 在其中 13 行中脫穎而出。 頭條新聞是 DeepSWE,一個長時間的編碼基準測試,達到了 78%, 領先約 4 個百分點。 最奇怪的勝利是法律草稿,Argon 得分 20%,而 其他模型則保持個位數。 這是在所有人都會失敗的測試中取得的最好成績,而且在幻燈片
1:38 基準測試中,這是無可匹敵的,這才是重要的。
網絡宣傳:自行修補,防禦者無護欄
1:41 真正的賣點是安全性。 Google 表示 Argon 可以自行發現、驗證和修補關鍵漏洞, 而且受信任的防禦者可以在沒有網絡護欄的情況下獲得它。 Wiz 用它在醫院軟體中發現了一個關鍵漏洞,這是早期模型 錯過的。一個小細節。 Wiz 屬於 Google,因為 320 億美元的交易於 3 月完成。 所以文章中的黑箱駭客測試是一個 Google 公司在評估一個 Google 模型。在漏洞修復排行榜上,三個模型共享 68%,
2:10 而最左邊的長條屬於 Grok。 那麼,外部測試人員測量了什麼?
外部數據:Artificial Analysis 稱 53,Opus 5.5 達到 58
2:15 我能找到帶有 Argon 的獨立排行榜是 Artificial Analysis。它在智慧指數上給 Argon 評分 53, 在「高」設定下,這與 Astra 和 Fable 並列。 Claude Opus 5.5 領先五分。 一週前我告訴你 Opus 在那裡名列前茅,它仍然保持著這個位置。 對 Google 而言公平的部分是費用。 Argon 在該指數上每次任務運行成本約 2 美元, 大約是 Opus 成本的三分之一。
你何時能拿到它:「所以請耐心等待」
2:42 那麼你何時能拿到它? Google 不會給出日期。 文章承諾開發人員、企業和消費者將盡快獲得訪問權限, 付費 API 客戶優先。 Sundar Pichai 在 X 上的文章寫道:「所以請耐心等待」。 在此之前,訪問權限通過 Fairwind 運行,這是 Google 一個月前 與 Gemini 3.8 Flash Cyber 啟動的計畫。 它有超過 650 個合作夥伴,他們可能只將 Argon 交給他們的
3:05 安全團隊,並且必須追蹤誰在使用它。 Hacker News 對此反應良好。 一位評論者寫道:「Gemini 沒能擺脫無法發佈模型的指控」。 另一位預測模型會變成虛假產品,只是一堆表格上的數字。 與此同時,Netlify 重建了 Edge Functions,每天運行約十億次。
Netlify Edge Functions:從 V8 isolates 到 microVMs,速度約快 5 倍
3:23 它們每天運行約十億次。 他們從託管服務中的 V8 isolates 轉移到 Netlify 自己網絡內的 Firecracker microVMs, 熱啟動時間從最長 40 毫秒降至約 6 毫秒。 Hacker News 指出 Cloudflare Workers 也是 V8 isolates, 並且運行速度更快,所以大部分的提升看起來像是請求不再 離開建築物。另一位評論者擔心快照, 因為克隆的 microVMs 可以共享隨機數狀態, 這就是你如何得到兩個相同的 UUID 的方法。
3:50 冷啟動,當一個區域從未見過你的函數時, 大約會佔據 1% 的呼叫,並需要大約 9 毫秒。 而 microVM 本身是 Firecracker,這是 Amazon 為 Lambda 構建的, 所以一位評論者建議你在下次咒罵 AWS 時記住這一點。
Google 文章中從未提及的兩行
4:06 現在,那兩行。 在 FrontierSWE 和 Terminal-bench 這兩個文章中從未提及的編碼測試中, Argon 在 Google 自己的表格中在四個模型中排名最後。 Terminal-bench 將代理放入真實的 shell 中,這是我們大多數人使用它的方式, Opus 以九分領先。 如果你寧願閱讀而不是聽我說,The Daily Diff 每天早上都會免費 發送到你的收件箱,網址在 thedailydiff.dev,連結如下。
判決:NEEDS REVIEW,等我能真正使用它那天
4:29 那麼,今天對 Gemini 4 Argon 的判決是。 NEEDS REVIEW。我會這樣標註它,因為我找到的獨立數據顯示它 並列第二,而我關心的兩行編碼測試中它排名最後, 所以我會在能夠實際使用它那天進行適當的審查。 訂閱,點擊鈴鐺,並在評論中告訴我你是否會 有不同的看法。這就是今天的 The Daily Diff。 我是 Axrisi 的 Niko。 Merge responsibly。
來源
- Googleblog.google
- Hacker Newsnews.ycombinator.com
- Fairwind Programdeepmind.google
- Artificial Analysisartificialanalysis.ai
- Sundar Pichaix.com
- Demis Hassabisx.com
- Google completes acquisition of Wizcloud.google.com
- Netlifywww.netlify.com
- Hacker Newsnews.ycombinator.com



