Gemini 4 Argon 是 Google 最好的模型。您還不能使用它。
Google 宣布推出其新的尖端模型 Gemini 4 Argon,目前只有值得信賴的網路防禦者可以使用。
Google 宣布推出其新的尖端模型 Gemini 4 Argon,目前只有值得信賴的網路防禦者可以使用。以下是 Google 自己的 19 行基準測試表所顯示的內容,獨立排行榜的測量結果,以及開發人員何時可能獲得它。判決:NEEDS REVIEW。
本影片重點
- Gemini 4 Argon:一百萬個輸出代幣,兩個美元的輸入,而且您還不能使用它
- Google 內部:Argon 代理將 C++ 移植到 Rust
- Google 自己的表格:Argon 在 19 行中領先 13 行
- 網路推廣:自行修補,防禦者沒有防護措施
- 外部數據:Artificial Analysis 稱 53,Opus 5.5 為 58
翻譯文字稿
譯自英文原版旁白。可用的音訊和字幕由 YouTube 控制。
Gemini 4 Argon:一百萬個輸出代幣,兩個美元的輸入,而且您還不能使用它
0:00 您可能會認為發布就代表您能獲得該模型。 Google 剛剛發布了 Gemini 4 Argon,除非您是值得信賴的網路 防禦者,否則您無法觸及它。 在本影片中:Google 的表格顯示了什麼? 外部測試人員測量了什麼? 以及您何時能獲得它? 您可能已經看過炒作影片了。 我反而閱讀了基準測試表,其中有兩行從未出現在
0:20 貼文內容中。我會在最後提到它們。 今天是 10 月 1 日星期四,這裡是 The Daily Diff。 今天有兩個故事,其中一個大新聞是 Gemini 4 Argon, Google 稱之為其「下一個時代的尖端智能」。 一個回答現在可以達到一百萬個代幣,從六萬四千個代幣增加, 這相當於單一回復中包含數本小說。 發布價格是每百萬個輸入代幣兩美元,輸出代幣十美元。 這與 OpenAI 對 GPT 6.1 Sol 的收費完全相同,
0:48 我昨天介紹的模型,而 Sol 是您可以實際購買的模型。 在 Google 內部,它已經開始運作。
Google 內部:Argon 代理將 C++ 移植到 Rust
0:54 Google 表示 Argon 代理正在將 C 和 C++ 移植到 Rust,遍及整個 公司,Fuchsia 核心多達八十萬行程式碼。 在 Hacker News 上,一位工程師回憶起 Google 的 C++ 團隊甚至不願 考慮 Rust,反而選擇了 Carbon。 現在,一個模型正在進行他們曾經爭論的遷移工作。
Google 自己的表格:Argon 在 19 行中領先 13 行
1:12 現在來看表格。 Google 將 Argon 與 GPT 6 Astra、Claude Fable 和 Claude Opus 並列在 19 行中,Argon 在其中 13 行中脫穎而出。 頭條是 DeepSWE,一個長編碼基準測試,以 78% 的成績領先, 領先約四個百分點。 最奇怪的勝利是法律草擬,Argon 獲得 20% 的分數,而 其他模型則保持在個位數。 這是所有人不及格的測試中最高的成績,而在簡報
1:38 基準測試中,這是無可匹敵的,這才是關鍵。
網路推廣:自行修補,防禦者沒有防護措施
1:41 真正的賣點是安全性。 Google 表示 Argon 可以自行發現、驗證和修補關鍵漏洞, 並且值得信賴的防禦者可以在沒有網路防護措施的情況下使用它。 Wiz 使用它在醫院軟體中發現了一個關鍵漏洞,這是早期模型 所遺漏的。一個小細節。 Wiz 屬於 Google,因為一項價值 320 億美元的交易於三月完成。 因此,貼文中的黑箱駭客測試是由 Google 公司評估 Google 模型。而在錯誤修復排行榜上,三個模型分享了 68%
2:10 的成績,最左邊的條形圖屬於 Grok。 那麼外部測試人員測量了什麼?
外部數據:Artificial Analysis 稱 53,Opus 5.5 為 58
2:15 我能找到的帶有 Argon 的獨立排行榜是 Artificial Analysis。它在其智能指數上給 Argon 打了 53 分, 在高設定下,這使其與 Astra 和 Fable 並列。 Claude Opus 5.5 領先五分。 一周前我告訴您 Opus 在那裡獲得了最高點,而且它仍然保持著。 對 Google 來說公平的部分是費用。 Argon 在該指數上每次任務的運行成本約為兩美元, 大約是 Opus 成本的三分之一。
您何時能獲得它:「所以請耐心等待」
2:42 那麼您何時能獲得它? Google 不會給出日期。 該貼文承諾盡快向開發人員、企業和消費者開放, 付費 API 客戶優先。 Sundar Pichai 在 X 上的貼文說:「所以請耐心等待。」 在此之前,訪問權限通過 Fairwind 運行,這是 Google 一個月前開始的 計劃,使用 Gemini 3.8 Flash Cyber。 它有超過 650 個合作夥伴,他們可能只會將 Argon 交給他們的
3:05 安全團隊,並且必須追蹤誰在使用它。 Hacker News 對此反應良好。 一位評論者寫道:「Gemini 沒能擺脫無法發布模型的指控。」 另一位預測模型會變成虛假產品,只是一堆表格上的數字。 同時,Netlify 重建了每天運行約十億次的 Edge Functions。
Netlify Edge Functions:V8 isolates 到 microVMs,速度約快 5 倍
3:23 它們從託管服務中的 V8 isolates 轉移到 Netlify 自己網路中的 Firecracker microVMs, 熱呼叫從最多 40 毫秒下降到 約 6 毫秒。Hacker News 指出 Cloudflare Workers 也是 V8 isolates 並且運行速度快得多,所以大部分的勝利看起來是請求不再離開 建築物。另一位評論者擔心快照, 因為複製的 microVMs 可以共享隨機數狀態, 這就是您如何獲得兩個相同的 UUID 的方式。 冷啟動,當一個區域從未見過您的功能時,
3:50 約佔呼叫的 1%,耗時約 9 毫秒。 而 microVM 本身是 Firecracker,這是 Amazon 為 Lambda 構建的, 所以一位評論者建議您下次咒罵 AWS 時記住這一點。 現在,那兩行。
Google 貼文從未提及的兩行
4:06 在 FrontierSWE 和 Terminal-bench 這兩個貼文內容從未提及的編碼測試中, Argon 在 Google 自己的表格中,在四個模型中排名最後。 Terminal-bench 將代理放入實際的 shell 中,這是我們大多數人會使用它的方式, Opus 以九分領先。 如果您寧願閱讀這份內容而不是聽我說,The Daily Diff 每天早上都會免費寄送到您的收件箱, 網址是 thedailydiff.dev,連結在下方。 所以,今天對 Gemini 4 Argon 的判決是。
判決:NEEDS REVIEW,等到我能實際使用它那天
4:29 NEEDS REVIEW。我會這樣標記它,因為我找到的獨立數據顯示它並列第二, 而我關心的兩行編碼測試顯示它排名最後, 所以等到我能實際使用它那天,我會好好地審查它。 訂閱,點擊小鈴鐺,並在評論中告訴我您是否會給出不同的標記。 這就是今天的 The Daily Diff。 我是 Axrisi 的 Niko。 負責任地合併。 SHIP IT。
來源
- Googleblog.google
- Hacker Newsnews.ycombinator.com
- Fairwind Programdeepmind.google
- Artificial Analysisartificialanalysis.ai
- Sundar Pichaix.com
- Demis Hassabisx.com
- Google completes acquisition of Wizcloud.google.com
- Netlifywww.netlify.com
- Hacker Newsnews.ycombinator.com



