Gemini 4 Argon 是 Google 最好的模型。你还不能使用它。
Google 发布了其新的前沿模型 Gemini 4 Argon,目前只有受信任的网络防御者才能使用。
Google 发布了其新的前沿模型 Gemini 4 Argon,目前只有受信任的网络防御者才能使用。以下是 Google 自己的 19 行基准测试表格显示的内容、独立排行榜的测量结果,以及开发者何时可能获得它。结论:NEEDS REVIEW。
本视频涵盖的内容
- Gemini 4 Argon:一百万个输出令牌,输入 2 美元,但你还不能用
- Google 内部:Argon 代理将 C++ 移植到 Rust
- Google 自己的表格:Argon 在 19 行中独占 13 行鳌头
- 网络宣传:可自行打补丁,防御者无护栏
- 外部数据:Artificial Analysis 称 53,Opus 5.5 为 58
翻译的文字记录
译自英文原版旁白。可用音频和字幕由 YouTube 控制。
Gemini 4 Argon:一百万个输出令牌,输入 2 美元,但你还不能用
0:00 你可能会认为发布就意味着你可以使用该模型。 Google 刚刚发布了 Gemini 4 Argon,除非你是一个受信任的网络 防御者,否则你无法使用它。 在本视频中:Google 的表格显示了什么? 外部测试人员测量了什么? 你何时能获得它? 你可能已经看过了那些炒作视频。 我反而阅读了基准测试表格,其中有两行从未出现在该
0:20 帖子的正文中。我将在最后讨论它们。 今天是 10 月 1 日星期四,这里是 The Daily Diff。 今天有两个故事,重头戏是 Gemini 4 Argon, Google 称之为前沿智能的新纪元。 一个答案现在可以达到一百万个令牌,高于六万四千个, 这相当于一次回复中包含了数部小说。 发布价格是每百万个输入令牌 2 美元,输出 10 美元。 这与 OpenAI 为我昨天介绍的 GPT 6.1 Sol 收费完全相同,
0:48 而 Sol 是你可以实际购买的模型。 在 Google 内部,它已经投入使用了。
Google 内部:Argon 代理将 C++ 移植到 Rust
0:54 Google 表示 Argon 代理正在公司范围内将 C 和 C++ 移植到 Rust, Fuchsia 内核多达八十万行。 在 Hacker News 上,一位工程师回忆起 Google 的 C++ 团队甚至不会 考虑 Rust,而是选择了 Carbon。 现在,一个模型正在完成他们争论不休的迁移。
Google 自己的表格:Argon 在 19 行中独占 13 行鳌头
1:12 现在是表格部分。 Google 将 Argon 与 GPT 6 Astra、Claude Fable 和 Claude Opus 在 19 行中进行比较,Argon 在其中 13 行中拔得头筹。 标题是 DeepSWE,一个长时间的编码基准测试,达到 78%, 领先约 4 个百分点。 最奇怪的胜利是法律起草,Argon 获得 20%,而 其他模型则保持个位数。 这是所有人都不及格的测试中最好的成绩,在幻灯片
1:38 基准测试中,这是无可匹敌的,这很重要。
网络宣传:可自行打补丁,防御者无护栏
1:41 真正的卖点是安全性。 Google 表示 Argon 可以自行发现、验证和修补关键漏洞, 并且受信任的防御者可以在没有网络护栏的情况下使用它。 Wiz 使用它在一个医院软件中发现了一个早期模型 遗漏的关键漏洞。一个小细节。 Wiz 属于 Google,因为一笔 320 亿美元的交易已于 3 月达成。 因此,帖子中的黑盒黑客测试是 Google 公司对 Google 模型进行评级。在 bug 修复排行榜上,三个模型分享了 68%
2:10 的份额,最左边的条形图属于 Grok。 那么外部测试人员测量了什么?
外部数据:Artificial Analysis 称 53,Opus 5.5 为 58
2:15 我能找到的包含 Argon 的独立排行榜是 Artificial Analysis。它在其智能指数上对 Argon 评分 53 分, 在最高设置下,这与 Astra 和 Fable 持平。 Claude Opus 5.5 领先 5 分。 一周前我告诉过你 Opus 在那里名列榜首,它仍然保持着。 对于 Google 来说,公平的部分是账单。 在该指数上,Argon 每次运行任务的成本约为 2 美元, 大约是 Opus 成本的三分之一。
你何时能用上它:“所以请耐心等待”
2:42 你何时能获得它? Google 不会给出具体日期。 该帖子承诺将尽快向开发者、企业和消费者提供访问权限, 付费 API 客户优先。 Sundar Pichai 在 X 上的帖子写道,“所以请耐心等待”。 在此之前,访问权限通过 Fairwind 运行,这是 Google 一个月前 与 Gemini 3.8 Flash Cyber 合作启动的项目。 它有超过 650 个合作伙伴,他们可能只将 Argon 交给他们的
3:05 安全团队,并且必须跟踪谁使用了它。 Hacker News 对此反应良好。 一位评论者写道:“Gemini 未能摆脱无法发布模型的指控。” 另一个人预测模型会变成“空头产品”,表格上的一堆数字。 与此同时,Netlify 重建了 Edge Functions,每天运行约十亿次。
Netlify Edge Functions:V8 isolates 到 microVMs,速度约快 5 倍
3:23 他们从托管服务中的 V8 isolates 迁移到 Netlify 自己网络中的 Firecracker microVMs, 并且热调用时间从最高 40 毫秒下降到大约 6 毫秒。 Hacker News 指出 Cloudflare Workers 也是 V8 isolates 并且运行速度快得多,所以大部分的提升看起来是请求不再离开 机房。另一位评论者担心快照问题, 因为克隆的 microVMs 可以共享随机数状态, 这就是你得到两个相同 UUID 的原因。 冷启动,当一个区域从未见过你的函数时,
3:50 会影响大约 1% 的调用,大约需要 9 毫秒。 而 microVM 本身是 Firecracker,这是 Amazon 为 Lambda 构建的, 所以一位评论者建议你下次诅咒 AWS 时记住这一点。 现在,那两行。
Google 帖子中从未提及的两行
4:06 在 FrontierSWE 和 Terminal-bench 这两个帖子正文从未提及的编码测试中, Argon 在 Google 自己的表格中排名倒数第一,在四款模型中。 Terminal-bench 将代理放入真实的 shell 中,这是我们大多数人使用它的方式, Opus 领先它 9 个百分点。 如果你宁愿阅读而不是听我讲,diff 每天早上都会免费发送到你的收件箱, 网址是 daily diff dot dev,链接在下方。 所以,今天对 Gemini 4 Argon 的结论是。
结论:NEEDS REVIEW,等我能真正使用它时再评价
4:29 NEEDS REVIEW。我会这样标记它,因为我找到的独立数据显示它并列第二, 而我关心的两行编码测试中它排名最后, 所以我会在我能真正使用它的时候进行适当的评估。 订阅,点击小铃铛,在评论中告诉我你是否会给出不同的评价。 这就是今天的 diff。 我是来自 Axrisi 的 Niko。 负责任地合并。 SHIP IT。
来源
- Googleblog.google
- Hacker Newsnews.ycombinator.com
- Fairwind Programdeepmind.google
- Artificial Analysisartificialanalysis.ai
- Sundar Pichaix.com
- Demis Hassabisx.com
- Google completes acquisition of Wizcloud.google.com
- Netlifywww.netlify.com
- Hacker Newsnews.ycombinator.com



