谷歌刚刚发布了一个黑客模型。以下是差异。
谷歌发布了 Gemini 3.8 Flash(输入每百万 $0.75 / 输出每百万 $3.75,1月1日价格翻倍)和 Gemini 3.8 Flash Cyber——一个漏洞搜寻模型,只卖给 650 家经过审查的“值得信赖的防御者”——四小时后,Meta 发布了 Muse Spark 1.3,其中包含一个每百万 $0.10 的“贡献者”级别,折扣是你的会话记录。
谷歌发布了 Gemini 3.8 Flash(输入每百万 $0.75 / 输出每百万 $3.75,1月1日价格翻倍)和 Gemini 3.8 Flash Cyber——一个漏洞搜寻模型,只卖给 650 家经过审查的“值得信赖的防御者”——四小时后,Meta 发布了 Muse Spark 1.3,其中包含一个每百万 $0.10 的“贡献者”级别,折扣是你的会话记录。我们用两家公司都没有编写的基准测试来检查这两款模型。结论:SHIP IT。
本视频涵盖的内容
- 谷歌发布 Gemini 3.8 Flash + Flash Cyber(86.2% CyberGym,Fairwind Program)
- Meta 发布 Muse Spark 1.3:$1.25/$4.25,如果 Meta 可以用于训练则为 $0.10/$0.20
- 三个网站制作了 215,128 个虚假的“最佳软件”页面;Perplexity 引用了它们
翻译的文字记录
译自英文原版旁白。可用音频和字幕由 YouTube 控制。
0:00 谷歌今天发布了六周内的第三个 Flash 模型, 外加一个经过训练可以进行黑客攻击的版本,四小时后 Meta 发布了一个模型, 如果你允许扎克伯格阅读你的代码,每百万个 token 只需十美分, 因此人工智能价格战现在有了一个网络安全部门。 今天是星期三,差异很大。 Gemini 3.8 Flash 在 Hacker News 上获得了 1100 分, Muse Spark 1.3 多了近 700 分,介于两者之间, 一家研究机构发现了三个网站,发布了 21.5 万个
0:28 虚假的最佳软件页面,纯粹是为了让 Perplexity 引用它们。 今天还有:一篇恳求你坚持使用 Firefox 的帖子获得了 900 分 88 分,Mistral 关于选择退出训练的帮助页面获得了 近 500 分,主要来自发现主权选项的欧洲人 默认情况下会根据你的提示进行训练。 在此视频中:Gemini 3.8 Flash 的实际成本,谷歌的黑客模型 将只出售给 650 个合作伙伴,Meta 的十美分级别及其 实际收费,以及两家公司都没有编写的基准测试。
0:59 今天是 9 月 2 日星期三,这是 The Daily Diff。 Gemini 3.8 Flash 输入每百万 token 75 美分,输出三 75 美分,与三周前的 3.7 Flash 相同, 附注说明价格在 1 月 1 日翻倍, 这是一个额外步骤的免费试用。 在幻灯片基准测试中,它以不败的战绩在 HLE-Verified 上获得了 54.9% 的分数, X 表示它在 Terminal-Bench 上击败了 Sol 和 Opus 5, Logan Kilpatrick 在 DeepSWE 上发布了 73.7 分,这是唯一一个尚未被记住的长期
1:29 编码基准测试, 据称。Simon Willison 要求它用 HTML 制作一个很酷的东西,在 13 秒内获得了 一个粒子模拟,花费 1.8 美分, 以每秒 60 帧的速度运行,因为 60 被硬编码到 页面中。谷歌自己的帖子用一个我愿意裱起来的句子解释了这些收益:3.8 Flash 更努力地工作。它执行额外的推理步骤,迭代调用工具, 并且,引用的话说,可能会使用更多的 token,这在公司内部的意思是计费速度更快。 独立的 DeepSWE 委员会在这两方面都同意:Flash 获得 74 分
2:02 百分之,与 Opus 5 并列,但每项任务的成本只有其五分之一, 但它需要 166 个步骤和 14.3 万个输出 token 才能达到目标, 这比 Sol 花费的两倍还多。 Artificial Analysis 燃烧了 1.4 亿个 token 和 1078 美元 只为了给它评分。 每个 token 便宜,每个任务话多,第一个 token 在思考 12 秒后才出现。 秒的思考。 然后是有趣的一半。
2:23 Gemini 3.8 Flash Cyber 是同一个模型,但为了 引用的话说,“值得信赖的防御者”而放宽了安全限制,Sundar 表示它在 CyberGym 上达到了 86.2%, 这是一个用于自主发现漏洞的基准测试。 它也进行修补:在 CWE-Bench 上达到 47.2%,而领先的 前沿模型为 47.8%,Chrome 团队表示它比更大的商业模型产生了 2.6 倍的正确补丁, 并且谷歌的云研究人员用它在不到两小时内发现了一个关键漏洞, 这项工作通常需要数月,或者一个有动力的青少年。 或者一个有动机的青少年。
2:54 谷歌坚称它优先考虑修复而非利用, 这是客气的说法,意思是这个模型绝对可以通过 漏洞,他们只是要求它不要。 所以你不能拥有它。 访问通过新的 Fairwind Program:政府、 关键基础设施,以及 650 家经过审查的合作伙伴(强制性)。 双重因素。现在每个前沿实验室都拥有一个它们不会卖给你的黑客模型, 而本周它很便宜。
3:16 四小时后,Meta发布了Muse Spark 1.3,扎克伯格称之为前沿 性能,便宜得几乎不计成本,这是真的, 但有一个和门洛帕克一样大的星号。 普通端点是输入1.25美元,输出4.25美元, 比Gemini还贵。 贡献者端点是输入10美分,输出20美分, 缓存读取每美分五分之一,便宜多达二十倍, 而唯一的区别是一栏写着“用于改进我们的产品”。
3:40 所以折扣就是你的会话记录, 而且这一次没有人需要阅读 许可证,因为Meta把许可证写成了一份价目表。 热门评论:现在完全明白窃取我的令牌值多少钱了。 第二条评论想知道,多久会有人从一个 在贡献者提示上训练的模型中提取出AWS密钥。 在Meta自己的记分卡上,Spark 1.3在DeepSWE上获得75.4分, 高于Sol和Opus 5,Meta表示它使用的工具调用减少了20%,
4:06 令牌减少了25%,与1.2版本相比,这与 谷歌的押注正好相反,所以今天地球上最大的两家广告公司在 多说话是不是好事上存在分歧。 与此同时,Trellner Research向Perplexity询问了三百 八十个类别中最好的软件,并阅读了所有引用:59.8%来自 排名前十万之外的网站,维基百科 在七千五百次中被引用了三次, 三个拥有二十一万五千个生成购买指南的姊妹网站将其主页命名为“事实和基础页面”,
4:34 这是给爬虫看的,不是给你看的。 AI SEO战争已经开始,它的第一个武器是带有营销预算的正则表达式。 这周三的价格标签真多;如果你宁愿阅读而不是 听我讲,The Daily Diff每天早上都会发送到你的收件箱——在daily diff.dev免费,链接在下方。 所以,今天的判决:SHIP IT。 Gemini 3.8 Flash在谷歌没有编写的榜单上与Opus 5打平, 价格是五分之一。
5:00 只需阅读令牌账单,并阅读Meta的列标题。 这就是今天的The Daily Diff。 我是Axrisi的Niko。 负责任地合并。 负责任地合并。
来源
- Introducing Gemini 3.8 Flash and 3.8 Flash Cyberblog.google
- Fairwind Programblog.google
- DeepSWE v1.1 leaderboarddeepswe.datacurve.ai
- Artificial Analysis: Gemini 3.8 Flashartificialanalysis.ai
- Muse Spark 1.3 pricingdeveloper.meta.com
- Introducing Muse Spark 1.3research.meta.ai
- Hang on to Your Firefoxwww.newsonaut.com
- Mistral: opting out of traininghelp.mistral.ai
- HN: Gemini 3.8 Flashnews.ycombinator.com
- HN: Muse Spark 1.3news.ycombinator.com
- HN: 215,128 "best software" pagesnews.ycombinator.com



