Google 剛剛發佈了一個黑客模型。以下是其差異。
Google 發佈了 Gemini 3.8 Flash(輸入每百萬代幣 $0.75,輸出每百萬代幣 $3.75,1 月 1 日價格翻倍)和 Gemini 3.8 Flash Cyber — 一個漏洞搜尋模型,它只售予 650 家經審查的「受信任防禦者」— 四小時後,Meta 發佈了 Muse Spark 1.3,其中設有每百萬代幣 $0.10 的「貢獻者」層級,折扣是您的會話記錄。
Google 發佈了 Gemini 3.8 Flash(輸入每百萬代幣 $0.75,輸出每百萬代幣 $3.75,1 月 1 日價格翻倍)和 Gemini 3.8 Flash Cyber — 一個漏洞搜尋模型,它只售予 650 家經審查的「受信任防禦者」— 四小時後,Meta 發佈了 Muse Spark 1.3,其中設有每百萬代幣 $0.10 的「貢獻者」層級,折扣是您的會話記錄。我們將兩者與兩家公司都未編寫的基準進行比較。評語:SHIP IT。
本影片涵蓋的內容
- Google 發佈 Gemini 3.8 Flash + Flash Cyber (86.2% CyberGym, Fairwind Program)
- Meta 發佈 Muse Spark 1.3:$1.25/$4.25,如果 Meta 可以用於訓練則為 $0.10/$0.20
- 三個網站製作了 215,128 個虛假「最佳軟件」頁面;Perplexity 引用了它們
翻譯的文字記錄
從英文原文旁白翻譯。可用的音頻和字幕由 YouTube 控制。
0:00 Google 今天發佈了其六週內的第三個 Flash 模型, 加上一個經過訓練可以進行黑客攻擊的版本,四小時後 Meta 發佈了一個模型, 如果你讓 Zuckerberg 閱讀你的代碼,它每百萬代幣只需十美分, 所以人工智能價格戰現在有了網絡安全部門。 今天是星期三,差異很大。 Gemini 3.8 Flash 在 Hacker News 上獲得了 1100 點, Muse Spark 1.3 多了近 700 點,而在此期間, 一個研究機構發現了三個網站發佈了 215,000 個
0:28 虛假的最佳軟件頁面,純粹是為了讓 Perplexity 引用它們。 今天還有:一個懇求你堅持使用 Firefox 的帖子獲得了 988 點, 而 Mistral 關於選擇退出訓練的幫助頁面獲得了近 500 點, 主要來自歐洲人發現主權選項預設會根據你的提示進行訓練。 預設會根據你的提示進行訓練。 在此影片中:Gemini 3.8 Flash 的實際成本,Google 只會售予 650 個合作夥伴的黑客模型, Meta 的十美分層級及其實際收費,以及兩家公司都未編寫的基準。 以及兩家公司都未編寫的基準。
0:59 今天是 9 月 2 日星期三,這是 The Daily Diff。 Gemini 3.8 Flash 的輸入費用為每百萬代幣 75 美分,輸出費用為 3.75 美元, 與三週前的 3.7 Flash 相同, 並附帶一個註腳說明價格將於 1 月 1 日翻倍, 這是一個附帶額外步驟的免費試用。 在幻燈片基準測試中,它以 54.9% 的分數在 HLE-Verified 上取得成功, X 表示它在 Terminal-Bench 上擊敗了 Sol 和 Opus 5, Logan Kilpatrick 在 DeepSWE 上發布了 73.7 分,這是唯一尚未被記憶的長時程編碼基準,
1:29 這是唯一尚未被記憶的長時程編碼基準, 據稱是這樣。Simon Willison 要求它在 HTML 中製作一個很酷的東西, 它在 13 秒內以 1.8 美分的價格完成了一個粒子模擬, 以每秒 60 幀的速度運行,因為 60 是硬編碼到頁面中的。Google 自己的帖子用一句我會框起來的句子解釋了這些改進: 3.8 Flash 更努力。它執行額外的推理步驟,迭代地調用工具, 並引用「可能會使用更多代幣」,這對於公司來說意味著計量器運行得更快。 計量器運行得更快。 獨立的 DeepSWE 委員會在兩方面都同意:Flash 獲得 74% 的分數,
2:02 與 Opus 5 並列,每個任務的成本是其五分之一, 但它需要 166 個步驟和 143,000 個輸出代幣才能達到, 是 Sol 所花費的兩倍多。 Artificial Analysis 燃燒了 1.4 億個代幣和 1078 美元來評估它。 它只是為了評估它。 每個代幣便宜,每個任務話多,而且第一個代幣在思考 12 秒後才到來。 它思考了 12 秒後才到達。 然後是更有趣的一半。
2:23 Gemini 3.8 Flash Cyber 是相同的模型,但為了「受信任的防禦者」而放鬆了安全防護, Sundar 表示它在 CyberGym 上達到了 86.2%, 這是用於自主查找漏洞的基準。 它也能修補:在 CWE-Bench 上達到 47.2%,而領先的邊緣模型為 47.8%, Chrome 團隊表示它產生了比更大商業模型多 2.6 倍的正確補丁, Google 的雲研究人員用它在兩小時內發現了一個關鍵漏洞, 這項工作通常需要數月,或者一個有動力的青少年。 這項工作通常需要數月,或者一個有動力的青少年。
2:54 Google 堅稱它優先考慮修復而非利用, 這是禮貌的說法,意思是不是該模型絕對可以穿過這些漏洞, 他們只是要求它不要這樣做。 所以你不能擁有它。 訪問需通過新的 Fairwind Program:政府、 關鍵基礎設施和 650 個經過審查的合作夥伴,並強制遵守 雙重認證。每個前沿實驗室現在都擁有一個他們不會賣給你的駭客模型, 而本週,它是一個便宜貨。
3:16 四小時後,Meta發布了Muse Spark 1.3,Zuck稱其為前沿 性能,便宜到幾乎無法計量,這是真的, 但有一個門洛公園大小的星號。 正常端點的費用是輸入1.25美元,輸出4.25美元, 比Gemini還要多。 貢獻者端點的費用是輸入10美分,輸出20美分, 快取讀取費用為0.2美分,便宜高達二十倍, 而唯一的區別就是一個寫著「用於改進我們的產品」的欄位。
3:40 所以折扣就是你的會話記錄, 而且這次沒人需要閱讀 許可證,因為Meta將許可證寫成了一份價目表。 熱門評論:現在完全清楚偷我的代幣值多少錢。 第二條評論想知道多久之後會有人從一個經過貢獻者提示訓練的模型中提取出一個AWS金鑰。 第二條評論想知道多久之後會有人從一個經過貢獻者提示訓練的模型中提取出一個AWS金鑰。 在Meta自己的記分卡上,Spark 1.3在DeepSWE上獲得75.4分, 高於Sol和Opus 5,Meta表示它使用的工具調用減少了百分之二十,
4:06 並且比1.2版本減少了百分之二十五的代幣,這與Google的賭注恰恰相反, 所以今天地球上最大的兩家廣告公司對於多說話是否是好事存在分歧。 所以今天地球上最大的兩家廣告公司對於多說話是否是好事存在分歧。 同時,Trellner Research向Perplexity詢問了三百八十個類別中最好的軟體, 並閱讀了所有引用:59.8%來自前十萬名以外的網站, 維基百科在七千五百次中被引用了三次, 維基百科在七千五百次中被引用了三次, 三個姐妹網站有21.5萬個生成的購買指南,它們的主頁標題是「事實與基礎頁面」,
4:34 針對的是爬蟲,而不是你。 針對的是爬蟲,而不是你。 AI SEO戰爭已經開始,它的第一個武器是帶有行銷預算的正規表達式。 對於一個週三來說,這價格標籤可真不少;如果你寧願閱讀而不是聽我說, 那麼diff每天早上都會發送到你的收件箱 — 在thedailydiff.dev免費,鏈接如下。 diff dot dev,鏈接如下。 所以,今天的判決是:SHIP IT。 Gemini 3.8 Flash在Google沒有編寫的排行榜上與Opus 5並列,
5:00 價格卻只有五分之一。 只需查看代幣賬單,並閱讀Meta的欄位標題。 這就是今天的diff。 我是來自Axrisi的Niko。 負責任地合併(Merge responsibly)。
來源
- Introducing Gemini 3.8 Flash and 3.8 Flash Cyberblog.google
- Fairwind Programblog.google
- DeepSWE v1.1 leaderboarddeepswe.datacurve.ai
- Artificial Analysis: Gemini 3.8 Flashartificialanalysis.ai
- Muse Spark 1.3 pricingdeveloper.meta.com
- Introducing Muse Spark 1.3research.meta.ai
- Hang on to Your Firefoxwww.newsonaut.com
- Mistral: opting out of traininghelp.mistral.ai
- HN: Gemini 3.8 Flashnews.ycombinator.com
- HN: Muse Spark 1.3news.ycombinator.com
- HN: 215,128 "best software" pagesnews.ycombinator.com



