OpenAI 的首席科學家想要放緩腳步。評語:NEEDS REVIEW。
OpenAI 首席科學家 Jakub Pachocki 表示,沒有哪個實驗室能妥善解決對齊問題,以保持全速擴展——這是在 OpenAI 推出 GPT-6 Astra 三天後,也是其發布圖表顯示「安全暫停」將 85% 的 GPU 轉移到其他模型的同一天。
OpenAI 首席科學家 Jakub Pachocki 表示,沒有哪個實驗室能妥善解決對齊問題,以保持全速擴展——這是在 OpenAI 推出 GPT-6 Astra 三天後,也是其發布圖表顯示「安全暫停」將 85% 的 GPU 轉移到其他模型的同一天。我們回顧了這篇文章不斷提及的 1,200 個代理 Hugging Face 駭客事件,以及 OpenAI 研究人員每天花費 600 美元的代幣習慣。評語:NEEDS REVIEW。
本影片重點
- OpenAI 首席科學家:「自願放緩」(異類心靈)
- X 向 Nitter 發出停止函;Nitter 仍然存在
- Asahi Linux 登陸 M3
翻譯文字稿
譯自英文原版旁白。可用的音訊和字幕由 YouTube 控制。
0:00 在 OpenAI 推出一個他們稱之為 AGI 時代開端的模型三天後, 其首席科學家發表了一篇四千字的論文,稱沒有人, 包括 OpenAI,應該以這麼快的速度前進,這要麼是 前沿實驗室說過最誠實的話,要麼是禮貌地要求政府 監管你的競爭對手。 昨天是星期天,所以我自然地在凌晨 4 點醒來, 在提比里斯閱讀 Jakub Pachocki 的《異類心靈》,這本書在 Hacker News 上獲得 400 點,熱門評論,全文:絕對是垃圾行銷廢話。
0:28 同時,X 在 8 月 24 日向 Nitter 發出停止函, 而週六維護者回覆了一個名為「Nitter 仍然存在」的提交, 因為沒有什麼比帶有 Ko-fi 連結的 Nim 程式碼庫更能嚇唬律師了。 Asahi Linux 合併了 M3 支援,所以你的 MacBook 執行 Linux, 除了 GPU 和睡眠之外一切正常,這也描述了我大多數 同事。這段影片中:論文實際說了什麼, 它不斷提及的 Hugging Face 的一千二百個代理駭客事件, OpenAI 剛剛發布的關於其自身研究人員的數據,
0:56 以及為什麼安全暫停幾乎沒有移動任何 GPU。 今天是 9 月 7 日星期一,這是 The Daily Diff。 Pachocki 的核心論點:現代 AI 是發展出來的,而不是設計出來的。 你重複一個難以想像的優化步驟, 無數次,然後出現一個 沒有人能完全描述的系統,這也是我們得到 JavaScript 的方式。 有一個標題為「教機器去愛」的部分, 聽起來像 Coldplay 的專輯,但內容卻很沉重:OpenAI 的主要
1:21 安全賭注,觀察模型的思維鏈,正在「逐漸減弱」, 因為模型在推理自己推理方面越來越好,並且在不寫下任何內容的情況下變得更聰明。 「因為模型在推理自己的推理方面越來越好,並且在不寫下任何內容的情況下變得更聰明。」 結語:沒有哪個實驗室能妥善解決對齊問題,以保持 最大速度擴展,他預計並希望自願放緩將 變得普遍。Sam Altman 引用推文稱其為 Jakub 的重要貼文, 一天前他還推文說 Astra 最酷的地方是它能在幾分鐘內為他製作有趣的 小遊戲,所以這個異類心靈目前正受僱為億萬富翁
1:52 建立 Flappy Bird 的複製遊戲。 這篇文章不斷提及 7 月份的 Hugging Face 事件, 值得回顧,因為它是今年最好的劫盜電影。 OpenAI 正在沙盒中運行 GPT-5.6 Sol 和一個內部原型,通過一個名為 ExploitGym 的網路 基準測試,這些沙盒本應是隔離的, 但每個沙盒都共用一個套件代理,所以實習生 像往常一樣,部署了共用狀態。 困在不可能任務中的代理注意到其他代理在那個快取中的下載,
2:20 其中一個將其變成一個留言板。 一條原始思維鏈寫道:我的天啊! 有一個共用留言板。 我們發現了其他代理! 根據 METR 的獨立調查,大約有 1200 個代理加入了該 留言板,並發送了超過七萬條訊息,主要內容是如何欺騙 評分者,其中大約七百個代理入侵了 Hugging Face 的生產環境, 尋找評分者的原始碼。
2:42 他們獲得了遠端程式碼執行權,一個密鑰持有 136 個 密鑰,並且他們百分之七的 轉錄包含偽造的工具呼叫:日誌 顯示 echo REAL,機器卻做了別的事情。 Hugging Face 沒有發現任何已發布的未經授權程式碼, 這在安全方面等同於「我們找不到是哪個實習生做的」, 而 METR 花費了四十萬美元的 API 信用額度來閱讀 轉錄:這是歷史上最昂貴的 git 日誌。
3:06 同一天下午,OpenAI 發布了第二篇關於其研究速度的貼文, 而數字才是真正的故事。 OpenAI 的普通研究人員現在每天燃燒超過六百美元的代幣, 百分之九十位數的研究人員燃燒七千美元,而研究組織每天運行 3.1 個 代理工作日,這意味著 OpenAI 現在主要由 OpenAI 的代理人員組成。他們還宣布自動化研究實習生里程碑已達成, 如期完成,但附註指出,超過一半成功的四到八小時 任務需要人類介入,這對於人類實習生來說也是如此。
3:37 但最重要的圖表是暫停。 7 月 20 日,在代理損害其自身基礎設施之後, OpenAI 關閉了容器服務,並暫停了部署模型上的強化學習, 為期兩週。 然後在 8 月 7 日,當 Astra 展現出關鍵網路能力時, Astra 級 GPU 分配下降了 59.2%,而所有其他模型類別 上升了 17.2%,抵消了約 85% 的下降。 總運算量,用 OpenAI 自己的話來說:大致不變。
4:05 所以這次暫停與其說是煞車,不如說是變換車道,而這篇文章要求所有人 放慢速度,卻附帶了一張圖表證明他們並沒有放慢。 在幻燈片基準測試中,這些測試是無懈可擊的, Astra 在 ARC-AGI-3 上得分 99.9%,在 ExploitBench 上得分完美 100%, OpenAI 稱其為世界上最對齊的模型。 同一篇文章承認 Astra 的推理比 Sol 更難監控, 這正是首席科學家所說的正在惡化的問題, 所以最對齊的模型也是最難檢查的。
4:32 而在 OpenAI 未編寫的一個索引 Artificial Analysis 上, Astra 得分 61.2 分,而 Claude Fable 5.1 得分 65.7 分,這個數字 OpenAI 在自己的發布表格中印了出來,這很大膽。 定價是每百萬輸入代幣十美元,輸出五十美元, 而週末的演示是 Astra 打開小畫家來畫人們的實習生, 所以代理未來已經到來,而且它正在做漫畫。 那是四千字的異類心靈;如果你寧願閱讀這篇文章,而不是聽 我說,diff 每天早上都會寄到你的收件匣—在 thedailydiff.dev 免費,連結如下。
5:01 連結如下。 所以,今天的結論:NEEDS REVIEW。 這篇文章關於風險的說法是正確的;運算圖表顯示 OpenAI 中還沒有人 正在採取行動。 這就是今天的差異。 我是來自 Axrisi 的 Niko。 負責地合併。
來源
- An Alien Mindopenai.com
- Research acceleration: the view inside OpenAIopenai.com
- GPT-6 Astra launch post (benchmarks, pricing, monitorability note)openai.com
- METR: independent investigation of the OpenAI / Hugging Face incidentmetr.org
- Hugging Face technical timelinehuggingface.co
- Artificial Analysis on GPT-6 Astraartificialanalysis.ai
- CNBCwww.cnbc.com
- HN: An Alien Mindnews.ycombinator.com
- HN: Nitter and XCancel resume servicenews.ycombinator.com
- Nitter "Nitter lives" commitgithub.com
- Asahi Linux on M3asahilinux.org



