Armin Ronacher 獨自讓 GPT-6 Astra 運作 35 小時。
Armin Ronacher(Flask、Jinja)只給了 GPT-6 Astra 一個提示,然後讓它獨自運作了 35 小時:大約十億個代幣,約 1,200 美元,79 次提交,75,000 行代碼——但「絕對沒有任何價值」。
Armin Ronacher(Flask、Jinja)只給了 GPT-6 Astra 一個提示,然後讓它獨自運作了 35 小時:大約十億個代幣,約 1,200 美元,79 次提交,75,000 行代碼——但「絕對沒有任何價值」。它恢復的代碼本身就是一個故事:用 Python 字符串拼接 heredocs 修補的 C 文件,Python 生成 Node 再生成 PowerShell,單元測試中刪除了所有空白字符,因為這樣可以節省 10% 的代幣費用。有兩項測量結果支持他的說法:Earendil 的 SlopCodeBench 數據(代理代碼比人類儲存庫冗長和「侵蝕」約兩倍,嚴格通過率為 0%)和 Quesma 對 RTK 的 1,500 美元基準測試(79k 星星,「節省了 89% 的代幣」,在 DeepSeek 情況下每個任務增加 17%)。此外:Cognition 的 SWE-2(穿著風衣的 Kimi K3,Terminal-Bench 2.1 上得分 92.8,而 Terminal-Bench 4 上得分 27.3),OpenAI 的 Agents API 和暫停的 200 美元 Pro 訂閱,以及星期五 Hacker News 要求減少 AI 新聞。結論:REVERT。
本影片涵蓋的內容
- Armin Ronacher:無人看管的 GPT-6 Astra 運作 35 小時,約 1,200 美元,79 次提交,增加 75k 行代碼,沒有任何成果。
- Earendil / SlopCodeBench:代理代碼比人類儲存庫冗長和「侵蝕」約兩倍;嚴格通過率為 0%。
- Quesma:RTK 報告節省了 89% 的代幣,但 Terminal-Bench 在 DeepSeek 情況下成本增加了 17%;一個重寫循環連續失敗了 339 次。
- Cognition SWE-2:Kimi K3 後期訓練,在 FrontierCode 上以三分之一的價格匹配 Fable 5.1;TB 2.1 92.8 分 vs TB 4 27.3 分;Devin Voice。
- OpenAI Agents API(Codex 框架即服務,僅限美國,無 ZDR);因 Astra 需求,200 美元 Pro 訂閱暫停註冊。
翻譯的文字記錄
從英文原文旁白翻譯。可用的音頻和字幕由 YouTube 控制。
0:00 Flask 的作者 Armin Ronacher,給了 GPT-6 Astra 一個簡單的提示,然後 讓它獨自運作了三十五小時。 它回來時帶有七萬五千行代碼,並且, 用他的話說,絕對沒有任何價值,這使它成為有史以來最真實的 軟件工廠。 他星期三發布了這篇文章。 星期四,Cognition 發布了 SWE-2,OpenAI 發布了 Agents API, 並暫停了其兩百美元計劃的註冊,
0:24 因為 Astra 佔用了伺服器。 而星期五,這篇文章登上了 Hacker News 的首頁, 就在一篇要求 Hacker News 停止發布關於 AI 的文章下面幾行。 在這段影片中:無人監督的 Astra 運作一天半會產生什麼, 兩項將「糟粕」轉化為數字的測量,為什麼一個擁有七萬九千顆 星的工具會讓你的帳單更大,以及 Hacker News 如何嘗試使用 AI 來過濾 AI。 今天是 9 月 11 日星期五,這是 The Daily Diff。
0:53 工廠。一個提示:用虛擬線程和詞法作用域構建一個 Python。 Astra 自己記筆記,啟動自己的子代理, 並一直運行,直到 Armin 拔掉電源,一天半後,大約花費了 一千二百美元。七十九次提交,所以每次提交花費十五點五美元, 這大約是人類收取的費用,只是人類最終會停止。 代碼本身就是故事。 Astra 不是使用編輯工具,而是通過管道傳輸 Python heredocs 來修補 C 文件, 這些 heredocs 會讀取文件,替換其中的一個函數,然後將其寫回。
1:20 為運行一個 Windows 測試,它編寫了 Python,Python 生成 Node,Node 生成 PowerShell,一個帶護照的調用堆棧。 它提交的單元測試完全沒有空白字符, 因為沒有縮進,它們可以節省 10% 的代幣費用。 而任務列表從一、二、三漂移到任務 8b2c2b2b 檢查點 一,這讓你知道實習生獨自一人太久了。 Armin 的理論:模型因完成長任務而獲得獎勵,而幾乎不會因 醜陋的代碼而受到懲罰,所以代幣「高爾夫」化的工具調用會洩漏到代碼庫中,
1:48 人類看得越少,影響就越小。 他將該部分命名為「如果你不看,那就是 AGI」。 Hacker News 補充了經濟學觀點:更多的代碼意味著更多的代幣來維護它, 這使得「糟粕」不是一個 bug,而是一個訂閱。 你能衡量「糟粕」嗎? Armin 自己的公司本週嘗試了這個。 Earendil 運行了 SlopCodeBench 數據:代理代碼的冗長程度和「侵蝕」程度大約是 它所比較的原始人類儲存庫的兩倍,
2:10 當基準測試在檢查點之間清除代理的記憶時, 他們測試的每個模型的嚴格通過率都是零。 他們發現最可靠的「糟粕」指標是原始行數, 但只要有人為此優化,這個指標就會失效, 所以請不要告訴模型。 然後是錢包。 RTK 在 GitHub 上有七萬九千顆星,YouTube 縮圖承諾將你的 Claude 代碼 費用減半;它在代理讀取終端輸出之前對其進行壓縮。Quesma 用它在
2:34 Terminal-Bench 上運行,花費了十五百美元的代幣。 使用 Fable,費用下降了百分之五,幾乎全部來自一個任務;使用 DeepSeek, 平均每個任務的費用增加了百分之十七。 同時,RTK 自己的計數器報告節省了百分之八十九, 因為它計算的是刪除的字節,而不是導致的額外操作:一個向鄰居 收費的智能電錶。 一個版本錯誤將「find」重寫為一個失敗的命令, 連續失敗了三百三十九次,價格是原來的九倍。
3:01 殺死代幣的工具竟然有一個循環。 洪水本身。 Cognition 的 SWE-2 是 Kimi K3,開源的中文模型, 經過後期訓練,以三分之一的價格在 Cognition 自己的基準測試中匹配 Fable 5.1; Hacker News:為什麼所有美國 AI 模型基本上都是穿著風衣的 Kimi。 在 Terminal-Bench 2.1 上,它位居整個榜首;在 Terminal-Bench 4 上, 這個還沒有人記住的基準,它得分二十七,而 Fable 得分五十六, 所以在投影片基準測試中,最好的那一列是每個人都已經
3:28 通過的考試。Cognition 還宣布了 Devin Voice,你最喜歡的 AI 軟件 工程師剛剛獲得了一個固定電話,因為代理編碼唯一缺少的就是 等候音樂。 OpenAI,同一天:Agents API,這是 Codex 框架作為服務出售。 OpenAI 運行沙盒,僅限美國數據駐留,沒有零數據保留, 所以代理記住你的代碼庫的精確程度就像 ChatGPT 一樣。 然後 OpenAI 暫停了兩百美元 Pro 計劃的註冊, 因為 Astra 的需求,引用原話,是「史無前例」的:
3:57 第一個有等候名單的產品 要支付更多。 Armin 在他的工廠上進行了一次全面重置。 他就是需求。 這讓我們回到了星期五的 Ask HN:我們能否限制 AI 新聞的洪水, 六百五十六點,因為,引用原話,每當 OpenAI 或 Anthropic 的人 放個屁,就會有一個熱門帖子。 回覆是過濾器:hcker.news 使用在八千個例子上訓練的 BERT
4:17 分類器來移除 AI 故事,以 AI 刪除 AI, 草飼的;而一個不區分大小寫匹配 A-I 的 uBlock 正則表達式也會刪除 email、daily、main、domain 和 train,所以這個正則表達式,一如既往, 是反派。 同一天下午,四百一十五條評論 爭論一個 Claude 支持頁面 說 Claude 適合十八歲以上使用。 該頁面日期是五月。
4:38 沒有改變。即使不是新聞的 AI 新聞也是新聞, 說實話,這也是我的商業模式。 如果你寧願閱讀而不是聽我說,那麼每天早上 The Daily Diff 都會發送到你的收件箱, 免費訂閱於 daily diff dot dev,鏈接在下方。 它不可避免地是 AI 新聞。 所以——今天對這個三十五小時軟件工廠的裁決是:撤銷。 七十九次沒有人閱讀的提交不是一個代碼庫,它是一個帶有 git 日誌的負債;Astra 令人印象深刻,而工廠是應該回滾的部分。
5:04 這就是今天的 The Daily Diff。 我是 Axrisi 的 Niko。 請負責任地合併。 負責任地合併。
來源
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



