# Armin Ronacher 獨自讓 GPT-6 Astra 運作 35 小時。

Published: 2026-09-12

Armin Ronacher（Flask、Jinja）只給了 GPT-6 Astra 一個提示，然後讓它獨自運作了 35 小時：大約十億個代幣，約 1,200 美元，79 次提交，75,000 行代碼——但「絕對沒有任何價值」。它恢復的代碼本身就是一個故事：用 Python 字符串拼接 heredocs 修補的 C 文件，Python 生成 Node 再生成 PowerShell，單元測試中刪除了所有空白字符，因為這樣可以節省 10% 的代幣費用。有兩項測量結果支持他的說法：Earendil 的 SlopCodeBench 數據（代理代碼比人類儲存庫冗長和「侵蝕」約兩倍，嚴格通過率為 0%）和 Quesma 對 RTK 的 1,500 美元基準測試（79k 星星，「節省了 89% 的代幣」，在 DeepSeek 情況下每個任務增加 17%）。此外：Cognition 的 SWE-2（穿著風衣的 Kimi K3，Terminal-Bench 2.1 上得分 92.8，而 Terminal-Bench 4 上得分 27.3），OpenAI 的 Agents API 和暫停的 200 美元 Pro 訂閱，以及星期五 Hacker News 要求減少 AI 新聞。結論：REVERT。

Canonical: https://thedailydiff.dev/zh-HK/video/2026-09-11-astra-slop-factory/

## 本影片涵蓋的內容

- Armin Ronacher：無人看管的 GPT-6 Astra 運作 35 小時，約 1,200 美元，79 次提交，增加 75k 行代碼，沒有任何成果。
- Earendil / SlopCodeBench：代理代碼比人類儲存庫冗長和「侵蝕」約兩倍；嚴格通過率為 0%。
- Quesma：RTK 報告節省了 89% 的代幣，但 Terminal-Bench 在 DeepSeek 情況下成本增加了 17%；一個重寫循環連續失敗了 339 次。
- Cognition SWE-2：Kimi K3 後期訓練，在 FrontierCode 上以三分之一的價格匹配 Fable 5.1；TB 2.1 92.8 分 vs TB 4 27.3 分；Devin Voice。
- OpenAI Agents API（Codex 框架即服務，僅限美國，無 ZDR）；因 Astra 需求，200 美元 Pro 訂閱暫停註冊。

## 翻譯的文字記錄

從英文原文旁白翻譯。可用的音頻和字幕由 YouTube 控制。

0:00 Flask 的作者 Armin Ronacher，給了 GPT-6 Astra 一個簡單的提示，然後 讓它獨自運作了三十五小時。 它回來時帶有七萬五千行代碼，並且， 用他的話說，絕對沒有任何價值，這使它成為有史以來最真實的 軟件工廠。 他星期三發布了這篇文章。 星期四，Cognition 發布了 SWE-2，OpenAI 發布了 Agents API， 並暫停了其兩百美元計劃的註冊，

0:24 因為 Astra 佔用了伺服器。 而星期五，這篇文章登上了 Hacker News 的首頁， 就在一篇要求 Hacker News 停止發布關於 AI 的文章下面幾行。 在這段影片中：無人監督的 Astra 運作一天半會產生什麼， 兩項將「糟粕」轉化為數字的測量，為什麼一個擁有七萬九千顆 星的工具會讓你的帳單更大，以及 Hacker News 如何嘗試使用 AI 來過濾 AI。 今天是 9 月 11 日星期五，這是 The Daily Diff。

0:53 工廠。一個提示：用虛擬線程和詞法作用域構建一個 Python。 Astra 自己記筆記，啟動自己的子代理， 並一直運行，直到 Armin 拔掉電源，一天半後，大約花費了 一千二百美元。七十九次提交，所以每次提交花費十五點五美元， 這大約是人類收取的費用，只是人類最終會停止。 代碼本身就是故事。 Astra 不是使用編輯工具，而是通過管道傳輸 Python heredocs 來修補 C 文件， 這些 heredocs 會讀取文件，替換其中的一個函數，然後將其寫回。

1:20 為運行一個 Windows 測試，它編寫了 Python，Python 生成 Node，Node 生成 PowerShell，一個帶護照的調用堆棧。 它提交的單元測試完全沒有空白字符， 因為沒有縮進，它們可以節省 10% 的代幣費用。 而任務列表從一、二、三漂移到任務 8b2c2b2b 檢查點 一，這讓你知道實習生獨自一人太久了。 Armin 的理論：模型因完成長任務而獲得獎勵，而幾乎不會因 醜陋的代碼而受到懲罰，所以代幣「高爾夫」化的工具調用會洩漏到代碼庫中，

1:48 人類看得越少，影響就越小。 他將該部分命名為「如果你不看，那就是 AGI」。 Hacker News 補充了經濟學觀點：更多的代碼意味著更多的代幣來維護它， 這使得「糟粕」不是一個 bug，而是一個訂閱。 你能衡量「糟粕」嗎？ Armin 自己的公司本週嘗試了這個。 Earendil 運行了 SlopCodeBench 數據：代理代碼的冗長程度和「侵蝕」程度大約是 它所比較的原始人類儲存庫的兩倍，

2:10 當基準測試在檢查點之間清除代理的記憶時， 他們測試的每個模型的嚴格通過率都是零。 他們發現最可靠的「糟粕」指標是原始行數， 但只要有人為此優化，這個指標就會失效， 所以請不要告訴模型。 然後是錢包。 RTK 在 GitHub 上有七萬九千顆星，YouTube 縮圖承諾將你的 Claude 代碼 費用減半；它在代理讀取終端輸出之前對其進行壓縮。Quesma 用它在

2:34 Terminal-Bench 上運行，花費了十五百美元的代幣。 使用 Fable，費用下降了百分之五，幾乎全部來自一個任務；使用 DeepSeek， 平均每個任務的費用增加了百分之十七。 同時，RTK 自己的計數器報告節省了百分之八十九， 因為它計算的是刪除的字節，而不是導致的額外操作：一個向鄰居 收費的智能電錶。 一個版本錯誤將「find」重寫為一個失敗的命令， 連續失敗了三百三十九次，價格是原來的九倍。

3:01 殺死代幣的工具竟然有一個循環。 洪水本身。 Cognition 的 SWE-2 是 Kimi K3，開源的中文模型， 經過後期訓練，以三分之一的價格在 Cognition 自己的基準測試中匹配 Fable 5.1； Hacker News：為什麼所有美國 AI 模型基本上都是穿著風衣的 Kimi。 在 Terminal-Bench 2.1 上，它位居整個榜首；在 Terminal-Bench 4 上， 這個還沒有人記住的基準，它得分二十七，而 Fable 得分五十六， 所以在投影片基準測試中，最好的那一列是每個人都已經

3:28 通過的考試。Cognition 還宣布了 Devin Voice，你最喜歡的 AI 軟件 工程師剛剛獲得了一個固定電話，因為代理編碼唯一缺少的就是 等候音樂。 OpenAI，同一天：Agents API，這是 Codex 框架作為服務出售。 OpenAI 運行沙盒，僅限美國數據駐留，沒有零數據保留， 所以代理記住你的代碼庫的精確程度就像 ChatGPT 一樣。 然後 OpenAI 暫停了兩百美元 Pro 計劃的註冊， 因為 Astra 的需求，引用原話，是「史無前例」的：

3:57 第一個有等候名單的產品 要支付更多。 Armin 在他的工廠上進行了一次全面重置。 他就是需求。 這讓我們回到了星期五的 Ask HN：我們能否限制 AI 新聞的洪水， 六百五十六點，因為，引用原話，每當 OpenAI 或 Anthropic 的人 放個屁，就會有一個熱門帖子。 回覆是過濾器：hcker.news 使用在八千個例子上訓練的 BERT

4:17 分類器來移除 AI 故事，以 AI 刪除 AI， 草飼的；而一個不區分大小寫匹配 A-I 的 uBlock 正則表達式也會刪除 email、daily、main、domain 和 train，所以這個正則表達式，一如既往， 是反派。 同一天下午，四百一十五條評論 爭論一個 Claude 支持頁面 說 Claude 適合十八歲以上使用。 該頁面日期是五月。

4:38 沒有改變。即使不是新聞的 AI 新聞也是新聞， 說實話，這也是我的商業模式。 如果你寧願閱讀而不是聽我說，那麼每天早上 The Daily Diff 都會發送到你的收件箱， 免費訂閱於 daily diff dot dev，鏈接在下方。 它不可避免地是 AI 新聞。 所以——今天對這個三十五小時軟件工廠的裁決是：撤銷。 七十九次沒有人閱讀的提交不是一個代碼庫，它是一個帶有 git 日誌的負債；Astra 令人印象深刻，而工廠是應該回滾的部分。

5:04 這就是今天的 The Daily Diff。 我是 Axrisi 的 Niko。 請負責任地合併。 負責任地合併。

## 來源

- [Armin Ronacher — Astra for Coding: Why Are We Doing This Again?](https://lucumr.pocoo.org/2026/9/7/astra-why/) — lucumr.pocoo.org
- [HN: Astra for Coding](https://news.ycombinator.com/item?id=49654229) — news.ycombinator.com
- [Earendil — Measuring the sloppiness of code](https://earendil.com/posts/measuring-code-sloppiness/) — earendil.com
- [HN: Measuring the sloppiness of code](https://news.ycombinator.com/item?id=49658311) — news.ycombinator.com
- [Quesma — RTK reports huge token savings, but our cost benchmarks disagree](https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/) — quesma.com
- [HN: RTK](https://news.ycombinator.com/item?id=49656471) — news.ycombinator.com
- [RTK (Rust Token Killer)](https://github.com/rtk-ai/rtk) — github.com
- [Cognition — Introducing SWE-2](https://cognition.com/blog/swe-2) — cognition.com
- [HN: Cognition SWE-2](https://news.ycombinator.com/item?id=49645443) — news.ycombinator.com
- [OpenAI — Agents API](https://developers.openai.com/api/docs/guides/agents-api/overview) — developers.openai.com
- [HN: OpenAI Agents API](https://news.ycombinator.com/item?id=49649213) — news.ycombinator.com
- [TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demand](https://techcrunch.com/2026/09/10/openai-puts-pro-subscriptions-on-hold-due-to-astra-demand/) — techcrunch.com
- [Ask HN: Can we please limit the AI news flood?](https://news.ycombinator.com/item?id=49657850) — news.ycombinator.com
- [HN: Claude is only available to people over 18 years](https://news.ycombinator.com/item?id=49656225) — news.ycombinator.com
