# Armin Ronacher 獨留 GPT-6 Astra 35 小時。

Published: 2026-09-12

Armin Ronacher（Flask、Jinja 的作者）給了 GPT-6 Astra 一個提示，然後獨留它 35 小時：大約十億個 token，約 1,200 美元，79 次提交，75,000 行程式碼——結果「絕對一無是處」。它找回來的程式碼本身就是一個故事：C 檔案透過 Python 字串拼接的 heredocs 修補，Python 啟動 Node，Node 又啟動 PowerShell，單元測試移除了所有空白字元，因為這樣可以節省 10% 的 token 成本。有兩項測量結果支持他的看法：Earendil 的 SlopCodeBench 數據（代理程式碼比人類程式碼庫冗長且腐蝕約兩倍，嚴格通過率為 0%）以及 Quesma 對 RTK 進行的 1,500 美元基準測試（79k 顆星，根據其自身計數器「節省 89% 的 token」，但使用 DeepSeek 時每個任務成本增加 17%）。此外還有：Cognition 的 SWE-2（穿著風衣的 Kimi K3，Terminal-Bench 2.1 上獲得 92.8 分，而 Terminal-Bench 4 上僅 27.3 分），OpenAI 的 Agents API 和暫停的 200 美元專業版註冊，以及週五 Hacker News 要求減少 AI 新聞。判決：REVERT。

Canonical: https://thedailydiff.dev/zh-TW/video/2026-09-11-astra-slop-factory/

## 本影片重點

- Armin Ronacher：35 小時無人看管的 GPT-6 Astra，約 1,200 美元，79 次提交，超過 75k 行程式碼，一無所獲。
- Earendil / SlopCodeBench：代理程式碼比人類程式碼庫冗長且腐蝕約 2 倍；嚴格通過率 0%。
- Quesma：RTK 報告節省 89% 的 token，但使用 DeepSeek 時 Terminal-Bench 成本增加 17%；一個重寫循環連續失敗 339 次。
- Cognition SWE-2：從 Kimi K3 後期訓練，以三分之一的價格在 FrontierCode 上與 Fable 5.1 匹配；TB 2.1 92.8 分 vs TB 4 27.3 分；Devin Voice。
- OpenAI Agents API (Codex 線束即服務，僅限美國，無 ZDR)；因 Astra 需求，暫停 200 美元專業版註冊。

## 翻譯文字稿

譯自英文原版旁白。可用的音訊和字幕由 YouTube 控制。

0:00 Armin Ronacher，Flask 的作者，給了 GPT-6 Astra 一個提示，然後 獨留它三十五個小時。 它回來時帶了七萬五千行的程式碼，以及， 用他的話說，絕對一無是處，這讓它成為最逼真的 軟體工廠。 他週三發佈了這篇文章。 週四，Cognition 推出了 SWE-2，OpenAI 推出了 Agents API 並暫停了其兩百美元方案的註冊，

0:24 因為 Astra 佔用了伺服器。 而週五，這篇文章登上了 Hacker News 的首頁， 位於一篇請求 Hacker News 不要再發 AI 相關貼文的幾行之下。 在此影片中：一天半無人監督的 Astra 會產生什麼， 兩個將混亂變成數字的測量方法，為什麼一個擁有七萬九千 顆星的工具會讓你的帳單變大，以及 Hacker News 如何試圖用 AI 過濾掉 AI。 今天是九月十一日星期五，這裡是 The Daily Diff。

0:53 工廠。一個提示：用虛擬執行緒和詞法作用域構建一個 Python。 Astra 自己做筆記，啟動自己的子代理， 並一直運行直到 Armin 拔掉插頭，一天半之後，大約花費了十二百 美元。七十九次提交，所以每次提交花費十五點五美元， 這大約是人類的收費，只不過人類最終會停止。 程式碼就是故事。 Astra 不使用編輯工具，而是透過管道傳輸 Python heredocs 來修補 C 檔案，這些 heredocs 讀取檔案，字串替換一個函數，然後將其寫回。

1:20 為了執行一個 Windows 測試，它編寫了 Python，然後 Python 啟動 Node，Node 又啟動 PowerShell，一個帶護照的呼叫堆疊。 它提交的單元測試完全沒有空白字元， 因為沒有縮排，它們在 token 上便宜了百分之十。 任務清單從一、二、三漂移到任務 8b2c2b2b 檢查點 一，這就是你知道實習生獨自一人太久的方式。 Armin 的理論是：模型因完成長期任務而獲得獎勵，卻幾乎沒有 因程式碼醜陋而受到懲罰，因此 token 縮減的工具呼叫會洩漏到程式碼庫中，

1:48 人類看得越少，問題就越不重要。 他把該部分命名為「如果你不看，它就是 AGI」。 Hacker News 補充了經濟學觀點：更多的程式碼意味著更多的 token 來維護它， 這使得混亂不是一個錯誤，而是一個訂閱。 你能測量混亂程度嗎？ Armin 自己的公司本週嘗試了這個。 Earendil 運行了 SlopCodeBench 的數據：代理程式碼大約比它所比較的 人類程式碼庫冗長且腐蝕約兩倍，

2:10 而且當基準測試在檢查點之間清除代理的記憶體時， 他們測試的每個模型的嚴格通過率都是零。 他們發現最可靠的混亂度量是原始行數， 但一旦有人針對它進行最佳化，它就會失效， 所以請不要告訴模型。 然後是錢包。 RTK 擁有七萬九千個 GitHub 星，YouTube 縮圖承諾將您的 Claude Code 帳單 減半；它在代理程式讀取之前壓縮終端機輸出。Quesma 在 Terminal-Bench 上以一千五百美元的 token 運行它。

2:34 使用 Fable 時，帳單下降了百分之五，幾乎全部來自一個任務；使用 DeepSeek 時， 平均每個任務貴了百分之十七。 與 Fable 合作，帳單減少了百分之五，幾乎全部來自一個任務；與 DeepSeek 合作， 同時，RTK 自己的計數器報告節省了百分之八十九， 因為它計算的是移除的位元組，而不是造成的額外輪次：一個智能電錶卻 向鄰居收費。 一個版本錯誤將 find 重寫成一個失敗的命令， 連續失敗了三百三十九次，價格卻是九倍。

3:01 殺死 token 的工具有一個迴圈。 洪水本身。 Cognition 的 SWE-2 是 Kimi K3，一個開放的中文模型， 經過後期訓練，它在 Cognition 自己的基準測試中以三分之一的價格與 Fable 5.1 匹配； Hacker News：為什麼所有的美國 AI 模型基本上都是穿著風衣的 Kimi。 穿著風衣的 Kimi。 在 Terminal-Bench 2.1 上它名列榜首；在 Terminal-Bench 4 上， 這個還沒有人背下來的，它得了二十七分，而 Fable 是五十六分，

3:28 所以在簡報基準測試中，最好的那一欄是每個人都已經 通過的考試。Cognition 還宣布了 Devin Voice，您最喜歡的 AI 軟體 工程師現在有了固定電話，因為代理程式編碼唯一缺少的就是 等待音樂。 OpenAI，同一天：Agents API，這是作為服務出售的 Codex 線束。 OpenAI 運行沙盒，僅限美國數據駐留，不保留零數據， 所以代理程式記住您的程式碼庫的程度與 ChatGPT 完全一樣。 然後 OpenAI 暫停了兩百美元專業版計畫的註冊，

3:57 因為 Astra 的需求，引用原話，是「前所未有」的： 第一個需要排隊 才能付更多錢的產品。 Armin 在他的工廠上進行了完全重置。 他就是需求。 這讓我們回到了週五的 Ask HN：我們可以限制 AI 新聞的洪流嗎？ 六百五十六分，因為，引用原話，「每次 OpenAI 或 Anthropic 的人放個屁，就會有一篇前十名的貼文」。

4:17 回覆是篩選器：hcker.news 使用一個經過八千個範例訓練的 BERT 分類器來移除 AI 故事，以 AI 刪除 AI， 自然餵養；以及一個不區分大小寫匹配 A-I 的 uBlock 正則表達式，它也會刪除 email、daily、main、domain 和 train，所以正則表達式，一如既往地， 是反派。 同日下午，四百一十五條評論 爭論著一個 Claude 支援頁面 聲明 Claude 適用於十八歲以上人士。

4:38 該頁面日期為五月。 沒有任何改變。連不是新聞的 AI 新聞也是新聞， 公平地說，這也是我的商業模式。 如果您寧願閱讀這份報告而不是聽我說，那麼這份差異報告每天早上都會寄到您的收件箱— 在 the daily diff dot dev 免費取得，連結如下。 它，不可避免地，就是 AI 新聞。 所以——今天對三十五小時軟體工廠的判決是：REVERT。 七十九次沒人閱讀的提交不是程式碼庫，它是一個帶有 git

5:04 日誌的負債；Astra 令人印象深刻，而工廠是需要回溯的部分。 這就是今天的差異報告。 我是 Axrisi 的 Niko。 負責任地合併。

## 來源

- [Armin Ronacher — Astra for Coding: Why Are We Doing This Again?](https://lucumr.pocoo.org/2026/9/7/astra-why/) — lucumr.pocoo.org
- [HN: Astra for Coding](https://news.ycombinator.com/item?id=49654229) — news.ycombinator.com
- [Earendil — Measuring the sloppiness of code](https://earendil.com/posts/measuring-code-sloppiness/) — earendil.com
- [HN: Measuring the sloppiness of code](https://news.ycombinator.com/item?id=49658311) — news.ycombinator.com
- [Quesma — RTK reports huge token savings, but our cost benchmarks disagree](https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/) — quesma.com
- [HN: RTK](https://news.ycombinator.com/item?id=49656471) — news.ycombinator.com
- [RTK (Rust Token Killer)](https://github.com/rtk-ai/rtk) — github.com
- [Cognition — Introducing SWE-2](https://cognition.com/blog/swe-2) — cognition.com
- [HN: Cognition SWE-2](https://news.ycombinator.com/item?id=49645443) — news.ycombinator.com
- [OpenAI — Agents API](https://developers.openai.com/api/docs/guides/agents-api/overview) — developers.openai.com
- [HN: OpenAI Agents API](https://news.ycombinator.com/item?id=49649213) — news.ycombinator.com
- [TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demand](https://techcrunch.com/2026/09/10/openai-puts-pro-subscriptions-on-hold-due-to-astra-demand/) — techcrunch.com
- [Ask HN: Can we please limit the AI news flood?](https://news.ycombinator.com/item?id=49657850) — news.ycombinator.com
- [HN: Claude is only available to people over 18 years](https://news.ycombinator.com/item?id=49656225) — news.ycombinator.com
