# Armin Ronacher 独自留下了 GPT-6 Astra 35 小时。

Published: 2026-09-12

Armin Ronacher (Flask, Jinja) 给 GPT-6 Astra 一个提示，然后让它独自运行了 35 小时：大约十亿个 token，约 1,200 美元，79 次提交，75,000 行代码 — 结果是“绝对没有任何价值”。它恢复的代码本身就是故事：通过 Python 字符串拼接 heredoc 打补丁的 C 文件，Python 启动 Node，Node 再启动 PowerShell，以及因删除空格可节省 10% token 而去除了所有空格的单元测试。两项测量结果支持了他的观点：Earendil 的 SlopCodeBench 数据（代理代码比人类代码仓库冗长且腐蚀约两倍，严格通过率为 0%）和 Quesma 对 RTK（7.9 万颗星，“自身计数器显示节省了 89% 的 token”，使用 DeepSeek 时每个任务成本增加 17%）的 1,500 美元基准测试。此外还有：Cognition 的 SWE-2（穿着风衣的 Kimi K3，Terminal-Bench 2.1 上得分为 92.8，Terminal-Bench 4 上为 27.3），OpenAI 的 Agents API 和暂停的 200 美元 Pro 版注册，以及周五 Hacker News 上要求减少 AI 新闻的帖子。结论：REVERT。

Canonical: https://thedailydiff.dev/zh-CN/video/2026-09-11-astra-slop-factory/

## 本视频涵盖的内容

- Armin Ronacher：GPT-6 Astra 无人看管 35 小时，约 1,200 美元，79 次提交，增加 7.5 万行代码，没有任何成果交付。
- Earendil / SlopCodeBench：代理代码比人类代码仓库冗长且腐蚀约 2 倍；严格通过率为 0%。
- Quesma：RTK 报告节省了 89% 的 token，但使用 DeepSeek 时 Terminal-Bench 成本增加了 17%；重写循环连续失败了 339 次。
- Cognition SWE-2：基于 Kimi K3 后训练，在 FrontierCode 上以三分之一的价格与 Fable 5.1 匹配；TB 2.1 得分 92.8，TB 4 得分 27.3；Devin Voice。
- OpenAI Agents API（作为服务提供的 Codex harness，仅限美国，无 ZDR）；因 Astra 需求暂停 200 美元专业版注册。

## 翻译的文字记录

译自英文原版旁白。可用音频和字幕由 YouTube 控制。

0:00 编写 Flask 的 Armin Ronacher 给了 GPT-6 Astra 一个简单的提示，然后 让它独自运行了三十五小时。 它返回了七万五千行代码，并且用他的话说， 绝对没有任何价值，这使其成为有史以来最真实的 软件工厂。 他周三发布了这份报告。 周四，Cognition 发布了 SWE-2，OpenAI 发布了 Agents API 并暂停了其两百美元套餐的注册，

0:24 因为 Astra 占用了服务器。 周五，这份报告登上了 Hacker News 的头版， 就在一篇请求 Hacker News 停止发布关于 AI 帖子的下面几行。 在此视频中：Astra 无人监督一天半的产出， 将混乱量化的两个测量方法，为什么一个拥有七万九千颗星的工具 会增加你的账单，以及 Hacker News 如何尝试使用 AI 来过滤 AI。 AI，使用 AI。 今天是 9 月 11 日星期五，这是 The Daily Diff。

0:53 工厂。一个提示：用虚拟线程和词法作用域构建一个 Python。 Astra 记录了自己的笔记，启动了自己的子代理， 然后一直运行，直到 Armin 拔掉插头，一天半后，大约花费了一千二百美元。 七十九次提交，所以每次提交花费十五美元半， 这大致是人类的收费，只不过人类最终会停止。 代码就是故事。 Astra 没有使用编辑工具，而是通过管道传输 Python heredoc 来修补 C 文件，这些 heredoc 读取文件，字符串替换一个函数，然后写回去。

1:20 为了运行一个 Windows 测试，它编写了 Python，然后 Python 启动 Node，Node 又启动了 PowerShell，一个带有护照的调用堆栈。 它提交的单元测试根本没有空格， 因为没有缩进，它们在 token 上便宜了百分之十。 任务列表从一、二、三漂移到了任务 8b2c2b2b 检查点 一，这就是你知道实习生独自待太久了。 Armin 的理论：模型因完成长期任务而获得奖励，但对丑陋的代码几乎没有 惩罚，所以 token 高尔夫化的工具调用泄露到代码库中，

1:48 并且越少人类查看，就越不重要。 他把这部分标题为“如果你不看，那就是通用人工智能”。 Hacker News 补充了经济学观点：更多的代码意味着更多的 token 来维护它， 这使得混乱不是一个 Bug，而是一种订阅。 你能测量混乱吗？ Armin 自己的公司本周尝试了。 Earendil 运行了 SlopCodeBench 的数据：代理代码比人类仓库冗长约两倍， 并且腐蚀程度是其两倍。

2:10 当基准测试在检查点之间清除代理的内存时， 他们测试的每个模型的严格通过率都是零。 他们发现最可靠的混乱指标是原始行数， 但一旦有人为此优化，它就不再起作用了， 所以请不要告诉模型。 然后是钱包。 RTK 在 GitHub 上有七万九千颗星，YouTube 缩略图承诺可以 将你的 Claude 代码账单减半；它在代理读取终端输出之前对其进行压缩。

2:34 Quesma 在 Terminal-Bench 上使用了一千五百美元的 token 运行它。 使用 Fable，账单下降了百分之五，几乎都来自一个任务；使用 DeepSeek， 平均每个任务的成本增加了百分之十七。 同时，RTK 自己的计数器报告节省了百分之八十九， 因为它计算的是移除的字节数，而不是造成的额外回合数：一个智能电表，却 向邻居收费。 一个版本错误将 find 重写成一个失败的命令， 连续失败了三百三十九次，价格是九倍。

3:01 这个吞噬 token 的工具有一个循环。 洪水本身。 Cognition 的 SWE-2 是 Kimi K3，这个开源的中文模型， 经过后期训练，使其在 Cognition 自己的基准测试中以三分之一的价格与 Fable 5.1 匹配； Hacker News：为什么所有的美国 AI 模型基本上都是穿着风衣的 Kimi。 Kimi，穿着风衣。 在 Terminal-Bench 2.1 上它位居榜首；在 Terminal-Bench 4 上， 这个还没人记住的基准上，它得了二十七分，而 Fable 是五十六分，

3:28 所以在幻灯片基准测试中，最好的那一列是每个人都 已经通过的考试。Cognition 还宣布了 Devin Voice，你最喜欢的 AI 软件 工程师刚有了一部固定电话，因为智能编码唯一缺少的就是 等候音乐。 OpenAI，同一天：Agents API，作为服务出售的 Codex harness。 OpenAI 运行沙盒，仅限美国数据驻留，不支持零数据保留， 因此代理记住你的代码库的程度与 ChatGPT 记住的完全一样。 然后 OpenAI 暂停了二百美元专业版计划的注册，

3:57 因为 Astra 的需求，“前所未有”： 第一个有等待名单的产品 需要支付更多费用。 Armin 对他的工厂进行了全面重置。 他就是需求。 这就引出了周五的 Ask HN：我们能不能限制一下 AI 新闻的洪流， 六百五十六个赞，因为，引用一下，“每当 OpenAI 或 Anthropic 的人放个屁，就会有一个热门帖子。”

4:17 回复是过滤器：hcker.news 使用一个基于八千个例子训练的 BERT 分类器来删除 AI 故事，以 AI 删除 AI， 天然饲养；一个不区分大小写匹配 A-I 的 uBlock 正则表达式也会删除 email、daily、main、domain 和 train，所以正则表达式，一如既往， 是罪魁祸首。 同一天下午，四百一十五条评论 就一个 Claude 支持页面争论不休， 该页面称 Claude 适合十八岁以上用户。

4:38 该页面日期为五月。 什么也没变。甚至不是新闻的 AI 新闻也是新闻， 公平地说，这也是我的商业模式。 如果你想阅读而不是听我说，每天早上你的收件箱里都会收到 diff ——免费订阅 the daily diff dot dev，链接如下。 它不可避免地是 AI 新闻。 所以——今天对这个三十五小时软件工厂的裁决是：REVERT。 七十九次无人阅读的提交不是一个代码库，而是一个带有 git

5:04 日志的负债；Astra 令人印象深刻，但工厂这部分需要回滚。 这就是今天的 diff。 我是 Axrisi 的 Niko。 负责任地合并。

## 来源

- [Armin Ronacher — Astra for Coding: Why Are We Doing This Again?](https://lucumr.pocoo.org/2026/9/7/astra-why/) — lucumr.pocoo.org
- [HN: Astra for Coding](https://news.ycombinator.com/item?id=49654229) — news.ycombinator.com
- [Earendil — Measuring the sloppiness of code](https://earendil.com/posts/measuring-code-sloppiness/) — earendil.com
- [HN: Measuring the sloppiness of code](https://news.ycombinator.com/item?id=49658311) — news.ycombinator.com
- [Quesma — RTK reports huge token savings, but our cost benchmarks disagree](https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/) — quesma.com
- [HN: RTK](https://news.ycombinator.com/item?id=49656471) — news.ycombinator.com
- [RTK (Rust Token Killer)](https://github.com/rtk-ai/rtk) — github.com
- [Cognition — Introducing SWE-2](https://cognition.com/blog/swe-2) — cognition.com
- [HN: Cognition SWE-2](https://news.ycombinator.com/item?id=49645443) — news.ycombinator.com
- [OpenAI — Agents API](https://developers.openai.com/api/docs/guides/agents-api/overview) — developers.openai.com
- [HN: OpenAI Agents API](https://news.ycombinator.com/item?id=49649213) — news.ycombinator.com
- [TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demand](https://techcrunch.com/2026/09/10/openai-puts-pro-subscriptions-on-hold-due-to-astra-demand/) — techcrunch.com
- [Ask HN: Can we please limit the AI news flood?](https://news.ycombinator.com/item?id=49657850) — news.ycombinator.com
- [HN: Claude is only available to people over 18 years](https://news.ycombinator.com/item?id=49656225) — news.ycombinator.com
