Armin RonacherはGPT-6 Astraを35時間放置しました。
Armin Ronacher(Flask、Jinja)はGPT-6 Astraに1つのプロンプトを与え、35時間放置しました。
Armin Ronacher(Flask、Jinja)はGPT-6 Astraに1つのプロンプトを与え、35時間放置しました。その結果、約10億トークン、約1,200ドル、79コミット、75,000行のコードが生成されましたが、「まったく価値のないもの」でした。回収されたコードは、Pythonの文字列置換 heredocでパッチが適用されたCファイル、PythonがNodeを、NodeがPowerShellを起動する構成、トークンコストを10%削減するために空白が削除された単体テストなど、その状況を物語っています。2つの測定が彼の主張を裏付けています。EarendilのSlopCodeBenchの数値(エージェントコードは人間が作成したリポジトリの約2倍冗長で劣化しており、厳密な合格率は0%)と、QuesmaによるRTKの1,500ドルのベンチマーク(79kスター、「自社カウンターで89%のトークンを節約」、DeepSeekを使用した場合、タスクあたり+17%)。その他、CognitionのSWE-2(トレンチコートを着たKimi K3、Terminal-Bench 2.1で92.8点、Terminal-Bench 4で27.3点)、OpenAIのAgents APIと一時停止された200ドルのProプランの登録、そして金曜日のHacker NewsがAIニュースの削減を要求したこと。評決:REVERT。
この動画の要点
- Armin Ronacher: 35時間の無人GPT-6 Astra、約1,200ドル、79コミット、7万5千行以上のコード、何も出荷されず
- Earendil / SlopCodeBench: エージェントコードは人間のリポジトリの約2倍冗長で劣化しており、厳密な合格率は0%
- Quesma: RTKは89%のトークンを節約したと報告していますが、Terminal-BenchのコストはDeepSeekで17%増加。書き換えループは339回連続で失敗しました
- Cognition SWE-2: Kimi K3から後方学習され、FrontierCodeでFable 5.1に匹敵し、価格は3分の1。TB 2.1で92.8点 vs TB 4で27.3点。Devin Voice
- OpenAI Agents API(Codexハーネスをサービスとして提供、米国のみ、ZDRなし)。Astraの需要のため、200ドルのProプランの登録は一時停止
翻訳されたトランスクリプト
オリジナルの英語ナレーションから翻訳されています。利用可能なオーディオとキャプションはYouTubeによって管理されています。
0:00 Flaskを書いた男、Armin RonacherはGPT-6 Astraに単一のプロンプトを与え、 35時間放置しました。 75,000行のコードが返ってきましたが、 彼の言葉を借りれば、「まったく価値のないもの」でした。これは、最も現実的な ソフトウェア工場と言えるでしょう。 彼は水曜日にその報告書を投稿しました。 木曜日には、CognitionがSWE-2を、OpenAIがAgents APIを出荷し、 そして200ドルのプランの登録を一時停止しました。
0:24 Astraがサーバーを食い尽くしたからです。 そして金曜日には、その報告書がHacker Newsのフロントページに到達しました。 Hacker Newsに対し、AIに関する投稿を減らすよう求める投稿の数行下です。 このビデオでは、1日半の監視なしのAstraが何を生み出すか、 混乱を数値化する2つの測定、7万9千 スターのツールがなぜあなたの請求額を増やすのか、そしてHacker NewsがAIを使って AIを除外しようとした方法について解説します。 9月11日金曜日、The Daily Diffです。
0:53 工場。1つのプロンプト:「仮想スレッドと字句スコープを持つPythonを構築せよ」。 Astraは独自のメモを取り、独自のサブエージェントを起動し、 Arminが電源を抜くまで実行され続けました。1日半後、約1200 ドルが費やされました。79コミット、つまり1コミットあたり15ドル半です。 これは人間が請求する料金とほぼ同じですが、人間はいずれ止まります。 コードが物語っています。 エディットツールの代わりに、AstraはPythonのheredocをパイプしてCファイルをパッチします。 ファイルの内容を読み込み、関数を文字列置換し、書き戻すのです。
1:20 Windowsのテストを実行するために、PythonがNodeを起動し、Nodeが PowerShellを起動するコードを書きました。パスポート付きのコールスタックです。 コミットされた単体テストには空白がまったくありません。 インデントがないと、トークンコストが10パーセント安くなるからです。 そして、タスクリストは1、2、3からタスク8b2c2b2bチェックポイント 1へとずれ込みました。これは、インターンが一人でいすぎた証拠です。 Arminの理論:モデルは長いタスクを完了すると報われ、醜いコードに対してはほとんど 罰せられない。そのため、トークンを節約したツール呼び出しがコードベースに漏れ出し、
1:48 人間が見る回数が減るほど、その影響は小さくなる。 彼はそのセクションに「見なければAGIだ」と題しました。 Hacker Newsは経済学的な側面を付け加えました。コードが増えれば、それを維持するためのトークンも増え、 そのため、だらしないコードはバグではなくサブスクリプションになります。 だらしなさを測定できますか? Arminの会社は今週試みました。 EarendilはSlopCodeBenchの数値を実行しました。エージェントのコードは、比較対象の 人間のリポジトリよりも約2倍冗長で、2倍劣化していました。
2:10 そして、ベンチマークがチェックポイント間でエージェントのメモリを消去すると、 テストしたすべてのモデルの厳密な合格率はゼロでした。 彼らが発見した最も信頼性の高いだらしさの指標は、生の行数でした。 これは、誰かがそれを最適化しようとした瞬間に機能しなくなります。 だから、モデルには言わないでくださいね。 次に財布です。 RTKは7万9千のGitHubスターと、Claude Codeの請求額を半減すると謳うYouTubeのサムネイルを誇ります。 エージェントが読み込む前にターミナル出力を圧縮します。Quesmaは1500ドル分のトークンを使ってTerminal-Benchで実行しました。
2:34 Fableの場合、請求額は5%減少しましたが、ほとんどが1つのタスクによるものでした。DeepSeekの場合、 Fableでは請求額が5%減少しました。ほとんどが1つのタスクによるものです。DeepSeekでは 平均的なタスクの費用が17%増加しました。 一方、RTK自身のカウンターは89%の節約を報告しました。 これは、削除されたバイト数を数えるためであり、余分なターン数を数えるわけではありません。隣人に 請求するスマートメーターのようなものです。 そして、あるバージョンのバグにより、findが失敗するコマンドに書き換えられ、 339回連続で、9倍の価格で失敗しました。
3:01 トークンを殺すツールにはループがあります。 その洪水の様相。 CognitionのSWE-2はKimi K3、つまりオープンな中国製モデルです。 Cognition独自のベンチマークでFable 5.1に匹敵するまで後方学習されましたが、価格は 3分の1です。Hacker Newsはこう問いかけます。「なぜアメリカのAIモデルはすべて基本的に トレンチコートを着たKimiなのでしょうか」。 Terminal-Bench 2.1では全項目でトップに立ちますが、Terminal-Bench 4では、 まだ誰も暗記していないものでは、Fableの56点に対して27点でした。
3:28 つまり、スライドデッキのベンチマークでは、最高の列はすでに誰もが 合格した試験なのです。CognitionはDevin Voiceも発表しました。お気に入りのAIソフトウェア エンジニアが固定電話を手に入れたのです。なぜなら、エージェント型コーディングに欠けていたのは 保留音だったからです。 OpenAIも同日、Agents APIを発表しました。これはCodexハーネスをサービスとして提供するものです。 OpenAIがサンドボックスを運営し、米国内のデータ常駐のみ、ゼロデータ保持なしです。 つまり、エージェントはChatGPTと同じくらいあなたのコードベースを覚えています。 その後、OpenAIは200ドルのProプランの登録を一時停止しました。
3:57 Astraの需要が、引用すると、「前例のない」レベルに達したためです。 より多くを支払うために、 ウェイティングリストがある最初の製品です。 Arminは彼の工場を完全にリセットしました。 彼こそが需要なのです。 これにより、金曜日のAsk HNにたどり着きます。「AIニュースの洪水を制限できませんか?」 656ポイント、なぜなら、引用すると、「OpenAIか Anthropicの誰かが屁をこくたびに、トップ10の投稿がある」からです。
4:17 返信はフィルターでした。hcker.newsは、8000の例で学習したBERT 分類器でAI記事を削除します。AIを削除するAI、 自然育成です。また、大文字小文字を区別しないA-Iに一致するuBlockの正規表現は、 メール、デイリー、メイン、ドメイン、トレインも削除します。つまり、正規表現は、いつものように、 悪役なのです。 同じ日の午後、415件のコメントが Claudeのサポートページについて議論しました。 Claudeは18歳以上であると記載されています。
4:38 ページの日付は5月でした。 何も変わっていません。ニュースではないAIニュースもニュースなのです。 公平に言えば、これも私のビジネスモデルです。 私が言うのを聞くよりもこれを読みたい場合は、毎朝差分があなたの受信箱に届きます。 thedailydiff.devで無料で、リンクは下にあります。 避けられないことに、これもAIニュースです。 ということで、今日の35時間ソフトウェア工場の評決は、REVERTです。 誰も読んでいない79コミットはコードベースではなく、git
5:04 ログ付きの負債です。Astraは印象的ですが、工場は元に戻すべき部分です。 本日の差分は以上です。 AxrisiのNikoでした。 責任を持ってマージしてください。
情報源
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



