Armin Ronacher bỏ mặc GPT-6 Astra 35 giờ.
Armin Ronacher (Flask, Jinja) đã đưa cho GPT-6 Astra một lời nhắc và bỏ mặc nó trong 35 giờ: khoảng một tỷ token, khoảng 1.200 USD, 79 commit, 75.000 dòng mã — và "hoàn toàn không có giá trị gì".
Armin Ronacher (Flask, Jinja) đã đưa cho GPT-6 Astra một lời nhắc và bỏ mặc nó trong 35 giờ: khoảng một tỷ token, khoảng 1.200 USD, 79 commit, 75.000 dòng mã — và "hoàn toàn không có giá trị gì". Mã nó khôi phục là câu chuyện: các tệp C được vá bằng các heredoc nối chuỗi Python, Python sinh ra Node sinh ra PowerShell, các bài kiểm tra đơn vị đã xóa khoảng trắng vì rẻ hơn 10% token. Hai phép đo ủng hộ anh ấy: các con số SlopCodeBench của Earendil (mã tác nhân dài dòng và bị xói mòn gấp đôi so với các kho lưu trữ của con người, tỷ lệ đạt nghiêm ngặt 0%) và điểm chuẩn 1.500 USD của Quesma về RTK (79k sao, "tiết kiệm 89% token" trên bộ đếm riêng của nó, +17% mỗi tác vụ với DeepSeek). Ngoài ra: SWE-2 của Cognition (Kimi K3 khoác áo măng tô, 92.8 trên Terminal-Bench 2.1 so với 27.3 trên Terminal-Bench 4), API Agents của OpenAI và việc tạm dừng đăng ký Pro 200 USD, và Hacker News thứ Sáu yêu cầu ít tin tức AI hơn. Phán quyết: REVERT.
Đọc phiên bản viết (tiếng Anh) ↗
Nội dung video này đề cập
- Armin Ronacher: 35 giờ GPT-6 Astra không giám sát, ~1.200 USD, 79 commit, +75k dòng, không có gì được giao hàng
- Earendil / SlopCodeBench: mã tác nhân ~2× dài dòng và bị xói mòn hơn các kho lưu trữ của con người; tỷ lệ đạt nghiêm ngặt 0%
- Quesma: RTK báo cáo tiết kiệm 89% token, nhưng chi phí Terminal-Bench tăng 17% với DeepSeek; một vòng lặp viết lại đã thất bại 339 lần liên tiếp
- Cognition SWE-2: được huấn luyện sau từ Kimi K3, khớp với Fable 5.1 trên FrontierCode với giá chỉ bằng một phần ba; TB 2.1 92.8 so với TB 4 27.3; Devin Voice
- API OpenAI Agents (Codex harness dưới dạng dịch vụ, chỉ ở Hoa Kỳ, không ZDR); tạm dừng đăng ký Pro 200 USD do nhu cầu Astra
Bản ghi đã dịch
Được dịch từ lời tường thuật tiếng Anh gốc. Âm thanh và phụ đề có sẵn được điều khiển bởi YouTube.
0:00 Armin Ronacher, người đã viết Flask, đã đưa cho GPT-6 Astra một lời nhắc duy nhất và bỏ mặc nó trong ba mươi lăm giờ. Nó đã trả về bảy mươi lăm nghìn dòng mã và, theo lời của anh ấy, hoàn toàn không có giá trị gì, điều này khiến nó trở thành nhà máy phần mềm thực tế nhất từng được xây dựng. Anh ấy đã đăng bài viết vào thứ Tư. Vào thứ Năm, Cognition đã giao SWE-2, và OpenAI đã giao API Agents và tạm dừng đăng ký gói hai trăm đô la của mình,
0:24 vì Astra đã chiếm hết máy chủ. Và vào thứ Sáu, bài viết đã lên trang nhất của Hacker News, vài hàng dưới một bài đăng yêu cầu Hacker News vui lòng ngừng đăng về AI. Trong video này: những gì một ngày rưỡi của Astra không giám sát tạo ra, hai phép đo biến sự cẩu thả thành một con số, tại sao một công cụ với bảy mươi chín nghìn sao lại làm hóa đơn của bạn lớn hơn, và cách Hacker News cố gắng lọc AI, bằng cách sử dụng AI. Hôm nay là thứ Sáu, ngày 11 tháng 9, và đây là The Daily Diff.
0:53 Nhà máy. Một lời nhắc: xây dựng một Python với các luồng ảo và phạm vi từ vựng. Astra tự ghi chú, tự tạo các tác nhân phụ của riêng mình, và chạy cho đến khi Armin rút phích cắm, một ngày rưỡi và khoảng mười hai trăm đô la sau đó. Bảy mươi chín commit, tức là mười lăm rưỡi đô la mỗi commit, xấp xỉ những gì một người tính phí, ngoại trừ việc người đó cuối cùng cũng dừng lại. Mã là câu chuyện. Thay vì công cụ chỉnh sửa, Astra vá các tệp C bằng cách truyền heredoc Python đọc tệp, thay thế chuỗi một hàm vào và ghi lại.
1:20 Để chạy một bài kiểm tra Windows, nó đã viết Python sinh ra Node sinh ra PowerShell, một ngăn xếp cuộc gọi có hộ chiếu. Các bài kiểm tra đơn vị mà nó đã commit hoàn toàn không có khoảng trắng nào, vì không có thụt lề, chúng rẻ hơn mười phần trăm token. Và danh sách tác vụ đã trôi từ một, hai, ba đến tác vụ 8b2c2b2b checkpoint một, đó là cách bạn biết thực tập sinh đã ở một mình quá lâu. Lý thuyết của Armin: mô hình được thưởng khi hoàn thành các tác vụ dài và hầu như không bị phạt vì mã xấu, vì vậy các lệnh gọi công cụ được rút gọn token rò rỉ vào codebase,
1:48 và càng ít người xem, thì điều đó càng ít quan trọng. Anh ấy đã đặt tên cho phần đó là It's AGI If You Don't Look. Hacker News đã thêm kinh tế: nhiều mã hơn có nghĩa là nhiều token hơn để duy trì nó, điều này khiến sự cẩu thả không phải là một lỗi mà là một gói đăng ký. Bạn có thể đo lường sự cẩu thả không? Công ty của Armin đã thử trong tuần này. Earendil đã chạy các con số SlopCodeBench: mã tác nhân dài dòng gấp đôi và bị xói mòn gấp đôi so với các kho lưu trữ của con người mà nó được so sánh,
2:10 và khi điểm chuẩn xóa bộ nhớ của tác nhân giữa các checkpoint, tỷ lệ đạt nghiêm ngặt cho mọi mô hình mà họ đã thử nghiệm là không. Số liệu cẩu thả đáng tin cậy nhất mà họ tìm thấy là số lượng dòng thô, điều này ngừng hoạt động ngay khi ai đó tối ưu hóa cho nó, vì vậy xin đừng nói với các mô hình. Rồi cái ví. RTK có bảy mươi chín nghìn sao GitHub và hình thu nhỏ YouTube hứa hẹn giảm một nửa hóa đơn Claude Code của bạn; nó nén đầu ra thiết bị đầu cuối trước khi tác nhân
2:34 đọc nó. Quesma đã chạy nó trên Terminal-Bench với mười lăm trăm đô la token. Với Fable, hóa đơn giảm năm phần trăm, gần như tất cả từ một tác vụ; với DeepSeek tác vụ trung bình trở nên đắt hơn mười bảy phần trăm. Trong khi đó, bộ đếm riêng của RTK báo cáo tiết kiệm tám mươi chín phần trăm, vì nó đếm số byte đã xóa, không phải số lượt thêm vào gây ra: một đồng hồ thông minh tính tiền hàng xóm. Và một lỗi phiên bản đã viết lại find thành một lệnh bị lỗi, ba trăm ba mươi chín lần liên tiếp, với giá gấp chín lần.
3:01 Công cụ giết token có một vòng lặp. Chính lũ lụt. SWE-2 của Cognition là Kimi K3, mô hình tiếng Trung mở, được huấn luyện sau cho đến khi nó khớp với Fable 5.1 trên điểm chuẩn của Cognition với giá một phần ba; Hacker News: tại sao tất cả các mô hình AI của Mỹ về cơ bản là Kimi trong một chiếc áo khoác măng tô. Trên Terminal-Bench 2.1, nó đứng đầu toàn bộ bảng; trên Terminal-Bench 4, cái mà chưa ai thuộc lòng, nó đạt hai mươi bảy so với năm mươi sáu của Fable,
3:28 vì vậy trên các điểm chuẩn slide-deck, cột tốt nhất là bài kiểm tra mà mọi người đã vượt qua. Cognition cũng công bố Devin Voice, kỹ sư phần mềm AI yêu thích của bạn vừa có điện thoại bàn, vì điều duy nhất mà lập trình tác nhân còn thiếu là nhạc chờ. OpenAI, cùng ngày: API Agents, đây là Codex harness được bán dưới dạng dịch vụ. OpenAI chạy hộp cát, chỉ lưu trữ dữ liệu tại Hoa Kỳ, không có lưu giữ dữ liệu bằng không, vì vậy tác nhân ghi nhớ codebase của bạn chính xác như ChatGPT. Sau đó OpenAI đã tạm dừng đăng ký gói Pro hai trăm đô la,
3:57 vì nhu cầu Astra là, trích dẫn, chưa từng có: sản phẩm đầu tiên có danh sách chờ để trả thêm tiền. Armin đã đốt một bản đặt lại hoàn toàn trên nhà máy của mình. Anh ấy chính là nhu cầu. Điều này đưa chúng ta đến Ask HN thứ Sáu: liệu chúng ta có thể giới hạn dòng tin tức AI không, sáu trăm năm mươi sáu điểm, vì, trích dẫn, mỗi khi ai đó tại OpenAI hoặc Anthropic xì hơi, có một bài đăng top-ten.
4:17 Các phản hồi là các bộ lọc: hcker dot news xóa các câu chuyện AI bằng bộ phân loại BERT được huấn luyện trên tám nghìn ví dụ, AI để xóa AI, nuôi cỏ; và một regex uBlock khớp A-I không phân biệt chữ hoa chữ thường cũng xóa email, daily, main, domain và train, vì vậy regex, như mọi khi, là kẻ phản diện. Cùng buổi chiều, bốn trăm mười lăm bình luận đã tranh cãi về một trang hỗ trợ Claude nói rằng Claude dành cho người từ mười tám tuổi trở lên.
4:38 Trang này có ngày tháng Năm. Không có gì thay đổi. Ngay cả tin tức AI không phải là tin tức cũng là tin tức, mà, công bằng mà nói, cũng là mô hình kinh doanh của tôi. Nếu bạn muốn đọc điều này hơn là nghe tôi nói, the diff sẽ đến hộp thư đến của bạn mỗi sáng — miễn phí tại the daily diff dot dev, liên kết bên dưới. Nó là, không thể tránh khỏi, tin tức AI. Vì vậy — phán quyết hôm nay về nhà máy phần mềm ba mươi lăm giờ: REVERT. Bảy mươi chín commit không ai đọc không phải là một codebase, nó là một khoản nợ có git
5:04 log; Astra rất ấn tượng, và nhà máy là phần cần quay lại. Và đó là the diff cho ngày hôm nay. Tôi là Niko từ Axrisi. Hợp nhất có trách nhiệm.
Nguồn
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



