Tự cải thiện đệ quy, bên trong
Google DeepMind đã xuất bản "Dream-RSI: Tự cải thiện đệ quy thông qua các thế giới đang phát triển" — và mô hình mã hóa bên trong nó không bao giờ thay đổi.
Google DeepMind đã xuất bản "Dream-RSI: Tự cải thiện đệ quy thông qua các thế giới đang phát triển" — và mô hình mã hóa bên trong nó không bao giờ thay đổi. Bên trong: cụm từ này có ý nghĩa gì trong 60 năm, điều gì thực sự lặp lại trong Dream-RSI (một chính sách khám phá bằng Python mà "mơ" về các cây tìm kiếm đã ghi), và tại sao 317 lệnh gọi tác tử thay vì 550 lại là một mức giảm giá, chứ không phải một sự cất cánh. Phán quyết: NEEDS REVIEW.
Đọc phiên bản viết (tiếng Anh) ↗
Nội dung video này đề cập
- 1965 → 2008: "Sự bùng nổ trí tuệ" của I. J. Good, AI hạt giống của Yudkowsky — một cỗ máy tự viết lại các trọng số của chính nó
- 2025: AlphaEvolve — phép nhân ma trận 4×4 48 lần, 0.7% sức mạnh tính toán của Google được phục hồi, nhân Gemini nhanh hơn 23%
- 2026: Dream-RSI — chính sách được cải thiện, người viết mã, thẩm phán và người viết lại đều bị đóng băng; lời nhắc ghi "Không giải quyết nhiệm vụ khoa học"
- X: "Google vừa phá vỡ khả năng tự cải thiện đệ quy" (819 lượt thích) so với HN: "gọi đây là RSI có vẻ gây hiểu lầm"
- Các số liệu được sử dụng: §4.1 Lasso 550 → 317 lệnh gọi tác tử, 3587 → 2931 ms; Bảng 1 đóng gói hình tròn 2.635983 = AlphaEvolveV2; §4.3 KernelBench ít thế hệ hơn 2.43× / 1.79×, nhanh hơn tới 2.09×; Phụ lục B.2 lời nhắc (tất cả từ tệp PDF ở trên)
Bản ghi đã dịch
Được dịch từ lời tường thuật tiếng Anh gốc. Âm thanh và phụ đề có sẵn được điều khiển bởi YouTube.
0:00 Tự cải thiện đệ quy là ý tưởng rằng một AI tự làm cho mình thông minh hơn, sau đó sử dụng bản thân thông minh hơn để làm điều đó một lần nữa, và tuần này Google đã xuất bản một bài báo với hai từ đó trong tiêu đề, trong đó các trọng số của mô hình không bao giờ di chuyển. Ba con số. CEO của Anthropic nói rằng vòng lặp này đã chạy từ mùa hè, đó là lý do của ông để làm chậm toàn bộ ngành công nghiệp. Tweet thông báo rằng Google vừa phá vỡ nó đã thu thập được tám trăm lượt thích trong một ngày.
0:24 Và kết quả chính của bài báo là 317 lệnh gọi mô hình thay vì 550, đó là một mức giảm giá, chứ không phải một sự cất cánh. Trong ba phút: cụm từ này đến từ đâu, điều gì thực sự lặp lại bên trong Dream-RSI, và cách đọc bài báo tiếp theo với RSI trên trang bìa. Đây là The Daily Diff, bên trong. 1965. I. J. Good, một nhà thống kê của Bletchley Park, người đã làm việc cạnh Turing, viết rằng một cỗ máy siêu thông minh có thể thiết kế những cỗ máy thậm chí còn tốt hơn,
0:52 gọi đó là sự bùng nổ trí tuệ và phát minh cuối cùng mà con người cần tạo ra, với điều kiện cỗ máy đó đủ ngoan ngoãn để nói cho chúng ta cách kiểm soát nó, đó là cái điều kiện mà mọi người ngừng đọc sau dấu phẩy. Trong bốn mươi năm, cụm từ này có nghĩa chính xác là: một hệ thống tự chỉnh sửa mã nguồn hoặc trọng số của nó và trở nên thông minh hơn sau mỗi lần chạy. Bài tiểu luận năm 2008 của Eliezer Yudkowsky đã biến nó thành từ then chốt của an toàn AI, và không ai có một cỗ máy để thử nghiệm nó, đó là điều kiện lý tưởng cho một định nghĩa. Sau đó vào tháng 5 năm 2025 DeepMind đã xuất xưởng AlphaEvolve,
1:23 một tác tử Gemini đề xuất mã, được chấm điểm, giữ lại những người thắng và đột biến chúng một lần nữa. Nó nhân các ma trận phức 4x4 trong 48 bước, đánh bại một kỷ lục mà Strassen đã thiết lập vào năm 1969, và nó phục hồi khoảng không phẩy bảy phần trăm tổng sức mạnh tính toán trên toàn thế giới của Google, mà ở quy mô của Google là một trung tâm dữ liệu được tìm thấy dưới ghế sofa. Gemini giờ đây đang giúp đào tạo Gemini, và cụm từ này lặng lẽ chuyển từ các blog về an toàn sang các thông cáo báo chí. Dream-RSI gắn một bộ điều khiển lên trên vòng lặp đó.
1:52 Một chính sách, một chương trình Python thực sự, quyết định những nhánh nào của cây tìm kiếm cần mở rộng, bao nhiêu cái song song, và khi nào thì từ bỏ. Gemini viết mã ứng viên, và một bộ đánh giá cố định chấm điểm nó. Mỗi lần chạy để lại một cây về những gì đã thử và điểm số của nó. Cái cây đó trở thành một trình mô phỏng phát lại: một Gemini thứ hai, cũng bị đóng băng, viết lại chính sách, và chính sách mới được kiểm tra dựa trên các kết quả đã ghi thay vì trên các GPU thực.
2:16 Bài báo gọi đây là mơ, và một lần chạy thực trả tiền cho hàng ngàn lần mơ với chi phí thực thi bằng không. Người thắng quay trở lại trực tuyến, nhóm các thế giới đã ghi được mở rộng, lặp lại. Và lời nhắc trong Phụ lục B.2 nói với AI tự cải thiện, bằng văn bản: chỉ chỉnh sửa tệp này, và không giải quyết nhiệm vụ khoa học. Được đo. Trên nhiệm vụ giải quyết Lasso, tìm kiếm cố định đã sử dụng 550 lệnh gọi Gemini để đạt ba phẩy sáu giây, Dream-RSI đã sử dụng 317 để đạt hai phẩy chín, và cả hai đều đánh bại scikit-learn.
2:46 Trên KernelBench, nó đạt tốc độ nhân tương tự với khoảng hai phẩy bốn lần ít thế hệ hơn. Và trên đóng gói hình tròn, nó đạt điểm hai phẩy sáu ba năm chín tám ba, chính xác là, đến sáu chữ số thập phân, những gì AlphaEvolve phiên bản hai đã đạt được năm ngoái. Vì vậy, X đọc tiêu đề: Google vừa phá vỡ khả năng tự cải thiện đệ quy. Hacker News đọc tệp PDF: gọi đây là RSI có vẻ gây hiểu lầm. Và cùng tuần đó, CEO của một đối thủ cạnh tranh nói rằng vòng lặp đã chạy từ mùa hè và mọi người nên chậm lại.
3:13 Ba câu, cùng hai từ, ba cỗ máy khác nhau. Vì vậy, thứ Hai, cách đọc bài báo RSI tiếp theo. Một: hỏi đối tượng nào thay đổi, trọng số, mã, hay cài đặt tìm kiếm; Dream-RSI thay đổi cái thứ ba. Hai: hỏi ai bị đóng băng; ở đây là người viết mã, thẩm phán và người viết lại, cả ba. Ba: hỏi số chính trong tiêu đề là đơn vị của cái gì. Tính toán được tiết kiệm là tối ưu hóa; một điểm chuẩn mà mô hình không thể đạt được trước đây là sự cất cánh, và chưa ai xuất bản cái đó.
3:40 Phán quyết, bên trong: needs review. Vòng lặp là có thật, các khoản tiết kiệm đã được đo lường, và hai từ trên trang bìa mô tả một cỗ máy không có trong bài báo. Nếu bạn muốn đọc điều này hơn là nghe tôi nói, The Daily Diff sẽ đến hộp thư của bạn mỗi sáng, miễn phí tại the daily diff dot dev, liên kết bên dưới. Hãy cho tôi biết những gì cần mở ra tiếp theo trong phần bình luận. Và đó là The Daily Diff của ngày hôm nay. Tôi là Niko từ Axrisi.
4:00 Sáp nhập một cách có trách nhiệm.
Nguồn
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



