Αναδρομική αυτοβελτίωση, κάτω από το κάλυμμα
Η Google DeepMind δημοσίευσε το «Dream-RSI: Αναδρομική Αυτοβελτίωση μέσω Εξελισσόμενων Κόσμων» — και το μοντέλο κωδικοποίησης μέσα σε αυτό δεν αλλάζει ποτέ.
Η Google DeepMind δημοσίευσε το «Dream-RSI: Αναδρομική Αυτοβελτίωση μέσω Εξελισσόμενων Κόσμων» — και το μοντέλο κωδικοποίησης μέσα σε αυτό δεν αλλάζει ποτέ. Κάτω από το κάλυμμα: τι σήμαινε η φράση για 60 χρόνια, τι πραγματικά επαναλαμβάνεται στο Dream-RSI (μια πολιτική εξερεύνησης Python που «ονειρεύεται» πάνω από καταγεγραμμένα δέντρα αναζήτησης), και γιατί 317 κλήσεις πρακτόρων αντί για 550 είναι έκπτωση, όχι απογείωση. Ετυμηγορία: NEEDS REVIEW.
Διαβάστε την γραπτή έκδοση (Αγγλικά) ↗
Τι καλύπτει αυτό το βίντεο
- 1965 → 2008: «έκρηξη νοημοσύνης» του I. J. Good, AI σπόρου του Yudkowsky — μια μηχανή που ξαναγράφει τα δικά της βάρη
- 2025: AlphaEvolve — 48-πολλαπλασιασμός 4×4 πίνακα πολλαπλασιασμού, 0,7% της υπολογιστικής ισχύος της Google ανακτήθηκε, πυρήνες Gemini 23% ταχύτεροι
- 2026: Dream-RSI — η πολιτική βελτιώνεται, ο κωδικοποιητής, ο κριτής και ο αναπροσαρμογέας είναι όλοι παγωμένοι· η προτροπή λέει «Μην λύσετε την επιστημονική εργασία»
- X: «Η Google μόλις έσπασε την αναδρομική αυτοβελτίωση» (819 likes) vs HN: «το να το αποκαλείς RSI φαίνεται παραπλανητικό»
- Χρησιμοποιημένοι αριθμοί: §4.1 Lasso 550 → 317 κλήσεις πρακτόρων, 3587 → 2931 ms· Πίνακας 1 κυκλική συσκευασία 2.635983 = AlphaEvolveV2· §4.3 KernelBench 2.43× / 1.79× λιγότερες γενιές, έως και 2.09× ταχύτερα· Παράρτημα B.2 προτροπή (όλα από το παραπάνω PDF)
Μεταφρασμένη μεταγραφή
Μεταφράστηκε από την πρωτότυπη αγγλική αφήγηση. Ο διαθέσιμος ήχος και οι υπότιτλοι ελέγχονται από το YouTube.
0:00 Η αναδρομική αυτοβελτίωση είναι η ιδέα ότι μια τεχνητή νοημοσύνη γίνεται πιο έξυπνη, και μετά χρησιμοποιεί τον πιο έξυπνο εαυτό της για να το ξανακάνει, και αυτή την εβδομάδα η Google δημοσίευσε ένα έγγραφο με αυτές τις δύο λέξεις στον τίτλο, στο οποίο τα βάρη του μοντέλου δεν κινούνται ποτέ. Τρεις αριθμοί. Ο Διευθύνων Σύμβουλος της Anthropic λέει ότι αυτός ο βρόχος τρέχει από το καλοκαίρι, που είναι ο λόγος του για να επιβραδύνει ολόκληρη τη βιομηχανία. Το tweet που ανακοίνωνε ότι η Google μόλις το έσπασε, συγκέντρωσε οκτακόσια likes σε μια μέρα.
0:24 Και το κύριο αποτέλεσμα της ίδιας της εργασίας είναι 317 κλήσεις μοντέλου αντί για 550, που είναι έκπτωση, όχι απογείωση. Σε τρία λεπτά: από πού προήλθε η φράση, τι πραγματικά επαναλαμβάνεται μέσα στο Dream-RSI, και πώς να διαβάσετε την επόμενη εργασία με το RSI στο εξώφυλλο. Αυτό είναι το The Daily Diff, κάτω από το κάλυμμα. 1965. Ο I. J. Good, ένας στατιστικολόγος του Bletchley Park που δούλευε δίπλα στον Turing, γράφει ότι μια υπερ-έξυπνη μηχανή θα μπορούσε να σχεδιάσει ακόμη καλύτερες μηχανές,
0:52 το ονομάζει έκρηξη νοημοσύνης και την τελευταία εφεύρεση που χρειάζεται να κάνει ο άνθρωπος, υπό την προϋπόθεση ότι η μηχανή είναι αρκετά υπάκουη για να μας πει πώς να την ελέγξουμε, που είναι το «υπό την προϋπόθεση ότι» οι άνθρωποι σταματούν να διαβάζουν μετά την κόμμα. Για σαράντα χρόνια η φράση σήμαινε ακριβώς αυτό: ένα σύστημα που επεξεργάζεται τα δικά του πηγαίο κώδικα ή βάρη και βγαίνει πιο έξυπνο σε κάθε πέρασμα. Το δοκίμιο του Eliezer Yudkowsky του 2008 το έκανε την κύρια λέξη της ασφάλειας της ΤΝ, και κανείς δεν είχε μια μηχανή για να το δοκιμάσει, που είναι η ιδανική συνθήκη για έναν ορισμό. Στη συνέχεια, τον Μάιο του 2025, η DeepMind κυκλοφόρησε το AlphaEvolve,
1:23 ένας πράκτορας Gemini που προτείνει κώδικα, τον βαθμολογεί, κρατά τους νικητές και τους μεταλλάσσει ξανά. Πολλαπλασίασε τετράγωνους προς τετράγωνους σύνθετους πίνακες σε 48 βήματα, ξεπερνώντας ένα ρεκόρ που έθεσε ο Strassen το 1969, και ανακτά περίπου μηδέν κόμμα επτά τοις εκατό της παγκόσμιας υπολογιστικής ισχύος της Google, η οποία στην κλίμακα της Google είναι ένα κέντρο δεδομένων που βρέθηκε κάτω από τον καναπέ. Το Gemini βοηθούσε τώρα στην εκπαίδευση του Gemini, και η φράση σιωπηλά μετακινήθηκε από τα ιστολόγια ασφαλείας σε δελτία τύπου. Το Dream-RSI βιδώνει έναν ελεγκτή πάνω από αυτόν τον βρόχο.
1:52 Μια πολιτική, ένα πραγματικό πρόγραμμα Python, αποφασίζει ποια παρακλάδια του δέντρου αναζήτησης θα επεκτείνει, πόσα παράλληλα, και πότε να εγκαταλείψει. Το Gemini γράφει τον υποψήφιο κώδικα, και ένας σταθερός αξιολογητής τον βαθμολογεί. Κάθε εκτέλεση αφήνει πίσω ένα δέντρο από αυτά που δοκιμάστηκαν και τι βαθμολογήθηκαν. Αυτό το δέντρο γίνεται ένας προσομοιωτής αναπαραγωγής: ένα δεύτερο, εξίσου παγωμένο Gemini ξαναγράφει την πολιτική, και η νέα πολιτική δοκιμάζεται έναντι των καταγεγραμμένων αποτελεσμάτων αντί σε πραγματικές GPUs.
2:16 Η εργασία το ονομάζει αυτό όνειρο, και μια πραγματική εκτέλεση πληρώνει για χιλιάδες ονειρεμένες χωρίς κόστος εκτέλεσης. Ο νικητής επιστρέφει online, η δεξαμενή των καταγεγραμμένων κόσμων μεγαλώνει, επαναλάβετε. Και η προτροπή στο Παράρτημα B.2 λέει στην αυτοβελτιούμενη τεχνητή νοημοσύνη, γραπτώς: επεξεργαστείτε μόνο αυτό το αρχείο, και μην λύσετε την επιστημονική εργασία. Μετρημένο. Στην εργασία επίλυσης Lasso, η σταθερή εξερεύνηση ξόδεψε 550 κλήσεις Gemini για να φτάσει τα τρία κόμμα έξι δευτερόλεπτα, το Dream-RSI ξόδεψε 317 για να φτάσει τα δύο κόμμα εννέα, και οι δύο ξεπέρασαν το scikit-learn.
2:46 Στο KernelBench έφτασε στην ίδια ταχύτητα πυρήνα με περίπου δύο κόμμα τέσσερις φορές λιγότερες γενιές. Και στην κυκλική συσκευασία σημείωσε δύο κόμμα έξι τρία πέντε εννέα οκτώ τρία, το οποίο είναι ακριβώς, σε έξι δεκαδικά ψηφία, ό,τι σημείωσε η AlphaEvolve έκδοση δύο πέρυσι. Έτσι, ο X διάβασε τον τίτλο: Η Google μόλις έσπασε την αναδρομική αυτοβελτίωση. Το Hacker News διάβασε το PDF: το να το αποκαλείς RSI φαίνεται παραπλανητικό. Και την ίδια εβδομάδα ο Διευθύνων Σύμβουλος ενός ανταγωνιστή είπε ότι ο βρόχος έτρεχε από το καλοκαίρι και όλοι πρέπει να επιβραδύνουν.
3:13 Τρεις προτάσεις, οι ίδιες δύο λέξεις, τρεις διαφορετικές μηχανές. Λοιπόν, Δευτέρα, πώς να διαβάσετε την επόμενη εργασία RSI. Ένα: ρωτήστε ποιο αντικείμενο αλλάζει, τα βάρη, τον κώδικα, ή τις ρυθμίσεις αναζήτησης· Το Dream-RSI αλλάζει το τρίτο. Δύο: ρωτήστε ποιος είναι παγωμένος· εδώ είναι ο κωδικοποιητής, ο κριτής και ο αναπροσαρμογέας, και οι τρεις. Τρία: ρωτήστε ποια μονάδα είναι ο κύριος αριθμός. Η εξοικονόμηση υπολογιστικής ισχύος είναι βελτιστοποίηση· ένα benchmark που το μοντέλο δεν μπορούσε να φτάσει πριν είναι η απογείωση, και κανείς δεν το έχει δημοσιεύσει ακόμα.
3:40 Ετυμηγορία, κάτω από το κάλυμμα: χρειάζεται επανεξέταση. Ο βρόχος είναι πραγματικός, οι εξοικονομήσεις μετρημένες, και οι δύο λέξεις στο εξώφυλλο περιγράφουν μια μηχανή που δεν υπάρχει στην εργασία. Αν προτιμάτε να το διαβάσετε αυτό παρά να με ακούσετε να το λέω, το diff προσγειώνεται στα εισερχόμενά σας κάθε πρωί, δωρεάν στο the daily diff dot dev, σύνδεσμος παρακάτω. Πείτε μου τι να ανοίξω στη συνέχεια στα σχόλια. Και αυτό είναι το diff για σήμερα. Είμαι ο Νίκος από την Axrisi.
4:00 Συγχωνεύστε υπεύθυνα.
Πηγές
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



