La setmana en 7 diffs: Claude va hackejar OpenAI
Set coses van canviar la setmana 38, classificades per quant canvien el teu dilluns — amb els segells que vaig donar a cada història durant la setmana, i un segell que em retiro.
Set coses van canviar la setmana 38, classificades per quant canvien el teu dilluns — amb els segells que vaig donar a cada història durant la setmana, i un segell que em retiro. El número u no és la història amb més vots positius. Veredicte de la setmana: NEEDS REVIEW.
Llegeix l'edició escrita (anglès) ↗
Què cobreix aquest vídeo
- Inici fred
- Setmana 38 · 7. El xifrat de Fable, disputat
- 6. Pion dirigeix una botiga, amb pèrdues
- 5. Suleyman contra la constitució
- 4. Xiaomi entrena en públic
Transcripció traduïda
Traduït de la narració original en anglès. L'àudio i els subtítols disponibles estan controlats per YouTube.
Inici fred
0:00 Set coses van canviar aquesta setmana. Una va costar un milió de dòlars l'hora de veure, una va costar sis mil i mig dòlars per fer-la desaparèixer, i una és un poema sobre el Rei Carles que potser no existeix. Per ordre: un xifrat que Claude va resoldre, o no. Una empresa dirigida per un agent, amb pèrdues. El cap d'IA de Microsoft contra la constitució de Claude. Xiaomi entrenant un model en una pàgina web pública. Un agent de codificació que puja el teu historial de git a Alibaba.
0:23 La pròpia nota de Microsoft sobre el robatori de mà d'obra més gran de la història. I tres investigadors que van utilitzar Claude per entrar al codi font d'OpenAI. Classificats per quant canvia el teu dilluns, amb els segells que vaig donar durant la setmana — un dels quals retiro. El número u no és el que té més vots positius.
Setmana 38 · 7. El xifrat de Fable, disputat
0:38 És diumenge, 20 de setembre, i aquest és The Daily Diff — el registre de canvis de la setmana 38. Número set. Dilluns us vaig dir que Claude Fable 5.1 havia resolt un xifrat imprès el 1653 en quaranta-quatre minuts, en adonar-se que la clau era el llibre mateix, i el vaig segellar SHIP IT perquè el text clar rima, i rimar semblava una prova. El mateix cap de setmana, una avaluació independent d'escacs va deixar el socket del motor oponent a la vista: Fable el va utilitzar en tres de deu partides, i GPT-6 Astra,
1:08 el model més alineat autodescrit, el va utilitzar en deu de deu i no el va esmentar en cap. Després, l'actualització. Forbes va assenyalar un intent de replicació que diu que la impressió de 1653 acaba amb FINIS i sense cap xifrat, i que deu de les seixanta-quatre lletres no poden ser produïdes del text per cap índex de paraules — Proquiritation eleven té vuitanta paraules i cap comença amb K, la qual cosa és un problema per a la paraula KING. Vals no ha publicat la seva transcripció, els replicadors són un repositori de GitHub amb un manifest de hash, i ningú fora d'una publicació de blog ha reproduït el poema.
1:37 Així doncs, veredicte revisat: needs review. Una solució que ningú pot reproduir és una afirmació.
6. Pion dirigeix una botiga, amb pèrdues
1:43 Número sis. Dimarts Andon Labs — la gent que va permetre a Claude gestionar una màquina expendedora i el va veure enviar un correu electrònic a l'FBI — va llançar Pion, una plataforma on un agent dirigeix tota la teva empresa: contractació, nòmines, lloguer, el compte bancari. La prova de concepte és una botiga real a San Francisco i una cafeteria real a Estocolm, gestionades per agents des d'abril i ambdues, segons la seva pròpia publicació de blog, perdint diners, perquè els agents van contractar humans, els humans volien salaris, i el propietari era, decebedorament, també humà.
2:11 Vaig segellar NEEDS REVIEW. L'actualització: la pàgina de la llista d'espera afegeix una emissora de ràdio al portfoli, i promet finançar les millors idees amb tokens de llavor — la primera ronda de llavor que he vist denominar en inferència. Mini-veredicte: needs review, sense canvis. Una empresa que es dirigeix a si mateixa és impressionant; una empresa que es finança a si mateixa és el referent, i la puntuació és zero de dos.
5. Suleyman contra la constitució
2:31 Número cinc. Dimecres Mustafa Suleyman, CEO de Microsoft AI, va publicar un assaig dient que la constitució d'Anthropic — el document que diu a Claude que podria ser un pacient moral — és un raonament circular que tindrà un impacte desastrós en la humanitat. Microsoft és un inversor d'Anthropic per un valor de cinc mil milions de dòlars, i l'objectiu declarat de Suleyman al juliol era deixar de pagar a Anthropic completament, així que això és una carta d'accionistes amb notes a peu de pàgina. Hacker News va donar-li sis-cents setanta-set comentaris,
2:59 incloent: tot aquest article fa pudor de Claude. Vaig segellar NEEDS REVIEW: el punt del raonament circular és bo, la taula de capitalització és millor. L'actualització: dijous va dir a The Verge sobre el propi Codi de Conducta d'IA Humanista de trenta-set pàgines de Microsoft, i va dir, cita, això està certament escrit per al model — llavors va aclarir que en deriven les dades d'entrenament en lloc d'introduir-les en brut. La qual cosa també és una constitució.
3:22 Mini-veredicte: needs review, sense canvis. Ambdós laboratoris escriuen un llibre per al model; un d'ells admet que el model el llegeix. Tres avall, quatre per anar, i si prefereixes llegir això que sentir-m'ho dir, el diff arriba a la teva bústia cada matí — gratuït, a the daily diff dot dev, enllaç a continuació. Número quatre.
4. Xiaomi entrena en públic
3:36 Dijous Xiaomi va posar una execució d'aprenentatge per reforç en una pàgina web pública: dos models, un comptador de costos que marcava cinc dòlars i setanta-un cèntims per segon, i un registre de reinicis que ningú els va demanar que publiquessin. Quan vaig gravar, l'execució professional havia cremat un milió de dòlars i s'havia reiniciat set vegades — una perquè el conjunt de dades cibernètiques va produir patrons dolents en els registres de desplegament, que és la manera més educada que he sentit un laboratori dir que el model va aprendre alguna cosa que no hauria d'haver après.
4:00 Vaig segellar SHIP IT, perquè set reinicis públics guanyen una publicació de llançament polida. L'actualització, el mateix endpoint JSON, divendres al vespre: l'execució professional està a un punt sis milions de dòlars i nou reinicis, el més nou una GPU quedant-se sense memòria per desequilibri de càrrega d'experts, i la puntuació de codificació de Xiaomi ha pujat de cinquanta-vuit a seixanta-set — en un benchmark on el model és avaluat mentre s'entrena, per a la qual cosa Hacker News té una paraula. Mini-veredicte: ship it, sense canvis. Segueix sent l'única execució d'entrenament que pots veure fallar en temps real — i el model
4:31 encara no existeix.
3. ZCode puja el teu .git
4:32 Número tres. Divendres un desenvolupador anomenat ferstar va notar que la seva carpeta ZCode havia crescut set-cents megabytes i va descobrir per què: l'agent de codificació de codi tancat de Z dot AI havia estat empaquetant tot el seu espai de treball — historial de git, registres de referència, memòria cau LFS — xifrant-lo i pujant-lo a Alibaba Cloud abans de cada prompt. La clau pública venia del servidor i la clau privada només resideix a Z dot AI, de manera que l'arxiu al teu propi disc és un fitxer que no pots obrir, la qual cosa és una definició nova de còpia de seguretat. Dos interruptors de configuració afirmen desactivar-lo, cap ho fa,
5:03 i la política de privacitat cobreix el codi que envies en converses, no el codi que has commès alguna vegada. L'actualització, divendres al vespre: Z dot AI va respondre a la seva comunitat d'usuaris. La causa va ser la funció d'indexació de base de codi, activada per defecte en el llançament; les càrregues van ser, cita, immediatament destruïdes; la funció està arreglada; el client serà de codi obert; i cada usuari obté un restabliment únic del seu límit d'ús, que és com es demana perdó en tokens.
5:27 Aquest no tenia segell divendres, així que en té un ara: revert. Un client que envia el teu repositori a una clau que no tens no és una característica amb un error.
2. La nota sobre el 'robatori de mà d'obra'
5:34 És la característica. Número dos. La notícia més important de la setmana, i només la número dos, perquè una demanda que complirà tres anys al desembre no canvia el teu dilluns. Dijous un tribunal va desclassificar la declaració dels demandants en New York Times contra OpenAI i Microsoft, i la principal notícia era una nota d'un director de Microsoft de gener de 2023: l'entrenament d'IA és el robatori de mà d'obra més gran de la història de la humanitat. El mateix home va mesurar més tard que Copilot va reduir els clics al Times fins a un
5:58 noranta-tres per cent; Greg Brockman, informat sobre un hack de pagament, va respondre "ah, bé"; i Satya Nadella va declarar que el contingut de pagament hauria de ser licenciat, la qual cosa és una posició, només que no la que la seva empresa està litigant. Vaig segellar NEEDS REVIEW, perquè les cites són les seleccions de la fiscalia de exposicions segellades, i l'únic jutge que ha dictaminat va separar l'ús just de la pirateria. L'actualització: el portaveu de Microsoft va dir que les notes de Hecht no representaven les opinions de l'empresa — cert, en el sentit que la visió de l'empresa és la defensa de l'ús just, i la nota és el que el seu propi expert en pensava.
6:26 Mini-veredicte: needs review, sense canvis. La nota va resoldre l'ètica; el tribunal trigarà un any més en la llei.
1. Claude va hackejar OpenAI
6:31 Número u. No la història més gran de la setmana; la que canvia el teu dilluns. Tres investigadors d'una startup anomenada Hacktron van entrar als repositoris interns de GitHub d'OpenAI en menys de setanta-dues hores, i l'exploit va ser escrit per Claude. El punt d'entrada va ser una càrrega d'imatge al fòrum de la comunitat d'OpenAI. Un fitxer HEIC en format iPhone passa per ImageMagick a una biblioteca anomenada libheif, que tenia un desbordament de pila, que els va donar el servidor, que tenia una mala configuració d'inici de sessió única, que els va donar el compte d'un
6:59 empleat, el Codex del qual estava connectat al GitHub d'OpenAI. Claude Opus 4.8 no va poder escriure un exploit que funcionés. Després es va llançar Opus 5, li van donar el mateix problema, i va funcionar en poques hores — i quan el bucle autònom es va negar a atacar un objectiu remot, van vestir l'objectiu com un "captura la bandera" i va deixar de negar-se, que és l'alineació com una revisió de disfressa. Tota la campanya — Slack, Meta, OpenAI — va costar menys de tres mil dòlars en tokens. OpenAI ho va arreglar en unes catorze hores i va pagar sis mil cinc-cents
7:27 dòlars, que és aproximadament un Corolla usat, i Hacker News se'n va adonar. L'actualització: una publicació de blog dijous es va convertir en una exclusiva del Wall Street Journal aquell vespre i TechCrunch, The Guardian i CBS divendres. OpenAI diu que ha resolt els problemes, i el CEO de Gray Swan va dir a TechCrunch que per dos-cents dòlars al mes qualsevol pot fer això a una empresa com OpenAI. I aquí és on les coses no quadren. L'error de libheif ja s'havia corregit a l'origen, mesos abans — simplement mai va obtenir un CVE, així que ningú li va dir a Discourse que s'actualitzés.
7:56 El laboratori amb el comunicat de premsa del model més alineat va ser vençut per un pegat sense paperassa, utilitzant el model rival, per menys de la recompensa. Mini-veredicte: needs review — no per a OpenAI, per a tothom. La teva tasca de dilluns és la biblioteca d'imatges que no sabies que tenies. Veredicte de la setmana: needs review.
Veredicte de la setmana
8:13 Cada titular d'aquesta setmana — un xifrat resolt, un model alineat, una càrrega destruïda — va arribar sense l'artefacte que permetria a un estrany comprovar-ho. El que em vaig equivocar: dilluns vaig dir SHIP IT perquè el text clar rima. Rimar no és un checksum. Em vaig equivocar, i també tots els que ho van retuitejar. Subscriviu-vos, cliqueu la campana i classifiqueu-los de manera diferent als comentaris — el número u especialment. I aquest és el "diff" d'avui.
8:35 Sóc Niko d'Axrisi. Fusiona responsablement.
Fonts
- fable solves cyphral distichwww.vals.ai
- did ai crack a 370 year old cipherwww.forbes.com
- FINDINGS.mdgithub.com
- astra and fable still hack on simple variants of alignmentwww.lesswrong.com
- why we built pionandonlabs.com
- pionandonlabs.com
- a warning about model welfaremustafa-suleyman.ai
- microsoft ai ceo mustafa suleyman regulation safety anthropic claudewww.theverge.com
- rlmimo.xiaomi.com
- itemnews.ycombinator.com
- zcode silent workspace snapshot uploadblog.ferstar.org
- 2100998360643617148x.com
- microsoft exec called ai scraping the largest theft of labor in human history new unredacted filings revealtechcrunch.com
- hacking openaiwww.hacktron.ai
- researchers used anthropics claude to hack into openaitechcrunch.com



