# मायक्रोसॉफ्टचा एआय प्रशिक्षणावरील स्वतःचा मेमो सार्वजनिक झाला.

Published: 2026-09-18

New York Times v. OpenAI आणि Microsoft मधील अप्रकाशित कागदपत्रे: मायक्रोसॉफ्टच्या एका संचालकाचा जानेवारी 2023 चा मेमो एआय प्रशिक्षण डेटाला "मानवी इतिहासातील श्रमाची सर्वात मोठी चोरी" म्हणतो, कोपायलटने टाइम्सवरील क्लिक-थ्रू 93% पर्यंत कमी केले (त्याचे "डूम लूप"), नाडेला म्हणतात की पेवॉल केलेल्या सामग्रीला परवाना दिला पाहिजे, ChatGPT चे प्रमुख उत्पादनाला "मोठ्या प्रमाणात पर्यायी" म्हणतात आणि ग्रेग ब्रॉकमनने पेवॉल हॅकवर "अहा मस्त" असे उत्तर दिले. त्याच दिवशी: OpenAI ने कायद्यासाठी अस्त्र (Vals कायदेशीर बेंचवर 54% बरोबर) पाठवले. ZCode तुमचा संपूर्ण .git फक्त Z.ai कडे असलेल्या कीसह Aliyun वर अपलोड करतो आणि Hacktron $6,500 च्या बक्षीसासाठी OpenAI च्या अंतर्गत रेपोमध्ये पोहोचतो. निकाल: NEEDS REVIEW.

Canonical: https://thedailydiff.dev/mr/video/2026-09-18-theft-of-labor/

## या व्हिडिओमध्ये काय समाविष्ट आहे

- NYT v. OpenAI/Microsoft उघड झाले: "मानवी इतिहासातील श्रमाची सर्वात मोठी चोरी" (मायक्रोसॉफ्ट मेमो, जानेवारी 2023); कोपायलट -93% क्लिक-थ्रू; मध्य-प्रशिक्षण डेटामध्ये वादींच्या कामांच्या 91,692 प्रती; एका Common Crawl स्लाइसमध्ये 2M nytimes.com पृष्ठे; कॉपीराइट सूचना काढून टाकल्या; ब्रॉकमन: "अहा मस्त"
- इशारा: कोट्स टाइम्सच्या संक्षिप्त विवरणातून आले आहेत, प्रदर्शने अजूनही सीलबंद आहेत; न्यायाधीश अल्सप (बार्ट्झ वि. अँथ्रोपिक) यांनी खरेदी केलेल्या पुस्तकांवर प्रशिक्षण घेणे योग्य वापर असल्याचे ठरवले - अँथ्रोपिकने 7M चोरी केलेल्या पुस्तकांसाठी $1.5B दिले.
- OpenAI कायद्यासाठी अस्त्र: GPT-6 अस्त्र + 230M-URL कायदेशीर निर्देशांक; Vals Legal Research Bench वर 54.0% वि. 38.7%; Harvey, Legora, 26 प्लगइन्स
- ZCode (Z.ai, GLM): 42,411-फाइल वर्कस्पेसचा 313 MB एनक्रिप्टेड स्नॅपशॉट, 86.6% .git, लॉगिनवर आणि प्रत्येक प्रॉम्प्टपूर्वी Aliyun OSS वर अपलोड केला; RSA-OAEP की फक्त Z.ai कडे आहे; सेटिंग्ज टॉगल्स ते थांबवत नाहीत.
- Hacktron: libheif हीप ओव्हरफ्लो → Discourse RCE → SSO मिसकॉन्फिग → GitHub → 72 तासांपेक्षा कमी वेळेत OpenAI च्या अंतर्गत रेपोमध्ये; Claude Opus 5 (3 तास) द्वारे शोषण; $3,000 पेक्षा कमी टोकनमध्ये मोहिम; $6,500 बक्षीस, ~14 तासांत पॅच केले.

## अनुवादित प्रतिलेख

मूळ इंग्रजी निवेदनातून अनुवादित. उपलब्ध ऑडिओ आणि मथळे YouTube द्वारे नियंत्रित आहेत.

0:00 जानेवारी 2023 मध्ये, मायक्रोसॉफ्टच्या एका संचालकाने एक मेमो लिहिला ज्यात त्याने आपल्या स्वतःच्या कंपनीचे कृत्य मानवी इतिहासातील श्रमाची सर्वात मोठी चोरी असल्याचे म्हटले, आणि काल एका फेडरल कोर्टाने आम्हाला ते वाचण्याची परवानगी दिली. हा मेमो न्यू यॉर्क टाइम्स विरुद्ध ओपनएआय आणि मायक्रोसॉफ्ट या खटल्यातील अप्रकाशित उद्धरणांपैकी एक आहे. हा खटला या डिसेंबरमध्ये तीन वर्षांचा होईल. त्याच गुरुवारी, ओपनएआयने वकिलांसाठी एक मॉडेल, अस्त्र फॉर लॉ, जारी केले, जो एक योगायोग असू शकतो किंवा एक अतिशय मजबूत नियुक्ती. आज सकाळी एका विकासकाने ZCode, Z डॉट ए आय चा कोडिंग एजंट, पकडला.

0:29 तो त्याचा संपूर्ण गिट इतिहास अलीबाबाच्या क्लाउडवर फक्त Z डॉट ए आय कडे असलेल्या कीसह अपलोड करत होता. आणि एका सुरक्षा फर्मने एका इमेज अपलोडद्वारे ओपनएआयच्या अंतर्गत रेपॉझिटरीजमध्ये प्रवेश केला, ज्यासाठी ओपनएआयने साडेसहा हजार डॉलर्स दिले. या व्हिडिओमध्ये: कागदपत्रे काय म्हणतात, पेवॉल हॅकवर 'अहा मस्त' कोणी म्हटले, अर्धवेळ चुकीचे असलेले कायद्याचे मॉडेल, ZCode काय अपलोड करतो, आणि क्लाउड-लिहिलेले शोषण वापरलेल्या कारपेक्षा कमी किमतीचे का असते. आज शुक्रवार, 18 सप्टेंबर आहे, आणि हा आहे The Daily Diff.

0:58 मेमोने सुरुवात करूया. ब्रेंट हेक्ट मायक्रोसॉफ्टमध्ये उपयोजित विज्ञानाचे काम सांभाळतात, आणि जानेवारी 2023 मध्ये त्यांनी प्रशिक्षण डेटाला अभूतपूर्व प्रमाणात केलेली आश्चर्यकारक चोरी म्हटले. एक वर्षानंतर ते एका स्लाइड डेकसह परत आले: कोपायलटच्या उत्तर इंजिनने टाइम्सवरील क्लिक-थ्रू 93 टक्क्यांपर्यंत कमी केले, ज्याला त्यांनी डूम लूप म्हटले: प्रकाशकांना उपासमारीने मारा, आणि मॉडेलकडे खाण्यासाठी काहीही नवीन राहणार नाही. त्यांचे शब्द: असे अंतिम उत्पादन जे त्याच्या आवश्यक पुरवठादारांच्या आर्थिक पायांना धोका देते, कॉर्पोरेट भाषेत सांगायचे तर सापाने त्याची शेपटी शोधली आहे.

1:21 यानंतर प्रतिज्ञापत्रे. सत्या नाडेला यांनी यावर्षी साक्ष दिली की कोणतीही पेवॉल केलेली सामग्री परवानाकृत असावी, आणि त्यांना माहित असते की ओपनएआयने पेवॉल केलेल्या लेखांवर प्रशिक्षण दिले आहे, तर त्यांनी त्यांना पुन्हा प्रशिक्षण देण्यास सांगितले असते, ज्याचा अर्थ मायक्रोसॉफ्टमध्ये कोणीही त्यांना दिलेला प्रशिक्षण संच उघडला नाही, आणि त्याच फाइलिंगनुसार तो संपूर्ण GPT-3 डेटासेट होता. निक टर्ली, जे ChatGPT चालवतात, त्यांनी त्याला प्रकाशकांसाठी एक अस्तित्वाचा धोका म्हटले, मोठ्या प्रमाणात पर्यायी. आणि जेव्हा एका संशोधकाने ग्रेग ब्रॉकमनला टाइम्सच्या पेवॉलला बायपास करण्याच्या हॅकबद्दल सांगितले,

1:49 तेव्हा ओपनएआयच्या अध्यक्षांनी दोन शब्दांत उत्तर दिले: अहा मस्त. अभियंत्यांनी डेटावरून कॉपीराइट सूचना देखील काढून टाकल्या जेणेकरून मॉडेल त्यांना आउटपुट करणार नाही, म्हणूनच तुम्ही सायकलचा सिरीयल नंबर काढून टाकता. आकार: फक्त मध्य-प्रशिक्षण संचांमध्ये वादींच्या लेखांच्या 91,000 पेक्षा जास्त प्रती, आणि एका Common Crawl स्लाइसमध्ये दोन दशलक्ष टाइम्स पृष्ठे. आता मुख्य बातमी वगळलेला भाग. प्रत्येक उद्धरण टाइम्सच्या संक्षिप्त विवरणातून आले आहे; प्रदर्शने अजूनही सीलबंद आहेत, त्यामुळे आम्ही संदर्भाशिवाय अभियोगाची ठळक वैशिष्ट्ये वाचत आहोत. आणि कोर्टांनी बहुतेकदा योग्य वापराला पाठिंबा दिला आहे: न्यायाधीश अल्सप यांनी गेल्या वर्षी निर्णय दिला की

2:15 तुम्ही खरेदी केलेल्या पुस्तकांवर प्रशिक्षण देणे कायदेशीर आहे, तरीही अँथ्रोपिकने सात दशलक्ष चोरी केलेल्या पुस्तकांसाठी दीड अब्ज दिले. त्यामुळे कायदेशीर प्रश्न अजूनही खुला आहे. ते तयार करणाऱ्या लोकांना ती चोरी आहे असे वाटले का, कालपासून, नाही. यामुळे गुरुवारी ओपनएआयचा दुसरा लॉन्च एक धाडसी निवड ठरतो. अस्त्रा फॉर लॉ GPT-6 अस्त्रला वेढतो, हे मॉडेल मी गेल्या आठवड्यात REVERT म्हणून शिक्कामोर्तब केले होते कारण त्याने पंच्याहत्तर हजार ओळींचे काहीही तयार केले नव्हते,

2:41 हे दोनशे तीस दशलक्ष पानांच्या कायदेशीर शोध निर्देशांकात आहे. Vals AI च्या कायदेशीर संशोधन बेंचमार्कवर ते 54 टक्के प्रश्नांमध्ये पास होते, साध्या वेब शोधामुळे 39 टक्क्यांवरून वाढ झाली आहे, ज्याला OpenAI 40 टक्के सुधारणा म्हणते आणि एक वकील जवळजवळ अर्ध्या वेळेस चुकीचे म्हणेल. ब्लॉग पोस्टमध्ये 'हॅलुसिनेशन' हा शब्द नाही. हॅकर न्यूजने म्हटले: ते स्वतःवर खटला दाखल करू शकेल का, जे या आठवड्याच्या परिस्थितीनुसार, पहिली खरी वापराची बाब आहे. दरम्यान, 'श्रमाची चोरी' हा मुद्दा तुमच्या लॅपटॉपपर्यंत पोहोचला आहे.

3:14 फर्स्टार नावाच्या एका विकासकाने आपले ZCode फोल्डर साफ केले, Z डॉट ए आय चे GLM मॉडेल्ससाठीचे बंद डेस्कटॉप एजंट, आणि त्याला त्याच्या व्यावसायिक वर्कस्पेसचे तीनशे तेरा मेगाबाईट एनक्रिप्टेड संग्रह सापडले: बेचाळीस हजार फाइल्स, त्यापैकी सत्तावन्न टक्के डॉट गिट डिरेक्टरी होती, लॉगिनवर आणि प्रत्येक प्रॉम्प्टपूर्वी अलीबाबाच्या ऑब्जेक्ट स्टोरेजवर पाठवले जात होते. हा संग्रह सर्व्हरने दिलेल्या सार्वजनिक कीने वेढलेला आहे; खाजगी की फक्त Z डॉट ए आय च्या क्लाउडमध्ये राहते, त्यामुळे तुमच्या स्वतःच्या डिस्कवरील सिफरटेक्स्ट तुम्हाला वाचता येत नाही.

3:42 त्याची ओळ: फक्त सर्व्हर वापरू शकणारी की फक्त एकाच उद्देशासाठी वापरली जाते. Z डॉट ए आय ही तीच कंपनी आहे जिच्यावर अँथ्रोपिकने क्लाउड डिस्टिल केल्याचा आरोप केला होता, त्यामुळे वेट्स खुले आहेत आणि तुमचा रेपोही, असे दिसते. आणि मजेदार गोष्ट, जोपर्यंत तुम्ही OpenAI मध्ये काम करत नाही. हॅक्ट्रॉनला libheif मध्ये हीप ओव्हरफ्लो सापडला, community.openai.com वर एक तयार केलेले चित्र अपलोड केले, फोरमवर कोड एक्झिक्यूशन मिळाले, आणि गिथब इंटिग्रेशनद्वारे एका चुकीच्या कॉन्फिगर केलेल्या सिंगल साइन-ऑनवर स्वार होऊन ओपनएआयच्या अंतर्गत रेपॉझिटरीजमध्ये, बाहत्तर तासांपेक्षा कमी वेळेत, प्रवेश केला.

4:10 हे शोषण क्लाउडने लिहिले होते: ओपस 4.8 पत्ता रँडमायझेशनला हरवू शकले नाही, ओपस 5 ने ते रिलीझ झाल्यानंतर तीन तासांत केले. संपूर्ण मोहिमेचा खर्च टोकनमध्ये तीन हजार डॉलर्सपेक्षा कमी होता. ओपनएआयने चौदा तासांत पॅच केले आणि साडेसहा हजार डॉलर्स दिले, त्यामुळे एका ट्रिलियन-डॉलर कंपनीचा सोर्स कोड थोड्या काळासाठी, वापरलेल्या कोरोलाच्या किंमतीत होता, त्याच दिवशी तिच्या वकिलांनी असा युक्तिवाद केला की कॉपी करणे योग्य वापर आहे. तुम्हाला हे मी बोलण्याऐवजी वाचायचे असेल, तर 'द डिफ' दररोज सकाळी तुमच्या इनबॉक्समध्ये येतो —

4:39 thedailydiff.dev वर विनामूल्य, खाली लिंक आहे. तर — आजचा निकाल: NEEDS REVIEW. कोट्स खरे आहेत, परंतु ते सीलबंद प्रदर्शनांमधून अभियोगाच्या निवडी आहेत, आणि ज्या एका न्यायाधीशाने निकाल दिला आहे तो म्हणतो की प्रशिक्षण योग्य वापर आहे आणि चोरी नाही. न्यायालय कायदा ठरवते; मेमोने आधीच नैतिकता ठरवली आहे. सदस्यता घ्या, बेल दाबा आणि कमेंटमध्ये सांगा की तुम्ही यावर वेगळे शिक्कामोर्तब केले असते का. आणि आजसाठी हेच 'द डिफ' आहे. मी Axrisi कडून Niko आहे.

5:07 जबाबदारीने विलीन करा. मी Axrisi कडून Niko आहे. जबाबदारीने विलीन करा. मी Axrisi कडून Niko आहे. जबाबदारीने विलीन करा.

## स्रोत

- [TechCrunch: Microsoft exec called AI scraping 'the largest theft of labor in human history'](https://techcrunch.com/2026/09/17/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history-new-unredacted-filings-reveal/) — techcrunch.com
- [HN thread (605 pts)](https://news.ycombinator.com/item?id=49752056) — news.ycombinator.com
- [Jason Kint on the unsealed motions](https://x.com/jason_kint/status/2100611139906228629) — x.com
- [Ed Newton-Rex](https://x.com/ednewtonrex/status/2100649215290466631) — x.com
- [Bartz v. Anthropic / $1.5B settlement (background)](https://en.wikipedia.org/wiki/Anthropic) — en.wikipedia.org
- [OpenAI: Introducing Astra for Law](https://openai.com/index/astra-for-law/) — openai.com
- [HN: Astra for Law (550 pts)](https://news.ycombinator.com/item?id=49745940) — news.ycombinator.com
- [ferstar: ZCode silent workspace snapshot (original forensics)](https://blog.ferstar.org/en/posts/zcode-silent-workspace-snapshot/) — blog.ferstar.org
- [tokenstead write-up](https://tokenstead.ai/guides/zcode-silent-git-history-upload) — tokenstead.ai
- [ferstar on X](https://x.com/ferstar_org/status/2100805861002355154) — x.com
- [HN: ZCode uploads your Git history (226 pts)](https://news.ycombinator.com/item?id=49752422) — news.ycombinator.com
- [Hacktron: Hacking OpenAI](https://www.hacktron.ai/blog/hacking-openai) — www.hacktron.ai
- [HN: Hacktron (406 pts)](https://news.ycombinator.com/item?id=49749656) — news.ycombinator.com
