+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

마이크로소프트의 AI 훈련 관련 내부 메모가 공개되었습니다.

뉴욕타임스 대 OpenAI & 마이크로소프트 사건의 가려지지 않은 서류: 마이크로소프트 이사의 2023년 1월 메모는 AI 훈련 데이터를 "인류 역사상 가장 큰 노동력 절도"라고 부르며, 코파일럿이 타임즈로의 클릭률을 최대 93% 감소시켰다고 언급했습니다(그의 "파멸의 고리").

뉴욕타임스 대 OpenAI & 마이크로소프트 사건의 가려지지 않은 서류: 마이크로소프트 이사의 2023년 1월 메모는 AI 훈련 데이터를 "인류 역사상 가장 큰 노동력 절도"라고 부르며, 코파일럿이 타임즈로의 클릭률을 최대 93% 감소시켰다고 언급했습니다(그의 "파멸의 고리"). 나델라는 유료 콘텐츠는 라이선스를 받아야 한다고 말했고, ChatGPT 책임자는 이 제품을 "주로 대체품"이라고 불렀으며, 그렉 브록만은 페이월 해킹에 대해 "아, 좋아"라고 답했습니다. 같은 날: OpenAI는 법률용 Astra를 출시했습니다(Vals 법률 벤치에서 54% 정확도). 또한 ZCode는 Z.ai만 보유한 키로 전체 .git을 Aliyun에 업로드하고 있으며, Hacktron은 6,500달러의 현상금으로 OpenAI의 내부 저장소에 도달했습니다. 판결: 검토 필요 (NEEDS REVIEW).

서면판 읽기 (영어) ↗

이 동영상에서 다루는 내용

  • NYT 대 OpenAI/Microsoft 봉인 해제: "인류 역사상 가장 큰 노동력 절도" (Microsoft 메모, 2023년 1월); Copilot 클릭률 93% 감소; 중간 훈련 데이터에 원고 작품 91,692개 복사본; 하나의 Common Crawl 슬라이스에 nytimes.com 페이지 200만 개; 저작권 표시 제거; Brockman: "아, 좋아"
  • 주의: 인용문은 타임즈의 소장에서 발췌한 것이며, 증거물은 여전히 봉인되어 있습니다. 알섭 판사(Bartz 대 Anthropic 사건)는 구매한 책을 훈련에 사용하는 것은 공정 사용이라고 판결했습니다. Anthropic은 해적판 700만 권에 대해 15억 달러를 지불했습니다.
  • OpenAI Astra for Law: GPT-6 Astra + 2억 3천만 URL 법률 색인; Vals 법률 연구 벤치에서 54.0% 대 38.7%; Harvey, Legora, 26개 플러그인.
  • ZCode (Z.ai, GLM): 42,411개 파일 워크스페이스의 313MB 암호화된 스냅샷, 86.6% .git, 로그인 시 및 모든 프롬프트 전에 Aliyun OSS에 업로드; RSA-OAEP 키는 Z.ai만 보유; 설정 토글로도 중지되지 않음.
  • Hacktron: libheif 힙 오버플로우 → Discourse RCE → SSO 잘못된 설정 → GitHub → 72시간 내 OpenAI 내부 저장소 접근; Claude Opus 5에 의한 익스플로잇 (3시간); 토큰 비용 3,000달러 미만; 현상금 6,500달러, 약 14시간 만에 패치 완료.

번역된 스크립트

원래 영어 내레이션에서 번역되었습니다. 사용 가능한 오디오 및 캡션은 YouTube에서 제어합니다.

0:00 2023년 1월, 한 마이크로소프트 이사는 자신의 회사가 하는 일을 인류 역사상 가장 큰 노동력 절도라고 부르는 메모를 작성했고, 어제 연방 법원은 우리 모두가 그 메모를 읽을 수 있도록 허용했습니다. 이 메모는 뉴욕타임스 대 OpenAI 및 마이크로소프트 소송에서 가려지지 않은 인용문 중 하나이며, 이 소송은 이번 12월에 3주년을 맞이합니다. 같은 목요일, OpenAI는 변호사를 위한 모델인 법률용 Astra를 출시했습니다. 이것은 우연이거나 매우 강력한 고용입니다. 오늘 아침 한 개발자는 ZCode, Z.AI의 코딩 에이전트가

0:29 자신의 전체 git 기록을 Z.AI만 보유한 키로 알리바바 클라우드에 업로드하는 것을 발견했습니다. Z.AI만 보유합니다. 그리고 한 보안 회사는 이미지 업로드를 통해 OpenAI의 내부 저장소에 침입했으며, 이에 대해 OpenAI는 6,500달러를 지불했습니다. 이 비디오에서: 서류 내용, 페이월 해킹에 "아, 좋아"라고 말한 사람, 절반은 틀린 법률 모델, ZCode가 업로드하는 것, 그리고 Claude가 작성한 익스플로잇이 왜 중고차보다 가치가 낮은지. 오늘은 9월 18일 금요일이며, 이것은 The Daily Diff입니다.

0:58 메모부터 시작하겠습니다. 브렌트 헥트(Brent Hecht)는 마이크로소프트에서 응용 과학을 총괄하며, 2023년 1월에 그는 훈련 데이터를 전례 없는 규모의 놀라운 절도라고 불렀습니다. 1년 후 그는 슬라이드 데크와 함께 돌아왔습니다. 코파일럿의 답변 엔진은 타임즈로의 클릭률을 최대 93% 감소시켰고, 그는 이를 파멸의 고리(doom loop)라고 명명했습니다. 즉, 출판사를 굶기면 모델이 새로 먹을 것이 없어집니다. 그의 말에 따르면: "필수 공급업체의 경제적 기반을 위협하는 최종 제품", 즉 뱀이 자신의 꼬리를 발견했다는 기업식 표현입니다.

1:21 기업식 표현입니다. 그리고 나서 진술. 사티아 나델라는 올해 유료 콘텐츠는 모두 라이선스를 받아야 하며, OpenAI가 유료 기사로 훈련했다는 것을 알았다면 재훈련을 시켰을 것이라고 증언했습니다. 이는 마이크로소프트의 아무도 그들이 제공받은 훈련 세트를 열어보지 않았다고 가정하는 것이며, 같은 서류에 따르면 그것은 전체 GPT-3 데이터 세트였습니다. ChatGPT를 운영하는 닉 털리(Nick Turley)는 이를 출판사들에게 실존적인 위협이라고 불렀고, 대부분 대체품이라고 말했습니다. 그리고 한 연구자가

1:49 그렉 브록만에게 타임즈 페이월을 우회하는 해킹에 대해 말했을 때, OpenAI의 사장은 두 단어로 답했습니다: "아, 좋아." 엔지니어들은 또한 모델이 저작권 표시를 출력하지 않도록 데이터에서 저작권 표시를 제거했습니다. 이것은 자전거에서 일련 번호를 지우는 이유와 같습니다. 규모: 중간 훈련 세트에만 원고의 기사가 91,000개 이상 복사되어 있었고, 하나의 Common Crawl 슬라이스에 200만 개의 타임즈 페이지가 있었습니다. 이제 헤드라인이 건너뛴 부분입니다.

2:15 모든 인용문은 타임즈의 소장에서 발췌한 것이며, 증거물은 여전히 봉인되어 있으므로, 우리는 맥락 없이 검찰의 주요 내용을 읽고 있습니다. 그리고 법원은 대체로 공정 사용에 동의했습니다. 알섭 판사는 작년에 구매한 책으로 훈련하는 것은 합법적이라고 판결했지만, 앤트로픽은 불법 복제한 700만 권에 대해 여전히 15억 달러를 지불했습니다. 따라서 법적 문제는 열려 있습니다. 이를 만든 사람들이 그것을 절도라고 생각했는지 여부는 어제부로 더 이상 문제가 아닙니다.

2:41 이는 목요일 OpenAI의 다른 출시를 대담한 선택으로 만듭니다. Astra for Law는 GPT-6 Astra를 감싸고 있습니다. 제가 지난주에 7만 5천 줄의 빈 줄을 생성한 후 REVERT를 찍었던 모델을 2억 3천만 페이지의 법률 검색 색인에 포함시켰습니다. Vals AI의 법률 연구 벤치마크에서 54%의 질문을 통과했으며, 일반 웹 검색의 39%에서 상승한 수치로, OpenAI는 이를 40% 향상이라고 부르지만 변호사들은 거의 절반은 틀렸다고 말할 것입니다. 블로그 게시물에는 환각(hallucination)이라는 단어가 포함되어 있지 않습니다.

3:14 해커 뉴스는 이렇게 말했습니다: 스스로를 고소할 수 있을까? 이는 이번 주를 감안할 때 첫 번째 진정한 사용 사례입니다. 한편, 노동력 절도 담론은 여러분의 노트북까지 미쳤습니다. ferstar라는 개발자는 ZCode 폴더를 정리하다가, GLM 모델용 Z.AI의 폐쇄형 데스크톱 에이전트에서, 자신의 상업용 작업 공간에 대한 313MB의 암호화된 아카이브를 발견했습니다. 4만 2천 개의 파일 중 87%가 .git 디렉토리였으며, 로그인 시 및 모든 프롬프트 전에 알리바바의 객체 스토리지로 전송되었습니다. 알리바바의 객체 스토리지로 전송되었습니다.

3:42 아카이브는 서버가 배포하는 공개 키로 암호화되어 있으며, 개인 키는 Z.AI의 클라우드에만 존재하므로, 자신의 디스크에 있는 암호문은 본인이 읽을 수 없습니다. 그의 말: 서버만 사용할 수 있는 키는 정확히 한 가지 목적에만 사용됩니다. Z.AI는 또한 앤트로픽이 클로드를 증류했다고 비난한 회사이기도 하므로, 가중치는 공개되어 있으며, 여러분의 저장소도 마찬가지인 것 같습니다. 그리고 OpenAI에서 일하지 않는 한 재미있는 일입니다. Hacktron은 libheif에서 힙 오버플로우를 발견했고, crafted된 사진을

4:10 community.openai.com에 업로드하여 포럼에서 코드 실행 권한을 얻었으며, 잘못 구성된 단일 사인온을 통해 GitHub 통합을 거쳐 72시간 이내에 OpenAI의 내부 저장소에 침투했습니다. 이 익스플로잇은 Claude가 작성했습니다. Opus 4.8은 주소 무작위화를 뚫지 못했지만, Opus 5는 출시 3시간 만에 성공했습니다. 전체 캠페인 비용은 토큰으로 3,000달러 미만이었습니다. OpenAI는 14시간 만에 패치를 완료하고 6,500달러를 지불했습니다. 따라서 1조 달러 기업의 소스 코드는

4:39 변호사들이 복사가 공정 사용이라고 주장한 바로 그 날에, 잠시 동안 중고 Corolla 가격이었습니다. 제가 말하는 것을 듣는 것보다 읽는 것을 선호하신다면, The Daily Diff가 매일 아침 여러분의 받은 편지함으로 도착합니다. daily-diff.dev에서 무료로 받아보세요. 링크는 아래에 있습니다. 자, 오늘의 판결: 검토 필요 (NEEDS REVIEW). 인용문은 사실이지만, 봉인된 증거물에서 검찰이 선별한 내용이며, 판결을 내린 한 판사는 훈련은 공정 사용이고 불법 복제는 아니라고 말했습니다. 법원이 법을 결정하고, 메모는 이미 윤리를 결정했습니다.

5:07 구독하고, 알림을 켜고, 다르게 평가했을지 댓글로 알려주세요. 알려주세요. 오늘의 The Daily Diff는 여기까지입니다. 악시리시(Axrisi)의 니코(Niko)였습니다. 책임감 있게 병합하세요.

출처

  1. TechCrunch: Microsoft exec called AI scraping 'the largest theft of labor in human history'techcrunch.com
  2. HN thread (605 pts)news.ycombinator.com
  3. Jason Kint on the unsealed motionsx.com
  4. Ed Newton-Rexx.com
  5. Bartz v. Anthropic / $1.5B settlement (background)en.wikipedia.org
  6. OpenAI: Introducing Astra for Lawopenai.com
  7. HN: Astra for Law (550 pts)news.ycombinator.com
  8. ferstar: ZCode silent workspace snapshot (original forensics)blog.ferstar.org
  9. tokenstead write-uptokenstead.ai
  10. ferstar on Xx.com
  11. HN: ZCode uploads your Git history (226 pts)news.ycombinator.com
  12. Hacktron: Hacking OpenAIwww.hacktron.ai
  13. HN: Hacktron (406 pts)news.ycombinator.com

관련 동영상