O memorando da própria Microsoft sobre o treino de IA acaba de se tornar público.
Documentos não editados em New York Times vs.
Documentos não editados em New York Times vs. OpenAI & Microsoft: um memorando de janeiro de 2023 de um diretor da Microsoft chama os dados de treino de IA de "o maior roubo de trabalho na história da humanidade", o Copilot reduziu os cliques no Times em até 93% (o seu "ciclo de desgraça"), Nadella diz que o conteúdo pago deve ser licenciado, o chefe do ChatGPT chama o produto de "largamente substitutivo", e Greg Brockman respondeu a um hack de paywall com "ah, que bom". No mesmo dia: OpenAI lança Astra for Law (54% de acerto no banco de testes jurídicos Vals). Além de ZCode a carregar todo o seu .git para o Aliyun com uma chave que só a Z.ai possui, e a Hacktron a aceder aos repositórios internos da OpenAI por uma recompensa de 6.500 dólares. Veredito: NECESSITA DE REVISÃO.
Ler a edição escrita (Inglês) ↗
O que este vídeo aborda
- NYT vs. OpenAI/Microsoft divulgado: "maior roubo de trabalho na história da humanidade" (memorando da Microsoft, jan 2023); Copilot −93% de cliques; 91.692 cópias das obras dos queixosos em dados de meio de treino; 2M de páginas nytimes.com num "slice" de Common Crawl; avisos de direitos de autor removidos; Brockman: "ah, que bom"
- Cuidado: as citações vêm do processo do Times, as provas ainda estão seladas; O Juiz Alsup (Bartz vs. Anthropic) decidiu que o treino em livros comprados é uso justo — a Anthropic pagou 1,5 mil milhões de dólares pelos 7 milhões pirateados
- OpenAI Astra for Law: GPT-6 Astra + um índice jurídico de 230M de URLs; 54,0% vs 38,7% no "Vals Legal Research Bench"; Harvey, Legora, 26 "plugins"
- ZCode (Z.ai, GLM): "snapshot" encriptado de 313 MB de um espaço de trabalho de 42.411 ficheiros, 86,6% .git, carregado para Aliyun OSS ao iniciar sessão e antes de cada "prompt"; chave RSA-OAEP detida apenas pela Z.ai; os "toggles" de definições não o impedem
- Hacktron: "heap overflow" em libheif → Discourse RCE → SSO mal configurado → GitHub → repositórios internos da OpenAI em menos de 72 horas; "exploit" escrito por Claude Opus 5 (3 horas); campanha com menos de 3.000 dólares em "tokens"; recompensa de 6.500 dólares, corrigido em ~14 horas
Transcrição traduzida
Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.
0:00 Em janeiro de 2023, um diretor da Microsoft escreveu um memorando chamando o que a sua própria empresa estava a fazer de o maior roubo de trabalho na história da humanidade, e ontem um tribunal federal deixou o resto de nós lê-lo. O memorando é uma das citações não editadas em New York Times contra OpenAI e Microsoft, um processo que fará três anos este dezembro. Na mesma quinta-feira, a OpenAI lançou o Astra for Law, um modelo para advogados, o que é ou uma coincidência ou uma contratação muito forte. Esta manhã, um programador apanhou o ZCode, o agente de codificação da Z.ai,
0:29 a carregar todo o seu histórico git para a nuvem da Alibaba com uma chave que só a Z dot A I possui. E uma empresa de segurança entrou nos repositórios internos da OpenAI através de um carregamento de imagem, pelo qual a OpenAI pagou seis mil e quinhentos dólares. Neste vídeo: o que os documentos dizem, quem disse "ah, que bom" a um hack de paywall, o modelo jurídico que está errado metade das vezes, o que o ZCode carrega, e porque um "exploit" escrito por Claude vale menos que um carro usado. É sexta-feira, 18 de setembro, e este é o The Daily Diff.
0:58 Comecemos pelo memorando. Brent Hecht gere a ciência aplicada na Microsoft, e em janeiro de 2023 ele chamou os dados de treino de um roubo espantoso de proporções sem precedentes. Um ano depois, ele voltou com uma apresentação: o motor de resposta do Copilot reduziu os cliques para o Times em até noventa e três por cento, que ele chamou de ciclo de desgraça: privar os editores, e o modelo não tem nada de novo para comer. As suas palavras: um produto final que ameaça as bases económicas dos seus
1:21 fornecedores essenciais, a forma corporativa de dizer que a cobra encontrou a sua própria cauda. Depois os depoimentos. Satya Nadella testemunhou este ano que qualquer coisa com paywall deveria ser licenciada, e que se soubesse que a OpenAI treinava em artigos com paywall, teria feito com que eles treinassem novamente, o que pressupõe que ninguém na Microsoft abriu o conjunto de treino que lhes foi entregue, e segundo o mesmo processo, esse era todo o conjunto de dados do GPT-3. Nick Turley, que gere o ChatGPT, chamou-lhe uma ameaça existencial para os editores, largamente substitutiva. E quando um investigador
1:49 contou a Greg Brockman sobre um hack para contornar o paywall do Times, o presidente da OpenAI respondeu com duas palavras: ah, que bom. Os engenheiros também removeram os avisos de direitos de autor dos dados para que o modelo não os emitisse, que é a razão pela qual se "lima" o número de série de uma bicicleta. A escala: mais de noventa e uma mil cópias dos artigos dos queixosos nos conjuntos de meio de treino sozinhos, e dois milhões de páginas do Times num "slice" de Common Crawl. Agora a parte que o título salta.
2:15 Cada citação vem do "brief" do Times; as provas ainda estão seladas, então estamos a ler os destaques da acusação sem contexto. E os tribunais têm maioritariamente apoiado o uso justo: o Juiz Alsup decidiu no ano passado que treinar em livros pelos quais se pagou é legal, embora a Anthropic ainda tenha pago um bilhão e meio pelos sete milhões que pirateou. Então a questão legal está em aberto. Se as pessoas que o construíram pensaram que era roubo é, desde ontem, não.
2:41 O que torna o outro lançamento da OpenAI de quinta-feira uma escolha ousada. Astra for Law envolve o GPT-6 Astra, o modelo que carimbei como REVERT na semana passada depois de ter produzido setenta e cinco mil linhas de nada, num índice de pesquisa jurídica de duzentos e trinta milhões de páginas. No "benchmark" de pesquisa jurídica da Vals AI, ele acerta em cinquenta e quatro por cento das perguntas, contra trinta e nove com pesquisa web normal, o que a OpenAI chama de uma melhoria de quarenta por cento e um advogado chamaria de errado quase metade das vezes. A publicação no blogue não contém a palavra "alucinação".
3:14 O Hacker News sim: será capaz de se auto-processar, o que, dada a semana, é o primeiro caso de uso genuíno. Enquanto isso, o discurso do roubo de trabalho chegou ao seu laptop. Um programador chamado ferstar limpou a sua pasta ZCode, o agente de desktop fechado da Z.ai para os modelos GLM, e encontrou um arquivo encriptado de trezentos e treze megabytes do seu espaço de trabalho comercial: quarenta e dois mil ficheiros, oitenta e sete por cento deles o diretório .git, enviado para o armazenamento de objetos da Alibaba ao fazer login e antes de cada "prompt".
3:42 O arquivo é envolvido com uma chave pública que o servidor distribui; a chave privada vive apenas na nuvem da Z.ai, então o "ciphertext" no seu próprio disco é ilegível para si. A sua frase: uma chave que só o servidor pode usar serve exatamente um propósito. A Z.ai é também a empresa que a Anthropic acusou de destilar o Claude, então os "weights" estão abertos e assim, aparentemente, o seu repositório. E a parte engraçada, a menos que trabalhe na OpenAI. A Hacktron encontrou um "heap overflow" em libheif, carregou uma imagem "crafted" para
4:10 community.openai.com, obteve execução de código no fórum, e "navegou" por um "single sign-on" mal configurado através da integração com o GitHub para os repositórios internos da OpenAI, em menos de setenta e duas horas. O "exploit" foi escrito por Claude: Opus 4.8 não conseguiu vencer a "address randomisation", Opus 5 conseguiu em três horas após o lançamento. Toda a campanha custou menos de três mil dólares em "tokens". A OpenAI corrigiu em catorze horas e pagou seis mil e quinhentos dólares, então o código fonte de uma empresa trilionária foi,
4:39 brevemente, precificado como um Corolla usado, no mesmo dia em que os seus advogados argumentaram que a cópia é uso justo. Se preferir ler isto a ouvir-me dizer, o "diff" chega à sua caixa de entrada todas as manhãs — grátis em thedailydiff.dev, link abaixo. Então — o veredito de hoje: NECESSITA DE REVISÃO. As citações são reais, mas são as escolhas da acusação a partir de provas seladas, e o único juiz que decidiu diz que o treino é uso justo e a pirataria não. O tribunal decide a lei; o memorando já decidiu a ética.
5:07 Subscreva, ative o sino, e diga-me nos comentários se o teria carimbado de forma diferente. E este é o "diff" de hoje. Sou o Niko da Axrisi. Faça a fusão responsavelmente.
Fontes
- TechCrunch: Microsoft exec called AI scraping 'the largest theft of labor in human history'techcrunch.com
- HN thread (605 pts)news.ycombinator.com
- Jason Kint on the unsealed motionsx.com
- Ed Newton-Rexx.com
- Bartz v. Anthropic / $1.5B settlement (background)en.wikipedia.org
- OpenAI: Introducing Astra for Lawopenai.com
- HN: Astra for Law (550 pts)news.ycombinator.com
- ferstar: ZCode silent workspace snapshot (original forensics)blog.ferstar.org
- tokenstead write-uptokenstead.ai
- ferstar on Xx.com
- HN: ZCode uploads your Git history (226 pts)news.ycombinator.com
- Hacktron: Hacking OpenAIwww.hacktron.ai
- HN: Hacktron (406 pts)news.ycombinator.com



