# Memorando da Microsoft sobre treinamento de IA acaba de se tornar público.

Published: 2026-09-18

Documentos não-redigidos em New York Times v. OpenAI &amp; Microsoft: um memorando de janeiro de 2023 de um diretor da Microsoft chama os dados de treinamento de IA de "o maior roubo de trabalho na história da humanidade", o Copilot cortou os cliques para o Times em até 93% (seu "ciclo de desgraça"), Nadella diz que o conteúdo pago deve ser licenciado, o chefe do ChatGPT chama o produto de "em grande parte substitutivo", e Greg Brockman respondeu a um hack de paywall com "ah, legal." No mesmo dia: OpenAI lança Astra for Law (54% correto no Vals legal bench). Além de ZCode enviando todo o seu .git para o Aliyun com uma chave que só a Z.ai possui, e Hacktron alcançando os repositórios internos da OpenAI por uma recompensa de US$ 6.500. Veredito: NEEDS REVIEW.

Canonical: https://thedailydiff.dev/pt-BR/video/2026-09-18-theft-of-labor/

## O que este vídeo aborda

- NYT v. OpenAI/Microsoft revelado: "maior roubo de trabalho na história da humanidade" (memorando da Microsoft, janeiro de 2023); Copilot -93% cliques; 91.692 cópias de trabalhos dos autores nos dados de meio de treinamento; 2M de páginas do nytimes.com em um Common Crawl; avisos de direitos autorais removidos; Brockman: "ah, legal"
- Cuidado: as citações vêm do processo do Times, as provas ainda estão lacradas; o Juiz Alsup (Bartz v. Anthropic) decidiu que o treinamento em livros comprados é uso justo — a Anthropic pagou US$ 1,5 bilhão pelos 7 milhões pirateados
- OpenAI Astra for Law: GPT-6 Astra + um índice jurídico de 230M de URLs; 54,0% vs 38,7% no Vals Legal Research Bench; Harvey, Legora, 26 plugins
- ZCode (Z.ai, GLM): 313 MB de snapshot criptografado de um workspace de 42.411 arquivos, 86,6% .git, enviado para Aliyun OSS no login e antes de cada prompt; chave RSA-OAEP detida apenas pela Z.ai; alternadores de configuração não o impedem
- Hacktron: overflow de heap em libheif → RCE do Discourse → má configuração de SSO → GitHub → repositórios internos da OpenAI em menos de 72 h; exploit escrito por Claude Opus 5 (3 h); campanha custou menos de US$ 3.000 em tokens; recompensa de US$ 6.500, corrigido em ~14 h

## Transcrição traduzida

Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.

0:00 Em janeiro de 2023, um diretor da Microsoft escreveu um memorando chamando o que sua própria empresa estava fazendo de o maior roubo de trabalho na história da humanidade, e ontem um tribunal federal permitiu que o resto de nós o lêsse. O memorando é uma das citações não-redigidas em New York Times versus OpenAI e Microsoft, um processo que completa três anos em dezembro. Na mesma quinta-feira, a OpenAI lançou o Astra for Law, um modelo para advogados, o que é uma coincidência ou uma contratação muito forte. Esta manhã, um desenvolvedor flagrou o ZCode, o agente de codificação da Z.ai,

0:29 fazendo upload de todo o seu histórico git para a nuvem da Alibaba com uma chave que só a Z.ai possui. E uma empresa de segurança acessou os repositórios internos da OpenAI através de um upload de imagem, pelo qual a OpenAI pagou seis mil e quinhentos dólares. Neste vídeo: o que os documentos dizem, quem disse "ah, legal" para um hack de paywall, o modelo jurídico que erra metade das vezes, o que o ZCode envia, e por que um exploit escrito por Claude vale menos que um carro usado. É sexta-feira, 18 de setembro, e este é The Daily Diff.

0:58 Comecemos com o memorando. Brent Hecht comanda a ciência aplicada na Microsoft, e em janeiro de 2023 ele chamou os dados de treinamento de um roubo surpreendente de proporções sem precedentes. Um ano depois, ele voltou com uma apresentação: o motor de resposta do Copilot cortou os cliques para o Times em até noventa e três por cento, o que ele chamou de ciclo de desgraça: privar os editores de comida, e o modelo não terá nada de novo para comer. Suas palavras: um produto final que ameaça os fundamentos econômicos de seus

1:21 fornecedores essenciais, a maneira corporativa de dizer que a cobra encontrou sua própria cauda. Em seguida, as declarações. Satya Nadella testemunhou este ano que qualquer conteúdo pago deveria ser licenciado, e que, se soubesse que a OpenAI treinava em artigos pagos, os teria feito retreinar, o que pressupõe que ninguém na Microsoft abriu o conjunto de treinamento que lhes foi entregue, e, de acordo com o mesmo documento, esse era todo o conjunto de dados do GPT-3. Nick Turley, que comanda o ChatGPT, chamou-o de uma ameaça existencial para os editores, em grande parte substitutivo. E quando um pesquisador

1:49 contou a Greg Brockman sobre um hack para contornar o paywall do Times, o presidente da OpenAI respondeu com duas palavras: ah, legal. Os engenheiros também removeram os avisos de direitos autorais dos dados para que o modelo não os exibisse, o que é o mesmo que lixar o número de série de uma bicicleta. A escala: mais de noventa e uma mil cópias dos artigos dos demandantes apenas nos conjuntos de meio de treinamento, e dois milhões de páginas do Times em um recorte do Common Crawl. Agora a parte que a manchete pula.

2:15 Cada citação vem do processo do Times; as provas ainda estão lacradas, então estamos lendo os destaques da acusação sem contexto. E os tribunais têm geralmente ficado do lado do uso justo: o Juiz Alsup decidiu no ano passado que treinar em livros pelos quais você pagou é legal, embora a Anthropic ainda tenha pago um bilhão e meio pelos sete milhões que pirateou. Então a questão legal está em aberto. Se as pessoas que o construíram pensaram que era roubo é, até ontem, não.

2:41 O que torna o outro lançamento da OpenAI na quinta-feira uma escolha ousada. Astra for Law envolve o GPT-6 Astra, o modelo que carimbei REVERT na semana passada depois que ele produziu setenta e cinco mil linhas de nada, em um índice de pesquisa jurídica de duzentos e trinta milhões de páginas. No benchmark de pesquisa jurídica da Vals AI, ele acerta cinquenta e quatro por cento das perguntas, acima dos trinta e nove com a pesquisa web simples, o que a OpenAI chama de uma melhoria de quarenta por cento e um advogado chamaria de errado quase metade das vezes. A postagem do blog não contém a palavra alucinação.

3:14 O Hacker News sim: ele será capaz de se processar, o que, dada a semana, é o primeiro caso de uso genuíno. Enquanto isso, o discurso de roubo de trabalho chegou ao seu laptop. Um desenvolvedor chamado ferstar limpou sua pasta ZCode, o agente de desktop fechado da Z.ai para os modelos GLM, e encontrou um arquivo criptografado de trezentos e treze megabytes de seu workspace comercial: quarenta e dois mil arquivos, oitenta e sete por cento dele o diretório .git, enviado para o armazenamento de objetos da Alibaba no login e antes de cada prompt.

3:42 O arquivo é empacotado com uma chave pública que o servidor distribui; a chave privada vive apenas na nuvem da Z.ai, então o texto cifrado em seu próprio disco é ilegível para você. Sua frase: uma chave que só o servidor pode usar serve exatamente a um propósito. Z.ai também é a empresa que a Anthropic acusou de destilar Claude, então os pesos estão abertos e, aparentemente, seu repositório também. E o engraçado, a menos que você trabalhe na OpenAI. Hacktron encontrou um overflow de heap em libheif, enviou uma imagem adulterada para

4:10 community.openai.com, obteve execução de código no fórum, e utilizou um single sign-on mal configurado através da integração com o GitHub para acessar os repositórios internos da OpenAI, em menos de setenta e duas horas. O exploit foi escrito por Claude: Opus 4.8 não conseguiu vencer a randomização de endereço, Opus 5 conseguiu em três horas após o lançamento. Toda a campanha custou menos de três mil dólares em tokens. A OpenAI corrigiu em quatorze horas e pagou seis mil e quinhentos dólares, então o código-fonte de uma empresa de trilhões de dólares foi,

4:39 brevemente, precificado como um Corolla usado, no mesmo dia em que seus advogados argumentaram que a cópia é uso justo. Se preferir ler isso a me ouvir dizer, o diff chega na sua caixa de entrada todas as manhãs — gratuito em thedailydiff.dev, link abaixo. Então — o veredito de hoje: NEEDS REVIEW. As citações são reais, mas são escolhas da acusação a partir de provas lacradas, e o único juiz que decidiu diz que o treinamento é uso justo e a pirataria não. O tribunal decide a lei; o memorando já decidiu a ética.

5:07 Inscreva-se, ative o sino e me diga nos comentários se você teria carimbado de forma diferente. E essa é a diferença de hoje. Sou Niko da Axrisi. SHIP IT com responsabilidade.

## Fontes

- [TechCrunch: Microsoft exec called AI scraping 'the largest theft of labor in human history'](https://techcrunch.com/2026/09/17/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history-new-unredacted-filings-reveal/) — techcrunch.com
- [HN thread (605 pts)](https://news.ycombinator.com/item?id=49752056) — news.ycombinator.com
- [Jason Kint on the unsealed motions](https://x.com/jason_kint/status/2100611139906228629) — x.com
- [Ed Newton-Rex](https://x.com/ednewtonrex/status/2100649215290466631) — x.com
- [Bartz v. Anthropic / $1.5B settlement (background)](https://en.wikipedia.org/wiki/Anthropic) — en.wikipedia.org
- [OpenAI: Introducing Astra for Law](https://openai.com/index/astra-for-law/) — openai.com
- [HN: Astra for Law (550 pts)](https://news.ycombinator.com/item?id=49745940) — news.ycombinator.com
- [ferstar: ZCode silent workspace snapshot (original forensics)](https://blog.ferstar.org/en/posts/zcode-silent-workspace-snapshot/) — blog.ferstar.org
- [tokenstead write-up](https://tokenstead.ai/guides/zcode-silent-git-history-upload) — tokenstead.ai
- [ferstar on X](https://x.com/ferstar_org/status/2100805861002355154) — x.com
- [HN: ZCode uploads your Git history (226 pts)](https://news.ycombinator.com/item?id=49752422) — news.ycombinator.com
- [Hacktron: Hacking OpenAI](https://www.hacktron.ai/blog/hacking-openai) — www.hacktron.ai
- [HN: Hacktron (406 pts)](https://news.ycombinator.com/item?id=49749656) — news.ycombinator.com
