+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Memorando da Microsoft sobre treinamento de IA acaba de se tornar público.

Documentos não-redigidos em New York Times v.

Documentos não-redigidos em New York Times v. OpenAI & Microsoft: um memorando de janeiro de 2023 de um diretor da Microsoft chama os dados de treinamento de IA de "o maior roubo de trabalho na história da humanidade", o Copilot cortou os cliques para o Times em até 93% (seu "ciclo de desgraça"), Nadella diz que o conteúdo pago deve ser licenciado, o chefe do ChatGPT chama o produto de "em grande parte substitutivo", e Greg Brockman respondeu a um hack de paywall com "ah, legal." No mesmo dia: OpenAI lança Astra for Law (54% correto no Vals legal bench). Além de ZCode enviando todo o seu .git para o Aliyun com uma chave que só a Z.ai possui, e Hacktron alcançando os repositórios internos da OpenAI por uma recompensa de US$ 6.500. Veredito: NEEDS REVIEW.

Leia a edição escrita (Inglês) ↗

O que este vídeo aborda

  • NYT v. OpenAI/Microsoft revelado: "maior roubo de trabalho na história da humanidade" (memorando da Microsoft, janeiro de 2023); Copilot -93% cliques; 91.692 cópias de trabalhos dos autores nos dados de meio de treinamento; 2M de páginas do nytimes.com em um Common Crawl; avisos de direitos autorais removidos; Brockman: "ah, legal"
  • Cuidado: as citações vêm do processo do Times, as provas ainda estão lacradas; o Juiz Alsup (Bartz v. Anthropic) decidiu que o treinamento em livros comprados é uso justo — a Anthropic pagou US$ 1,5 bilhão pelos 7 milhões pirateados
  • OpenAI Astra for Law: GPT-6 Astra + um índice jurídico de 230M de URLs; 54,0% vs 38,7% no Vals Legal Research Bench; Harvey, Legora, 26 plugins
  • ZCode (Z.ai, GLM): 313 MB de snapshot criptografado de um workspace de 42.411 arquivos, 86,6% .git, enviado para Aliyun OSS no login e antes de cada prompt; chave RSA-OAEP detida apenas pela Z.ai; alternadores de configuração não o impedem
  • Hacktron: overflow de heap em libheif → RCE do Discourse → má configuração de SSO → GitHub → repositórios internos da OpenAI em menos de 72 h; exploit escrito por Claude Opus 5 (3 h); campanha custou menos de US$ 3.000 em tokens; recompensa de US$ 6.500, corrigido em ~14 h

Transcrição traduzida

Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.

0:00 Em janeiro de 2023, um diretor da Microsoft escreveu um memorando chamando o que sua própria empresa estava fazendo de o maior roubo de trabalho na história da humanidade, e ontem um tribunal federal permitiu que o resto de nós o lêsse. O memorando é uma das citações não-redigidas em New York Times versus OpenAI e Microsoft, um processo que completa três anos em dezembro. Na mesma quinta-feira, a OpenAI lançou o Astra for Law, um modelo para advogados, o que é uma coincidência ou uma contratação muito forte. Esta manhã, um desenvolvedor flagrou o ZCode, o agente de codificação da Z.ai,

0:29 fazendo upload de todo o seu histórico git para a nuvem da Alibaba com uma chave que só a Z.ai possui. E uma empresa de segurança acessou os repositórios internos da OpenAI através de um upload de imagem, pelo qual a OpenAI pagou seis mil e quinhentos dólares. Neste vídeo: o que os documentos dizem, quem disse "ah, legal" para um hack de paywall, o modelo jurídico que erra metade das vezes, o que o ZCode envia, e por que um exploit escrito por Claude vale menos que um carro usado. É sexta-feira, 18 de setembro, e este é The Daily Diff.

0:58 Comecemos com o memorando. Brent Hecht comanda a ciência aplicada na Microsoft, e em janeiro de 2023 ele chamou os dados de treinamento de um roubo surpreendente de proporções sem precedentes. Um ano depois, ele voltou com uma apresentação: o motor de resposta do Copilot cortou os cliques para o Times em até noventa e três por cento, o que ele chamou de ciclo de desgraça: privar os editores de comida, e o modelo não terá nada de novo para comer. Suas palavras: um produto final que ameaça os fundamentos econômicos de seus

1:21 fornecedores essenciais, a maneira corporativa de dizer que a cobra encontrou sua própria cauda. Em seguida, as declarações. Satya Nadella testemunhou este ano que qualquer conteúdo pago deveria ser licenciado, e que, se soubesse que a OpenAI treinava em artigos pagos, os teria feito retreinar, o que pressupõe que ninguém na Microsoft abriu o conjunto de treinamento que lhes foi entregue, e, de acordo com o mesmo documento, esse era todo o conjunto de dados do GPT-3. Nick Turley, que comanda o ChatGPT, chamou-o de uma ameaça existencial para os editores, em grande parte substitutivo. E quando um pesquisador

1:49 contou a Greg Brockman sobre um hack para contornar o paywall do Times, o presidente da OpenAI respondeu com duas palavras: ah, legal. Os engenheiros também removeram os avisos de direitos autorais dos dados para que o modelo não os exibisse, o que é o mesmo que lixar o número de série de uma bicicleta. A escala: mais de noventa e uma mil cópias dos artigos dos demandantes apenas nos conjuntos de meio de treinamento, e dois milhões de páginas do Times em um recorte do Common Crawl. Agora a parte que a manchete pula.

2:15 Cada citação vem do processo do Times; as provas ainda estão lacradas, então estamos lendo os destaques da acusação sem contexto. E os tribunais têm geralmente ficado do lado do uso justo: o Juiz Alsup decidiu no ano passado que treinar em livros pelos quais você pagou é legal, embora a Anthropic ainda tenha pago um bilhão e meio pelos sete milhões que pirateou. Então a questão legal está em aberto. Se as pessoas que o construíram pensaram que era roubo é, até ontem, não.

2:41 O que torna o outro lançamento da OpenAI na quinta-feira uma escolha ousada. Astra for Law envolve o GPT-6 Astra, o modelo que carimbei REVERT na semana passada depois que ele produziu setenta e cinco mil linhas de nada, em um índice de pesquisa jurídica de duzentos e trinta milhões de páginas. No benchmark de pesquisa jurídica da Vals AI, ele acerta cinquenta e quatro por cento das perguntas, acima dos trinta e nove com a pesquisa web simples, o que a OpenAI chama de uma melhoria de quarenta por cento e um advogado chamaria de errado quase metade das vezes. A postagem do blog não contém a palavra alucinação.

3:14 O Hacker News sim: ele será capaz de se processar, o que, dada a semana, é o primeiro caso de uso genuíno. Enquanto isso, o discurso de roubo de trabalho chegou ao seu laptop. Um desenvolvedor chamado ferstar limpou sua pasta ZCode, o agente de desktop fechado da Z.ai para os modelos GLM, e encontrou um arquivo criptografado de trezentos e treze megabytes de seu workspace comercial: quarenta e dois mil arquivos, oitenta e sete por cento dele o diretório .git, enviado para o armazenamento de objetos da Alibaba no login e antes de cada prompt.

3:42 O arquivo é empacotado com uma chave pública que o servidor distribui; a chave privada vive apenas na nuvem da Z.ai, então o texto cifrado em seu próprio disco é ilegível para você. Sua frase: uma chave que só o servidor pode usar serve exatamente a um propósito. Z.ai também é a empresa que a Anthropic acusou de destilar Claude, então os pesos estão abertos e, aparentemente, seu repositório também. E o engraçado, a menos que você trabalhe na OpenAI. Hacktron encontrou um overflow de heap em libheif, enviou uma imagem adulterada para

4:10 community.openai.com, obteve execução de código no fórum, e utilizou um single sign-on mal configurado através da integração com o GitHub para acessar os repositórios internos da OpenAI, em menos de setenta e duas horas. O exploit foi escrito por Claude: Opus 4.8 não conseguiu vencer a randomização de endereço, Opus 5 conseguiu em três horas após o lançamento. Toda a campanha custou menos de três mil dólares em tokens. A OpenAI corrigiu em quatorze horas e pagou seis mil e quinhentos dólares, então o código-fonte de uma empresa de trilhões de dólares foi,

4:39 brevemente, precificado como um Corolla usado, no mesmo dia em que seus advogados argumentaram que a cópia é uso justo. Se preferir ler isso a me ouvir dizer, o diff chega na sua caixa de entrada todas as manhãs — gratuito em thedailydiff.dev, link abaixo. Então — o veredito de hoje: NEEDS REVIEW. As citações são reais, mas são escolhas da acusação a partir de provas lacradas, e o único juiz que decidiu diz que o treinamento é uso justo e a pirataria não. O tribunal decide a lei; o memorando já decidiu a ética.

5:07 Inscreva-se, ative o sino e me diga nos comentários se você teria carimbado de forma diferente. E essa é a diferença de hoje. Sou Niko da Axrisi. SHIP IT com responsabilidade.

Fontes

  1. TechCrunch: Microsoft exec called AI scraping 'the largest theft of labor in human history'techcrunch.com
  2. HN thread (605 pts)news.ycombinator.com
  3. Jason Kint on the unsealed motionsx.com
  4. Ed Newton-Rexx.com
  5. Bartz v. Anthropic / $1.5B settlement (background)en.wikipedia.org
  6. OpenAI: Introducing Astra for Lawopenai.com
  7. HN: Astra for Law (550 pts)news.ycombinator.com
  8. ferstar: ZCode silent workspace snapshot (original forensics)blog.ferstar.org
  9. tokenstead write-uptokenstead.ai
  10. ferstar on Xx.com
  11. HN: ZCode uploads your Git history (226 pts)news.ycombinator.com
  12. Hacktron: Hacking OpenAIwww.hacktron.ai
  13. HN: Hacktron (406 pts)news.ycombinator.com

Vídeos relacionados