+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Memorando de Microsoft sobre o adestramento de IA acaba de facerse público.

Documentos non redactados en New York Times v.

Documentos non redactados en New York Times v. OpenAI e Microsoft: un memorando dun director de Microsoft de xaneiro de 2023 cualifica os datos de adestramento de IA como "o maior roubo de man de obra na historia da humanidade", Copilot reduciu os clics no Times ata un 93% (o seu "bucle fatal"), Nadella di que o contido de pago debería ter licenza, o xefe de ChatGPT cualifica o produto de "en gran medida substitutivo", e Greg Brockman respondeu a un hack de muro de pago con "ah, que ben". O mesmo día: OpenAI lanza Astra for Law (54% correcto no banco legal Vals). Ademais, ZCode carga todo o teu .git a Aliyun cunha clave que só Z.ai posúe, e Hacktron accede aos repositorios internos de OpenAI por unha recompensa de 6.500 $. Veredicto: NEEDS REVIEW.

Ler a edición escrita (inglés) ↗

Que abrangue este vídeo

  • NYT v. OpenAI/Microsoft desclasificado: "o maior roubo de man de obra na historia da humanidade" (memorando de Microsoft, xan. 2023); Copilot −93% de clics; 91.692 copias de obras dos demandantes en datos de adestramento intermedios; 2M de páxinas de nytimes.com nunha sección de Common Crawl; avisos de dereitos de autor eliminados; Brockman: "ah, que ben"
  • Advertencia: as citas proceden do informe do Times, as probas aínda están seladas; o xuíz Alsup (Bartz v. Anthropic) ditaminou que o adestramento con libros comprados é de uso lexítimo — Anthropic pagou 1.500 millóns de dólares polos 7 millóns pirateados
  • OpenAI Astra for Law: GPT-6 Astra + un índice legal de 230 millóns de URL; 54,0% fronte a 38,7% no Vals Legal Research Bench; Harvey, Legora, 26 complementos
  • ZCode (Z.ai, GLM): instantánea cifrada de 313 MB dun espazo de traballo de 42.411 ficheiros, 86,6% .git, cargada a Aliyun OSS ao iniciar sesión e antes de cada solicitude; clave RSA-OAEP só en poder de Z.ai; os interruptores de configuración non o deteñen
  • Hacktron: desbordamento de pila libheif → RCE de Discourse → mala configuración de SSO → GitHub → repositorios internos de OpenAI en menos de 72 h; exploit escrito por Claude Opus 5 (3 h); campaña de menos de 3.000 $ en tokens; recompensa de 6.500 $, parcheado en ~14 h

Transcrición traducida

Traducido da narración orixinal en inglés. O audio e os subtítulos dispoñibles son controlados por YouTube.

0:00 En xaneiro de 2023, un director de Microsoft escribiu un memorando cualificando o que a súa propia empresa estaba facendo como o maior roubo de man de obra na historia da humanidade, e onte un tribunal federal permitiunos lelo ao resto de nós. O memorando é unha das citas sen redactar no caso New York Times contra OpenAI e Microsoft, unha demanda que cumpre tres anos este decembro. O mesmo xoves, OpenAI lanzou Astra for Law, un modelo para avogados, o que é unha coincidencia ou unha contratación moi forte. Esta mañá un desenvolvedor pillou a ZCode, o axente de codificación de Z.ai,

0:29 cargando todo o seu historial de git na nube de Alibaba cunha clave que só Z punto A I posúe. E unha empresa de seguridade entrou nos repositorios internos de OpenAI a través dunha carga de imaxes, pola que OpenAI pagou seis mil cincocentos dólares. Neste vídeo: o que din os documentos, quen dixo 'ah, que ben' a un hack de muro de pago, o modelo legal que se equivoca a metade das veces, o que ZCode carga, e por que un exploit escrito por Claude vale menos que un coche usado. É venres, 18 de setembro, e este é The Daily Diff.

0:58 Comecemos polo memorando. Brent Hecht dirixe a ciencia aplicada en Microsoft, e en xaneiro de 2023 cualificou os datos de adestramento como un roubo asombroso de proporcións sen precedentes. Un ano despois volveu cunha presentación: o motor de resposta de Copilot reduciu os clics no Times ata un noventa e tres por cento, o que el chamou un bucle fatal: famar os editores, e o modelo non ten nada novo que comer. As súas palabras: un produto final que ameaza os alicerces económicos dos seus

1:21 provedores esenciais, a forma corporativa de dicir que a serpe localizou a súa cola. Despois as declaracións. Satya Nadella testificou este ano que calquera contido de pago debería ter licenza, e que se soubera que OpenAI adestrara con artigos de pago, el tería feito que os volvesen adestrar, o que supón que ninguén en Microsoft abriu o conxunto de adestramento que lles entregaron, e segundo o mesmo documento, ese era todo o conxunto de datos de GPT-3. Nick Turley, que dirixe ChatGPT, chamouno unha ameaza existencial para os editores, en gran medida substitutiva. E cando un investigador

1:49 díxolle a Greg Brockman sobre un hack para evitar o muro de pago do Times, o presidente de OpenAI respondeu con dúas palabras: ah, que ben. Os enxeñeiros tamén eliminaron os avisos de dereitos de autor dos datos para que o modelo non os producise, que é por que se lima o número de serie dunha bicicleta. A escala: máis de noventa e unha mil copias dos artigos dos demandantes só nos conxuntos de adestramento intermedios, e dous millóns de páxinas do Times nunha sección de Common Crawl. Agora a parte que o titular omite.

2:15 Cada cita procede do informe do Times; as probas aínda están seladas, polo que estamos a ler os puntos destacados da acusación sen contexto. E os tribunais maioritariamente puxéronse do lado do uso lexítimo: o xuíz Alsup ditaminou o ano pasado que adestrar con libros polos que pagaches é legal, aínda que Anthropic aínda pagou mil cincocentos millóns polos sete millóns que pirateou. Polo tanto, a cuestión legal está aberta. Se a xente que o construía pensaba que era un roubo, como de onte, non o é.

2:41 O que fai do outro lanzamento de OpenAI do xoves unha elección audaz. Astra for Law engloba a GPT-6 Astra, o modelo que marquei como REVERT a semana pasada despois de que producise setenta e cinco mil liñas de nada, nun índice de busca legal de douscentos trinta millóns de páxinas. No benchmark de investigación legal de Vals AI, aproba o cincuenta e catro por cento das preguntas, fronte ao trinta e nove cunha simple busca web, o que OpenAI chama unha mellora do corenta por cento e un avogado chamaría erróneo case a metade das veces. A publicación do blog non contén a palabra "alucinación".

3:14 Hacker News si: poderá demandarse a si mesmo, o que, dada a semana, é o primeiro caso de uso xenuíno. Mentres tanto, o discurso do roubo de man de obra chegou ao teu portátil. Un desenvolvedor chamado ferstar limpou a súa carpeta ZCode, o axente de escritorio pechado de Z.ai para os modelos GLM, e atopou un arquivo cifrado de trescentos trece megabytes do seu espazo de traballo comercial: corenta e dous mil ficheiros, oitenta e sete por cento deles o directorio .git, enviado ao almacenamento de obxectos de Alibaba ao iniciar sesión e antes de cada solicitude.

3:42 O arquivo está envolto cunha clave pública que o servidor entrega; a clave privada vive só na nube de Z.ai, polo que o texto cifrado no teu propio disco é ilexible para ti. A súa frase: unha clave que só o servidor pode usar ten exactamente un propósito. Z.ai tamén é a empresa que Anthropic acusou de destilar a Claude, polo que os pesos están abertos e tamén, aparentemente, o teu repositorio. E o divertido, a menos que traballes en OpenAI. Hacktron atopou un desbordamento de pila en libheif, cargou unha imaxe modificada en

4:10 community.openai.com, obtivo execución de código no foro, e aproveitou unha configuración incorrecta de inicio de sesión único a través da integración de GitHub para entrar nos repositorios internos de OpenAI, en menos de setenta e dúas horas. O exploit foi escrito por Claude: Opus 4.8 non puido superar a aleatorización de enderezo, Opus 5 fíxoo dentro das tres horas do lanzamento. Toda a campaña custou menos de tres mil dólares en tokens. OpenAI parcheou en catorce horas e pagou seis mil cincocentos dólares, polo que o código fonte dunha empresa de billóns de dólares foi,

4:39 brevemente, valorado como un Corolla usado, o mesmo día que os seus avogados argumentaron que a copia é de uso lexítimo. Se prefires ler isto en lugar de escoitarme dicilo, o 'diff' chega á túa caixa de entrada cada mañá — de balde en thedailydiff.dev, ligazón debaixo. Así que — o veredicto de hoxe: NEEDS REVIEW. As citas son reais, pero son as eleccións da acusación de probas seladas, e o único xuíz que ditaminou di que o adestramento é de uso lexítimo e a piratería non. O tribunal decide a lei; o memorando xa decidiu a ética.

5:07 Subscríbete, preme na campá e dime nos comentarios se o terías marcado de xeito diferente. E ese é o 'diff' de hoxe. Son Niko de Axrisi. SHIP IT con responsabilidade.

Fontes

  1. TechCrunch: Microsoft exec called AI scraping 'the largest theft of labor in human history'techcrunch.com
  2. HN thread (605 pts)news.ycombinator.com
  3. Jason Kint on the unsealed motionsx.com
  4. Ed Newton-Rexx.com
  5. Bartz v. Anthropic / $1.5B settlement (background)en.wikipedia.org
  6. OpenAI: Introducing Astra for Lawopenai.com
  7. HN: Astra for Law (550 pts)news.ycombinator.com
  8. ferstar: ZCode silent workspace snapshot (original forensics)blog.ferstar.org
  9. tokenstead write-uptokenstead.ai
  10. ferstar on Xx.com
  11. HN: ZCode uploads your Git history (226 pts)news.ycombinator.com
  12. Hacktron: Hacking OpenAIwww.hacktron.ai
  13. HN: Hacktron (406 pts)news.ycombinator.com

Vídeos relacionados