+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

El memoràndum de Microsoft sobre l'entrenament d'IA acaba de fer-se públic.

Documents no redactats en New York Times contra OpenAI i Microsoft: un memoràndum d'un director de Microsoft de gener de 2023 anomena les dades d'entrenament d'IA "el robatori de mà d'obra més gran de la història de la humanitat", Copilot va reduir els clics al Times fins a un 93% (la seva "espiral de la mort"), Nadella diu que el contingut de pagament hauria de tenir llicència, el cap de ChatGPT anomena el producte "majoritàriament substitutiu", i Greg Brockman va respondre a un hack de pagament amb "ah, bé".

Documents no redactats en New York Times contra OpenAI i Microsoft: un memoràndum d'un director de Microsoft de gener de 2023 anomena les dades d'entrenament d'IA "el robatori de mà d'obra més gran de la història de la humanitat", Copilot va reduir els clics al Times fins a un 93% (la seva "espiral de la mort"), Nadella diu que el contingut de pagament hauria de tenir llicència, el cap de ChatGPT anomena el producte "majoritàriament substitutiu", i Greg Brockman va respondre a un hack de pagament amb "ah, bé". El mateix dia: OpenAI llança Astra for Law (54% correcte a la prova legal de Vals). A més, ZCode puja tot el teu .git a Aliyun amb una clau que només Z.ai posseeix, i Hacktron arriba als repositoris interns d'OpenAI per una recompensa de 6.500 dòlars. Veredicte: NEEDS REVIEW.

Llegeix l'edició escrita (anglès) ↗

Què cobreix aquest vídeo

  • NYT v. OpenAI/Microsoft dessegellat: "el robatori de mà d'obra més gran de la història de la humanitat" (memoràndum de Microsoft, gener de 2023); Copilot -93% de clics; 91.692 còpies d'obres dels demandants en dades d'entrenament intermèdies; 2M de pàgines de nytimes.com en un segment de Common Crawl; avisos de copyright eliminats; Brockman: "ah, bé"
  • Advertiment: les cites provenen de l'escrit del Times, les proves encara estan segellades; el jutge Alsup (Bartz v. Anthropic) va dictaminar que l'entrenament amb llibres comprats és ús legítim — Anthropic va pagar 1.500 milions de dòlars pels 7 milions de pirates
  • OpenAI Astra for Law: GPT-6 Astra + un índex legal de 230M d'URL; 54,0% vs 38,7% al Vals Legal Research Bench; Harvey, Legora, 26 plugins
  • ZCode (Z.ai, GLM): 313 MB de snapshot xifrat d'un espai de treball de 42.411 fitxers, 86,6% .git, pujat a Aliyun OSS en iniciar sessió i abans de cada sol·licitud; clau RSA-OAEP només en possessió de Z.ai; els commutadors de configuració no ho aturen
  • Hacktron: desbordament de pila de libheif → Discourse RCE → SSO mal configurat → GitHub → Repositoris interns d'OpenAI en menys de 72 h; exploit per Claude Opus 5 (3 h); campanya per menys de 3.000 dòlars en tokens; recompensa de 6.500 dòlars, pegat en ~14 h

Transcripció traduïda

Traduït de la narració original en anglès. L'àudio i els subtítols disponibles estan controlats per YouTube.

0:00 El gener de 2023, un director de Microsoft va escriure un memoràndum qualificant el que la seva pròpia empresa estava fent el robatori de mà d'obra més gran de la història de la humanitat, i ahir un tribunal federal va deixar que la resta de nosaltres el llegís. El memoràndum és una de les cites no redactades en New York Times contra OpenAI i Microsoft, una demanda que compleix tres anys aquest desembre. El mateix dijous, OpenAI va llançar Astra for Law, un model per a advocats, cosa que és una coincidència o una contractació molt sòlida. Aquest matí, un desenvolupador va enxampar ZCode, l'agent de codificació de Z dot A I,

0:29 pujant tot el seu historial de git al núvol d'Alibaba amb una clau que només Z dot A I posseeix. I una empresa de seguretat va entrar als repositoris interns d'OpenAI mitjançant una càrrega d'imatges, per la qual OpenAI va pagar sis mil cinc-cents dòlars. En aquest vídeo: què diuen els documents, qui va dir "ah, bé" a un hack de pagament, el model legal que s'equivoca la meitat del temps, què puja ZCode, i per què un exploit escrit per Claude val menys que un cotxe usat. És divendres, 18 de setembre, i aquest és The Daily Diff.

0:58 Comencem amb el memoràndum. Brent Hecht dirigeix la ciència aplicada a Microsoft, i el gener de 2023 va anomenar les dades d'entrenament un robatori sorprenent de proporcions sense precedents. Un any més tard va tornar amb una presentació: el motor de respostes de Copilot va reduir els clics al Times fins a un noranta-tres per cent, que ell va anomenar una espiral de la mort: mor els editors, i el model no té res de nou a menjar. Les seves paraules: un producte final que amenaça els fonaments econòmics dels seus

1:21 proveïdors essencials, la manera corporativa de dir que la serp ha localitzat la seva cua. Després les declaracions. Satya Nadella va testificar aquest any que qualsevol contingut de pagament hauria de tenir llicència, i que si hagués sabut que OpenAI entrenava amb articles de pagament els hauria fet reentrenar, la qual cosa assumeix que ningú a Microsoft va obrir el conjunt d'entrenament que se'ls va lliurar, i segons el mateix document, aquest era tot el conjunt de dades de GPT-3. Nick Turley, que dirigeix ChatGPT, ho va qualificar d'amenaça existencial per als editors, majoritàriament substitutiu. I quan un investigador

1:49 va dir a Greg Brockman sobre un hack per evitar el pagament del Times, el president d'OpenAI va respondre amb dues paraules: ah, bé. Els enginyers també van eliminar els avisos de copyright de les dades perquè el model no els produís, que és per això que s'esborra el número de sèrie d'una bicicleta. L'escala: més de noranta-un mil còpies dels articles dels demandants en els conjunts d'entrenament intermedis sols, i dos milions de pàgines del Times en un segment de Common Crawl. Ara la part que el titular s'oblida.

2:15 Cada cita prové de l'escrit del Times; les proves encara estan segellades, així que estem llegint els aspectes més destacats de la fiscalia sense context. I els tribunals majoritàriament s'han posat del costat de l'ús legítim: el jutge Alsup va dictaminar l'any passat que entrenar amb llibres que has pagat és legal, tot i que Anthropic encara va pagar mil cinc-cents milions pels set milions que va piratejar. Així que la qüestió legal està oberta. Si les persones que ho van construir pensaven que era un robatori és, des d'ahir, que no.

2:41 El que fa que l'altre llançament d'OpenAI de dijous sigui una elecció atrevida. Astra for Law embolcalla GPT-6 Astra, el model que vaig marcar REVERT la setmana passada després que produís setanta-cinc mil línies de res, en un índex de recerca legal de dos-cents trenta milions de pàgines. En el benchmark de recerca legal de Vals AI, passa el cinquanta-quatre per cent de les preguntes, augmentant des del trenta-nou amb una cerca web normal, el que OpenAI anomena una millora del quaranta per cent i un advocat diria que s'equivoca gairebé la meitat del temps. La publicació del bloc no conté la paraula "al·lucinació".

3:14 Hacker News sí: podrà demandar-se a si mateix, cosa que, donada la setmana, és el primer cas d'ús genuí. Mentrestant, el discurs del robatori de mà d'obra va arribar al vostre portàtil. Un desenvolupador anomenat ferstar va netejar la seva carpeta ZCode, l'agent d'escriptori tancat de Z dot A I per als models GLM, i va trobar un arxiu xifrat de tres-cents tretze megabytes del seu espai de treball comercial: quaranta-dos mil fitxers, el vuitanta-set per cent el directori dot git, enviat a l'emmagatzematge d'objectes d'Alibaba en iniciar sessió i abans de cada sol·licitud.

3:42 L'arxiu està embolicat amb una clau pública que el servidor distribueix; la clau privada viu només al núvol de Z dot A I, així que el text xifrat al vostre propi disc és il·legible per a vosaltres. La seva frase: una clau que només el servidor pot utilitzar serveix exactament per a un propòsit. Z dot A I també és l'empresa que Anthropic va acusar de destil·lar Claude, així que els pesos són oberts i, aparentment, també ho és el vostre repositori. I el divertit, tret que treballeu a OpenAI. Hacktron va trobar un desbordament de pila a libheif, va pujar una imatge manipulada a

4:10 community dot openai dot com, va obtenir execució de codi al fòrum, i va aprofitar una configuració incorrecta de l'inici de sessió únic a través de la integració de GitHub a els repositoris interns d'OpenAI, en menys de setanta-dues hores. L'exploit va ser escrit per Claude: Opus 4.8 no va poder superar la randomització d'adreces, Opus 5 ho va fer en tres hores des del llançament. Tota la campanya va costar menys de tres mil dòlars en tokens. OpenAI va parchejar en catorze hores i va pagar sis mil cinc-cents dòlars, així que el codi font d'una empresa de bilions de dòlars va ser,

4:39 breument, valorat com un Corolla usat, el mateix dia que els seus advocats van argumentar que la còpia és ús legítim. Si preferiu llegir-ho que sentir-me dir-ho, el diff arriba a la vostra safata d'entrada cada matí — gratuït a the daily diff dot dev, enllaç a continuació. Així que — el veredicte d'avui: NEEDS REVIEW. Les cites són reals, però són les seleccions de la fiscalia d'exposicions segellades, i l'únic jutge que ha dictaminat diu que l'entrenament és ús legítim i la pirateria no ho és. El tribunal decideix la llei; el memoràndum ja va decidir l'ètica.

5:07 Subscriviu-vos, cliqueu la campana i digueu-me als comentaris si l'hauríeu marcat diferentment. I això és el diff d'avui. Sóc Niko d'Axrisi. Fusiona amb responsabilitat.

Fonts

  1. TechCrunch: Microsoft exec called AI scraping 'the largest theft of labor in human history'techcrunch.com
  2. HN thread (605 pts)news.ycombinator.com
  3. Jason Kint on the unsealed motionsx.com
  4. Ed Newton-Rexx.com
  5. Bartz v. Anthropic / $1.5B settlement (background)en.wikipedia.org
  6. OpenAI: Introducing Astra for Lawopenai.com
  7. HN: Astra for Law (550 pts)news.ycombinator.com
  8. ferstar: ZCode silent workspace snapshot (original forensics)blog.ferstar.org
  9. tokenstead write-uptokenstead.ai
  10. ferstar on Xx.com
  11. HN: ZCode uploads your Git history (226 pts)news.ycombinator.com
  12. Hacktron: Hacking OpenAIwww.hacktron.ai
  13. HN: Hacktron (406 pts)news.ycombinator.com

Vídeos relacionats