+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Ang sariling memo ng Microsoft tungkol sa pagsasanay sa AI ay lumabas sa publiko.

Mga walang redacted na paghaharap sa New York Times laban sa OpenAI at Microsoft: isang memo ng direktor ng Microsoft noong Enero 2023 ay tinawag ang data ng pagsasanay ng AI na "pinakamalaking pagnanakaw ng paggawa sa kasaysayan ng tao", binawasan ng Copilot ang mga click-throughs sa Times ng hanggang 93% (ang kanyang "doom loop"), sinabi ni Nadella na ang paywalled na nilalaman ay dapat lisensyado, tinawag ng pinuno ng ChatGPT ang produkto na "malaking kapalit", at sinagot ni Greg Brockman ang isang paywall hack ng "ah nice." Sa parehong araw: Naglabas ang OpenAI ng Astra for Law (54% tama sa Vals legal bench).

Mga walang redacted na paghaharap sa New York Times laban sa OpenAI at Microsoft: isang memo ng direktor ng Microsoft noong Enero 2023 ay tinawag ang data ng pagsasanay ng AI na "pinakamalaking pagnanakaw ng paggawa sa kasaysayan ng tao", binawasan ng Copilot ang mga click-throughs sa Times ng hanggang 93% (ang kanyang "doom loop"), sinabi ni Nadella na ang paywalled na nilalaman ay dapat lisensyado, tinawag ng pinuno ng ChatGPT ang produkto na "malaking kapalit", at sinagot ni Greg Brockman ang isang paywall hack ng "ah nice." Sa parehong araw: Naglabas ang OpenAI ng Astra for Law (54% tama sa Vals legal bench). Dagdag pa ang pag-upload ng ZCode sa iyong buong .git sa Aliyun gamit ang isang key na tanging hawak ng Z.ai, at ang Hacktron na umabot sa mga panloob na repos ng OpenAI para sa isang $6,500 bounty. Verdict: NEEDS REVIEW.

Basahin ang nakasulat na edisyon (English) ↗

Ang sakop ng video na ito

  • NYT laban sa OpenAI/Microsoft binuksan: "pinakamalaking pagnanakaw ng paggawa sa kasaysayan ng tao" (memo ng Microsoft, Enero 2023); Copilot −93% na click-throughs; 91,692 kopya ng mga gawa ng mga nagsasakdal sa mid-training data; 2M nytimes.com na pahina sa isang Common Crawl slice; tinanggal ang mga paunawa ng copyright; Brockman: "ah nice"
  • Babala: ang mga sipi ay nagmula sa brief ng Times, ang mga exhibit ay selyado pa; Nagpasya si Judge Alsup (Bartz laban sa Anthropic) na ang pagsasanay sa biniling libro ay patas na paggamit — Nagbayad ang Anthropic ng $1.5B para sa 7M na mga pirated na libro
  • OpenAI Astra for Law: GPT-6 Astra + isang 230M-URL na legal na index; 54.0% laban sa 38.7% sa Vals Legal Research Bench; Harvey, Legora, 26 plugin
  • ZCode (Z.ai, GLM): 313 MB na naka-encrypt na snapshot ng 42,411-file na workspace, 86.6% .git, na-upload sa Aliyun OSS sa pag-login at bago ang bawat prompt; RSA-OAEP key na hawak lamang ng Z.ai; ang mga toggle ng setting ay hindi ito pinipigilan
  • Hacktron: libheif heap overflow → Discourse RCE → SSO misconfig → GitHub → OpenAI internal repos sa ilalim ng 72 oras; exploit ng Claude Opus 5 (3 oras); kampanya sa ilalim ng $3,000 sa mga token; bounty $6,500, na-patch sa ~14 oras

Isinaling transcript

Isinalin mula sa orihinal na salaysay sa English. Ang available na audio at mga caption ay kinokontrol ng YouTube.

0:00 Noong Enero 2023, isang direktor ng Microsoft ang sumulat ng memo na tinatawag ang ginagawa ng kanyang sariling kumpanya na pinakamalaking pagnanakaw ng paggawa sa kasaysayan ng tao, at kahapon ay pinahintulutan ng isang pederal na korte ang iba sa atin na basahin ito. Ang memo ay isa sa mga walang redacted na sipi sa New York Times laban sa OpenAI at Microsoft, isang kaso na tatlong taon na ngayong Disyembre. Parehong Huwebes, naglabas ang OpenAI ng Astra for Law, isang modelo para sa mga abogado, na maaaring isang pagkakataon o isang napakalakas na pagkuha. Ngayong umaga ay nahuli ng isang developer ang ZCode, ang coding agent ng Z dot A I,

0:29 na nag-a-upload ng kanyang buong kasaysayan ng git sa cloud ng Alibaba gamit ang isang key na tanging si Z dot A I lamang ang may hawak. At isang security firm ang nakapasok sa mga panloob na repository ng OpenAI sa pamamagitan ng isang pag-upload ng larawan, kung saan binayaran ng OpenAI ng anim na libo limang daang dolyar. Sa video na ito: kung ano ang sinasabi ng mga paghaharap, sino ang nagsabi ng ah nice sa isang paywall hack, ang modelo ng batas na mali kalahati ng oras, kung ano ang ina-upload ng ZCode, at kung bakit ang isang Claude-written exploit ay nagkakahalaga ng mas mababa kaysa sa isang ginamit na kotse. Biyernes na, Setyembre 18, at ito ang The Daily Diff.

0:58 Magsimula sa memo. Pinamamahalaan ni Brent Hecht ang applied science sa Microsoft, at noong Enero 2023 ay tinawag niya ang data ng pagsasanay na isang kamangha-manghang pagnanakaw ng walang kapantay na proporsyon. Makalipas ang isang taon ay bumalik siya na may slide deck: ang answer engine ng Copilot ay nagbawas ng mga click-through sa Times ng hanggang siyamnapu't-tatlong porsyento, na pinangalanan niyang doom loop: gutumin ang mga publisher, at ang modelo ay walang bago na makakain. Ang kanyang mga salita: isang end product na nagbabanta sa mga pundasyong pang-ekonomiya ng mga

1:21 mahahalagang supplier nito, ang korporasyon na paraan ng pagsasabi na natagpuan ng ahas ang kanyang buntot. Pagkatapos ang mga deposition. Sumaksi si Satya Nadella ngayong taon na ang anumang paywalled ay dapat lisensyado, at kung alam niya na nagsanay ang OpenAI sa mga paywalled na artikulo ay ipapagawa niya sa kanila ang retraining, na nagpapahiwatig na walang sinuman sa Microsoft ang nagbukas ng training set na ibinigay sa kanila, at ayon sa parehong filing na iyon ay ang buong GPT-3 dataset. Nick Turley, na namumuno sa ChatGPT, tinawag itong isang banta sa mga publisher, malaking kapalit. At nang isang mananaliksik

1:49 ang nagsabi kay Greg Brockman tungkol sa isang hack upang malampasan ang paywall ng Times, ang presidente ng OpenAI ay sumagot ng dalawang salita: ah nice. Tinanggal din ng mga inhinyero ang mga paunawa ng copyright mula sa data upang hindi ito ilabas ng modelo, iyon ang dahilan kung bakit mo kinakaskas ang serial number sa isang bisikleta. Ang sukat: higit sa siyamnapu't-isang libong kopya ng mga artikulo ng mga nagsasakdal sa mga mid-training set lamang, at dalawang milyong pahina ng Times sa isang Common Crawl slice. Ngayon ang bahagi na nilalaktawan ng headline.

2:15 Ang bawat sipi ay nagmula sa brief ng Times; selyado pa rin ang mga exhibit, kaya binabasa natin ang mga highlight ng prosekusyon nang walang konteksto. At karamihan ay sumusuporta ang mga korte sa patas na paggamit: nagpasya si Judge Alsup noong nakaraang taon na ang pagsasanay sa mga librong binayaran mo ay legal, bagaman nagbayad pa rin ang Anthropic ng isa at kalahating bilyon para sa pitong milyon na niraid nito. Kaya ang legal na tanong ay bukas pa. Kung inakala ng mga taong bumuo nito na ito ay pagnanakaw ay, kahapon, hindi.

2:41 Na ginagawang matapang na pagpipilian ang iba pang paglulunsad ng OpenAI noong Huwebes. Ang Astra for Law ay nagbalot ng GPT-6 Astra, ang modelong ini-stampa ko REVERT noong nakaraang linggo pagkatapos itong gumawa ng pitumpu't-limang libong linya ng wala, sa isang legal na search index ng dalawandaan at tatlumpung milyong pahina. Sa Vals AI's legal research benchmark, pumasa ito sa limampu't-apat na porsiyento ng mga tanong, tumaas mula sa tatlumpu't-siyam na may simpleng web search, na tinatawag ng OpenAI na apatnapung porsiyentong pagpapabuti at tatawagin ng abogado na mali halos kalahati ng oras. Ang blog post ay hindi naglalaman ng salitang hallucination.

3:14 Naglalaman ang Hacker News: magagawa ba nitong idemanda ang sarili nito, na, dahil sa linggo, ay ang unang tunay na kaso ng paggamit. Samantala, umabot sa iyong laptop ang diskurso tungkol sa pagnanakaw ng paggawa. Isang developer na tinawag na ferstar ang naglinis ng kanyang ZCode folder, ang saradong desktop agent ng Z dot A I para sa mga modelo ng GLM, at natagpuan ang tatlongdaan at labintatlong megabyte na naka-encrypt na archive ng kanyang commercial workspace: apatnapu't-dalawa libong file, walumpu't-pito porsyento nito ang .git directory, ipinadala sa object storage ng Alibaba sa pag-login at bago ang bawat prompt.

3:42 Ang archive ay binalot ng isang public key na ibinibigay ng server; ang private key ay naninirahan lamang sa cloud ng Z dot A I, kaya ang ciphertext sa iyong sariling disk ay hindi mo mabasa. Ang kanyang linya: isang key na tanging ang server lamang ang makakagamit ay nagsisilbi ng eksaktong isang layunin. Ang Z dot A I rin ang kumpanyang inakusahan ng Anthropic ng pag-distill kay Claude, kaya bukas ang mga weights at gayundin, tila, ang iyong repo. At ang nakakatawa, maliban kung nagtatrabaho ka sa OpenAI. Nakahanap si Hacktron ng heap overflow sa libheif, nag-upload ng na-craft na larawan sa

4:10 community dot openai dot com, nakakuha ng code execution sa forum, at sinakyan ang isang misconfigured single sign-on sa pamamagitan ng integrasyon ng GitHub patungo sa mga panloob na repositoryo ng OpenAI, sa loob ng wala pang pitumpu't-dalawang oras. Ang exploit ay isinulat ni Claude: hindi matalo ng Opus 4.8 ang address randomisation, ginawa ito ng Opus 5 sa loob ng tatlong oras ng paglabas. Ang buong kampanya ay nagkakahalaga ng wala pang tatlong libong dolyar sa mga token. Nag-patch ang OpenAI sa labing-apat na oras at nagbayad ng anim na libo limang daang dolyar, kaya ang source code ng isang trilyong-dolyar na kumpanya ay,

4:39 sandali, pinresyuhan tulad ng isang ginamit na Corolla, sa parehong araw na pinagtatalunan ng mga abogado nito na ang pagkopya ay patas na paggamit. Kung mas gusto mong basahin ito kaysa pakinggan akong sabihin ito, ang diff ay dumarating sa iyong inbox tuwing umaga — libre sa the daily diff dot dev, link sa ibaba. Kaya — ang hatol ngayon: needs review. Ang mga sipi ay totoo, ngunit sila ang mga pinili ng prosekusyon mula sa mga selyadong exhibit, at ang isang hukom na nagpasya ay nagsasabing ang pagsasanay ay patas na paggamit at ang pagnanakaw ay hindi. Ang korte ang nagpapasya ng batas; ang memo ay nagpasya na ng etika.

5:07 Mag-subscribe, pindutin ang bell, at sabihin sa akin sa mga komento kung nai-stampa mo ito nang iba. At iyan ang diff para sa araw na ito. Ako si Niko mula sa Axrisi. Merge nang responsable.

Mga Pinagmulan

  1. TechCrunch: Microsoft exec called AI scraping 'the largest theft of labor in human history'techcrunch.com
  2. HN thread (605 pts)news.ycombinator.com
  3. Jason Kint on the unsealed motionsx.com
  4. Ed Newton-Rexx.com
  5. Bartz v. Anthropic / $1.5B settlement (background)en.wikipedia.org
  6. OpenAI: Introducing Astra for Lawopenai.com
  7. HN: Astra for Law (550 pts)news.ycombinator.com
  8. ferstar: ZCode silent workspace snapshot (original forensics)blog.ferstar.org
  9. tokenstead write-uptokenstead.ai
  10. ferstar on Xx.com
  11. HN: ZCode uploads your Git history (226 pts)news.ycombinator.com
  12. Hacktron: Hacking OpenAIwww.hacktron.ai
  13. HN: Hacktron (406 pts)news.ycombinator.com

Mga kaugnay na video