Microsofti enda memo tehisintellekti koolitamise kohta avalikustati.
Toimetamata dokumendid kohtuasjas New York Times vs.
Toimetamata dokumendid kohtuasjas New York Times vs. OpenAI & Microsoft: Microsofti direktori 2023. aasta jaanuarikuu memo nimetab AI treeningandmeid "suurimaks tööjõuvarguseks inimkonna ajaloos", Copilot vähendas klikke Timesi veebilehele kuni 93% (tema "hukatslik tsükkel"), Nadella ütleb, et tasulise sisuga materjalid tuleks litsentseerida, ChatGPT juht nimetab toodet "suures osas asendavaks" ja Greg Brockman vastas tasulise sisu piirangust möödahiilimisele "ah tore". Samal päeval: OpenAI andis välja Astra for Law (54% õige Valsi õigusalases võrdluskatses). Lisaks ZCode, mis laeb kogu sinu .git-i Aliyuni üles võtmega, mida hoiab ainult Z.ai, ja Hacktron, mis jõudis OpenAI sisemistesse hoidlatesse 6500 dollari suuruse preemiaga. Otsus: NEEDS REVIEW.
Loe kirjalikku väljaannet (inglise keeles) ↗
Mida see video hõlmab
- NYT vs. OpenAI/Microsoft pitseeriti lahti: "suurim tööjõu vargus inimkonna ajaloos" (Microsofti memo, jaanuar 2023); Copilot –93% klikke; 91 692 eksemplari hagejate teoseid keskmise treeningandmete hulgas; 2 miljonit nytimes.com lehte ühes Common Crawli lõigus; autoriõigusteated eemaldati; Brockman: "ah tore"
- Märkus: tsitaadid pärinevad Timesi esitatud hagist, eksponaadid on endiselt pitseeritud; kohtunik Alsup (Bartz vs. Anthropic) otsustas, et ostetud raamatute põhjal treenimine on õiglane kasutus – Anthropic maksis 1,5 miljardit 7 miljoni piraatkoopia eest
- OpenAI Astra for Law: GPT-6 Astra + 230 miljoni URL-i õigusregister; 54,0% vs 38,7% Vals Legal Research Benchis; Harvey, Legora, 26 pistikprogrammi
- ZCode (Z.ai, GLM): 313 MB krüpteeritud snapshot 42 411 failiga töölaualt, 86,6% .git, laaditi üles Aliyun OSS-i sisselogimisel ja enne iga käsku; RSA-OAEP võti on ainult Z.ai käes; seadistuste lülitid seda ei peata
- Hacktron: libheif heap overflow → Discourse RCE → SSO valesti seadistatud → GitHub → OpenAI sisemised hoidlad vähem kui 72 tunni jooksul; exploit kirjutas Claude Opus 5 (3 tundi); kampaania alla 3000 dollari tokenite eest; preemia 6500 dollarit, parandati umbes 14 tunni jooksul
Tõlgitud transkriptsioon
Tõlgitud ingliskeelsest originaaljutustusest. Saadaolevat heli ja subtiitreid kontrollib YouTube.
0:00 2023. aasta jaanuaris kirjutas Microsofti direktor memo, milles nimetas seda, mida tema enda ettevõte tegi, suurimaks tööjõuvarguseks inimkonna ajaloos, ja eile lubas föderaalkohus meil kõigil seda lugeda. Memo on üks toimetamata tsitaatidest New York Timesi ja OpenAI ning Microsofti vastases kohtuasjas, mis saab sel detsembril kolmeaastaseks. Samal neljapäeval andis OpenAI välja Astra for Law, advokaatidele mõeldud mudeli, mis on kas kokkusattumus või väga tugev palkamine. Täna hommikul tabas arendaja ZCode, Z.ai kodeerimisagendi,
0:29 kogu oma giti ajaloo üleslaadimisega Alibaba pilve võtmega, mida hoiab ainult Z. dot A I. Ja turvafirma pääses OpenAI sisemistesse hoidlatesse läbi pildi üleslaadimise, mille eest OpenAI maksis kuus tuhat viissada dollarit. Selles videos: mida esitatud dokumendid ütlevad, kes ütles "ah tore" tasulise sisu piirangust möödahiilimise kohta, õigusmudel, mis on poole ajast vale, mida ZCode üles laeb, ja miks Claude'i kirjutatud "exploit" on väärt vähem kui kasutatud auto. On reede, 18. september, ja see on The Daily Diff.
0:58 Alustame memost. Brent Hecht juhib Microsoftis rakendusteadust, ja 2023. aasta jaanuaris nimetas ta treeningandmeid hämmastavaks ja enneolematute proportsioonidega varguseks. Aasta hiljem oli ta tagasi slaidiesitlusega: Copiloti vastusmootor vähendas klikkide arvu Timesi veebilehel kuni üheksakümmend kolm protsenti, mida ta nimetas hukatuslikuks tsükliks: näljuta kirjastajaid ja mudelil pole midagi uut süüa. Tema sõnad: lõpptoode, mis ohustab oma oluliste tarnijate majanduslikke aluseid,
1:21 korporatiivne viis öelda, et madu on leidnud oma saba. Seejärel ütlused. Satya Nadella tunnistas sel aastal, et kõik tasulise sisuga materjalid tuleks litsentseerida, ja et kui ta oleks teadnud, et OpenAI treenis tasulistel artiklitel, oleks ta palunud neil uuesti treenida, mis eeldab, et keegi Microsoftis ei avanud neile antud treeningkomplekti, ja sama esitatud dokumendi kohaselt oli see kogu GPT-3 andmestik. Nick Turley, kes juhib ChatGPT-d, nimetas seda eksistentsiaalseks ohuks kirjastajatele, suures osas asendavaks. Ja kui teadlane
1:49 rääkis Greg Brockmanile häkist, kuidas Timesi tasulise sisu piirangust mööda saada, vastas OpenAI president kahe sõnaga: "ah tore". Insenerid eemaldasid andmetest ka autoriõigusteated, et mudel neid ei väljastaks, mis on põhjus, miks jalgratta seerianumbri maha viilid. Mastaap: rohkem kui üheksakümmend üks tuhat eksemplari hagejate artiklitest ainult vahepealsetes treeningkomplektides ja kaks miljonit Timesi lehte ühes Common Crawli lõigus. Nüüd see osa, mille pealkiri vahele jätab.
2:15 Iga tsitaat pärineb Timesi hagist; eksponaadid on endiselt pitseeritud, nii et loeme süüdistuse esiletoodud punkte ilma kontekstita. Ja kohtud on enamasti toetanud õiglast kasutust: kohtunik Alsup otsustas eelmisel aastal, et makstud raamatute põhjal treenimine on seaduslik, kuigi Anthropic maksis siiski poolteist miljardit seitsme miljoni piraatkoopia eest, mida ta piraadis. Nii et õiguslik küsimus on lahtine. Kas seda ehitanud inimesed arvasid, et see oli vargus, on, alates eilsest, mitte.
2:41 Mis teeb neljapäevase teise OpenAI käivituse julgeks valikuks. Astra for Law hõlmab GPT-6 Astrat, mudelit, millele ma panin templi REVERT eelmisel nädalal pärast seda, kui see tootis seitsekümmend viis tuhat rida mitte midagi, 230 miljoni leheküljega õigusaluses otsinguindeksis. Vals AI õigusalase uurimistöö võrdluskatses läbib see viiskümmend neli protsenti küsimustest, tõustes tavalise veebiotsingu 39 protsendilt, mida OpenAI nimetab 40-protsendiliseks paranduseks ja advokaat nimetaks peaaegu poole ajast valeks. Blogipostitus ei sisalda sõna hallutsinatsioon.
3:14 Hacker Newsil oli: kas see suudab ennast kohtusse kaevata, mis, arvestades nädalat, on esimene tõeline kasutusjuhtum. Samal ajal jõudis tööjõuvarguse diskursus teie sülearvutisse. Arendaja nimega ferstar puhastas oma ZCode kausta, Z.ai suletud töölauaagendi GLM mudelite jaoks, ja leidis kolmsada kolmteist megabaiti krüpteeritud arhiivi oma ärilisest tööruumist: nelikümmend kaks tuhat faili, kaheksakümmend seitse protsenti sellest .git-kataloogist, saadeti Alibaba objektihoidlasse sisselogimisel ja enne iga käsku.
3:42 Arhiiv on pakitud avaliku võtmega, mille server väljastab; privaatvõti asub ainult Z.ai pilves, nii et teie enda kettal olev šifreeritud tekst on teile loetamatu. Tema lause: võti, mida saab kasutada ainult server, teenib täpselt ühte eesmärki. Z.ai on ka see ettevõte, keda Anthropic süüdistas Claude'i destilleerimises, nii et kaalud on avatud ja nii on ilmselt ka teie repo. Ja see naljakas, kui te just OpenAI-s ei tööta. Hacktron leidis libheifist mälu ületäitumise, laadis üles käsitletud pildi
4:10 community.openai.com-i, sai koodi käivitamise foorumis, ja kasutas valesti seadistatud ühekordset sisselogimist GitHubi integreerimise kaudu OpenAI sisemistesse hoidlatesse, vähem kui seitsmekümne kahe tunni jooksul. Exploiti kirjutas Claude: Opus 4.8 ei suutnud ületada aadressi juhuslikustamist, Opus 5 tegi seda kolme tunni jooksul pärast avaldamist. Kogu kampaania maksis alla kolme tuhande dollari tokenites. OpenAI parandas selle neljateistkümne tunni jooksul ja maksis kuus tuhat viissada dollarit, nii et triljoni dollari väärtusega ettevõtte lähtekood oli
4:39 korraks hinnatud nagu kasutatud Corolla, samal päeval, kui selle advokaadid vaidlesid, et kopeerimine on õiglane kasutus. Kui te pigem loeksite seda, kui kuuleksite mind seda ütlemas, jõuab see erinevus teie postkasti igal hommikul – tasuta aadressil thedailydiff.dev, link allpool. Niisiis – tänane otsus: NEEDS REVIEW. Tsitaadid on reaalsed, kuid need on süüdistuse valikud pitseeritud eksponaatidest, ja ainus kohtunik, kes on otsustanud, ütleb, et treenimine on õiglane kasutus ja piraatlus mitte. Kohus otsustab seaduse; memo on juba otsustanud eetika.
5:07 Tellige, vajutage kellukest ja öelge kommentaarides, kas te oleksite sellele teise templi pannud. erinevalt. Ja see on tänane vahe. Olen Niko Axrisist. Ühendage vastutustundlikult.
Allikad
- TechCrunch: Microsoft exec called AI scraping 'the largest theft of labor in human history'techcrunch.com
- HN thread (605 pts)news.ycombinator.com
- Jason Kint on the unsealed motionsx.com
- Ed Newton-Rexx.com
- Bartz v. Anthropic / $1.5B settlement (background)en.wikipedia.org
- OpenAI: Introducing Astra for Lawopenai.com
- HN: Astra for Law (550 pts)news.ycombinator.com
- ferstar: ZCode silent workspace snapshot (original forensics)blog.ferstar.org
- tokenstead write-uptokenstead.ai
- ferstar on Xx.com
- HN: ZCode uploads your Git history (226 pts)news.ycombinator.com
- Hacktron: Hacking OpenAIwww.hacktron.ai
- HN: Hacktron (406 pts)news.ycombinator.com



