Il promemoria interno di Microsoft sull'addestramento dell'IA è diventato pubblico.
Documenti non censurati in New York Times contro OpenAI e Microsoft: un promemoria di un direttore di Microsoft del gennaio 2023 definisce i dati di addestramento dell'IA "il più grande furto di lavoro nella storia umana", Copilot ha ridotto i click-through al Times fino al 93% (il suo "circolo vizioso"), Nadella afferma che i contenuti a pagamento dovrebbero essere concessi in licenza, il capo di ChatGPT definisce il prodotto "largamente sostitutivo", e Greg Brockman ha risposto a un hack per aggirare il paywall con "ah nice".
Documenti non censurati in New York Times contro OpenAI e Microsoft: un promemoria di un direttore di Microsoft del gennaio 2023 definisce i dati di addestramento dell'IA "il più grande furto di lavoro nella storia umana", Copilot ha ridotto i click-through al Times fino al 93% (il suo "circolo vizioso"), Nadella afferma che i contenuti a pagamento dovrebbero essere concessi in licenza, il capo di ChatGPT definisce il prodotto "largamente sostitutivo", e Greg Brockman ha risposto a un hack per aggirare il paywall con "ah nice". Lo stesso giorno: OpenAI rilascia Astra for Law (54% corretto sul benchmark legale Vals). Inoltre ZCode carica l'intero .git su Aliyun con una chiave detenuta solo da Z.ai, e Hacktron raggiunge i repository interni di OpenAI per una ricompensa di 6.500 dollari. Verdetto: NEEDS REVIEW.
Leggi l'edizione scritta (inglese) ↗
Contenuto di questo video
- NYT contro OpenAI/Microsoft svelato: "il più grande furto di lavoro nella storia umana" (memo Microsoft, gennaio 2023); Copilot -93% click-through; 91.692 copie di opere dei querelanti nei dati di metà addestramento; 2 milioni di pagine nytimes.com in una sezione di Common Crawl; avvisi di copyright rimossi; Brockman: "ah nice"
- Avvertenza: le citazioni provengono dal dossier del Times, i documenti sono ancora sigillati; il giudice Alsup (Bartz contro Anthropic) ha stabilito che l'addestramento su libri acquistati è fair use — Anthropic ha pagato 1,5 miliardi per i 7 milioni piratati
- OpenAI Astra for Law: GPT-6 Astra + un indice legale di 230 milioni di URL; 54,0% contro 38,7% sul Vals Legal Research Bench; Harvey, Legora, 26 plugin
- ZCode (Z.ai, GLM): snapshot criptato di 313 MB di un workspace di 42.411 file, 86,6% .git, caricato su Aliyun OSS al login e prima di ogni prompt; chiave RSA-OAEP detenuta solo da Z.ai; le impostazioni non lo fermano
- Hacktron: overflow di heap in libheif → Discourse RCE → errata configurazione SSO → GitHub → repository interni di OpenAI in meno di 72 ore; exploit scritto da Claude Opus 5 (3 ore); campagna sotto i 3.000 dollari in token; ricompensa 6.500 dollari, patchato in circa 14 ore
Trascrizione tradotta
Tradotto dalla narrazione originale inglese. L'audio e i sottotitoli disponibili sono controllati da YouTube.
0:00 Nel gennaio 2023, un direttore di Microsoft ha scritto un promemoria definendo quello che la sua stessa azienda stava facendo come il più grande furto di lavoro nella storia umana, e ieri un tribunale federale ha permesso al resto di noi di leggerlo. Il promemoria è una delle citazioni non censurate in New York Times contro OpenAI e Microsoft, una causa che compirà tre anni questo dicembre. Lo stesso giovedì, OpenAI ha rilasciato Astra for Law, un modello per avvocati, il che è una coincidenza o un'assunzione molto forte. Questa mattina uno sviluppatore ha scoperto che ZCode, l'agente di codifica di Z dot A I,
0:29 stava caricando la sua intera cronologia git sul cloud di Alibaba con una chiave detenuta solo da Z dot A I. E un'azienda di sicurezza è entrata nei repository interni di OpenAI tramite un caricamento di immagini, per il quale OpenAI ha pagato seimila cinquecento dollari. In questo video: cosa dicono i documenti, chi ha detto 'ah nice' a un hack del paywall, il modello legale che è sbagliato metà delle volte, cosa carica ZCode, e perché un exploit scritto da Claude vale meno di un'auto usata. È venerdì 18 settembre, e questo è The Daily Diff.
0:58 Iniziamo con il promemoria. Brent Hecht dirige la scienza applicata in Microsoft, e nel gennaio 2023 ha definito i dati di addestramento un furto sorprendente di proporzioni senza precedenti. Un anno dopo è tornato con una presentazione: il motore di risposta di Copilot ha tagliato i click-through al Times fino al novantatré percento, che lui ha chiamato un circolo vizioso: affamare gli editori, e il modello non ha nulla di nuovo da 'mangiare'. Le sue parole: un prodotto finale che minaccia le fondamenta economiche dei suoi
1:21 fornitori essenziali, il modo aziendale di dire che il serpente ha localizzato la sua coda. Poi le deposizioni. Satya Nadella ha testimoniato quest'anno che qualsiasi contenuto a pagamento dovrebbe essere concesso in licenza, e che se avesse saputo che OpenAI si addestrava su articoli a pagamento li avrebbe fatti riaddestrare, il che presuppone che nessuno in Microsoft abbia aperto il set di addestramento che gli è stato consegnato, e secondo lo stesso documento quello era l'intero dataset GPT-3. Nick Turley, che gestisce ChatGPT, lo ha definito una minaccia esistenziale per gli editori, largamente sostitutivo. E quando un ricercatore
1:49 ha parlato a Greg Brockman di un hack per aggirare il paywall del Times, il presidente di OpenAI ha risposto con due parole: ah nice. Gli ingegneri hanno anche rimosso gli avvisi di copyright dai dati in modo che il modello non li producesse, che è il motivo per cui si lima il numero di serie di una bicicletta. La scala: più di novantunomila copie degli articoli dei querelanti solo nei set di metà addestramento, e due milioni di pagine del Times in una sezione di Common Crawl. Ora la parte che il titolo salta.
2:15 Ogni citazione proviene dal dossier del Times; i documenti sono ancora sigillati, quindi stiamo leggendo i punti salienti dell'accusa senza contesto. E i tribunali si sono in gran parte schierati con il fair use: il giudice Alsup ha stabilito l'anno scorso che l'addestramento su libri che hai pagato è legale, anche se Anthropic ha comunque pagato un miliardo e mezzo per i sette milioni che ha piratato. Quindi la questione legale è aperta. Se le persone che lo stavano costruendo pensassero che fosse un furto è, da ieri, non più un mistero.
2:41 Il che rende l'altro lancio di OpenAI di giovedì una scelta audace. Astra for Law racchiude GPT-6 Astra, il modello che ho bollato REVERT la settimana scorsa dopo che ha prodotto settantacinquemila righe di niente, in un indice di ricerca legale di duecentotrenta milioni di pagine. Sul benchmark di ricerca legale di Vals AI risolve il cinquantaquattro percento delle domande, rispetto al trentanove con la semplice ricerca web, che OpenAI definisce un miglioramento del quaranta percento e un avvocato definirebbe sbagliato quasi la metà delle volte. Il post del blog non contiene la parola allucinazione.
3:14 Hacker News sì: sarà in grado di citare in giudizio se stesso, il che, data la settimana, è il primo caso d'uso genuino. Nel frattempo il dibattito sul furto di lavoro ha raggiunto il tuo laptop. Uno sviluppatore chiamato ferstar ha pulito la sua cartella ZCode, l'agente desktop chiuso di Z dot A I per i modelli GLM, e ha trovato un archivio crittografato di trecento e tredici megabyte del suo workspace commerciale: quarantadue mila file, l'ottantasette percento dei quali la directory .git, spedito all'archiviazione oggetti di Alibaba al login e prima di ogni prompt.
3:42 L'archivio è avvolto con una chiave pubblica che il server distribuisce; la chiave privata risiede solo nel cloud di Z dot A I, quindi il testo cifrato sul tuo disco è illeggibile per te. La sua frase: una chiave che solo il server può usare serve esattamente a uno scopo. Z dot A I è anche l'azienda che Anthropic ha accusato di distillare Claude, quindi i pesi sono aperti e così, a quanto pare, lo è anche il tuo repo. E quello divertente, a meno che tu non lavori a OpenAI. Hacktron ha trovato un heap overflow in libheif, ha caricato un'immagine creata ad arte su
4:10 community dot openai dot com, ha ottenuto l'esecuzione di codice sul forum, e ha sfruttato una configurazione errata del single sign-on tramite l'integrazione GitHub nei repository interni di OpenAI, in meno di settantadue ore. L'exploit è stato scritto da Claude: Opus 4.8 non riusciva a superare la randomizzazione dell'indirizzo, Opus 5 lo ha fatto entro tre ore dal rilascio. L'intera campagna è costata meno di tremila dollari in token. OpenAI ha patchato in quattordici ore e ha pagato seimila cinquecento dollari, quindi il codice sorgente di un'azienda da un trilione di dollari era,
4:39 brevemente, prezzato come una Corolla usata, lo stesso giorno in cui i suoi avvocati hanno sostenuto che la copia è fair use. Se preferisci leggere questo piuttosto che sentirmi dirlo, il diff arriva nella tua casella di posta ogni mattina — gratuitamente su the daily diff dot dev, link qui sotto. Quindi — il verdetto di oggi: needs review. Le citazioni sono reali, ma sono le scelte dell'accusa da documenti sigillati, e l'unico giudice che ha sentenziato dice che l'addestramento è fair use e la pirateria no. Il tribunale decide la legge; il promemoria ha già deciso l'etica.
5:07 Iscriviti, premi la campanella e dimmi nei commenti se l'avresti bollato diversamente. E questo è il diff per oggi. Sono Niko di Axrisi. SHIP IT responsabilmente.
Fonti
- TechCrunch: Microsoft exec called AI scraping 'the largest theft of labor in human history'techcrunch.com
- HN thread (605 pts)news.ycombinator.com
- Jason Kint on the unsealed motionsx.com
- Ed Newton-Rexx.com
- Bartz v. Anthropic / $1.5B settlement (background)en.wikipedia.org
- OpenAI: Introducing Astra for Lawopenai.com
- HN: Astra for Law (550 pts)news.ycombinator.com
- ferstar: ZCode silent workspace snapshot (original forensics)blog.ferstar.org
- tokenstead write-uptokenstead.ai
- ferstar on Xx.com
- HN: ZCode uploads your Git history (226 pts)news.ycombinator.com
- Hacktron: Hacking OpenAIwww.hacktron.ai
- HN: Hacktron (406 pts)news.ycombinator.com



