Το εσωτερικό υπόμνημα της Microsoft για την εκπαίδευση AI μόλις δημοσιεύτηκε.
Ανεπεξέργαστα αρχεία στην υπόθεση New York Times κατά OpenAI & Microsoft: ένα υπόμνημα διευθυντή της Microsoft τον Ιανουάριο του 2023 χαρακτηρίζει τα δεδομένα εκπαίδευσης AI «τη μεγαλύτερη κλοπή εργασίας στην ανθρώπινη ιστορία», το Copilot μείωσε τα κλικ στους Times έως και 93% (ο «βρόχος καταστροφής» του), ο Nadella λέει ότι το περιεχόμενο με paywall θα πρέπει να αδειοδοτείται, ο επικεφαλής του ChatGPT χαρακτηρίζει το προϊόν «σε μεγάλο βαθμό υποκατάστατο» και ο Greg Brockman απάντησε σε ένα hack paywall με «α, ωραία».
Ανεπεξέργαστα αρχεία στην υπόθεση New York Times κατά OpenAI & Microsoft: ένα υπόμνημα διευθυντή της Microsoft τον Ιανουάριο του 2023 χαρακτηρίζει τα δεδομένα εκπαίδευσης AI «τη μεγαλύτερη κλοπή εργασίας στην ανθρώπινη ιστορία», το Copilot μείωσε τα κλικ στους Times έως και 93% (ο «βρόχος καταστροφής» του), ο Nadella λέει ότι το περιεχόμενο με paywall θα πρέπει να αδειοδοτείται, ο επικεφαλής του ChatGPT χαρακτηρίζει το προϊόν «σε μεγάλο βαθμό υποκατάστατο» και ο Greg Brockman απάντησε σε ένα hack paywall με «α, ωραία». Την ίδια μέρα: Η OpenAI κυκλοφορεί το Astra for Law (54% σωστό στο νομικό πάγκο του Vals). Επιπλέον, το ZCode ανεβάζει ολόκληρο το .git σας στο Aliyun με ένα κλειδί που κατέχει μόνο η Z.ai, και η Hacktron φτάνει στα εσωτερικά αποθετήρια της OpenAI για ένα bounty 6.500 $. Ετυμηγορία: NEEDS REVIEW.
Διαβάστε την γραπτή έκδοση (Αγγλικά) ↗
Τι καλύπτει αυτό το βίντεο
- NYT κατά OpenAI/Microsoft αποσφραγίστηκε: «η μεγαλύτερη κλοπή εργασίας στην ανθρώπινη ιστορία» (υπόμνημα Microsoft, Ιαν 2023). Copilot -93% κλικ-μέσω. 91.692 αντίγραφα έργων των εναγόντων σε δεδομένα ενδιάμεσης εκπαίδευσης. 2M σελίδες nytimes.com σε ένα τμήμα Common Crawl. Οι ανακοινώσεις πνευματικών δικαιωμάτων αφαιρέθηκαν. Brockman: «α, ωραία»
- Προσοχή: οι αναφορές προέρχονται από το υπόμνημα των Times, τα εκθέματα παραμένουν σφραγισμένα. Ο Δικαστής Alsup (Bartz κατά Anthropic) έκρινε ότι η εκπαίδευση σε αγορασμένα βιβλία είναι θεμιτή χρήση — η Anthropic πλήρωσε 1,5 δισεκατομμύρια δολάρια για τα 7 εκατομμύρια πειρατικά.
- OpenAI Astra for Law: GPT-6 Astra + νομικός δείκτης 230 εκατομμυρίων URL. 54,0% έναντι 38,7% στο Vals Legal Research Bench. Harvey, Legora, 26 plugins.
- ZCode (Z.ai, GLM): 313 MB κρυπτογραφημένο στιγμιότυπο ενός χώρου εργασίας 42.411 αρχείων, 86,6% .git, ανέβηκε στο Aliyun OSS κατά την είσοδο και πριν από κάθε εντολή. Κλειδί RSA-OAEP που κατέχει μόνο η Z.ai. Οι εναλλαγές ρυθμίσεων δεν το σταματούν.
- Hacktron: υπερχείλιση σωρού libheif → RCE του Discourse → λάθος διαμόρφωση SSO → GitHub → εσωτερικά αποθετήρια OpenAI σε λιγότερο από 72 ώρες. Εκμετάλλευση από τον Claude Opus 5 (3 ώρες). Η καμπάνια κόστισε λιγότερο από 3.000 δολάρια σε μάρκες. Ανταμοιβή 6.500 δολάρια, επιδιορθώθηκε σε ~14 ώρες.
Μεταφρασμένη μεταγραφή
Μεταφράστηκε από την πρωτότυπη αγγλική αφήγηση. Ο διαθέσιμος ήχος και οι υπότιτλοι ελέγχονται από το YouTube.
0:00 Τον Ιανουάριο του 2023, ένας διευθυντής της Microsoft έγραψε ένα υπόμνημα που χαρακτήριζε αυτό που έκανε η δική του εταιρεία τη μεγαλύτερη κλοπή εργασίας στην ανθρώπινη ιστορία, και χθες ένα ομοσπονδιακό δικαστήριο μας επέτρεψε να το διαβάσουμε. Το υπόμνημα είναι ένα από τα ανεπεξέργαστα αποσπάσματα στην υπόθεση New York Times κατά OpenAI και Microsoft, μια αγωγή που κλείνει τρία χρόνια φέτος τον Δεκέμβριο. Την ίδια Πέμπτη, η OpenAI κυκλοφόρησε το Astra for Law, ένα μοντέλο για δικηγόρους, που είναι είτε σύμπτωση είτε μια πολύ δυνατή πρόσληψη. Σήμερα το πρωί ένας προγραμματιστής έπιασε το ZCode, τον πράκτορα κωδικοποίησης της Z dot A I,
0:29 να ανεβάζει ολόκληρο το ιστορικό του git στο cloud της Alibaba με ένα κλειδί που κατέχει μόνο η Z dot A I. Και μια εταιρεία ασφαλείας εισήλθε στα εσωτερικά αποθετήρια της OpenAI μέσω μιας μεταφόρτωσης εικόνας, για την οποία η OpenAI πλήρωσε έξι χιλιάδες πεντακόσια δολάρια. Σε αυτό το βίντεο: τι λένε οι καταθέσεις, ποιος είπε «α, ωραία» σε ένα χακάρισμα paywall, το νομικό μοντέλο που κάνει λάθη τις μισές φορές, τι ανεβάζει το ZCode, και γιατί ένα exploit γραμμένο από τον Claude αξίζει λιγότερο από ένα μεταχειρισμένο αυτοκίνητο. Είναι Παρασκευή, 18 Σεπτεμβρίου, και αυτό είναι το The Daily Diff.
0:58 Ας ξεκινήσουμε με το υπόμνημα. Ο Brent Hecht διευθύνει τις εφαρμοσμένες επιστήμες στη Microsoft, και τον Ιανουάριο του 2023 χαρακτήρισε τα δεδομένα εκπαίδευσης μια εκπληκτική κλοπή πρωτοφανούς μεγέθους. Ένα χρόνο αργότερα επέστρεψε με μια παρουσίαση: η μηχανή απαντήσεων του Copilot μείωσε τα κλικ προς τους Times έως και ενενήντα τρία τοις εκατό, το οποίο ονόμασε βρόχο καταστροφής: λιμοκτονούν οι εκδότες, και το μοντέλο δεν έχει τίποτα καινούργιο να φάει. Τα λόγια του: ένα τελικό προϊόν που απειλεί τα οικονομικά θεμέλια των
1:21 απαραίτητων προμηθευτών του, ο εταιρικός τρόπος να πει κανείς ότι το φίδι έχει εντοπίσει την ουρά του. Έπειτα, οι καταθέσεις. Ο Satya Nadella κατέθεσε φέτος ότι οτιδήποτε με paywall θα πρέπει να αδειοδοτείται, και ότι αν γνώριζε ότι η OpenAI εκπαιδευόταν σε άρθρα με paywall, θα τους είχε αναγκάσει να επανεκπαιδευτούν, πράγμα που υποθέτει ότι κανείς στη Microsoft δεν άνοιξε το σετ δεδομένων εκπαίδευσης που τους δόθηκε, και σύμφωνα με την ίδια κατάθεση αυτό ήταν ολόκληρο το σύνολο δεδομένων του GPT-3. Ο Nick Turley, ο οποίος διευθύνει το ChatGPT, το χαρακτήρισε υπαρξιακή απειλή για τους εκδότες, σε μεγάλο βαθμό υποκατάστατο. Και όταν ένας ερευνητής
1:49 είπε στον Greg Brockman για ένα hack για να παρακάμψει το paywall των Times, ο πρόεδρος της OpenAI απάντησε με δύο λέξεις: α ωραία. Οι μηχανικοί αφαίρεσαν επίσης τις σημειώσεις πνευματικών δικαιωμάτων από τα δεδομένα ώστε το μοντέλο να μην τις εξάγει, γι' αυτό και αφαιρείς τον σειριακό αριθμό από ένα ποδήλατο. Η κλίμακα: περισσότερα από ενενήντα μία χιλιάδες αντίγραφα των άρθρων των εναγόντων στα σετ ενδιάμεσης εκπαίδευσης μόνο, και δύο εκατομμύρια σελίδες των Times σε ένα τμήμα Common Crawl. Τώρα το μέρος που παραλείπει ο τίτλος.
2:15 Κάθε απόσπασμα προέρχεται από το υπόμνημα των Times. Τα εκθέματα είναι ακόμα σφραγισμένα, οπότε διαβάζουμε τις επισημάνσεις της κατηγορούσας αρχής χωρίς πλαίσιο. Και τα δικαστήρια έχουν κυρίως ταχθεί υπέρ της θεμιτής χρήσης: ο Δικαστής Alsup έκρινε πέρυσι ότι η εκπαίδευση σε βιβλία που πληρώσατε είναι νόμιμη, αν και η Anthropic πλήρωσε ενάμιση δισεκατομμύριο για τα επτά εκατομμύρια που πειρατεύτηκε. Έτσι, το νομικό ερώτημα παραμένει ανοιχτό. Το αν οι άνθρωποι που το κατασκεύασαν το θεώρησαν κλοπή, είναι, από χθες, όχι.
2:41 Πράγμα που καθιστά την άλλη κυκλοφορία της OpenAI την Πέμπτη μια τολμηρή επιλογή. Το Astra for Law ενσωματώνει το GPT-6 Astra, το μοντέλο που σφράγισα REVERT την περασμένη εβδομάδα αφού παρήγαγε εβδομήντα πέντε χιλιάδες γραμμές του τίποτα, σε έναν νομικό δείκτη αναζήτησης διακοσίων τριάντα εκατομμυρίων σελίδων. Στο Vals AI's legal research benchmark περνάει το πενήντα τέσσερα τοις εκατό των ερωτήσεων, από τριάντα εννέα με απλή αναζήτηση στον ιστό, το οποίο η OpenAI αποκαλεί βελτίωση σαράντα τοις εκατό και ένας δικηγόρος θα το χαρακτήριζε λάθος σχεδόν τις μισές φορές. Η ανάρτηση στο blog δεν περιέχει τη λέξη ψευδαίσθηση.
3:14 Το Hacker News το έκανε: θα μπορεί να αυτομηνυθεί, το οποίο, δεδομένης της εβδομάδας, είναι η πρώτη γνήσια περίπτωση χρήσης. Εν τω μεταξύ, η συζήτηση περί κλοπής εργασίας έφτασε στο laptop σας. Ένας προγραμματιστής ονόματι ferstar καθάρισε τον φάκελο ZCode του, τον κλειστό επιτραπέζιο πράκτορα της Z dot A I για τα μοντέλα GLM, και βρήκε ένα κρυπτογραφημένο αρχείο τριακοσίων δεκατριών megabyte του εμπορικού χώρου εργασίας του: σαράντα δύο χιλιάδες αρχεία, το ογδόντα επτά τοις εκατό από αυτά ο κατάλογος dot git, απεστάλη στο object storage της Alibaba κατά την είσοδο και πριν από κάθε εντολή.
3:42 Το αρχείο είναι κρυπτογραφημένο με ένα δημόσιο κλειδί που παρέχει ο διακομιστής. Το ιδιωτικό κλειδί βρίσκεται μόνο στο cloud της Z dot A I, οπότε το κρυπτογραφημένο κείμενο στον δίσκο σας είναι μη αναγνώσιμο για εσάς. Η φράση του: ένα κλειδί που μόνο ο διακομιστής μπορεί να χρησιμοποιήσει εξυπηρετεί ακριβώς έναν σκοπό. Η Z dot A I είναι επίσης η εταιρεία που η Anthropic κατηγόρησε για απόσταξη του Claude, οπότε τα βάρη είναι ανοιχτά και έτσι, προφανώς, είναι και το αποθετήριο σας. Και το αστείο, εκτός αν δουλεύεις στην OpenAI. Ο Hacktron βρήκε υπερχείλιση σωρού στο libheif, ανέβασε μια κακόβουλη εικόνα στο
4:10 community dot openai dot com, απέκτησε εκτέλεση κώδικα στο φόρουμ, και εκμεταλλεύτηκε μια λάθος διαμορφωμένη ενιαία σύνδεση μέσω της ενσωμάτωσης GitHub στα εσωτερικά αποθετήρια της OpenAI, σε λιγότερο από εβδομήντα δύο ώρες. Το exploit γράφτηκε από τον Claude: Ο Opus 4.8 δεν μπορούσε να νικήσει την τυχαιοποίηση διευθύνσεων, Ο Opus 5 το έκανε μέσα σε τρεις ώρες από την κυκλοφορία. Ολόκληρη η εκστρατεία κόστισε λιγότερο από τρεις χιλιάδες δολάρια σε μάρκες. Η OpenAI επιδιόρθωσε σε δεκατέσσερις ώρες και πλήρωσε έξι χιλιάδες πεντακόσια δολάρια, έτσι ο πηγαίος κώδικας μιας εταιρείας αξίας τρισεκατομμυρίων δολαρίων ήταν,
4:39 εν συντομία, στην τιμή ενός μεταχειρισμένου Corolla, την ίδια μέρα που οι δικηγόροι της υποστήριξαν ότι η αντιγραφή είναι θεμιτή χρήση. Αν προτιμάτε να το διαβάσετε αντί να με ακούσετε να το λέω, το diff φτάνει στα εισερχόμενά σας κάθε πρωί — δωρεάν στο the daily diff dot dev, σύνδεσμος παρακάτω. Λοιπόν — η σημερινή ετυμηγορία: NEEDS REVIEW. Οι αναφορές είναι αληθινές, αλλά είναι οι επιλογές της κατηγορούσας αρχής από σφραγισμένα εκθέματα, και ο μόνος δικαστής που έχει αποφανθεί λέει ότι η εκπαίδευση είναι θεμιτή χρήση και η πειρατεία όχι. Το δικαστήριο αποφασίζει τον νόμο. Το υπόμνημα έχει ήδη αποφασίσει την ηθική.
5:07 Εγγραφείτε, πατήστε το κουδουνάκι και πείτε μου στα σχόλια αν θα το είχατε σφραγίσει διαφορετικά. Και αυτή είναι η διαφορά για σήμερα. Είμαι ο Νίκος από την Axrisi. Συγχωνεύστε υπεύθυνα.
Πηγές
- TechCrunch: Microsoft exec called AI scraping 'the largest theft of labor in human history'techcrunch.com
- HN thread (605 pts)news.ycombinator.com
- Jason Kint on the unsealed motionsx.com
- Ed Newton-Rexx.com
- Bartz v. Anthropic / $1.5B settlement (background)en.wikipedia.org
- OpenAI: Introducing Astra for Lawopenai.com
- HN: Astra for Law (550 pts)news.ycombinator.com
- ferstar: ZCode silent workspace snapshot (original forensics)blog.ferstar.org
- tokenstead write-uptokenstead.ai
- ferstar on Xx.com
- HN: ZCode uploads your Git history (226 pts)news.ycombinator.com
- Hacktron: Hacking OpenAIwww.hacktron.ai
- HN: Hacktron (406 pts)news.ycombinator.com



