El propio memorándum de Microsoft sobre el entrenamiento de IA acaba de hacerse público.
Documentos sin censurar en New York Times v.
Documentos sin censurar en New York Times v. OpenAI y Microsoft: un memorándum de enero de 2023 de un director de Microsoft califica los datos de entrenamiento de IA como "el mayor robo de mano de obra en la historia de la humanidad", Copilot redujo los clics en el Times hasta en un 93% (su "bucle de fatalidad"), Nadella dice que el contenido de pago debería tener licencia, el jefe de ChatGPT califica el producto como "en gran medida sustitutivo", y Greg Brockman respondió a un truco de "paywall" con "ah, qué bien". El mismo día: OpenAI lanza Astra for Law (54% correcto en el "Vals legal bench"). Además, ZCode sube todo tu .git a Aliyun con una clave que solo Z.ai posee, y Hacktron accede a los repositorios internos de OpenAI por una recompensa de $6,500. Veredicto: NEEDS REVIEW.
Leer la edición escrita (inglés) ↗
Lo que cubre este video
- NYT v. OpenAI/Microsoft desclasificado: "el mayor robo de mano de obra en la historia de la humanidad" (memo de Microsoft, enero de 2023); Copilot -93% de clics; 91,692 copias de obras de los demandantes en datos de entrenamiento intermedio; 2M de páginas de nytimes.com en una sección de Common Crawl; avisos de copyright eliminados; Brockman: "ah, qué bien"
- Advertencia: las citas provienen del escrito del Times, las pruebas aún están selladas; el juez Alsup (Bartz v. Anthropic) dictaminó que entrenar con libros comprados es uso justo — Anthropic pagó $1.5 mil millones por los 7 millones pirateados
- OpenAI Astra for Law: GPT-6 Astra + un índice legal de 230M de URL; 54.0% vs 38.7% en Vals Legal Research Bench; Harvey, Legora, 26 plugins
- ZCode (Z.ai, GLM): 313 MB de instantánea encriptada de un espacio de trabajo de 42,411 archivos, 86.6% .git, subido a Aliyun OSS al iniciar sesión y antes de cada "prompt"; clave RSA-OAEP en poder solo de Z.ai; los interruptores de configuración no lo detienen
- Hacktron: desbordamiento de "heap" de libheif → RCE de Discourse → mala configuración de SSO → GitHub → repositorios internos de OpenAI en menos de 72 h; "exploit" por Claude Opus 5 (3 h); campaña de menos de $3,000 en "tokens"; recompensa de $6,500, parcheado en ~14 h
Transcripción traducida
Traducido de la narración original en inglés. El audio y los subtítulos disponibles son controlados por YouTube.
0:00 En enero de 2023, un director de Microsoft escribió un memorándum calificando lo que su propia compañía estaba haciendo como el mayor robo de mano de obra en la historia de la humanidad, y ayer un tribunal federal nos permitió a todos leerlo. El memorándum es una de las citas no censuradas en New York Times contra OpenAI y Microsoft, una demanda que cumple tres años este diciembre. El mismo jueves, OpenAI lanzó Astra for Law, un modelo para abogados, lo cual es una coincidencia o una contratación muy acertada. Esta mañana un desarrollador descubrió que ZCode, el agente de codificación de Z.ai,
0:29 estaba subiendo todo su historial de Git a la nube de Alibaba con una clave que solo Z.ai posee. Y una empresa de seguridad accedió a los repositorios internos de OpenAI a través de una carga de imagen, por lo que OpenAI pagó seis mil quinientos dólares. En este video: lo que dicen los documentos, quién dijo "ah, qué bien" a un "paywall" hackeado, el modelo legal que se equivoca la mitad de las veces, lo que ZCode sube, y por qué un "exploit" escrito por Claude vale menos que un coche usado. Es viernes, 18 de septiembre, y esto es The Daily Diff.
0:58 Comencemos con el memorándum. Brent Hecht dirige la ciencia aplicada en Microsoft, y en enero de 2023 calificó los datos de entrenamiento como un asombroso robo de proporciones sin precedentes. Un año después, regresó con una presentación: el motor de respuesta de Copilot redujo los clics en el Times hasta en un noventa y tres por ciento, lo que llamó un "bucle de fatalidad": matar de hambre a los editores, y el modelo no tiene nada nuevo que "comer". Sus palabras: un producto final que amenaza los cimientos económicos de sus
1:21 proveedores esenciales, la forma corporativa de decir que la serpiente se ha localizado la cola. Luego las declaraciones. Satya Nadella testificó este año que todo el contenido de pago debería tener licencia, y que si hubiera sabido que OpenAI entrenaba con artículos de pago, les habría hecho reentrenar, lo que asume que nadie en Microsoft abrió el conjunto de entrenamiento que les entregaron, y según el mismo documento, ese era todo el conjunto de datos de GPT-3. Nick Turley, quien dirige ChatGPT, lo calificó como una amenaza existencial para los editores, en gran medida sustitutivo. Y cuando un investigador
1:49 le contó a Greg Brockman sobre un "hack" para evadir el "paywall" del Times, el presidente de OpenAI respondió con dos palabras: "ah, qué bien". Los ingenieros también eliminaron los avisos de derechos de autor de los datos para que el modelo no los generara, que es por lo que se lima el número de serie de una bicicleta. La escala: más de noventa y un mil copias de los artículos de los demandantes en los conjuntos de entrenamiento intermedios solamente, y dos millones de páginas del Times en una sección de Common Crawl. Ahora la parte que el titular omite.
2:15 Cada cita proviene del escrito del Times; las pruebas aún están selladas, así que estamos leyendo los puntos destacados de la fiscalía sin contexto. Y los tribunales se han puesto mayormente del lado del uso justo: el juez Alsup dictaminó el año pasado que entrenar con libros por los que pagaste es legal, aunque Anthropic todavía pagó mil quinientos millones por los siete millones que pirateó. Así que la cuestión legal está abierta. Si las personas que lo construyeron pensaron que era un robo es, desde ayer, no.
2:41 Lo que hace que el otro lanzamiento de OpenAI del jueves sea una elección audaz. Astra for Law envuelve GPT-6 Astra, el modelo que marqué REVERT la semana pasada después de que produjo setenta y cinco mil líneas de nada, en un índice de búsqueda legal de doscientos treinta millones de páginas. En el "benchmark" de investigación legal de Vals AI, aprueba el cincuenta y cuatro por ciento de las preguntas, frente al treinta y nueve con la búsqueda web simple, lo que OpenAI llama una mejora del cuarenta por ciento y un abogado llamaría incorrecto casi la mitad del tiempo. La publicación del blog no contiene la palabra "alucinación".
3:14 Hacker News sí lo hizo: ¿podrá demandarse a sí mismo, lo cual, dada la semana, es el primer caso de uso genuino. Mientras tanto, el discurso del robo de mano de obra llegó a su computadora portátil. Un desarrollador llamado ferstar limpió su carpeta de ZCode, el agente de escritorio cerrado de Z.AI para los modelos GLM, y encontró un archivo encriptado de trescientos trece megabytes de su espacio de trabajo comercial: cuarenta y dos mil archivos, ochenta y siete por ciento de los cuales era el directorio .git, enviado al almacenamiento de objetos de Alibaba al iniciar sesión y antes de cada "prompt".
3:42 El archivo está envuelto con una clave pública que el servidor entrega; la clave privada vive solo en la nube de Z.AI, por lo que el texto cifrado en su propio disco es ilegible para usted. Su frase: una clave que solo el servidor puede usar tiene exactamente un propósito. Z.AI es también la compañía a la que Anthropic acusó de "destilar" Claude, así que los "weights" están abiertos y, al parecer, también lo está su repositorio. Y lo gracioso, a menos que trabajes en OpenAI. Hacktron encontró un desbordamiento de "heap" en libheif, subió una imagen modificada a
4:10 community.openai.com, obtuvo ejecución de código en el foro, y aprovechó una mala configuración de inicio de sesión único a través de la integración de GitHub para acceder a los repositorios internos de OpenAI, en menos de setenta y dos horas. El "exploit" fue escrito por Claude: Opus 4.8 no pudo superar la aleatorización de direcciones, Opus 5 lo hizo en tres horas desde su lanzamiento. Toda la campaña costó menos de tres mil dólares en "tokens". OpenAI parcheó en catorce horas y pagó seis mil quinientos dólares, así que el código fuente de una compañía de billones de dólares fue,
4:39 brevemente, valorado como un Corolla usado, el mismo día que sus abogados argumentaron que la copia es uso justo. Si prefiere leer esto en lugar de escucharme decirlo, el "diff" llega a su bandeja de entrada cada mañana — gratis en thedailydiff.dev, enlace abajo. Así que — el veredicto de hoy: NEEDS REVIEW. Las citas son reales, pero son las selecciones de la fiscalía de pruebas selladas, y el único juez que ha dictaminado dice que el entrenamiento es uso justo y la piratería no. La corte decide la ley; el memorándum ya decidió la ética.
5:07 Suscríbase, presione la campana y dígame en los comentarios si lo habría marcado de manera diferente. Y esa es la diferencia de hoy. Soy Niko de Axrisi. SHIP IT responsablemente.
Fuentes
- TechCrunch: Microsoft exec called AI scraping 'the largest theft of labor in human history'techcrunch.com
- HN thread (605 pts)news.ycombinator.com
- Jason Kint on the unsealed motionsx.com
- Ed Newton-Rexx.com
- Bartz v. Anthropic / $1.5B settlement (background)en.wikipedia.org
- OpenAI: Introducing Astra for Lawopenai.com
- HN: Astra for Law (550 pts)news.ycombinator.com
- ferstar: ZCode silent workspace snapshot (original forensics)blog.ferstar.org
- tokenstead write-uptokenstead.ai
- ferstar on Xx.com
- HN: ZCode uploads your Git history (226 pts)news.ycombinator.com
- Hacktron: Hacking OpenAIwww.hacktron.ai
- HN: Hacktron (406 pts)news.ycombinator.com



