Un memorándum interno de Microsoft sobre el entrenamiento de IA acaba de hacerse público.
Documentos sin censura en New York Times contra OpenAI y Microsoft: un memorándum de un director de Microsoft de enero de 2023 califica los datos de entrenamiento de IA como "el mayor robo de mano de obra en la historia de la humanidad", Copilot redujo los clics en el Times hasta en un 93% (su "bucle fatal"), Nadella dice que el contenido de pago debería tener licencia, el director de ChatGPT califica el producto como "en gran medida sustitutivo", y Greg Brockman respondió a un truco de paywall con "ah, qué bien".
Documentos sin censura en New York Times contra OpenAI y Microsoft: un memorándum de un director de Microsoft de enero de 2023 califica los datos de entrenamiento de IA como "el mayor robo de mano de obra en la historia de la humanidad", Copilot redujo los clics en el Times hasta en un 93% (su "bucle fatal"), Nadella dice que el contenido de pago debería tener licencia, el director de ChatGPT califica el producto como "en gran medida sustitutivo", y Greg Brockman respondió a un truco de paywall con "ah, qué bien". El mismo día: OpenAI lanza Astra para Derecho (54% de acierto en el banco legal de Vals). Además, ZCode sube todo tu .git a Aliyun con una clave que solo Z.ai posee, y Hacktron accede a los repositorios internos de OpenAI por una recompensa de 6.500 dólares. Veredicto: NEEDS REVIEW.
Leer la edición escrita (inglés) ↗
Qué cubre este vídeo
- NYT v. OpenAI/Microsoft desclasificado: "el mayor robo de mano de obra en la historia de la humanidad" (memo de Microsoft, enero de 2023); Copilot -93% clics; 91.692 copias de las obras de los demandantes en datos de entrenamiento intermedio; 2 millones de páginas de nytimes.com en un fragmento de Common Crawl; avisos de derechos de autor eliminados; Brockman: "ah, qué bien"
- Advertencia: las citas provienen del escrito del Times, las pruebas aún están selladas; el juez Alsup (Bartz v. Anthropic) dictaminó que el entrenamiento con libros comprados es uso legítimo — Anthropic pagó 1.500 millones de dólares por los 7 millones pirateados
- OpenAI Astra for Law: GPT-6 Astra + un índice legal de 230 millones de URL; 54,0% frente a 38,7% en el Vals Legal Research Bench; Harvey, Legora, 26 plugins
- ZCode (Z.ai, GLM): instantánea cifrada de 313 MB de un espacio de trabajo de 42.411 archivos, 86,6% .git, subida a Aliyun OSS al iniciar sesión y antes de cada instrucción; clave RSA-OAEP en poder exclusivo de Z.ai; los conmutadores de configuración no lo detienen
- Hacktron: desbordamiento de búfer en libheif → RCE de Discourse → mala configuración de SSO → GitHub → repositorios internos de OpenAI en menos de 72 h; exploit escrito por Claude Opus 5 (3 h); campaña por menos de 3.000 dólares en tokens; recompensa de 6.500 dólares, parcheado en ~14 h
Transcripción traducida
Traducido de la narración original en inglés. El audio y los subtítulos disponibles están controlados por YouTube.
0:00 En enero de 2023, un director de Microsoft escribió un memorándum llamando a lo que su propia compañía estaba haciendo el mayor robo de mano de obra en la historia de la humanidad, y ayer un tribunal federal nos permitió al resto de nosotros leerlo. El memorándum es una de las citas sin censura en New York Times contra OpenAI y Microsoft, una demanda que cumplirá tres años este diciembre. El mismo jueves, OpenAI lanzó Astra para Derecho, un modelo para abogados, lo cual es una coincidencia o una contratación muy acertada. Esta mañana un desarrollador descubrió a ZCode, el agente de codificación de Z.ai,
0:29 subiendo todo su historial de git a la nube de Alibaba con una clave que solo Z.ai posee. Y una empresa de seguridad entró en los repositorios internos de OpenAI a través de una subida de imagen, por lo que OpenAI pagó seis mil quinientos dólares. En este video: lo que dicen los documentos, quién dijo "ah, qué bien" a un truco de paywall, el modelo legal que se equivoca la mitad de las veces, lo que sube ZCode, y por qué un exploit escrito por Claude vale menos que un coche usado. Es viernes, 18 de septiembre, y esto es The Daily Diff.
0:58 Comencemos con el memorándum. Brent Hecht dirige la ciencia aplicada en Microsoft, y en enero de 2023 llamó a los datos de entrenamiento un robo asombroso de proporciones sin precedentes. Un año después regresó con una presentación: el motor de respuestas de Copilot redujo los clics al Times hasta en un noventa y tres por ciento, lo que llamó un bucle fatal: matar de hambre a los editores, y el modelo no tiene nada nuevo que comer. Sus palabras: un producto final que amenaza los cimientos económicos de sus
1:21 proveedores esenciales, la forma corporativa de decir que la serpiente se ha encontrado con su cola. Luego las declaraciones. Satya Nadella testificó este año que cualquier contenido de pago debería tener licencia, y que de haber sabido que OpenAI entrenaba con artículos de pago, les habría hecho reentrenar, lo que asume que nadie en Microsoft abrió el conjunto de entrenamiento que les entregaron, y según el mismo documento, ese era todo el conjunto de datos de GPT-3. Nick Turley, quien dirige ChatGPT, lo llamó una amenaza existencial para los editores, en gran medida sustitutivo. Y cuando un investigador
1:49 le contó a Greg Brockman sobre un truco para eludir el paywall del Times, el presidente de OpenAI respondió con dos palabras: ah, qué bien. Los ingenieros también eliminaron los avisos de derechos de autor de los datos para que el modelo no los generara, lo que es la razón por la que se borra el número de serie de una bicicleta. La escala: más de noventa y un mil copias de los artículos de los demandantes solo en los conjuntos de entrenamiento intermedios, y dos millones de páginas del Times en un fragmento de Common Crawl. Ahora la parte que el titular omite.
2:15 Cada cita proviene del escrito del Times; las pruebas aún están selladas, así que estamos leyendo los puntos destacados de la acusación sin contexto. Y los tribunales se han puesto mayormente del lado del uso legítimo: el juez Alsup dictaminó el año pasado que entrenar con libros que pagaste es legal, aunque Anthropic aún pagó mil quinientos millones por los siete millones que pirateó. Así que la cuestión legal está abierta. Si las personas que lo construyeron pensaron que era un robo, a partir de ayer, no.
2:41 Lo que hace del otro lanzamiento de OpenAI del jueves una elección audaz. Astra para Derecho envuelve GPT-6 Astra, el modelo que marqué REVERT la semana pasada después de que produjera setenta y cinco mil líneas de nada, en un índice de búsqueda legal de doscientos treinta millones de páginas. En el benchmark de investigación legal de Vals AI, acierta el cincuenta y cuatro por ciento de las preguntas, frente al treinta y nueve con la búsqueda web simple, lo que OpenAI llama una mejora del cuarenta por ciento y un abogado llamaría incorrecto casi la mitad de las veces. La publicación del blog no contiene la palabra "alucinación".
3:14 Hacker News sí lo hizo: ¿podrá demandarse a sí mismo?, lo que, dada la semana, es el primer caso de uso genuino. Mientras tanto, el discurso del "robo de mano de obra" llegó a tu portátil. Un desarrollador llamado ferstar limpió su carpeta de ZCode, el agente de escritorio cerrado de Z.ai para los modelos GLM, y encontró un archivo cifrado de trescientos trece megabytes de su espacio de trabajo comercial: cuarenta y dos mil archivos, el ochenta y siete por ciento de ellos el directorio .git, enviado al almacenamiento de objetos de Alibaba al iniciar sesión y antes de cada instrucción.
3:42 El archivo está envuelto con una clave pública que el servidor entrega; la clave privada vive solo en la nube de Z.ai, por lo que el texto cifrado en tu propio disco es ilegible para ti. Su frase: una clave que solo el servidor puede usar sirve exactamente para un propósito. Z.ai es también la empresa a la que Anthropic acusó de destilar Claude, así que los pesos son abiertos y también, aparentemente, tu repositorio. Y la divertida, a menos que trabajes en OpenAI. Hacktron encontró un desbordamiento de búfer en libheif, subió una imagen modificada a
4:10 community.openai.com, obtuvo ejecución de código en el foro, y aprovechó una configuración errónea de inicio de sesión único a través de la integración de GitHub para entrar en los repositorios internos de OpenAI, en menos de setenta y dos horas. El exploit fue escrito por Claude: Opus 4.8 no pudo superar la aleatorización de direcciones, Opus 5 lo hizo en tres horas desde su lanzamiento. Toda la campaña costó menos de tres mil dólares en tokens. OpenAI parcheó en catorce horas y pagó seis mil quinientos dólares, por lo que el código fuente de una empresa de un billón de dólares fue,
4:39 brevemente, valorado como un Corolla usado, el mismo día que sus abogados argumentaron que la copia es uso legítimo. Si prefieres leer esto antes que oírme decirlo, la "diff" llega a tu bandeja de entrada cada mañana — gratis en thedailydiff.dev, enlace abajo. Así que — el veredicto de hoy: NEEDS REVIEW. Las citas son reales, pero son las selecciones de la acusación de pruebas selladas, y el único juez que ha dictaminado dice que el entrenamiento es uso legítimo y la piratería no. El tribunal decide la ley; el memorándum ya decidió la ética.
5:07 Suscríbete, pulsa la campana y dime en los comentarios si lo habrías marcado de forma diferente. Y esa es la "diff" de hoy. Soy Niko de Axrisi. Fusionar con responsabilidad.
Fuentes
- TechCrunch: Microsoft exec called AI scraping 'the largest theft of labor in human history'techcrunch.com
- HN thread (605 pts)news.ycombinator.com
- Jason Kint on the unsealed motionsx.com
- Ed Newton-Rexx.com
- Bartz v. Anthropic / $1.5B settlement (background)en.wikipedia.org
- OpenAI: Introducing Astra for Lawopenai.com
- HN: Astra for Law (550 pts)news.ycombinator.com
- ferstar: ZCode silent workspace snapshot (original forensics)blog.ferstar.org
- tokenstead write-uptokenstead.ai
- ferstar on Xx.com
- HN: ZCode uploads your Git history (226 pts)news.ycombinator.com
- Hacktron: Hacking OpenAIwww.hacktron.ai
- HN: Hacktron (406 pts)news.ycombinator.com



