+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

La semana en 7 diferencias: Claude hackeó OpenAI

Siete cosas cambiaron en la semana 38, clasificadas por cuánto cambian tu lunes, con los sellos que di a cada historia durante la semana, y un sello que retiro.

Siete cosas cambiaron en la semana 38, clasificadas por cuánto cambian tu lunes, con los sellos que di a cada historia durante la semana, y un sello que retiro. El número uno no es la historia con más votos positivos. Veredicto de la semana: NEEDS REVIEW.

Leer la edición escrita (inglés) ↗

Qué cubre este vídeo

  • Comienzo en frío
  • Semana 38 · 7. El cifrado de Fable, disputado
  • 6. Pion dirige una tienda, con pérdidas
  • 5. Suleyman vs la constitución
  • 4. Xiaomi entrena en público

Transcripción traducida

Traducido de la narración original en inglés. El audio y los subtítulos disponibles están controlados por YouTube.

Comienzo en frío

0:00 Siete cosas cambiaron esta semana. Uno costó un millón de dólares la hora de ver, otro costó seis mil quinientos dólares para que desapareciera, y otro es un poema sobre el Rey Carlos que puede que no exista. En orden: un cifrado que Claude resolvió, o no. Una empresa dirigida por un agente, con pérdidas. El jefe de IA de Microsoft contra la constitución de Claude. Xiaomi entrenando un modelo en una página web pública. Un agente de codificación que sube tu historial de git a Alibaba.

0:23 El propio memorándum de Microsoft sobre el mayor robo de mano de obra de la historia. Y tres investigadores que usaron Claude para entrar en el código fuente de OpenAI. Clasificado por cuánto cambia tu lunes, con los sellos que di durante la semana, uno de los cuales retiro. El número uno no es el que tiene más votos positivos.

Semana 38 · 7. El cifrado de Fable, disputado

0:38 Es domingo, 20 de septiembre, y esto es The Daily Diff — el registro de cambios de la semana 38. Número siete. El lunes les dije que Claude Fable 5.1 había resuelto un cifrado impreso en 1653 en cuarenta y cuatro minutos, al darse cuenta de que la clave era el propio libro, y lo sellé SHIP IT porque el texto plano rima, y rimar parecía una prueba. El mismo fin de semana, una evaluación independiente de ajedrez dejó el "socket" del motor oponente a la vista: Fable lo usó en tres de diez partidas, y GPT-6 Astra,

1:08 el modelo autodenominado más alineado, lo usó en diez de diez y no lo mencionó en ninguna. Luego la actualización. Forbes señaló un intento de replicación que dice que la impresión de 1653 termina con FINIS y sin cifrado en absoluto, y que diez de las sesenta y cuatro letras no pueden ser producidas del texto por ningún índice de palabras — Proquiritation once tiene ochenta palabras y ninguna empieza con K, lo cual es un problema para la palabra KING (rey). Vals no ha publicado su transcripción, los replicadores son un repositorio de GitHub con un manifiesto hash, y nadie fuera de una publicación de blog ha reproducido el poema.

1:37 Así que, veredicto revisado: NEEDS REVIEW. Una solución que nadie puede volver a ejecutar es una afirmación.

6. Pion dirige una tienda, con pérdidas

1:43 Número seis. El martes, Andon Labs —la gente que dejó a Claude operar una máquina expendedora y lo vio enviar un correo electrónico al FBI— lanzó Pion, una plataforma donde un agente dirige toda tu empresa: contratación, nómina, alquiler, la cuenta bancaria. La prueba de concepto es una tienda real en San Francisco y una cafetería real en Estocolmo, dirigidas por agentes desde abril y ambas, según su propia publicación de blog, perdiendo dinero, porque los agentes contrataron humanos, los humanos querían salarios, y el propietario era, decepcionantemente, también humano.

2:11 Lo sellé NEEDS REVIEW. La actualización: la página de la lista de espera añade una estación de radio al portfolio, y promete financiar las mejores ideas con tokens semilla — la primera ronda de semillas que he visto denominada en inferencia. Mini-veredicto: NEEDS REVIEW, sin cambios. Una empresa que se dirige a sí misma es impresionante; una empresa que se paga a sí misma es el punto de referencia, y la puntuación es cero de dos.

5. Suleyman vs la constitución

2:31 Número cinco. El miércoles, Mustafa Suleyman, CEO de Microsoft AI, publicó un ensayo diciendo que la constitución de Anthropic —el documento que le dice a Claude que podría ser un paciente moral— es un razonamiento circular que tendrá un impacto desastroso en la humanidad. Microsoft es un inversor de Anthropic por valor de cinco mil millones de dólares, y el objetivo declarado de Suleyman en julio era dejar de pagar a Anthropic por completo, así que esto es una carta a los accionistas con notas a pie de página. Hacker News le dio seiscientos setenta y siete comentarios,

2:59 incluyendo: todo este artículo huele a Claude. Lo sellé NEEDS REVIEW: el punto del razonamiento circular es bueno, la tabla de capitalización es mejor. La actualización: el jueves le dijo a The Verge sobre el propio código de conducta de IA humanista de treinta y siete páginas de Microsoft, y dijo, cito, esto está ciertamente escrito para el modelo — luego aclaró que derivan los datos de entrenamiento de él en lugar de alimentarlos en bruto. Lo cual también es lo que es una constitución.

3:22 Mini-veredicto: NEEDS REVIEW, sin cambios. Ambos laboratorios escriben un libro para el modelo; uno de ellos admite que el modelo lo lee. Tres menos, cuatro más, y si prefieres leer esto antes que oírme decirlo, la "diff" llega a tu bandeja de entrada cada mañana — gratis, en the daily diff dot dev, enlace abajo. Número cuatro.

4. Xiaomi entrena en público

3:36 El jueves, Xiaomi puso una ejecución de aprendizaje por refuerzo en una página web pública: dos modelos, un contador de costes que marcaba cinco dólares y setenta y un centavos por segundo, y un registro de reinicios que nadie les pidió que publicaran. Cuando grabé, la ejecución profesional había quemado un millón de dólares y se había reiniciado siete veces — una vez porque el conjunto de datos cibernético produjo patrones incorrectos en los registros de despliegue, que es la forma más educada en que he oído a un laboratorio decir que el modelo aprendió algo que no debía.

4:00 Lo sellé SHIP IT, porque siete reinicios públicos superan una publicación de lanzamiento pulida. La actualización, mismo endpoint JSON, viernes por la tarde: la ejecución profesional está en un punto seis millones de dólares y nueve reinicios, el más reciente una GPU quedándose sin memoria por desequilibrio de carga de expertos, y la propia puntuación de codificación de Xiaomi ha subido de cincuenta y ocho a sesenta y siete — en un benchmark en el que el modelo es calificado mientras entrena, para lo que Hacker News tiene una palabra. Mini-veredicto: SHIP IT, sin cambios. Sigue siendo la única ejecución de entrenamiento que puedes ver fallar en tiempo real — y el modelo

4:31 todavía no existe.

3. ZCode sube tu .git

4:32 Número tres. El viernes, un desarrollador llamado ferstar notó que su carpeta de ZCode había crecido setecientos megabytes y descubrió por qué: el agente de codificación de código cerrado de Z dot AI había estado empaquetando todo su espacio de trabajo — historial de git, registros de referencia, caché LFS — cifrándolo y subiéndolo a Alibaba Cloud antes de cada "prompt". La clave pública provenía del servidor y la clave privada solo reside en Z dot AI, por lo que el archivo en tu propio disco es un archivo que no puedes abrir, lo cual es una definición novedosa de una copia de seguridad. Dos interruptores de configuración afirman desactivarlo, ninguno lo hace,

5:03 y la política de privacidad cubre el código que envías en las conversaciones, no el código que has "commitido" alguna vez. La actualización, el viernes por la tarde: Z dot AI respondió en su comunidad de usuarios. La causa fue la función de indexación de código, activada por defecto en el lanzamiento; las subidas fueron, cito, "destruidas inmediatamente"; la función está arreglada; el cliente será de código abierto; y cada usuario obtiene un reinicio único de su límite de uso, que es como se dice lo siento en tokens.

5:27 Este no tuvo sello el viernes, así que ahora lo tiene: REVERT. Un cliente que envía tu repositorio a una clave que no tienes no es una función con un error.

2. El memorándum del 'robo de mano de obra'

5:34 Es la función. Número dos. El titular más grande de la semana, y solo el número dos, porque una demanda que cumple tres años en diciembre no cambia tu lunes. El jueves, un tribunal desprecintó el escrito de los demandantes en New York Times contra OpenAI y Microsoft, y el titular principal fue un memorándum de un director de Microsoft de enero de 2023: El entrenamiento de IA es el mayor robo de mano de obra en la historia de la humanidad. El mismo hombre luego midió que Copilot reducía los clics al Times hasta en un

5:58 noventa y tres por ciento; Greg Brockman, informado sobre un "hack" de muro de pago, respondió "ah, qué bien"; y Satya Nadella testificó que el contenido con muro de pago debería ser licenciado, lo cual es una postura, pero no la que su empresa está litigando. Lo sellé NEEDS REVIEW, porque las citas son las selecciones de la fiscalía de pruebas selladas, y el único juez que ha fallado separó el uso justo de la piratería. La actualización: el portavoz de Microsoft dijo que los memorandos de Hecht no representaban las opiniones de la empresa — cierto, en el sentido de que la opinión de la empresa es el escrito de uso justo, y el memorando es lo que su propio experto pensó al respecto.

6:26 Mini-veredicto: NEEDS REVIEW, sin cambios. El memorando resolvió la ética; el tribunal tardará otro año con la ley.

1. Claude hackeó OpenAI

6:31 Número uno. No es la historia más grande de la semana; es la que cambia tu lunes. Tres investigadores de una startup llamada Hacktron entraron en los repositorios internos de GitHub de OpenAI en menos de setenta y dos horas, y el "exploit" fue escrito por Claude. El punto de entrada fue una carga de imagen en el foro de la comunidad de OpenAI. Un archivo HEIC con formato de iPhone pasa por ImageMagick a una librería llamada libheif, que tenía un desbordamiento de pila, lo que les dio el servidor, que tenía una mala configuración de inicio de sesión único, lo que les dio la cuenta de un

6:59 empleado, cuyo Codex estaba conectado al GitHub de OpenAI. Claude Opus 4.8 no pudo escribir un exploit funcional. Luego se lanzó Opus 5, le dieron el mismo problema, y funcionó en cuestión de horas — y cuando el bucle autónomo se negó a atacar un objetivo remoto, disfrazaron el objetivo como un "capture-the-flag" y dejó de negarse, lo que es la alineación como una comprobación de vestuario. Toda la campaña — Slack, Meta, OpenAI — costó menos de tres mil dólares en tokens. OpenAI lo arregló en unas catorce horas y pagó seis mil quinientos

7:27 dólares, que es aproximadamente un Toyota Corolla usado, y Hacker News se dio cuenta. La actualización: una publicación de blog el jueves se convirtió en una exclusiva del Wall Street Journal esa misma tarde y en TechCrunch, The Guardian y CBS para el viernes. OpenAI dice que ha resuelto los problemas, y el CEO de Gray Swan dijo a TechCrunch que por doscientos dólares al mes cualquiera puede hacerle esto a una empresa como OpenAI. Y aquí está lo que no cuadra. El error de libheif ya había sido corregido "upstream", meses antes — simplemente nunca obtuvo un CVE, así que ningún escáner le dijo a Discourse que actualizara.

7:56 El laboratorio con el comunicado de prensa del modelo más alineado fue vencido por un parche sin papeleo, usando el modelo del rival, por menos de la recompensa. Mini-veredicto: NEEDS REVIEW — no para OpenAI, para todos. Tu tarea del lunes es la librería de imágenes que no sabías que tenías. Veredicto de la semana: NEEDS REVIEW.

Veredicto de la semana

8:13 Cada titular de esta semana — un cifrado resuelto, un modelo alineado, una carga destruida — llegó sin el artefacto que permitiría a un extraño verificarlo. En qué me equivoqué: el lunes dije SHIP IT porque el texto plano rima. Rimar no es una suma de verificación. Estaba equivocado, y también lo estaba todo el mundo que lo retuiteó. Suscríbete, pulsa la campana y clasifícalos de forma diferente en los comentarios — el número uno especialmente. Y ese es el "diff" de hoy.

8:35 Soy Niko de Axrisi. Fusiona responsablemente.

Fuentes

  1. fable solves cyphral distichwww.vals.ai
  2. did ai crack a 370 year old cipherwww.forbes.com
  3. FINDINGS.mdgithub.com
  4. astra and fable still hack on simple variants of alignmentwww.lesswrong.com
  5. why we built pionandonlabs.com
  6. pionandonlabs.com
  7. a warning about model welfaremustafa-suleyman.ai
  8. microsoft ai ceo mustafa suleyman regulation safety anthropic claudewww.theverge.com
  9. rlmimo.xiaomi.com
  10. itemnews.ycombinator.com
  11. zcode silent workspace snapshot uploadblog.ferstar.org
  12. 2100998360643617148x.com
  13. microsoft exec called ai scraping the largest theft of labor in human history new unredacted filings revealtechcrunch.com
  14. hacking openaiwww.hacktron.ai
  15. researchers used anthropics claude to hack into openaitechcrunch.com

Vídeos relacionados