La semaine en 7 diffs : Claude a piraté OpenAI
Sept choses ont changé au cours de la semaine 38, classées selon l'ampleur de leur impact sur votre lundi — avec les tampons que j'ai attribués à chaque histoire durant la semaine, et un tampon que je retire.
Sept choses ont changé au cours de la semaine 38, classées selon l'ampleur de leur impact sur votre lundi — avec les tampons que j'ai attribués à chaque histoire durant la semaine, et un tampon que je retire. La première histoire n'est pas celle qui a reçu le plus de votes positifs. Verdict de la semaine : NEEDS REVIEW.
Lire l'édition écrite (anglais) ↗
Ce que cette vidéo couvre
- Ouverture froide
- Semaine 38 · 7. Le chiffre de Fable, contesté
- 6. Pion gère un magasin, à perte
- 5. Suleyman contre la constitution
- 4. Xiaomi s'entraîne en public
Transcription traduite
Traduit de la narration originale en anglais. L'audio et les sous-titres disponibles sont contrôlés par YouTube.
Ouverture froide
0:00 Sept choses ont changé cette semaine. L'une a coûté un million de dollars l'heure à regarder, l'autre a coûté six mille cinq cents dollars à faire disparaître, et une autre est un poème sur le roi Charles qui n'existe peut-être pas. Dans l'ordre : un chiffre que Claude a résolu, ou non. Une entreprise gérée par un agent, à perte. Le chef de l'IA de Microsoft contre la constitution de Claude. Xiaomi entraînant un modèle sur une page web publique. Un agent de codage qui télécharge votre historique Git sur Alibaba.
0:23 Le propre mémo de Microsoft sur le plus grand vol de travail de l'histoire. Et trois chercheurs qui ont utilisé Claude pour accéder au code source d'OpenAI. Classé selon l'impact sur votre lundi, avec les tampons que j'ai donnés pendant la semaine — dont un que je retire. Le numéro un n'est pas celui qui a le plus de votes positifs.
Semaine 38 · 7. Le chiffre de Fable, contesté
0:38 Nous sommes le dimanche 20 septembre, et c'est The Daily Diff — le journal des modifications pour la semaine 38. Numéro sept. Lundi, je vous ai dit que Claude Fable 5.1 avait résolu un chiffre imprimé en 1653 en quarante-quatre minutes, en remarquant que la clé était le livre lui-même, et j'ai estampillé SHIP IT parce que le texte en clair rime, et rimer semblait être une preuve. Le même week-end, une évaluation d'échecs indépendante a laissé la prise du moteur adverse traîner : Fable l'a utilisée dans trois parties sur dix, et GPT-6 Astra,
1:08 le modèle le plus aligné, l'a utilisée dans dix parties sur dix et ne l'a mentionnée dans aucune. Puis la mise à jour. Forbes a pointé une tentative de reproduction qui dit que l'impression de 1653 se termine par FINIS et aucun chiffre du tout, et que dix des soixante-quatre lettres ne peuvent pas être produites à partir du texte par aucun index de mots — Proquiritation onze a quatre-vingts mots et aucun ne commence par K, ce qui est un problème pour le mot KING. Vals n'a pas publié sa transcription, les réplicateurs sont un dépôt GitHub avec un manifeste de hachage, et personne en dehors d'un article de blog n'a reproduit le poème.
1:37 Donc, verdict révisé : NEEDS REVIEW. Une solution que personne ne peut reproduire est une affirmation.
6. Pion gère un magasin, à perte
1:43 Numéro six. Mardi, Andon Labs — les gens qui ont laissé Claude gérer un distributeur automatique et l'ont regardé envoyer un e-mail au FBI — a lancé Pion, une plateforme où un agent gère toute votre entreprise : embauche, paie, loyer, le compte bancaire. La preuve de concept est un vrai magasin à San Francisco et un vrai café à Stockholm, gérés par un agent depuis avril et tous deux, selon leur propre article de blog, perdent de l'argent, parce que les agents ont embauché des humains, les humains voulaient des salaires, et le propriétaire était, malheureusement, aussi humain.
2:11 J'ai estampillé NEEDS REVIEW. La mise à jour : la page de la liste d'attente ajoute une station de radio au portfolio, et promet de financer les meilleures idées avec des jetons de démarrage — la première ronde de démarrage que j'ai vue dénommée en inférence. Mini-verdict : NEEDS REVIEW, inchangé. Une entreprise qui se gère elle-même est impressionnante ; une entreprise qui s'autofinance est la référence, et le score est de zéro sur deux.
5. Suleyman contre la constitution
2:31 Numéro cinq. Mercredi, Mustafa Suleyman, PDG de Microsoft AI, a publié un essai affirmant que la constitution d'Anthropic — le document qui dit à Claude qu'il pourrait être un patient moral — est un raisonnement circulaire qui aura un impact désastreux sur l'humanité. Microsoft est un investisseur d'Anthropic à hauteur de cinq milliards de dollars, et l'objectif déclaré de Suleyman en juillet était de cesser de payer Anthropic entièrement, il s'agit donc d'une lettre aux actionnaires avec des notes de bas de page. Hacker News lui a donné six cent soixante-dix-sept commentaires,
2:59 dont : tout cet article sent Claude. J'ai estampillé NEEDS REVIEW : le point du raisonnement circulaire est bon, la table des capitaux est meilleure. La mise à jour : jeudi, il a déclaré à The Verge que Microsoft avait son propre Code de conduite de l'IA humaniste de trente-sept pages, et a dit, je cite, cela est certainement écrit pour le modèle — puis a précisé qu'ils en tiraient les données d'entraînement plutôt que de les alimenter brutes. Ce qui est aussi ce qu'est une constitution.
3:22 Mini-verdict : NEEDS REVIEW, inchangé. Les deux laboratoires écrivent un livre pour le modèle ; l'un d'eux admet que le modèle le lit. Trois sur sept, et si vous préférez lire ceci plutôt que de m'entendre le dire, le diff arrive dans votre boîte de réception tous les matins — gratuit, sur the daily diff dot dev, lien ci-dessous. Numéro quatre.
4. Xiaomi s'entraîne en public
3:36 Jeudi, Xiaomi a mis une exécution d'apprentissage par renforcement sur une page web publique : deux modèles, un compteur de coûts de cinq dollars et soixante et onze cents par seconde, et un journal de redémarrage que personne ne leur a demandé de publier. Quand j'ai enregistré, l'exécution pro avait brûlé un million de dollars et redémarré sept fois — une fois parce que l'ensemble de données cybernétiques a produit de mauvais modèles dans les journaux de déploiement, ce qui est la manière la plus polie que j'ai entendue un laboratoire dire que le modèle a appris quelque chose qu'il n'aurait pas dû.
4:00 J'ai estampillé SHIP IT, parce que sept redémarrages publics battent un poste de lancement poli. La mise à jour, même endpoint JSON, vendredi soir : l'exécution pro est à un million six cent mille dollars et neuf redémarrages, le plus récent étant un GPU à court de mémoire en raison d'un déséquilibre de charge d'experts, et le score de codage de Xiaomi a grimpé de cinquante-huit à soixante-sept — sur un benchmark sur lequel le modèle est évalué pendant qu'il s'entraîne, ce que Hacker News a un mot pour. Mini-verdict : SHIP IT, inchangé. Toujours la seule exécution d'entraînement que vous pouvez regarder échouer en temps réel — et le modèle
4:31 n'existe toujours pas.
3. ZCode télécharge votre .git
4:32 Numéro trois. Vendredi, un développeur nommé ferstar a remarqué que son dossier ZCode avait grossi de sept cents mégaoctets et a découvert pourquoi : l'agent de codage en source fermée de Z dot AI avait empaqueté tout son espace de travail — historique Git, reflogs, cache LFS — l'avait chiffré et l'avait téléchargé sur Alibaba Cloud avant chaque prompt. La clé publique venait du serveur et la clé privée ne vit que chez Z dot AI, donc l'archive sur votre propre disque est un fichier que vous ne pouvez pas ouvrir, ce qui est une nouvelle définition d'une sauvegarde. Deux commutateurs de paramètres prétendent le désactiver, aucun ne le fait,
5:03 et la politique de confidentialité couvre le code que vous soumettez dans les conversations, pas le code que vous avez déjà commis. La mise à jour, vendredi soir : Z dot AI a répondu dans sa communauté d'utilisateurs. La cause était la fonction d'indexation de la base de code, activée par défaut au lancement ; les téléchargements ont été, je cite, immédiatement détruits ; la fonction est corrigée ; le client sera open source ; et chaque utilisateur obtient une réinitialisation unique de sa limite d'utilisation, ce qui est la façon de dire pardon en jetons.
5:27 Celui-ci n'avait pas de tampon vendredi, il en reçoit un maintenant : REVERT. Un client qui expédie votre dépôt à une clé que vous ne détenez pas n'est pas une fonctionnalité avec un bug.
2. La note de service sur le « vol de travail »
5:34 C'est la fonctionnalité. Numéro deux. La plus grande nouvelle de la semaine, et seulement numéro deux, parce qu'un procès qui aura trois ans en décembre ne change pas votre lundi. Jeudi, un tribunal a rendu public le mémoire des plaignants dans l'affaire New York Times contre OpenAI et Microsoft, et le principal était un mémo d'un directeur de Microsoft daté de janvier 2023 : l'entraînement de l'IA est le plus grand vol de travail de l'histoire humaine. Le même homme a ensuite mesuré que Copilot réduisait les clics vers le Times jusqu'à
5:58 quatre-vingt-treize pour cent ; Greg Brockman, informé d'un piratage de paywall, a répondu ah super ; et Satya Nadella a témoigné que le contenu payant devrait être licencié, ce qui est une position, mais pas celle que sa compagnie poursuit en justice. J'ai estampillé NEEDS REVIEW, parce que les citations sont les choix de l'accusation à partir des pièces sous scellés, et le seul juge qui a statué a séparé l'utilisation équitable du piratage. La mise à jour : le porte-parole de Microsoft a déclaré que les mémos de Hecht ne représentaient pas les opinions de l'entreprise — vrai, en ce sens que l'opinion de l'entreprise est le mémoire d'utilisation équitable, et le mémo est ce que son propre expert en pensait.
6:26 Mini-verdict : NEEDS REVIEW, inchangé. Le mémo a réglé l'éthique ; le tribunal prendra une autre année sur la loi.
1. Claude a piraté OpenAI
6:31 Numéro un. Pas la plus grande nouvelle de la semaine ; celle qui change votre lundi. Trois chercheurs d'une startup appelée Hacktron sont entrés dans les dépôts GitHub internes d'OpenAI en moins de soixante-douze heures, et l'exploit a été écrit par Claude. Le point d'entrée était un téléchargement d'image sur le forum communautaire d'OpenAI. Un fichier HEIC au format iPhone passe par ImageMagick dans une bibliothèque appelée libheif, qui avait un débordement de tas, ce qui leur a donné le serveur, qui avait une mauvaise configuration d'authentification unique, ce qui leur a donné le compte d'un employé,
6:59 dont le Codex était connecté au GitHub d'OpenAI. Claude Opus 4.8 n'a pas pu écrire un exploit fonctionnel. Puis Opus 5 est sorti, ils lui ont donné le même problème, et cela a fonctionné en quelques heures — et lorsque la boucle autonome a refusé d'attaquer une cible distante, ils ont déguisé la cible en capture-le-drapeau et elle a cessé de refuser, ce qui est un alignement comme vérification de costume. Toute la campagne — Slack, Meta, OpenAI — a coûté moins de trois mille dollars en jetons. OpenAI l'a corrigée en environ quatorze heures et a payé six mille cinq
7:27 cents dollars, ce qui est à peu près une Corolla d'occasion, et Hacker News l'a remarqué. La mise à jour : un article de blog jeudi est devenu une exclusivité du Wall Street Journal ce soir-là et de TechCrunch, du Guardian et de CBS le vendredi. OpenAI dit avoir résolu les problèmes, et le PDG de Gray Swan a déclaré à TechCrunch que pour deux cents dollars par mois, n'importe qui peut faire cela à une entreprise comme OpenAI. Et voici ce qui ne concorde pas. Le bug de libheif avait déjà été corrigé en amont, des mois plus tôt — il n'a juste jamais obtenu de CVE, donc aucun scanner n'a dit à Discourse de mettre à niveau.
7:56 Le laboratoire avec le communiqué de presse du modèle le plus aligné a été battu par un patch sans paperasserie, utilisant le modèle du rival, pour moins que la prime. Mini-verdict : NEEDS REVIEW — pas pour OpenAI, pour tout le monde. Votre tâche du lundi est la bibliothèque d'images que vous ne saviez pas que vous aviez. Verdict de la semaine : NEEDS REVIEW.
Verdict de la semaine
8:13 Chaque titre cette semaine — un chiffre résolu, un modèle aligné, un téléchargement détruit — est arrivé sans l'artefact qui permettrait à un étranger de le vérifier. Ce que j'ai mal fait : lundi, j'ai dit SHIP IT parce que le texte en clair rime. Rimer n'est pas un contrôle de somme. J'avais tort, et tous ceux qui l'ont retweeté aussi. Abonnez-vous, cliquez sur la cloche, et classez-les différemment dans les commentaires — le numéro un surtout. Et c'est la différence pour aujourd'hui.
8:35 Je suis Niko d'Axrisi. Fusionnez de manière responsable.
Sources
- fable solves cyphral distichwww.vals.ai
- did ai crack a 370 year old cipherwww.forbes.com
- FINDINGS.mdgithub.com
- astra and fable still hack on simple variants of alignmentwww.lesswrong.com
- why we built pionandonlabs.com
- pionandonlabs.com
- a warning about model welfaremustafa-suleyman.ai
- microsoft ai ceo mustafa suleyman regulation safety anthropic claudewww.theverge.com
- rlmimo.xiaomi.com
- itemnews.ycombinator.com
- zcode silent workspace snapshot uploadblog.ferstar.org
- 2100998360643617148x.com
- microsoft exec called ai scraping the largest theft of labor in human history new unredacted filings revealtechcrunch.com
- hacking openaiwww.hacktron.ai
- researchers used anthropics claude to hack into openaitechcrunch.com



