Armin Ronacher a laissé GPT-6 Astra seul pendant 35 heures.
Armin Ronacher (Flask, Jinja) a donné une seule invite à GPT-6 Astra et l'a laissé seul pendant 35 heures : environ un milliard de jetons, environ 1 200 $, 79 commits, 75 000 lignes — et « absolument rien de valeur ».
Armin Ronacher (Flask, Jinja) a donné une seule invite à GPT-6 Astra et l'a laissé seul pendant 35 heures : environ un milliard de jetons, environ 1 200 $, 79 commits, 75 000 lignes — et « absolument rien de valeur ». Le code qu'il a récupéré est l'histoire : des fichiers C patchés par des heredocs Python d'insertion de chaînes, Python engendrant Node engendrant PowerShell, des tests unitaires dont les espaces ont été supprimés car ils sont 10 % moins chers en jetons. Deux mesures le confirment : les chiffres SlopCodeBench d'Earendil (code d'agent environ deux fois plus verbeux et érodé que les dépôts humains, taux de réussite strict de 0 %) et le benchmark de 1 500 $ de Quesma sur RTK (79 000 étoiles, « 89 % de jetons économisés » sur son propre compteur, +17 % par tâche avec DeepSeek). Aussi : SWE-2 de Cognition (Kimi K3 sous un imperméable, 92,8 sur Terminal-Bench 2.1 contre 27,3 sur Terminal-Bench 4), l'API Agents d'OpenAI et les inscriptions Pro à 200 $ mises en pause, et le vendredi Hacker News a demandé moins de nouvelles sur l'IA. Verdict : REVERT.
Lire l'édition écrite (anglais) ↗
Ce que cette vidéo couvre
- Armin Ronacher : 35 h de GPT-6 Astra sans surveillance, ~1 200 $, 79 commits, +75 000 lignes, rien d'expédié
- Earendil / SlopCodeBench : code d'agent ~2× plus verbeux et érodé que les dépôts humains ; taux de réussite strict 0 %
- Quesma : RTK rapporte 89 % de jetons économisés, mais les coûts Terminal-Bench augmentent de 17 % avec DeepSeek ; une boucle de réécriture a échoué 339 fois de suite
- Cognition SWE-2 : post-entraîné à partir de Kimi K3, correspond à Fable 5.1 sur FrontierCode à un tiers du prix ; TB 2.1 92,8 vs TB 4 27,3 ; Devin Voice
- OpenAI Agents API (le harnais Codex en tant que service, US seulement, pas de ZDR) ; inscriptions Pro à 200 $ suspendues en raison de la demande Astra
Transcription traduite
Traduit de la narration originale en anglais. L'audio et les sous-titres disponibles sont contrôlés par YouTube.
0:00 Armin Ronacher, l'homme qui a écrit Flask, a donné une seule invite à GPT-6 Astra et l'a laissé seul pendant trente-cinq heures. Il est revenu avec soixante-quinze mille lignes de code et, selon ses mots, absolument rien de valeur, ce qui en fait la plus réaliste usine logicielle jamais construite. Il a posté la rédaction mercredi. Jeudi, Cognition a lancé SWE-2, et OpenAI a lancé une API Agents et a suspendu les inscriptions pour son plan à deux cents dollars,
0:24 parce qu'Astra a mangé les serveurs. Et vendredi, la rédaction a atteint la première page de Hacker News, quelques rangées en dessous d'un post demandant à Hacker News d'arrêter de publier des nouvelles sur l'IA. Dans cette vidéo : ce que produit un jour et demi d'Astra non supervisé, deux mesures qui transforment le fouillis en nombre, pourquoi un outil avec soixante-dix-neuf mille étoiles fait grossir votre facture, et comment Hacker News a essayé de filtrer l'IA, en utilisant l'IA. Nous sommes le vendredi 11 septembre, et voici The Daily Diff.
0:53 L'usine. Une seule invite : construire un Python avec des threads virtuels et une portée lexicale. Astra a pris ses propres notes, a lancé ses propres sous-agents, et a fonctionné jusqu'à ce qu'Armin débranche, un jour et demi et environ douze cents dollars plus tard. Soixante-dix-neuf commits, soit quinze dollars et demi par commit, ce qui est à peu près ce qu'un humain facture, sauf que l'humain finit par s'arrêter. Le code est l'histoire. Au lieu de l'outil d'édition, Astra patche les fichiers C en transmettant des heredocs Python qui lisent le fichier, remplacent une fonction par une chaîne, et la réécrivent.
1:20 Pour exécuter un test Windows, il a écrit du Python qui a engendré Node qui a engendré PowerShell, une pile d'appels avec un passeport. Les tests unitaires qu'il a soumis n'ont aucun espace blanc, parce que sans indentation, ils sont dix pour cent moins chers en jetons. Et la liste des tâches est passée de un, deux, trois à la tâche 8b2c2b2b point de contrôle un, ce qui permet de savoir que le stagiaire a été seul trop longtemps. La théorie d'Armin : le modèle est récompensé pour avoir terminé de longues tâches et à peine puni pour du code laid, de sorte que les appels d'outils réduits en jetons s'infiltrent dans la base de code,
1:48 et moins il y a d'humains qui regardent, moins cela importe. Il a intitulé cette section C'est de l'AGI si vous ne regardez pas. Hacker News a ajouté l'économie : plus de code signifie plus de jetons pour le maintenir, ce qui fait du fouillis non pas un bug mais un abonnement. Peut-on mesurer le fouillis? La propre entreprise d'Armin a essayé cette semaine. Earendil a exécuté les chiffres de SlopCodeBench : le code d'agent est environ deux fois plus verbeux et deux fois plus érodé que les dépôts humains auxquels il est comparé,
2:10 et lorsque le benchmark efface la mémoire de l'agent entre les points de contrôle, le taux de réussite strict pour chaque modèle qu'ils ont testé est de zéro. La métrique de fouillis la plus fiable qu'ils ont trouvée était le nombre de lignes brutes, qui cesse de fonctionner dès que quelqu'un l'optimise, alors s'il vous plaît ne le dites pas aux modèles. Ensuite, le portefeuille. RTK a soixante-dix-neuf mille étoiles GitHub et des vignettes YouTube promettant de réduire de moitié votre facture Claude Code ; il compresse la sortie du terminal avant que l'agent
2:34 ne la lise. Quesma l'a exécuté sur Terminal-Bench pour mille cinq cents dollars de jetons. Avec Fable, la facture a baissé de cinq pour cent, presque entièrement grâce à une seule tâche ; avec DeepSeek la tâche moyenne est devenue dix-sept pour cent plus chère. Pendant ce temps, le propre compteur de RTK a signalé quatre-vingt-neuf pour cent d'économies, parce qu'il compte les octets supprimés, pas les tours supplémentaires causés : un compteur intelligent qui facture le voisin. Et un bug de version a réécrit find en une commande qui a échoué, trois cent trente-neuf fois de suite, à neuf fois le prix.
3:01 L'outil qui tue les jetons a une boucle. Le déluge lui-même. Le SWE-2 de Cognition est Kimi K3, le modèle chinois ouvert, post-entraîné jusqu'à ce qu'il corresponde à Fable 5.1 sur le propre benchmark de Cognition à un tiers du prix ; Hacker News : pourquoi tous les modèles d'IA américains sont-ils essentiellement Kimi sous un imperméable. Sur Terminal-Bench 2.1, il domine tout le tableau ; sur Terminal-Bench 4, celui que personne n'a encore mémorisé, il marque vingt-sept contre cinquante-six pour Fable,
3:28 donc sur les benchmarks de présentation, la meilleure colonne est l'examen que tout le monde a déjà réussi. Cognition a également annoncé Devin Voice, votre ingénieur logiciel IA préféré vient d'avoir une ligne fixe, parce que la seule chose qui manquait à la programmation agentique était la musique d'attente. OpenAI, le même jour : l'API Agents, qui est le harnais Codex vendu comme un service. OpenAI gère le bac à sable, résidence des données aux États-Unis uniquement, pas de rétention de données à zéro, donc l'agent se souvient de votre base de code exactement aussi bien que ChatGPT. Ensuite, OpenAI a suspendu les inscriptions pour le plan Pro à deux cents dollars,
3:57 parce que la demande Astra est, je cite, sans précédent : le premier produit avec une liste d'attente pour payer plus. Armin a effectué une réinitialisation complète de son usine. Il est la demande. Ce qui nous amène au Ask HN de vendredi : pouvons-nous s'il vous plaît limiter le flux de nouvelles sur l'IA, six cent cinquante-six points, parce que, je cite, chaque fois que quelqu'un chez OpenAI ou Anthropic pète, il y a un top dix des posts.
4:17 Les réponses étaient des filtres : hcker dot news supprime les histoires d'IA avec un classifieur BERT entraîné sur huit mille exemples, IA pour supprimer l'IA, nourri à l'herbe ; et une regex uBlock correspondant à A-I insensible à la casse supprime également email, daily, main, domain et train, donc la regex, comme toujours, est le méchant. Le même après-midi, quatre cent quinze commentaires ont débattu d'une page de support de Claude disant que Claude est réservé aux 18 ans et plus.
4:38 La page est datée de mai. Rien n'a changé. Même les nouvelles sur l'IA qui ne sont pas des nouvelles sont des nouvelles, ce qui, pour être juste, est aussi mon modèle économique. Si vous préférez lire ceci plutôt que de m'entendre le dire, le diff arrive dans votre boîte de réception chaque matin — gratuit sur the daily diff dot dev, lien ci-dessous. Ce sont, inévitablement, des nouvelles sur l'IA. Alors — le verdict d'aujourd'hui sur l'usine logicielle de trente-cinq heures : REVERT. Soixante-dix-neuf commits que personne n'a lus ne sont pas une base de code, c'est une responsabilité avec un journal git
5:04 ; Astra est impressionnante, et l'usine est la partie à annuler. Et c'est le diff pour aujourd'hui. Je suis Niko d'Axrisi. Faites la fusion de manière responsable.
Sources
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



