Armin Ronacher het GPT-6 Astra 35 uur lank alleen gelaat.
Armin Ronacher (Flask, Jinja) het GPT-6 Astra een opdrag gegee en dit 35 uur lank alleen gelaat: ongeveer 'n miljard "tokens", ongeveer $1,200, 79 "commits", 75,000 reëls — en "absoluut niks van waarde" nie.
Armin Ronacher (Flask, Jinja) het GPT-6 Astra een opdrag gegee en dit 35 uur lank alleen gelaat: ongeveer 'n miljard "tokens", ongeveer $1,200, 79 "commits", 75,000 reëls — en "absoluut niks van waarde" nie. Die kode wat dit herwin het, is die storie: C-lêers herstel deur Python "string-splicing heredocs", Python wat Node voortbring wat PowerShell voortbring, eenheidstoetse met die "whitespace" verwyder omdat dit 10% goedkoper in "tokens" is. Twee metings ondersteun hom: Earendil se SlopCodeBench-syfers (agentkode ongeveer twee keer so "verbose" en geërodeerd soos menslike "repos", 0% "strict pass rate") en Quesma se $1,500-maatstaf van RTK (79k sterre, "89% tokens saved" op sy eie teller, +17% per taak met DeepSeek). Ook: Cognition se SWE-2 (Kimi K3 in 'n slootjas, 92.8 op Terminal-Bench 2.1 vs 27.3 op Terminal-Bench 4), OpenAI se Agents API en onderbreekte $200 Pro-inskrywings, en die Vrydag Hacker News het gevra vir minder KI-nuus. Uitspraak: REVERT.
Lees die geskrewe uitgawe (Engels) ↗
Wat hierdie video dek
- Armin Ronacher: 35 uur van onbewaakte GPT-6 Astra, ~$1,200, 79 "commits", +75k reëls, niks verskeep
- Earendil / SlopCodeBench: agentkode ~2× so "verbose" en geërodeerd soos menslike "repos"; "strict pass rate" 0%
- Quesma: RTK rapporteer 89% "tokens" bespaar, maar Terminal-Bench koste styg 17% met DeepSeek; 'n "rewrite loop" het 339 keer agtereenvolgens misluk
- Cognition SWE-2: na-opleiding van Kimi K3, pas Fable 5.1 op FrontierCode teen 'n derde van die prys; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
- OpenAI Agents API (die Codex-tuig as 'n diens, slegs VSA, geen ZDR); $200 Pro-inskrywings onderbreek vir Astra-aanvraag
Vertaalde transkripsie
Vertaal uit die oorspronklike Engelse vertelling. Beskikbare klank en onderskrifte word deur YouTube beheer.
0:00 Armin Ronacher, die man wat Flask geskryf het, het GPT-6 Astra 'n enkele opdrag gegee en dit vyf-en-dertig uur lank alleen gelaat. Dit het teruggekom met vyf-en-sewentigduisend reëls kode en, in sy woorde, absoluut niks van waarde nie, wat dit die mees realistiese sagtewarefabriek maak wat ooit gebou is. Hy het die verslag Woensdag geplaas. Donderdag het Cognition SWE-2 verskeep, en OpenAI het 'n Agents API verskeep en inskrywings vir sy tweehonderd-dollar-plan onderbreek,
0:24 omdat Astra die bedieners opgevreet het. En Vrydag het die verslag die voorblad van Hacker News bereik, 'n paar rye onder 'n pos wat Hacker News gevra het om asseblief op te hou om oor KI te plaas. In hierdie video: wat 'n dag en 'n half van onbewaakte Astra produseer, twee metings wat "slop" in 'n getal verander, waarom 'n hulpmiddel met nege-en-sewentigduisend sterre jou rekening groter maak, en hoe Hacker News probeer het om KI uit te filtreer, met behulp van KI. Dit is Vrydag, 11 September, en dit is The Daily Diff.
0:53 Die fabriek. Een opdrag: bou 'n Python met virtuele drade en leksikale omvangsbepaling. Astra het sy eie notas gehou, sy eie subagente begin, en geloop totdat Armin die prop uitgetrek het, 'n dag en 'n half en ongeveer twaalfhonderd dollar later. Nege-en-sewentig "commits", dus vyftien en 'n half dollar per "commit", wat ongeveer is wat 'n mens vra, behalwe die mens stop uiteindelik. Die kode is die storie. In plaas van die redigeerhulpmiddel, "patch" Astra C-lêers deur Python "heredocs" te pyp wat die lêer lees, 'n funksie daarin met 'n string vervang, en dit terugskryf.
1:20 Om een Windows-toets uit te voer, het dit Python geskryf wat Node voortgebring het wat PowerShell voortgebring het, 'n oproepstapel met 'n paspoort. Die eenheidstoetse wat dit "committed" het, het glad geen "whitespace" nie, want sonder inspringing is dit tien persent goedkoper in "tokens". En die taaklys het verskuif van een, twee, drie na taak 8b2c2b2b kontrolepunt een, wat is hoe jy weet die intern is te lank alleen gelaat. Armin se teorie: die model word beloon vir die voltooiing van lang take en skaars gestraf vir lelike kode, so "token-golfed tool calls" lek in die kodebasis in,
1:48 en hoe minder mense kyk, hoe minder maak dit saak. Hy het daardie afdeling getiteld Dit is AGI as jy nie kyk nie. Hacker News het die ekonomie bygevoeg: meer kode beteken meer "tokens" om dit in stand te hou, wat "slop" nie 'n fout maar 'n intekening maak. Kan jy "slop" meet? Armin se eie maatskappy het dit hierdie week probeer. Earendil het die SlopCodeBench-syfers geloop: agentkode is ongeveer twee keer so "verbose" en twee keer so geërodeerd soos die menslike "repos" waarmee dit vergelyk word,
2:10 en wanneer die maatstaf die agent se geheue tussen kontrolepunte uitvee, is die "strict pass rate" vir elke model wat hulle getoets het nul. Die mees betroubare "slop"-metriek wat hulle gevind het, was die rou lyn telling, wat ophou werk sodra iemand daarvoor optimeer, so moenie asseblief vir die modelle vertel nie. Dan die beursie. RTK het nege-en-sewentigduisend GitHub-sterre en YouTube-miniatuurbeelde wat belowe om jou Claude Code-rekening te halveer; dit komprimeer terminale uitvoer voordat die agent
2:34 dit lees. Quesma het dit op Terminal-Bench geloop vir vyftienhonderd dollar se "tokens". Met Fable het die rekening met vyf persent gedaal, byna alles van een taak; met DeepSeek het die gemiddelde taak sewentien persent duurder geword. Intussen het RTK se eie teller nege-en-tagtig persent besparing gerapporteer, omdat dit verwyderde grepe tel, nie ekstra draaie veroorsaak nie: 'n slim meter wat die buurman faktureer. En een weergawefout het "find" in 'n opdrag herskryf wat misluk het, driehonderd nege-en-dertig keer agtereenvolgens, teen nege keer die prys.
3:01 Die hulpmiddel wat "tokens" doodmaak, het 'n lus. Die vloed self. Cognition se SWE-2 is Kimi K3, die oop Chinese model, na-opleiding totdat dit Fable 5.1 pas op Cognition se eie maatstaf teen 'n derde van die prys; Hacker News: waarom is alle Amerikaanse KI-modelle basies Kimi in 'n slootjas. Op Terminal-Bench 2.1 is dit boaan die hele tabel; op Terminal-Bench 4, die een wat niemand nog gememoriseer het nie, behaal dit sewe-en-twintig teenoor Fable se ses-en-vyftig,
3:28 so op die skyfievertoning-maatstawwe is die beste kolom die eksamen wat almal reeds geslaag het. Cognition het ook Devin Voice aangekondig, jou gunsteling KI-sagteware-ingenieur het pas 'n landlyn gekry, want die een ding wat agentiese kodering gemis het, was "hold music". OpenAI, dieselfde dag: die Agents API, wat die Codex-tuig is wat as 'n diens verkoop word. OpenAI bestuur die "sandbox", slegs VSA-dataresidensie, geen nul-data-behoud nie, so die agent onthou jou kodebasis presies so goed soos ChatGPT dit doen. Toe het OpenAI inskrywings vir die tweehonderd-dollar Pro-plan onderbreek,
3:57 omdat Astra-aanvraag, aanhaal, ongekend is: die eerste produk met 'n waglys om meer te betaal. Armin het 'n volle "reset" op sy fabriek verbrand. Hy is die vraag. Wat ons bring by Vrydag se Vra HN: kan ons asseblief die KI-nuusvloed beperk, seshonderd ses-en-vyftig punte, want, aanhaal, elke keer as iemand by OpenAI of Anthropic "farts", is daar 'n top-tien pos.
4:17 Die antwoorde was filters: hcker dot news verwyder KI-stories met 'n BERT-klassifiseerder wat opgelei is op agtduisend voorbeelde, KI om KI te verwyder, "grass-fed"; en 'n uBlock "regex" wat A-I "case-insensitively" pas, verwyder ook e-pos, daagliks, hoof, domein en trein, so die "regex", soos altyd, is die skurk. Dieselfde middag, vierhonderd vyftien kommentare het gestry oor 'n Claude-ondersteuningsblad wat sê Claude is agtien-plus.
4:38 Die bladsy is gedateer Mei. Niks het verander nie. Selfs die KI-nuus wat nie nuus is nie, is nuus, wat, om regverdig te wees, ook my besigheidsmodel is. As jy dit eerder wil lees as om my dit te hoor sê, land die "diff" elke oggend in jou inkassie — gratis by the daily diff dot dev, skakel hieronder. Dit is, onvermydelik, KI-nuus. So — vandag se uitspraak oor die vyf-en-dertig-uur sagtewarefabriek: REVERT. Nege-en-sewentig "commits" wat niemand gelees het nie, is nie 'n kodebasis nie, dit is 'n las met 'n "git"
5:04 log; Astra is indrukwekkend, en die fabriek is die deel om terug te rol. En dit is die "diff" vir vandag. Ek is Niko van Axrisi. Voeg verantwoordelik saam.
Bronne
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



