+− THE DAILY DIFFdev & AI news
REVERT

Armin Ronacher a lăsat GPT-6 Astra singur timp de 35 de ore.

Armin Ronacher (Flask, Jinja) a dat un prompt lui GPT-6 Astra și l-a lăsat singur timp de 35 de ore: aproximativ un miliard de token-uri, aproximativ 1.200 $, 79 de commit-uri, 75.000 de linii – și "absolut nimic de valoare".

Armin Ronacher (Flask, Jinja) a dat un prompt lui GPT-6 Astra și l-a lăsat singur timp de 35 de ore: aproximativ un miliard de token-uri, aproximativ 1.200 $, 79 de commit-uri, 75.000 de linii – și "absolut nimic de valoare". Codul recuperat este povestea: fișiere C patch-uite prin string-splicing heredoc-uri Python, Python care generează Node care generează PowerShell, teste unitare cu spațiul alb eliminat deoarece este cu 10% mai ieftin în token-uri. Două măsurători îl susțin: numerele SlopCodeBench ale lui Earendil (codul agentului este de aproximativ două ori mai verbos și mai erodat decât depozitele umane, rată de trecere strictă de 0%) și benchmark-ul Quesma de 1.500 $ al RTK (79k stele, "89% token-uri economisite" pe propriul contor, +17% per sarcină cu DeepSeek). De asemenea: SWE-2 de la Cognition (Kimi K3 într-un palton, 92.8 pe Terminal-Bench 2.1 vs 27.3 pe Terminal-Bench 4), API-ul Agents de la OpenAI și înscrierile Pro de 200 $ întrerupte, și vineri, Hacker News a cerut mai puține știri despre AI. Verdict: REVERT.

Citiți ediția scrisă (engleză) ↗

Ce acoperă acest videoclip

  • Armin Ronacher: 35 h de GPT-6 Astra nesupravegheat, ~$1.200, 79 de commit-uri, +75k linii, nimic livrat
  • Earendil / SlopCodeBench: codul agentului este de ~2× mai verbos și erodat decât depozitele umane; rată de trecere strictă 0%
  • Quesma: RTK raportează 89% token-uri economisite, dar costurile Terminal-Bench cresc cu 17% cu DeepSeek; o buclă de rescriere a eșuat de 339 de ori la rând
  • Cognition SWE-2: post-antrenat de la Kimi K3, se potrivește cu Fable 5.1 pe FrontierCode la o treime din preț; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
  • API-ul OpenAI Agents (cablajul Codex ca serviciu, doar pentru SUA, fără ZDR); înscrierile Pro de 200 $ întrerupte din cauza cererii pentru Astra

Transcrierea tradusă

Tradus din narațiunea originală în engleză. Audio-ul și subtitrările disponibile sunt controlate de YouTube.

0:00 Armin Ronacher, omul care a scris Flask, a dat lui GPT-6 Astra un singur prompt și l-a lăsat singur timp de treizeci și cinci de ore. S-a întors cu șaptezeci și cinci de mii de linii de cod și, în cuvintele sale, absolut nimic de valoare, ceea ce o face cea mai realistă fabrică de software construită vreodată. A postat textul miercuri. Joi, Cognition a livrat SWE-2, iar OpenAI a livrat un API Agents și a întrerupt înscrierile pentru planul său de două sute de dolari,

0:24 deoarece Astra a consumat serverele. Și vineri, textul a ajuns pe prima pagină a Hacker News, câteva rânduri sub o postare care cerea Hacker News să nu mai posteze despre AI. În acest videoclip: ce produce o zi și jumătate de Astra nesupravegheată, două măsurători care transformă dezordinea într-un număr, de ce un instrument cu șaptezeci și nouă de mii de mii de stele îți mărește factura și cum Hacker News a încercat să filtreze AI, folosind AI. Este vineri, 11 septembrie, și acesta este The Daily Diff.

0:53 Fabrica. Un singur prompt: construiește un Python cu fire virtuale și scope lexical. Astra și-a păstrat propriile notițe, și-a lansat proprii sub-agenți, și a rulat până când Armin a oprit-o, o zi și jumătate și aproximativ o mie două sute de dolari mai târziu. Șaptezeci și nouă de commit-uri, adică cincisprezece dolari și jumătate pe commit, ceea ce este aproximativ ceea ce percepe un om, cu excepția faptului că omul se oprește în cele din urmă. Codul este povestea. În loc de instrumentul de editare, Astra patch-uiește fișiere C prin redirijarea de heredoc-uri Python care citesc fișierul, înlocuiesc o funcție și o scriu înapoi.

1:20 Pentru a rula un test Windows, a scris Python care a generat Node care a generat PowerShell, o stivă de apeluri cu un pașaport. Testele unitare pe care le-a comis nu au deloc spații albe, deoarece fără indentare sunt cu zece la sută mai ieftine în token-uri. Și lista de sarcini a deviat de la unu, doi, trei la sarcina 8b2c2b2b checkpoint unu, așa știi că internul a fost singur prea mult timp. Teoria lui Armin: modelul este recompensat pentru finalizarea sarcinilor lungi și abia pedepsit pentru codul urât, astfel încât apelurile de instrumente cu token-uri reduse se scurg în baza de cod,

1:48 și cu cât mai puțini oameni se uită, cu atât contează mai puțin. A intitulat acea secțiune „Este AGI dacă nu te uiți”. Hacker News a adăugat economia: mai mult cod înseamnă mai multe token-uri pentru a-l menține, ceea ce face din dezordine nu un bug, ci o subscripție. Poți măsura dezordinea? Propria companie a lui Armin a încercat asta săptămâna aceasta. Earendil a rulat numerele SlopCodeBench: codul agentului este de aproximativ două ori mai verbos și de două ori mai erodat decât depozitele umane cu care este comparat,

2:10 și când benchmark-ul șterge memoria agentului între punctele de control, rata de trecere strictă pentru fiecare model testat este zero. Cea mai fiabilă metrică a dezordinii pe care au găsit-o a fost numărul brut de linii, care încetează să funcționeze în momentul în care cineva optimizează pentru ea, așa că, vă rog, nu spuneți modelelor. Apoi portofelul. RTK are șaptezeci și nouă de mii de stele pe GitHub și miniaturi pe YouTube care promit să înjumătățească factura Claude Code; comprimă ieșirea terminalului înainte ca agentul

2:34 să o citească. Quesma a rulat-o pe Terminal-Bench pentru o mie cinci sute de dolari în token-uri. Cu Fable, factura a scăzut cu cinci procente, aproape în totalitate dintr-o singură sarcină; cu DeepSeek sarcina medie a devenit cu șaptesprezece procente mai scumpă. Între timp, propriul contor al RTK a raportat optzeci și nouă la sută economisite, deoarece numără byte-urile eliminate, nu turele suplimentare cauzate: un contor inteligent care facturează vecinul. Și o eroare de versiune a rescris find într-o comandă care a eșuat, trei sute treizeci și nouă de ori la rând, la de nouă ori prețul.

3:01 Instrumentul care ucide token-urile are o buclă. Inundația în sine. SWE-2 de la Cognition este Kimi K3, modelul chinezesc deschis, post-antrenat până când se potrivește cu Fable 5.1 pe propriul benchmark al Cognition la o treime din preț; Hacker News: de ce toate modelele AI americane sunt, practic, Kimi într-un palton. Pe Terminal-Bench 2.1 domină întregul tabel; pe Terminal-Bench 4, cel pe care nimeni nu l-a memorat încă, obține douăzeci și șapte față de cincizeci și șase ale lui Fable,

3:28 așa că, pe benchmark-urile de prezentare, cea mai bună coloană este examenul pe care toată lumea l-a trecut deja. Cognition a anunțat și Devin Voice, inginerul tău software AI preferat tocmai a primit un telefon fix, pentru că singurul lucru care lipsea codării agentice era muzica de așteptare. OpenAI, în aceeași zi: API-ul Agents, care este cablajul Codex vândut ca serviciu. OpenAI rulează sandbox-ul, numai cu rezidență de date în SUA, fără reținere zero-date, așa că agentul își amintește baza de cod la fel de bine ca ChatGPT. Apoi OpenAI a întrerupt înscrierile pentru planul Pro de două sute de dolari,

3:57 deoarece cererea pentru Astra este, citez, fără precedent: primul produs cu o listă de așteptare pentru a plăti mai mult. Armin a efectuat o resetare completă a fabricii sale. El este cererea. Ceea ce ne aduce la Ask HN de vineri: putem, vă rog, să limităm fluxul de știri AI, șase sute cincizeci și șase de puncte, pentru că, citez, de fiecare dată când cineva de la OpenAI sau Anthropic scoate un vânt, există o postare în top zece.

4:17 Răspunsurile au fost filtre: hcker dot news elimină poveștile AI cu un clasificator BERT antrenat pe opt mii de exemple, AI pentru a șterge AI, crescut cu iarbă; și o expresie regulată uBlock care se potrivește cu A-I indiferent de majuscule/minuscule, de asemenea, șterge e-mail, zilnic, principal, domeniu și tren, deci expresia regulată, ca întotdeauna, este răufăcătorul. În aceeași după-amiază, patru sute cincisprezece comentarii s-au certat despre o pagină de asistență Claude care spunea că Claude este pentru 18+.

4:38 Pagina este datată mai. Nimic nu s-a schimbat. Chiar și știrile AI care nu sunt știri sunt știri, ceea ce, sincer, este și modelul meu de afaceri. Dacă preferați să citiți asta decât să mă auziți spunând-o, diff-ul ajunge în căsuța dvs. de e-mail în fiecare dimineață — gratuit la the daily diff dot dev, link mai jos. Este, inevitabil, știri AI. Deci — verdictul de astăzi despre fabrica de software de treizeci și cinci de ore: revert. Șaptezeci și nouă de commit-uri pe care nimeni nu le-a citit nu sunt o bază de cod, ci o datorie cu un log git;

5:04 Astra este impresionantă, iar fabrica este partea care trebuie anulată. Și asta e diff-ul pentru astăzi. Sunt Niko de la Axrisi. Îmbină responsabil.

Surse

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

Videoclipuri similare