Armin Ronacher ließ GPT-6 Astra 35 Stunden lang allein.
Armin Ronacher (Flask, Jinja) gab GPT-6 Astra einen Prompt und ließ es 35 Stunden lang allein: etwa eine Milliarde Tokens, etwa 1.200 $, 79 Commits, 75.000 Zeilen – und "absolut nichts von Wert".
Armin Ronacher (Flask, Jinja) gab GPT-6 Astra einen Prompt und ließ es 35 Stunden lang allein: etwa eine Milliarde Tokens, etwa 1.200 $, 79 Commits, 75.000 Zeilen – und "absolut nichts von Wert". Der Code, den es generierte, ist die Geschichte: C-Dateien, die mit Python-String-Splicing-Heredocs gepatcht wurden, Python, das Node, das PowerShell startet, Unit-Tests, bei denen der Whitespace entfernt wurde, weil dies 10 % billiger an Tokens ist. Zwei Messungen stützen ihn: Earendils SlopCodeBench-Zahlen (Agenten-Code etwa doppelt so ausführlich und erodiert wie menschliche Repos, 0 % strenge Erfolgsquote) und Quesmas 1.500 $-Benchmark von RTK (79k Sterne, "89 % Tokens gespart" auf dem eigenen Zähler, +17 % pro Aufgabe mit DeepSeek). Außerdem: Cognitions SWE-2 (Kimi K3 im Trenchcoat, 92,8 auf Terminal-Bench 2.1 vs. 27,3 auf Terminal-Bench 4), OpenAIs Agents API und die pausierten 200 $-Pro-Anmeldungen, und der Freitag-Hacker News fragte nach weniger KI-Nachrichten. Urteil: REVERT.
Die schriftliche Ausgabe lesen (Englisch) ↗
Was dieses Video behandelt
- Armin Ronacher: 35 Stunden unbeaufsichtigte GPT-6 Astra, ~1.200 $, 79 Commits, +75.000 Zeilen, nichts ausgeliefert
- Earendil / SlopCodeBench: Agenten-Code ~2× so ausführlich und erodiert wie menschliche Repos; strenge Erfolgsquote 0 %
- Quesma: RTK meldet 89 % gesparte Tokens, aber die Terminal-Bench-Kosten steigen mit DeepSeek um 17 %; eine Umschreibeschleife schlug 339 Mal hintereinander fehl
- Cognition SWE-2: nachtrainiert von Kimi K3, entspricht Fable 5.1 auf FrontierCode zu einem Drittel des Preises; TB 2.1 92,8 vs. TB 4 27,3; Devin Voice
- OpenAI Agents API (das Codex-Harness als Dienst, nur USA, kein ZDR); 200 $-Pro-Anmeldungen wegen Astra-Nachfrage pausiert
Übersetztes Transkript
Aus der englischen Originalerzählung übersetzt. Verfügbare Audio- und Untertitel werden von YouTube gesteuert.
0:00 Armin Ronacher, der Mann, der Flask schrieb, gab GPT-6 Astra einen einzigen Prompt und ließ es fünfunddreißig Stunden lang allein. Es kam mit fünfundsiebzigtausend Zeilen Code zurück und, in seinen Worten, absolut nichts von Wert, was es zur realistischsten Softwarefabrik macht, die je gebaut wurde. Er veröffentlichte den Bericht am Mittwoch. Am Donnerstag lieferte Cognition SWE-2 aus, und OpenAI lieferte eine Agents API aus und pausierte Anmeldungen für seinen Zweihundert-Dollar-Plan,
0:24 weil Astra die Server aufgefressen hat. Und am Freitag erreichte der Bericht die Startseite von Hacker News, ein paar Zeilen unter einem Beitrag, der Hacker News bat, bitte nicht mehr über KI zu posten. In diesem Video: was anderthalb Tage unbeaufsichtigte Astra produzieren, zwei Messungen, die Schlamperei in eine Zahl verwandeln, warum ein Tool mit neunundsiebzigtausend tausend Sternen Ihre Rechnung erhöht, und wie Hacker News versuchte, KI mit Hilfe von KI zu filtern. KI, mit KI. Es ist Freitag, der 11. September, und dies ist The Daily Diff.
0:53 Die Fabrik. Ein Prompt: Baue ein Python mit virtuellen Threads und lexikalischer Bereichsdefinition. Astra führte seine eigenen Notizen, startete seine eigenen Subagenten, und lief, bis Armin den Stecker zog, anderthalb Tage und etwa zwölhundert Dollar später. Neunundsiebzig Commits, also fünfzehn und eineinhalb Dollar pro Commit, was ungefähr dem entspricht, was ein Mensch verlangt, außer dass der Mensch irgendwann aufhört. Der Code ist die Geschichte. Anstelle des Bearbeitungswerkzeugs patcht Astra C-Dateien, indem es Python-Heredocs pipet, die die Datei lesen, eine Funktion per String-Replace einfügen und zurückschreiben.
1:20 Um einen Windows-Test auszuführen, schrieb es Python, das Node, das PowerShell startete, einen Call-Stack mit Pass. Die Unit-Tests, die es committete, haben überhaupt keine Leerzeichen, weil sie ohne Einrückung zehn Prozent billiger in Tokens sind. Und die Aufgabenliste driftete von eins, zwei, drei zu Aufgabe 8b2c2b2b Checkpoint eins, woran man erkennt, dass der Praktikant zu lange allein war. Armins Theorie: Das Modell wird für das Beenden langer Aufgaben belohnt und kaum für hässlichen Code bestraft, so dass Token-optimierte Tool-Aufrufe in die Codebasis gelangen,
1:48 und je weniger Menschen hinschauen, desto weniger spielt es eine Rolle. Er betitelte diesen Abschnitt Es ist AGI, wenn man nicht hinsieht. Hacker News fügte die Wirtschaftlichkeit hinzu: mehr Code bedeutet mehr Tokens, um ihn zu pflegen, was Schlamperei nicht zu einem Fehler, sondern zu einem Abonnement macht. Kann man Schlamperei messen? Armins eigenes Unternehmen hat es diese Woche versucht. Earendil berechnete die SlopCodeBench-Zahlen: Agenten-Code ist etwa doppelt so ausführlich und doppelt so erodiert wie die menschlichen Repos, mit denen er verglichen wird,
2:10 und wenn der Benchmark den Speicher des Agenten zwischen den Checkpoints löscht, beträgt die strenge Erfolgsquote für jedes getestete Modell null. Die zuverlässigste Schlamperei-Metrik, die sie fanden, war die reine Zeilenzahl, was aufhört zu funktionieren, sobald jemand dafür optimiert, also bitte nicht den Modellen erzählen. Dann die Brieftasche. RTK hat neunundsiebzigtausend GitHub-Sterne und YouTube-Thumbnails, die versprechen, Ihre Claude Code-Rechnung zu halbieren; es komprimiert die Terminalausgabe, bevor der Agent
2:34 sie liest. Quesma ließ es für fünfzehnhundert Dollar an Tokens auf Terminal-Bench laufen. Mit Fable sank die Rechnung um fünf Prozent, fast alles von einer Aufgabe; mit DeepSeek wurde die durchschnittliche Aufgabe siebzehn Prozent teurer. Währenddessen meldete RTKs eigener Zähler neunundachtzig Prozent gespart, weil es entfernte Bytes zählt, nicht verursachte extra Züge: ein intelligenter Zähler, der den Nachbarn abrechnet. Und ein Versionsfehler schrieb 'find' in einen Befehl um, der fehlschlug, dreihundertneununddreißig Mal hintereinander, zum neunfachen Preis.
3:01 Das Tool, das Tokens tötet, hat eine Schleife. Die Flut selbst. Cognitions SWE-2 ist Kimi K3, das offene chinesische Modell, nachtrainiert, bis es Fable 5.1 auf Cognitions eigenem Benchmark zu einem Drittel des Preises entspricht; Hacker News: Warum sind alle amerikanischen KI-Modelle im Grunde Kimi im Trenchcoat. Auf Terminal-Bench 2.1 führt es die gesamte Tabelle an; auf Terminal-Bench 4, das noch niemand auswendig gelernt hat, erzielt es siebenundzwanzig Punkte gegenüber Fabels sechsundfünfzig,
3:28 also ist bei den Folien-Benchmarks die beste Spalte die Prüfung, die jeder schon bestanden hat. Cognition kündigte auch Devin Voice an, Ihren Lieblings-KI-Softwareentwickler, der gerade einen Festnetzanschluss bekommen hat, denn das Einzige, was dem agentenbasierten Codieren fehlte, war Wartemusik. OpenAI, am selben Tag: die Agents API, die das Codex-Harness als Dienst verkauft. OpenAI betreibt die Sandbox, nur US-Datenresidenz, keine Null-Daten-Aufbewahrung, so dass der Agent Ihre Codebasis genauso gut speichert wie ChatGPT. Dann pausierte OpenAI die Anmeldungen für den zweihundert Dollar teuren Pro-Plan,
3:57 weil die Astra-Nachfrage, Zitat, beispiellos ist: das erste Produkt mit einer Warteliste um mehr zu zahlen. Armin brannte einen vollständigen Reset in seiner Fabrik ab. Er ist die Nachfrage. Was uns zu Freitags Ask HN bringt: Können wir bitte die KI-Nachrichtenflut begrenzen, sechshundertsechsundfünfzig Punkte, weil, Zitat, jedes Mal, wenn jemand bei OpenAI oder Anthropic furzt, gibt es einen Top-Ten-Beitrag.
4:17 Die Antworten waren Filter: hcker.news entfernt KI-Geschichten mit einem BERT Klassifikator, der auf achttausend Beispielen trainiert wurde, KI, um KI zu löschen, grasgefüttert; und ein uBlock-Regex, das A-I case-insensitiv abgleicht, löscht auch E-Mail, täglich, Haupt-, Domain und Zug, so dass das Regex, wie immer, der Bösewicht ist. Am selben Nachmittag, vierhundertfünfzehn Kommentare diskutierten über eine Claude-Supportseite, die besagt, dass Claude achtzehn plus ist.
4:38 Die Seite ist vom Mai datiert. Nichts hat sich geändert. Sogar die KI-Nachrichten, die keine Nachrichten sind, sind Nachrichten, was, um fair zu sein, auch mein Geschäftsmodell ist. Wenn Sie dies lieber lesen als mich sprechen zu hören, landet der Diff jeden Morgen in Ihrem Posteingang jeden Morgen – kostenlos unter thedailydiff.dev, Link unten. Es sind, unweigerlich, KI-Nachrichten. Also – das heutige Urteil zur fünfunddreißigstündigen Softwarefabrik: REVERT. Neunundsiebzig Commits, die niemand gelesen hat, sind keine Codebasis, sondern eine Verbindlichkeit mit einem Git-Log;
5:04 Astra ist beeindruckend, und die Fabrik ist der Teil, der rückgängig gemacht werden sollte. Und das ist der Diff für heute. Ich bin Niko von Axrisi. Verantwortungsbewusst mergen.
Quellen
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



