Armin Ronacher deixou o GPT-6 Astra sozinho por 35 horas.
Armin Ronacher (Flask, Jinja) deu ao GPT-6 Astra um prompt e o deixou sozinho por 35 horas: cerca de um bilhão de tokens, cerca de US$ 1.200, 79 commits, 75.000 linhas — e "absolutamente nada de valor".
Armin Ronacher (Flask, Jinja) deu ao GPT-6 Astra um prompt e o deixou sozinho por 35 horas: cerca de um bilhão de tokens, cerca de US$ 1.200, 79 commits, 75.000 linhas — e "absolutamente nada de valor". O código que ele recuperou é a história: arquivos C corrigidos por heredocs de "string-splicing" do Python, Python gerando Node que gera PowerShell, testes de unidade com os espaços em branco removidos porque é 10% mais barato em tokens. Duas medições o apoiam: os números do SlopCodeBench de Earendil (código de agente cerca de duas vezes mais verboso e corroído que repositórios humanos, taxa de aprovação estrita de 0%) e o benchmark de US$ 1.500 de Quesma para RTK (79k estrelas, "89% de tokens economizados" em seu próprio contador, +17% por tarefa com DeepSeek). Além disso: SWE-2 da Cognition (Kimi K3 em um casaco, 92.8 no Terminal-Bench 2.1 vs 27.3 no Terminal-Bench 4), Agents API da OpenAI e inscrições pausadas de US$ 200 Pro, e o Hacker News de sexta-feira pediu menos notícias de IA. Veredito: REVERT.
Leia a edição escrita (Inglês) ↗
O que este vídeo aborda
- Armin Ronacher: 35 h de GPT-6 Astra autônomo, ~$1.200, 79 commits, +75k linhas, nada enviado
- Earendil / SlopCodeBench: código de agente ~2× mais verboso e corroído que repositórios humanos; taxa de aprovação estrita de 0%
- Quesma: RTK relata 89% de tokens economizados, mas os custos do Terminal-Bench aumentam 17% com DeepSeek; um loop de reescrita falhou 339 vezes consecutivas
- Cognition SWE-2: pós-treinado a partir do Kimi K3, corresponde ao Fable 5.1 no FrontierCode por um terço do preço; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
- OpenAI Agents API (o "Codex harness" como um serviço, apenas nos EUA, sem ZDR); inscrições Pro de US$ 200 pausadas devido à demanda por Astra
Transcrição traduzida
Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.
0:00 Armin Ronacher, o homem que escreveu Flask, deu ao GPT-6 Astra um único prompt e o deixou sozinho por trinta e cinco horas. Ele voltou com setenta e cinco mil linhas de código e, em suas palavras, absolutamente nada de valor, o que a torna a mais realista fábrica de software já construída. Ele publicou o relatório na quarta-feira. Na quinta-feira, a Cognition lançou o SWE-2, e a OpenAI lançou uma Agents API e pausou as inscrições para seu plano de duzentos dólares,
0:24 porque o Astra consumiu os servidores. E na sexta-feira o relatório chegou à primeira página do Hacker News, algumas linhas abaixo de um post pedindo ao Hacker News para parar de postar sobre IA. Neste vídeo: o que um dia e meio de Astra sem supervisão produz, duas medições que transformam a "bagunça" em um número, por que uma ferramenta com setenta e nove mil estrelas aumenta sua conta, e como o Hacker News tentou filtrar IA, usando IA. É sexta-feira, 11 de setembro, e este é The Daily Diff.
0:53 A fábrica. Um prompt: construir um Python com "virtual threads" e "lexical scoping". Astra manteve suas próprias notas, criou seus próprios subagentes, e funcionou até que Armin desligasse a tomada, um dia e meio e cerca de mil e duzentos dólares depois. Setenta e nove commits, ou seja, quinze dólares e meio por commit, o que é aproximadamente o que um humano cobra, exceto que o humano eventualmente para. O código é a história. Em vez da ferramenta de edição, Astra corrige arquivos C passando heredocs de Python que leem o arquivo, substituem uma função por uma string e o reescrevem.
1:20 Para executar um teste do Windows, ele escreveu Python que gerou Node que gerou PowerShell, uma pilha de chamadas com um passaporte. Os testes de unidade que ele comitou não têm nenhum espaço em branco, porque sem indentação eles são dez por cento mais baratos em tokens. E a lista de tarefas mudou de um, dois, três para a tarefa 8b2c2b2b checkpoint um, que é como você sabe que o estagiário está sozinho há muito tempo. A teoria de Armin: o modelo é recompensado por concluir tarefas longas e quase não punido por código feio, então as chamadas de ferramentas otimizadas por tokens vazam para a base de código,
1:48 e quanto menos humanos olham, menos isso importa. Ele intitulou aquela seção "É AGI Se Você Não Olhar". O Hacker News adicionou a economia: mais código significa mais tokens para mantê-lo, o que torna a "bagunça" não um bug, mas uma assinatura. Você consegue medir a "bagunça"? A própria empresa de Armin tentou esta semana. Earendil executou os números do SlopCodeBench: o código do agente é cerca de duas vezes mais verboso e duas vezes mais corroído do que os repositórios humanos com os quais é comparado,
2:10 e quando o benchmark limpa a memória do agente entre os checkpoints, a taxa de aprovação estrita para cada modelo que eles testaram é zero. A métrica de "bagunça" mais confiável que eles encontraram foi a contagem bruta de linhas, que para de funcionar no momento em que alguém otimiza para ela, então, por favor, não contem aos modelos. Então a carteira. RTK tem setenta e nove mil estrelas no GitHub e miniaturas do YouTube prometendo reduzir pela metade sua conta do Claude Code; ele comprime a saída do terminal antes que o agente
2:34 a leia. Quesma o executou no Terminal-Bench por quinze mil dólares em tokens. Com Fable, a conta caiu cinco por cento, quase tudo de uma tarefa; com DeepSeek a tarefa média ficou dezessete por cento mais cara. Enquanto isso, o próprio contador do RTK relatou oitenta e nove por cento economizados, porque ele conta bytes removidos, não turnos extras causados: um medidor inteligente que cobra o vizinho. E um bug de versão reescreveu "find" para um comando que falhou, trezentas e trinta e nove vezes consecutivas, por nove vezes o preço.
3:01 A ferramenta que mata tokens tem um loop. A própria inundação. O SWE-2 da Cognition é o Kimi K3, o modelo chinês aberto, pós-treinado até que ele corresponda ao Fable 5.1 no próprio benchmark da Cognition por um terço do preço; Hacker News: por que todos os modelos de IA americanos são basicamente Kimi em um casaco de trincheira. No Terminal-Bench 2.1 ele lidera toda a tabela; no Terminal-Bench 4, aquele que ninguém memorizou ainda, ele marca vinte e sete contra cinquenta e seis do Fable,
3:28 então nos benchmarks de "slide-deck" a melhor coluna é o exame que todos já passaram. A Cognition também anunciou o Devin Voice, seu software de IA favorito engenheiro acabou de ganhar um telefone fixo, porque a única coisa que faltava à codificação "agêntica" era música de espera. OpenAI, no mesmo dia: a Agents API, que é o "Codex harness" vendido como um serviço. A OpenAI executa o sandbox, apenas residência de dados nos EUA, sem retenção de dados zero, então o agente lembra sua base de código exatamente tão bem quanto o ChatGPT. Então a OpenAI pausou as inscrições para o plano Pro de duzentos dólares,
3:57 porque a demanda por Astra é, cito, sem precedentes: o primeiro produto com lista de espera para pagar mais. Armin fez um "reset" completo em sua fábrica. Ele é a demanda. O que nos leva ao Ask HN de sexta-feira: podemos por favor limitar a enxurrada de notícias de IA, seiscentos e cinquenta e seis pontos, porque, cito, toda vez que alguém da OpenAI ou Anthropic peida, há um post no top dez.
4:17 As respostas foram filtros: hcker dot news remove histórias de IA com um classificador BERT treinado em oito mil exemplos, IA para deletar IA, "grass-fed"; e uma regex uBlock correspondendo a A-I sem distinção de maiúsculas e minúsculas também exclui email, daily, main, domain e train, então a regex, como sempre, é o vilão. Mesma tarde, quatrocentas e quinze comentários discutiram sobre uma página de suporte do Claude dizendo que Claude é para maiores de dezoito anos.
4:38 A página é de maio. Nada mudou. Mesmo a notícia de IA que não é notícia é notícia, o que, para ser justo, também é o meu modelo de negócios. Se você preferir ler isso a me ouvir dizer, o "diff" chega na sua caixa de entrada todas as manhãs — gratuito em the daily diff dot dev, link abaixo. É, inevitavelmente, notícia de IA. Então — o veredito de hoje sobre a fábrica de software de trinta e cinco horas: REVERT. Setenta e nove commits que ninguém leu não são uma base de código, são um passivo com um "git
5:04 log"; Astra é impressionante, e a fábrica é a parte a ser revertida. E esse é o "diff" de hoje. Sou Niko da Axrisi. Faça o "merge" com responsabilidade.
Fontes
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



