+− THE DAILY DIFFdev & AI news
REVERT

Armin Ronacher deixou GPT-6 Astra só durante 35 horas.

Armin Ronacher (Flask, Jinja) deulle a GPT-6 Astra unha instrución e deixouno só durante 35 horas: preto dun billón de tokens, uns 1.200 $, 79 "commits", 75.000 liñas — e "absolutamente nada de valor".

Armin Ronacher (Flask, Jinja) deulle a GPT-6 Astra unha instrución e deixouno só durante 35 horas: preto dun billón de tokens, uns 1.200 $, 79 "commits", 75.000 liñas — e "absolutamente nada de valor". O código que recuperou é a historia: ficheiros C parcheados por "heredocs" de "string-splicing" de Python, Python xerando Node xerando PowerShell, probas unitarias co espazo en branco eliminado porque é un 10 % máis barato en tokens. Dúas medicións apóianno: os números de SlopCodeBench de Earendil (código de axente aproximadamente dúas veces máis verboso e erosionado que os repositorios humanos, taxa de aprobación estrita do 0 %) e o "benchmark" de 1.500 $ de Quesma de RTK (79k estrelas, "89 % de tokens aforrados" no seu propio contador, +17 % por tarefa con DeepSeek). Tamén: SWE-2 de Cognition (Kimi K3 cunha gabardina, 92,8 en Terminal-Bench 2.1 vs 27,3 en Terminal-Bench 4), a API de Axentes de OpenAI e as inscricións Pro de 200 $ en pausa, e o venres Hacker News pediu menos noticias de IA. Veredito: REVERT.

Ler a edición escrita (inglés) ↗

Que abrangue este vídeo

  • Armin Ronacher: 35 h de GPT-6 Astra sen vixilancia, ~1.200 $, 79 "commits", +75k liñas, nada enviado
  • Earendil / SlopCodeBench: código de axente ~2× máis verboso e erosionado que os repositorios humanos; taxa de aprobación estrita 0 %
  • Quesma: RTK informa dun 89 % de tokens aforrados, pero os custos de Terminal-Bench aumentan un 17 % con DeepSeek; un bucle de reescritura fallou 339 veces seguidas
  • Cognition SWE-2: pos-entrenado de Kimi K3, coincide con Fable 5.1 en FrontierCode a un terzo do prezo; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
  • API de Axentes de OpenAI (o "harness" de Codex como servizo, só nos EUA, sen ZDR); inscricións Pro de 200 $ en pausa pola demanda de Astra

Transcrición traducida

Traducido da narración orixinal en inglés. O audio e os subtítulos dispoñibles son controlados por YouTube.

0:00 Armin Ronacher, o home que escribiu Flask, deulle a GPT-6 Astra unha única instrución e deixouno só durante trinta e cinco horas. Volveu con setenta e cinco mil liñas de código e, nas súas palabras, absolutamente nada de valor, o que a converte na fábrica de software máis realista xamais construída. Publicou o informe o mércores. O xoves, Cognition enviou SWE-2 e OpenAI enviou unha API de Axentes e puxo en pausa as inscricións para o seu plan de douscentos dólares,

0:24 porque Astra consumiu os servidores. E o venres o informe chegou á portada de Hacker News, unhas filas debaixo dunha publicación que pedía a Hacker News que por favor deixase de publicar sobre IA. Neste vídeo: o que produce un día e medio de Astra sen supervisión, dúas medidas que converten a "slop" nun número, por que unha ferramenta con setenta e nove mil estrelas aumenta a túa factura, e como Hacker News intentou filtrar a IA, usando IA. É venres, 11 de setembro, e este é The Daily Diff.

0:53 A fábrica. Unha instrución: construír un Python con "virtual threads" e "lexical scoping". Astra gardou as súas propias notas, creou os seus propios subaxentes, e funcionou ata que Armin o desconectou, un día e medio e uns mil douscentos dólares despois. Setenta e nove "commits", o que fai quince dólares e medio por "commit", que é aproximadamente o que cobra un humano, excepto que o humano finalmente para. O código é a historia. En lugar da ferramenta de edición, Astra "parchea" ficheiros C mediante a canalización de "heredocs" de Python que leen o ficheiro, substitúen unha función por cadeas e o volven escribir.

1:20 Para executar unha proba de Windows, escribiu Python que xerou Node que xerou PowerShell, unha pila de chamadas cun pasaporte. As probas unitarias que "comiteou" non teñen espazo en branco en absoluto, porque sen sangría son un dez por cento máis baratas en tokens. E a lista de tarefas pasou de un, dous, tres a tarefa 8b2c2b2b punto de control un, que é como sabes que o becario estivo só demasiado tempo. A teoría de Armin: o modelo é recompensado por rematar tarefas longas e apenas castigado por código feo, polo que as chamadas a ferramentas "token-golfed" fíltranse na base de código,

1:48 e cantos menos humanos miren, menos importa. Titulou esa sección "É AGI se non miras". Hacker News engadiu a economía: máis código significa máis tokens para mantelo, o que fai que "slop" non sexa un erro senón unha subscrición. Pódese medir o "slop"? A propia empresa de Armin intentouno esta semana. Earendil executou os números de SlopCodeBench: o código do axente é aproximadamente o dobre de verboso e o dobre de erosionado que os repositorios humanos cos que se compara,

2:10 e cando o "benchmark" borra a memoria do axente entre os puntos de control, a taxa de aprobación estrita para cada modelo que probaron é cero. A métrica de "slop" máis fiable que atoparon foi a conta de liñas en bruto, que deixa de funcionar no momento en que alguén optimiza para ela, así que por favor non llo digas aos modelos. Despois a carteira. RTK ten setenta e nove mil estrelas en GitHub e miniaturas de YouTube que prometen reducir á metade a túa factura de Claude Code; comprime a saída do terminal antes de que o axente

2:34 o lea. Quesma executouno en Terminal-Bench por mil cincocentos dólares de tokens. Con Fable a factura baixou un cinco por cento, case todo por unha tarefa; con DeepSeek a tarefa media volveuse un dezasete por cento máis cara. Mentres tanto, o propio contador de RTK informou dun aforro do oitenta e nove por cento, porque conta os bytes eliminados, non os xiros extra causados: un contador intelixente que factura ao veciño. E un erro de versión reescribiu "find" nun comando que fallou, trescentas trinta e nove veces seguidas, a nove veces o prezo.

3:01 A ferramenta que mata tokens ten un bucle. A propia inundación. SWE-2 de Cognition é Kimi K3, o modelo chinés aberto, pos-entrenado ata que coincide con Fable 5.1 no propio "benchmark" de Cognition a un terzo do prezo; Hacker News: por que todos os modelos de IA americanos son basicamente Kimi cunha gabardina. En Terminal-Bench 2.1 encabeza toda a táboa; en Terminal-Bench 4, o que ninguén memorizou aínda, obtén vinte e sete fronte aos cincuenta e seis de Fable,

3:28 polo que nos "benchmarks" de presentación a mellor columna é o exame que todos xa aprobaron. Cognition tamén anunciou Devin Voice, o teu enxeñeiro de software de IA favorito acaba de ter un teléfono fixo, porque o que lle faltaba á codificación axéntica era música de espera. OpenAI, o mesmo día: a API de Axentes, que é o "harness" de Codex vendido como servizo. OpenAI executa o "sandbox", só residencia de datos nos EUA, sen retención de datos cero, polo que o axente lembra a túa base de código exactamente tan ben como o fai ChatGPT. Despois OpenAI puxo en pausa as inscricións para o plan Pro de douscentos dólares,

3:57 porque a demanda de Astra é, cito, sen precedentes: o primeiro produto cunha lista de espera para pagar máis. Armin queimou un reinicio completo na súa fábrica. El é a demanda. O que nos leva á pregunta de Hacker News do venres: podemos limitar a inundación de noticias de IA, seiscentos cincuenta e seis puntos, porque, cito, cada vez que alguén en OpenAI ou Anthropic se tira un peido, hai unha publicación entre as dez primeiras.

4:17 As respostas foron filtros: hcker.news elimina as historias de IA cun clasificador BERT adestrado con oito mil exemplos, IA para eliminar IA, alimentado con herba; e unha expresión regular de uBlock que coincide con AI sen distinción de maiúsculas e minúsculas tamén elimina correo electrónico, diario, principal, dominio e tren, polo que a expresión regular, como sempre, é a malvada. Esa mesma tarde, catrocentos quince comentarios discutiron sobre unha páxina de soporte de Claude que dicía que Claude é para maiores de dezaoito anos.

4:38 A páxina está datada en maio. Nada cambiou. Mesmo as noticias de IA que non son noticias son noticias, o que, para ser xusto, tamén é o meu modelo de negocio. Se prefires ler isto que escoitarme dicilo, o "diff" chega á túa caixa de entrada cada mañá — gratis en thedailydiff.dev, ligazón debaixo. É, inevitablemente, noticias de IA. Entón — o veredito de hoxe sobre a fábrica de software de trinta e cinco horas: REVERT. Setenta e nove "commits" que ninguén leu non son unha base de código, é unha responsabilidade cun rexistro de git;

5:04 Astra é impresionante, e a fábrica é a parte que hai que reverter. E ese é o "diff" de hoxe. Son Niko de Axrisi. Fusiona con responsabilidade.

Fontes

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

Vídeos relacionados