+− THE DAILY DIFFdev & AI news
REVERT

Армін Ронахер пакінуў GPT-6 Astra адну на 35 гадзін.

Армін Ронахер (Flask, Jinja) даў GPT-6 Astra адну падказку і пакінуў яе адну на 35 гадзін: каля мільярда токенаў, каля 1200 долараў, 79 камітаў, 75 000 радкоў — і "абсалютна нічога вартага".

Армін Ронахер (Flask, Jinja) даў GPT-6 Astra адну падказку і пакінуў яе адну на 35 гадзін: каля мільярда токенаў, каля 1200 долараў, 79 камітаў, 75 000 радкоў — і "абсалютна нічога вартага". Код, які яна аднавіла, — гэта гісторыя: C-файлы, выпраўленыя Python-струменным heredocs, Python, які стварае Node, які стварае PowerShell, модульны тэст з выдаленымі прабеламі, таму што гэта на 10% танней у токенах. Два вымярэнні пацвярджаюць яго: лічбы SlopCodeBench ад Earendil (код агента прыкладна ў два разы больш шматслоўны і эрадзіраваны, чым чалавечыя сховішчы, 0% строгі паказчык праходжання) і тэст Quesma коштам 1500 долараў для RTK (79k зорак, "89% токенаў захавана" на ўласным лічыльніку, +17% за задачу з DeepSeek). Таксама: SWE-2 ад Cognition (Kimi K3 у плашчы, 92,8 на Terminal-Bench 2.1 супраць 27,3 на Terminal-Bench 4), API агентаў OpenAI і прыпыненыя падпіскі на Pro за 200 долараў, а таксама пятнічны Hacker News, які прасіў менш навін пра штучны інтэлект. Вердыкт: REVERT.

Чытаць пісьмовае выданне (англійская) ↗

Што ахоплівае гэта відэа

  • Армін Ронахер: 35 гадзін без нагляду GPT-6 Astra, ~$1200, 79 камітаў, +75k радкоў, нічога не адпраўлена
  • Earendil / SlopCodeBench: код агента ў ~2 разы больш шматслоўны і эрадзіраваны, чым чалавечыя сховішчы; строгі паказчык праходжання 0%
  • Quesma: RTK паведамляе пра 89% зэканомленых токенаў, але выдаткі Terminal-Bench павялічваюцца на 17% з DeepSeek; цыкл перазапісу праваліўся 339 разоў запар
  • Cognition SWE-2: пасля навучання ад Kimi K3, супадае з Fable 5.1 на FrontierCode за траціну кошту; TB 2.1 92.8 супраць TB 4 27.3; Devin Voice
  • API агентаў OpenAI (сэрвіс Codex harness, толькі для ЗША, без ZDR); прыпыненыя падпіскі на Pro за 200 долараў з-за попыту на Astra

Перакладзеная стэнаграма

Перакладзена з арыгінальнай англійскай агучкі. Даступнае аўдыя і субтытры кантралююцца YouTube.

0:00 Армін Ронахер, чалавек, які напісаў Flask, даў GPT-6 Astra адну падказку і пакінуў яе адну на трыццаць пяць гадзін. Яна вярнулася з сямюдзесяццю пяццю тысячамі радкоў кода і, паводле яго слоў, абсалютна нічога вартага, што робіць яе самай рэалістычнай фабрыкай праграмнага забеспячэння, калі-небудзь створанай. Ён апублікаваў артыкул у сераду. У чацвер Cognition выпусціла SWE-2, а OpenAI выпусціла API агентаў і прыпыніла падпіскі на свой план за дзвесце долараў,

0:24 таму што Astra з'ела серверы. І ў пятніцу артыкул трапіў на першую старонку Hacker News, праз некалькі радкоў ніжэй паста з просьбай да Hacker News, калі ласка, перастаць публікаваць пра штучны інтэлект. У гэтым відэа: што стварае паўтара дня без нагляду Astra, два вымярэнні, якія ператвараюць бязладдзе ў лік, чаму інструмент з сямюдзесяццю дзевяццю тысячамі зорак павялічвае ваш рахунак, і як Hacker News спрабаваў адфільтраваць штучны інтэлект, выкарыстоўваючы штучны інтэлект. Сёння пятніца, 11 верасня, і гэта The Daily Diff.

0:53 Фабрыка. Адна падказка: стварыць Python з віртуальнымі патокамі і лексічнай вобласцю бачнасці. Astra вяла свае запісы, запускала сваіх падагентаў, і працавала, пакуль Армін не выцягнуў вілку, праз паўтара дня і прыкладна тысячу дзвесце долараў. Сямідзесяць дзевяць камітаў, такім чынам, пятнаццаць з паловай долараў за каміт, што прыкладна тое, што бярэ чалавек, за выключэннем таго, што чалавек у канчатковым выніку спыняецца. Код — гэта гісторыя. Замест інструмента рэдагавання Astra выпраўляе файлы C, перадаючы Python heredocs, якія чытаюць файл, замяняюць функцыю і запісваюць яе назад.

1:20 Каб запусціць адзін тэст Windows, яна напісала Python, які стварыў Node, які стварыў PowerShell, стэк выклікаў з пашпартам. Модульныя тэсты, якія яна зафіксавала, зусім не маюць прабелаў, таму што без водступу яны на дзесяць працэнтаў танней у токенах. І спіс задач дрэйфаваў ад адной, дзвюх, трох да задачы 8b2c2b2b кантрольнай кропкі адзін, што сведчыць аб тым, што стажор занадта доўга быў адзін. Тэорыя Арміна: мадэль узнагароджваецца за выкананне доўгіх задач і амаль не караецца за непрыгожы код, таму выклікі інструментаў з токен-гольфам прасочваюцца ў кодавую базу,

1:48 і чым менш людзей глядзіць, тым менш гэта мае значэнне. Ён назваў гэты раздзел: Гэта AGI, калі вы не глядзіце. Hacker News дадаў эканамічны аспект: больш кода азначае больш токенаў для яго падтрымання, што робіць бязладдзе не памылкай, а падпіскай. Ці можна вымераць бязладдзе? Уласная кампанія Арміна паспрабавала гэта на гэтым тыдні. Earendil правёў лічбы SlopCodeBench: код агента прыкладна ў два разы больш шматслоўны і у два разы больш эрадзіраваны, чым чалавечыя сховішчы, з якімі ён параўноўваецца,

2:10 і калі тэст выдаляе памяць агента паміж кантрольнымі кропкамі, строгі паказчык праходжання для кожнай пратэставанай імі мадэлі роўны нулю. Найбольш надзейным паказчыкам бязладдзя, які яны знайшлі, была колькасць радкоў, які перастае працаваць, як толькі хто-небудзь пачынае аптымізаваць пад яго, таму, калі ласка, не кажыце мадэлям. Потым кашалёк. RTK мае семдзесят дзевяць тысяч зорак на GitHub і мініяцюры YouTube, якія абяцаюць паменшыць ваш рахунак Claude Code напалову; ён сціскае выхад тэрмінала перад тым, як агент

2:34 чытае яго. Quesma запусціла яго на Terminal-Bench за паўтары тысячы долараў токенаў. З Fable рахунак знізіўся на пяць працэнтаў, амаль увесь з адной задачы; з DeepSeek сярэдняя задача стала на семнаццаць працэнтаў даражэйшай. Між тым, уласны лічыльнік RTK паведаміў пра восемдзесят дзевяць працэнтаў зэканомленых, таму што ён лічыць выдаленыя байты, а не выкліканыя дадатковыя абароты: разумны лічыльнік, які выстаўляе рахункі суседу. І адна памылка ў версіі перапісала find у каманду, якая правалілася, трыста трыццаць дзевяць разоў запар, у дзевяць разоў даражэй.

3:01 Інструмент, які забівае токены, мае цыкл. Сама паводка. SWE-2 ад Cognition — гэта Kimi K3, адкрытая кітайская мадэль, пасля навучання, пакуль яна не супадае з Fable 5.1 па ўласным тэсту Cognition за траціну кошту; Hacker News: чаму ўсе амерыканскія мадэлі AI у асноўным Kimi у плашчы. На Terminal-Bench 2.1 яна займае першае месца ва ўсёй табліцы; на Terminal-Bench 4, той, якую ніхто яшчэ не запомніў, яна набірае дваццаць сем супраць пяцідзесяці шасці Fable,

3:28 таму на тэстах слайд-дэка лепшы слупок — гэта экзамен, які ўсе ўжо здалі. Cognition таксама анансавала Devin Voice, ваш любімы інжынер па праграмным забеспячэнні AI толькі што атрымаў стацыянарны тэлефон, таму што адзінае, чаго не хапала агенцкаму кадаванню, была музыка на ўтрыманні. OpenAI, у той жа дзень: API агентаў, які з'яўляецца Codex harness, які прадаецца як паслуга. OpenAI запускае пясочніцу, толькі з рэзідэнцтвам даных у ЗША, без захавання нулявых даных, таму агент памятае вашу кодавую базу роўна так жа добра, як ChatGPT. Потым OpenAI прыпыніла падпіскі на двухсотдоларовы план Pro,

3:57 таму што попыт на Astra, цытата, беспрэцэдэнтны: першы прадукт са спісам чакання, каб плаціць больш. Армін спаліў поўны скід на сваёй фабрыцы. Ён — попыт. Што прыводзіць нас да пятнічнага Ask HN: ці можам мы, калі ласка, абмежаваць паток навін AI, шэсцьсот пяцьдзесят шэсць пунктаў, таму што, цытата, кожны раз, калі нехта ў OpenAI або Anthropic пускае ветры, з'яўляецца топ-дзесяць паст.

4:17 Адказы былі фільтры: hcker dot news выдаляе гісторыі AI з класіфікатарам BERT, навучаным на васьмі тысячах прыкладаў, AI для выдалення AI, натуральны; і uBlock regex, які супастаўляе A-I без уліку рэгістра, таксама выдаляе электронную пошту, штодзённую, асноўную, дамен і навучальную, таму regex, як заўсёды, з'яўляецца злыднем. У той жа дзень пасля абеду, чатырыста пятнаццаць каментарыяў спрачаліся пра старонку падтрымкі Claude, дзе сказана, што Claude прызначаны для 18+.

4:38 Старонка датуецца маем. Нічога не змянілася. Нават навіны AI, якія не з'яўляюцца навінамі, з'яўляюцца навінамі, што, справядлівасці дзеля, таксама мая бізнес-мадэль. Калі вы аддаеце перавагу чытаць гэта, чым чуць, як я гэта кажу, дыф трапляе ў вашу паштовую скрыню кожную раніцу — бясплатна на the daily diff dot dev, спасылка ніжэй. Гэта, непазбежна, навіны AI. Такім чынам — сённяшні вердыкт па трыццаціпяцігадзіннай фабрыцы праграмнага забеспячэння: REVERT. Сямідзесяць дзевяць камітаў, якія ніхто не чытаў, — гэта не кодавая база, гэта абавязацельства з git

5:04 логам; Astra ўражвае, і фабрыка — гэта тая частка, якую трэба адкаціць. І гэта ўсё на сёння. Я Ніка з Axrisi. Аб'ядноўвайце адказна.

Крыніцы

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

Звязаныя відэа

daily · be · 1 кас 2026 г.

Gemini 4 Argon — найлепшая мадэль Google. Вы пакуль не можаце ёй карыстацца.

Google анансаваў Gemini 4 Argon, сваю новую мадэль мяжы, і толькі правераныя кібер-абаронцы могуць ёю карыстацца. Вось што паказвае ўласная 19-радковая табліца параўнання Google, што вымераў незалежны

4:53 ↗