+− THE DAILY DIFFdev & AI news
REVERT

Արմին Ռոնախերը GPT-6 Astra-ին թողել է մենակ 35 ժամով։

Արմին Ռոնախերը (Flask, Jinja) GPT-6 Astra-ին տվել է մեկ հրահանգ և թողել այն մենակ 35 ժամով՝ մոտ մեկ միլիարդ թոքեն, մոտ $1,200, 79 քոմիթ, 75,000 տող — և «բացարձակապես ոչ մի արժեքավոր բան»։ Կոդը, որը նա վերականգնել է, պատմություն է.

Արմին Ռոնախերը (Flask, Jinja) GPT-6 Astra-ին տվել է մեկ հրահանգ և թողել այն մենակ 35 ժամով՝ մոտ մեկ միլիարդ թոքեն, մոտ $1,200, 79 քոմիթ, 75,000 տող — և «բացարձակապես ոչ մի արժեքավոր բան»։ Կոդը, որը նա վերականգնել է, պատմություն է. C ֆայլեր, որոնք կարկատված են Python-ի տողերի միացման heredocs-ով, Python-ը ստեղծում է Node-ը, որն էլ ստեղծում է PowerShell-ը, միավոր թեստեր՝ առանց բացատների, քանի որ դրանք 10% ավելի էժան են թոքեններում։ Նրան աջակցում են երկու չափումներ՝ Earendil-ի SlopCodeBench-ի թվերը (գործակալի կոդը մոտ երկու անգամ ավելի բազմաբառ ու քայքայված է, քան մարդկային ռեպոզիտորիաները, 0% խիստ անցողիկության մակարդակ) և Quesma-ի $1,500 RTK-ի բենչմարկը (79k աստղ, իր սեփական հաշվիչով «89% թոքեններ խնայված», +17% յուրաքանչյուր առաջադրանքի համար DeepSeek-ի հետ)։ Նաև՝ Cognition-ի SWE-2 (Kimi K3 թիկնոցով, 92.8 Terminal-Bench 2.1-ի վրա ընդդեմ 27.3 Terminal-Bench 4-ի վրա), OpenAI-ի Agents API-ը և դադարեցված $200 Pro գրանցումները, և ուրբաթ օրը Hacker News-ը խնդրել է ավելի քիչ AI նորություններ։ Դատավճիռը՝ REVERT։

Կարդացեք գրավոր տարբերակը (անգլերեն) ↗

Ինչ է ընդգրկում այս տեսանյութը

  • Արմին Ռոնախեր. 35 ժամ առանց հսկողության GPT-6 Astra, ~$1,200, 79 քոմիթ, +75k տող, ոչինչ չառաքվեց։
  • Earendil / SlopCodeBench. գործակալի կոդը ~2× ավելի բազմաբառ ու քայքայված է, քան մարդկային ռեպոզիտորիաները. խիստ անցողիկության մակարդակը 0% է։
  • Quesma. RTK-ը հաղորդում է 89% խնայված թոքեններ, բայց Terminal-Bench-ի արժեքները 17%-ով աճում են DeepSeek-ի հետ. վերաշարադրման ցիկլը ձախողվել է անընդմեջ 339 անգամ։
  • Cognition SWE-2. հետվերապատրաստված է Kimi K3-ից, համապատասխանում է Fable 5.1-ին FrontierCode-ի վրա՝ գնի մեկ երրորդով. TB 2.1 92.8 ընդդեմ TB 4 27.3. Devin Voice։
  • OpenAI Agents API (Codex-ի հարմարանքը որպես ծառայություն, միայն ԱՄՆ-ում, առանց ZDR). $200 Pro գրանցումները դադարեցվել են Astra-ի պահանջարկի պատճառով։

Թարգմանված արձանագրություն

Թարգմանվել է բնօրինակ անգլերեն պատմությունից։ Հասանելի աուդիո և ենթագրերը վերահսկվում են YouTube-ի կողմից։

0:00 Արմին Ռոնախերը՝ Flask-ը գրած մարդը, GPT-6 Astra-ին տվեց մեկ հրահանգ և այն թողեց մենակ երեսունհինգ ժամով։ Այն վերադարձավ յոթանասունհինգ հազար տող կոդով և, իր խոսքերով, բացարձակապես ոչ մի արժեքավոր բանով, ինչը այն դարձնում է ամենաիրատեսականը երբևէ կառուցված ծրագրային ապահովման գործարանը։ Նա հրապարակեց գրությունը չորեքշաբթի օրը։ Հինգշաբթի օրը Cognition-ը թողարկեց SWE-2-ը, իսկ OpenAI-ը՝ Agents API-ն և դադարեցրեց իր երկու հարյուր դոլարանոց պլանի գրանցումները,

0:24 քանի որ Astra-ն կերավ սերվերները։ Եվ ուրբաթ օրը գրությունը հասավ Hacker News-ի առաջին էջ, մի քանի տող ներքև մի գրառման, որը խնդրում էր Hacker News-ին դադարեցնել AI-ի մասին գրառումները։ Այս տեսանյութում. ինչ է արտադրում մեկ ու կես օր անվերահսկելի Astra-ն, երկու չափումներ, որոնք անփութությունը դարձնում են թիվ, ինչու է յոթանասունինը հազար աստղ ունեցող գործիքը մեծացնում ձեր հաշիվը, և ինչպես Hacker News-ը փորձեց զտել AI-ն՝ օգտագործելով AI։ Ուրբաթ է, սեպտեմբերի 11-ը, և սա The Daily Diff-ն է։

0:53 Գործարանը։ Մեկ հրահանգ. կառուցել Python՝ վիրտուալ թելերով և լեքսիկական շրջանակով։ Astra-ն պահեց իր նշումները, գործարկեց իր ենթագործակալներին, և աշխատեց մինչև Արմինը հանեց վարդակից՝ մեկ ու կես օր և մոտ տասներկու հարյուր դոլար անց։ Յոթանասունինը քոմիթ, այսինքն՝ տասնհինգ ու կես դոլար մեկ քոմիթի համար, ինչը մոտավորապես այն է, ինչ մարդն է գանձում, բացառությամբ, որ մարդն ի վերջո դադարում է։ Կոդը պատմությունն է։ Փոխանակ խմբագրման գործիքի, Astra-ն կարկատում է C ֆայլերը՝ Python heredocs-ի միջոցով, որոնք կարդում են ֆայլը, տողով փոխարինում են ֆունկցիան և այն հետ են գրում։

1:20 Մեկ Windows թեստ գործարկելու համար այն գրեց Python, որը գործարկեց Node, որն էլ գործարկեց PowerShell՝ անձնագիր ունեցող կանչերի հերթ։ Միավոր թեստերը, որոնք այն քոմիթ արեց, բացատներ չունեն ընդհանրապես, քանի որ առանց ներդիրների դրանք տասը տոկոսով ավելի էժան են թոքեններում։ Եվ առաջադրանքների ցուցակը տեղաշարժվեց մեկից, երկուսից, երեքից դեպի առաջադրանք 8b2c2b2b հսկիչ կետ մեկը, ինչից էլ հասկանում ես, որ ստաժորը շատ երկար է մենակ մնացել։ Արմինի տեսությունը. մոդելը պարգևատրվում է երկար առաջադրանքներն ավարտելու համար և հազիվ է պատժվում տգեղ կոդի համար, ուստի թոքեն-գոլֆ արված գործիքների կանչերը թափանցում են կոդբազա,

1:48 և որքան քիչ մարդիկ են նայում, այնքան քիչ է դա նշանակություն ունենում։ Նա այդ բաժինը վերնագրել է «Դա AGI է, եթե չես նայում»։ Hacker News-ը ավելացրեց տնտեսագիտությունը. ավելի շատ կոդ նշանակում է ավելի շատ թոքեններ այն պահպանելու համար, ինչը անփութությունը դարձնում է ոչ թե սխալ, այլ բաժանորդագրություն։ Կարո՞ղ եք չափել անփութությունը։ Արմինի սեփական ընկերությունը փորձեց այս շաբաթ։ Earendil-ը գործարկեց SlopCodeBench-ի թվերը. գործակալի կոդը մոտ երկու անգամ ավելի բազմաբառ է և երկու անգամ ավելի քայքայված, քան մարդկային ռեպոզիտորիաները, որոնց հետ համեմատվում է,

2:10 և երբ բենչմարկը ջնջում է գործակալի հիշողությունը հսկիչ կետերի միջև, յուրաքանչյուր փորձարկված մոդելի խիստ անցողիկության մակարդակը զրո է։ Ամենահուսալի անփութության չափորոշիչը, որը նրանք գտան, հում տողերի քանակն էր, որը դադարում է աշխատել այն պահին, երբ որևէ մեկը օպտիմիզացնում է այն, ուստի խնդրում եմ, մի ասեք մոդելներին։ Ապա դրամապանակը։ RTK-ն ունի յոթանասունինը հազար GitHub աստղեր և YouTube-ի մանրապատկերներ, որոնք խոստանում են կիսով չափ կրճատել ձեր Claude Code հաշիվը. այն սեղմում է տերմինալի ելքը, նախքան գործակալը

2:34 կարդում է այն։ Quesma-ն այն գործարկեց Terminal-Bench-ի վրա տասնհինգ հարյուր դոլար արժողությամբ թոքենների համար։ Fable-ի հետ հաշիվը նվազեց հինգ տոկոսով, գրեթե ամբողջը մեկ առաջադրանքից. DeepSeek-ի հետ միջին առաջադրանքը տասնյոթ տոկոսով ավելի թանկացավ։ Մինչդեռ RTK-ի սեփական հաշվիչը հաղորդեց ութսունինը տոկոսի խնայողություն, քանի որ այն հաշվում է հեռացված բայթերը, ոչ թե առաջացած լրացուցիչ շրջադարձերը. խելացի հաշվիչ, որը հաշիվ է ուղարկում հարևանին։ Եվ մեկ տարբերակի սխալը վերաշարադրեց find-ը մի հրամանի, որը ձախողվեց, երեք հարյուր երեսունինը անգամ անընդմեջ, ինը անգամ ավելի թանկ գնով։

3:01 Գործիքը, որը սպանում է թոքենները, ունի ցիկլ։ Ինքը հեղեղը։ Cognition-ի SWE-2-ը Kimi K3-ն է՝ բաց չինական մոդելը, հետվերապատրաստված այնքան ժամանակ, մինչև այն համընկնում է Fable 5.1-ին Cognition-ի սեփական բենչմարկի վրա գնի մեկ երրորդով. Hacker News. ինչու են ամերիկյան բոլոր AI մոդելները հիմնականում Kimi-ն թիկնոցով։ Terminal-Bench 2.1-ի վրա այն գլխավորում է ամբողջ աղյուսակը. Terminal-Bench 4-ի վրա, այն մեկը, որը դեռ ոչ ոք չի անգիր արել, այն հավաքում է քսանյոթ միավոր Fable-ի հիսունվեցի դիմաց,

3:28 ուստի սլայդ-դեքի բենչմարկներում լավագույն սյունակը այն քննությունն է, որը բոլորն արդեն անցել են։ Cognition-ը նաև հայտարարեց Devin Voice-ի մասին, ձեր սիրելի AI ծրագրային ինժեները պարզապես ֆիքսված հեռախոս ստացավ, քանի որ գործակալային կոդավորումից միակ բանը, որ բացակայում էր, դա սպասման երաժշտությունն էր։ OpenAI, նույն օրը. Agents API-ը, որը Codex-ի հարմարանքն է՝ վաճառված որպես ծառայություն։ OpenAI-ը գործարկում է sandbox-ը, միայն ԱՄՆ տվյալների բնակության վայրը, առանց զրոյական տվյալների պահպանման, ուստի գործակալը հիշում է ձեր կոդբազան ճիշտ այնպես, ինչպես ChatGPT-ն։ Ապա OpenAI-ը դադարեցրեց երկու հարյուր դոլարանոց Pro պլանի գրանցումները,

3:57 քանի որ Astra-ի պահանջարկը, մեջբերում, աննախադեպ է. առաջին արտադրանքը սպասման ցուցակով ավելի շատ վճարելու համար։ Արմինն իր գործարանում ամբողջական վերակայում կատարեց։ Նա է պահանջարկը։ Ինչը մեզ բերում է ուրբաթ օրվա Ask HN-ին. կարո՞ղ ենք արդյոք սահմանափակել AI նորությունների հեղեղը, վեց հարյուր հիսունվեց միավոր, քանի որ, մեջբերում, ամեն անգամ, երբ OpenAI-ի կամ Anthropic-ի մեկը հողմապայթում է, լինում է տասնյակ լավագույն գրառում։

4:17 Պատասխանները ֆիլտրեր էին. hcker dot news-ը հեռացնում է AI պատմությունները BERT դասակարգիչով, որը վերապատրաստված է ութ հազար օրինակների վրա, AI-ն AI-ն ջնջելու համար, խոտակեր. և uBlock regex-ը, որը համընկնում է A-I-ին՝ առանց տառատեսակի տարբերակման, ջնջում է նաև էլփոստը, ամենօրյա, հիմնական, դոմեն և գնացք, ուստի regex-ը, ինչպես միշտ, չարագործն է։ Նույն կեսօրին, չորս հարյուր տասնհինգ մեկնաբանություն վիճեցին Claude-ի աջակցության էջի շուրջ, որտեղ ասվում էր, որ Claude-ը տասնութից բարձր է։

4:38 Էջը թվագրված է մայիսով։ Ոչինչ չփոխվեց։ Նույնիսկ AI նորությունները, որոնք նորություն չեն, նորություններ են, ինչը, արդար լինելու համար, նաև իմ բիզնես մոդելն է։ Եթե նախընտրում եք սա կարդալ, քան լսել, թե ինչպես եմ ես ասում, ապա տարբերությունը ձեր մուտքի արկղ է ընկնում ամեն առավոտ — անվճար the daily diff dot dev-ում, հղումը ներքևում։ Դա, անխուսափելիորեն, AI նորություն է։ Այսպիսով — այսօրվա դատավճիռը երեսունհինգ ժամյա ծրագրային ապահովման գործարանի վերաբերյալ՝ REVERT։ Յոթանասունինը քոմիթ, որոնք ոչ ոք չի կարդացել, կոդբազա չեն, դա պարտավորություն է git-ի հետ

5:04 տեղեկամատյան. Astra-ն տպավորիչ է, և գործարանը այն մասն է, որը պետք է հետ շրջել։ Եվ սա է այսօրվա տարբերությունը։ Ես Նիկոն եմ Axrisi-ից։ Միավորել պատասխանատվությամբ։

Աղբյուրներ

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

Հարակից տեսանյութեր

daily · hy · 01 հոկ, 2026 թ.

Gemini 4 Argon-ը Google-ի լավագույույն մոդելն է։ Դուք դեռ չեք կարող օգտագործել այն։

Google-ը հայտարարեց Gemini 4 Argon-ի մասին՝ իր նոր սահմանային մոդելը, և միայն վստահելի կիբերպաշտպանները կարող են օգտագործել այն։ Ահա թե ինչ է ցույց տալիս Google-ի սեփական 19-շարքանոց չափորոշիչ աղյուսա

4:53 ↗