+− THE DAILY DIFFdev & AI news
REVERT

არმინ რონაჩერმა GPT-6 Astra 35 საათის განმავლობაში მარტო დატოვა.

არმინ რონაჩერმა (Flask, Jinja) GPT-6 Astra-ს ერთი მოთხოვნა მისცა და 35 საათით მარტო დატოვა: დაახლოებით მილიარდი ტოკენი, დაახლოებით $1,200, 79 კომიტი, 75,000 ხაზი — და „აბსოლუტურად არაფერი ღირებული“.

არმინ რონაჩერმა (Flask, Jinja) GPT-6 Astra-ს ერთი მოთხოვნა მისცა და 35 საათით მარტო დატოვა: დაახლოებით მილიარდი ტოკენი, დაახლოებით $1,200, 79 კომიტი, 75,000 ხაზი — და „აბსოლუტურად არაფერი ღირებული“. მის მიერ აღდგენილი კოდი არის ამბავი: C ფაილები, რომლებიც დაპაჩულია Python-ის სტრიქონების გაერთიანებით heredocs-ით, Python-ი, რომელიც აწარმოებს Node-ს, რომელიც აწარმოებს PowerShell-ს, ერთეული ტესტები, რომლებსაც სიცარიელე ამოღებული აქვთ, რადგან ტოკენებში 10%-ით იაფია. მას ორი გაზომვა უმაგრებს ზურგს: Earendil-ის SlopCodeBench-ის რიცხვები (აგენტის კოდი დაახლოებით ორჯერ უფრო მრავალსიტყვიანი და დაზიანებულია, ვიდრე ადამიანის რეპოზიტორები, 0% ზუსტი გავლის მაჩვენებელი) და Quesma-ს $1,500 ღირებულების RTK-ის ბენჩმარკი (79k ვარსკვლავი, „89% ტოკენის დაზოგვა“ საკუთარ მრიცხველზე, +17% დავალებაზე DeepSeek-ით). ასევე: Cognition-ის SWE-2 (Kimi K3 ლაბადაში, 92.8 Terminal-Bench 2.1-ზე 27.3-ის წინააღმდეგ Terminal-Bench 4-ზე), OpenAI-ის Agents API და შეჩერებული $200 Pro რეგისტრაციები, და პარასკევს Hacker News-მა მოითხოვა ნაკლები AI სიახლე. განაჩენი: REVERT.

წაიკითხეთ წერილობითი გამოცემა (ინგლისური) ↗

რას მოიცავს ეს ვიდეო

  • არმინ რონაჩერი: 35 საათი უყურადღებოდ დატოვებული GPT-6 Astra, ~$1,200, 79 კომიტი, +75k ხაზი, არაფერი გამოშვებული
  • Earendil / SlopCodeBench: აგენტის კოდი ~2× უფრო მრავალსიტყვიანი და დაზიანებულია, ვიდრე ადამიანის რეპოზიტორები; ზუსტი გავლის მაჩვენებელი 0%
  • Quesma: RTK იუწყება ტოკენების 89% დაზოგვას, მაგრამ Terminal-Bench-ის ხარჯები 17%-ით იზრდება DeepSeek-თან ერთად; გადაწერის ციკლი 339-ჯერ ზედიზედ ჩავარდა
  • Cognition SWE-2: Kimi K3-დან პოსტ-ტრენინგით, შეესაბამება Fable 5.1-ს FrontierCode-ზე მესამედ ფასად; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
  • OpenAI Agents API (Codex-ის აღკაზმულობა სერვისად, მხოლოდ აშშ-ში, ZDR-ის გარეშე); $200 Pro რეგისტრაციები შეჩერებულია Astra-ზე მოთხოვნის გამო

ნათარგმნი ტრანსკრიპტი

ნათარგმნია ორიგინალური ინგლისური ნარატივიდან. ხელმისაწვდომი აუდიო და სუბტიტრები კონტროლდება YouTube-ის მიერ.

0:00 არმინ რონაჩერმა, კაცმა, რომელმაც დაწერა Flask, GPT-6 Astra-ს ერთი მოთხოვნა მისცა და 35 საათით მარტო დატოვა. მან 75 000 ხაზი კოდი დააბრუნა და, მისი თქმით, არაფერი ღირებული, რაც მას ყველაზე რეალისტურ პროგრამული უზრუნველყოფის ქარხნად აქცევს, რაც კი ოდესმე აშენებულა. მან მოხსენება ოთხშაბათს გამოაქვეყნა. ხუთშაბათს Cognition-მა SWE-2 გამოუშვა, OpenAI-მ კი Agents API და 200 დოლარიანი გეგმის რეგისტრაციები შეაჩერა,

0:24 რადგან Astra-მ სერვერები გადატვირთა. ხოლო პარასკევს მოხსენება Hacker News-ის წინა გვერდზე მოხვდა, რამდენიმე სტრიქონით ქვემოთ პოსტიდან, რომელიც Hacker News-ს სთხოვდა, შეეწყვიტა AI-ზე პოსტების განთავსება. ამ ვიდეოში: რას აწარმოებს დღენახევარი უყურადღებოდ დატოვებული Astra, ორი გაზომვა, რომელიც არეულობას ციფრად აქცევს, რატომ ზრდის 79 000 ვარსკვლავიანი ხელსაწყო თქვენს გადასახადს და როგორ სცადა Hacker News-მა AI-ს გაფილტვრა, AI-ს გამოყენებით. დღეს პარასკევია, 11 სექტემბერი, და ეს არის The Daily Diff.

0:53 ქარხანა. ერთი მოთხოვნა: შექმენით Python ვირტუალური თრედებით და ლექსიკური ფარგლებით. Astra-მ საკუთარი შენიშვნები შეინახა, საკუთარი ქვემფლობელები აამუშავა და მუშაობდა მანამ, სანამ არმინმა დენის წყარო არ გამორთო, დღენახევრისა და დაახლოებით ათას ორასი დოლარის შემდეგ. 79 კომიტი, ანუ თხუთმეტნახევარი დოლარი თითო კომიტზე, რაც დაახლოებით იმდენია, რასაც ადამიანი ითხოვს, გარდა იმისა, რომ ადამიანი საბოლოოდ ჩერდება. კოდი არის ამბავი. რედაქტირების ხელსაწყოს ნაცვლად, Astra C ფაილებს აპაჩებს Python heredocs-ის გადაცემით, რომელიც კითხულობს ფაილს, სტრიქონით ანაცვლებს ფუნქციას და უკან წერს.

1:20 ერთი Windows ტესტის გასაშვებად მან Python დაწერა, რომელმაც Node გაუშვა, რომელმაც PowerShell გაუშვა, ზარის სტეკი პასპორტით. მის მიერ დაკოპირებულ ერთეულ ტესტებს საერთოდ არ აქვთ სიცარიელე, რადგან ჩაღრმავების გარეშე ისინი ტოკენებში ათი პროცენტით იაფია. და დავალებების სია ერთი, ორი, სამიდან დავალება 8b2c2b2b საგუშაგო ერთამდე გადავიდა, რაც იმაზე მიუთითებს, რომ სტაჟიორი ძალიან დიდხანს იყო მარტო. არმინის თეორია: მოდელი ჯილდოვდება გრძელი დავალებების დასრულებისთვის და ძლივს ისჯება მახინჯი კოდისთვის, ამიტომ ტოკენებით დახვეწილი ინსტრუმენტების გამოძახება კოდის ბაზაში ჟონავს,

1:48 და რაც ნაკლები ადამიანი უყურებს, მით ნაკლები მნიშვნელობა აქვს ამას. მან ამ სექციას დაარქვა „ეს არის AGI, თუ არ შეხედავ“. Hacker News-მა ეკონომიკა დაამატა: მეტი კოდი ნიშნავს მეტ ტოკენს მის შესანარჩუნებლად, რაც არეულობას შეცდომად კი არა, გამოწერად აქცევს. შეგიძლიათ არეულობის გაზომვა? არმინის საკუთარმა კომპანიამ სცადა ამ კვირაში. Earendil-მა SlopCodeBench-ის რიცხვები გაუშვა: აგენტის კოდი დაახლოებით ორჯერ უფრო მრავალსიტყვიანია და ორჯერ უფრო დაზიანებულია, ვიდრე ადამიანის რეპოზიტორები, რომლებსაც ის შედარებულია,

2:10 და როდესაც ბენჩმარკი აგენტის მეხსიერებას წმენდს საგუშაგოებს შორის, მათ მიერ ტესტირებული ყველა მოდელის ზუსტი გავლის მაჩვენებელი ნულია. მათ მიერ ნაპოვნი ყველაზე საიმედო არეულობის მეტრიკა იყო უმი ხაზების რაოდენობა, რომელიც წყვეტს მუშაობას იმ მომენტში, როდესაც ვინმე მისთვის ოპტიმიზაციას გააკეთებს, ასე რომ, გთხოვთ, არ უთხრათ მოდელებს. შემდეგ საფულე. RTK-ს სამოცდაცხრამეტი ათასი GitHub ვარსკვლავი და YouTube ესკიზები აქვს, რომლებიც თქვენი Claude Code გადასახადის განახევრებას გვპირდება; ის ტერმინალის გამომავალს შეკუმშავს, სანამ აგენტი

2:34 მას წაიკითხავს. Quesma-მ ის Terminal-Bench-ზე ათას ხუთასი დოლარის ღირებულების ტოკენებით გაუშვა. Fable-ით გადასახადი ხუთი პროცენტით შემცირდა, თითქმის მთლიანად ერთი დავალებიდან; DeepSeek-ით საშუალო დავალება ჩვიდმეტი პროცენტით გაძვირდა. ამასობაში RTK-ის საკუთარმა მრიცხველმა ოთხმოცდაცხრამეტი პროცენტი დაზოგვა იუწყა, რადგან ის დათვლის ამოღებულ ბაიტებს და არა გამოწვეულ დამატებით ბრუნვებს: ჭკვიანი მრიცხველი, რომელიც მეზობელს უგზავნის გადასახადს. და ერთი ვერსიის შეცდომამ find ბრძანებაში გადაწერა, რომელიც ჩავარდა, სამას ოცდაცხრამეტი ჯერ ზედიზედ, ცხრაჯერ უფრო ძვირად.

3:01 ხელსაწყოს, რომელიც ტოკენებს კლავს, აქვს ციკლი. თავად წყალდიდობა. Cognition-ის SWE-2 არის Kimi K3, ღია ჩინური მოდელი, პოსტ-ტრენინგით მანამ, სანამ ის Fable 5.1-ს არ შეესაბამება Cognition-ის საკუთარ ბენჩმარკზე ფასის მესამედით; Hacker News: რატომ არის ყველა ამერიკული AI მოდელი ძირითადად Kimi ლაბადაში. Terminal-Bench 2.1-ზე ის მთელ ცხრილს ლიდერობს; Terminal-Bench 4-ზე, რომელიც ჯერ არავის დაუმახსოვრებია, ის ოცდაშვიდს იღებს Fable-ის ორმოცდათექვსმეტის წინააღმდეგ,

3:28 ასე რომ, სლაიდ-დეკ ბენჩმარკებზე საუკეთესო სვეტი არის ის გამოცდა, რომელიც ყველამ უკვე ჩააბარა. Cognition-მა ასევე გამოაცხადა Devin Voice, თქვენი საყვარელი AI პროგრამული ინჟინერი ახლახან დააკავშირეს, რადგან ერთადერთი, რაც აგენტურ კოდირებას აკლდა, იყო ლოდინის მუსიკა. OpenAI, იმავე დღეს: Agents API, რომელიც არის Codex-ის აღკაზმულობა, როგორც სერვისი. OpenAI მართავს სენდბოქსს, მხოლოდ აშშ-ის მონაცემთა რეზიდენცია, მონაცემთა ნულოვანი შენარჩუნების გარეშე, ასე რომ, აგენტი თქვენს კოდის ბაზას ზუსტად ისევე იმახსოვრებს, როგორც ChatGPT. შემდეგ OpenAI-მ შეაჩერა რეგისტრაციები ორასდოლარიანი Pro გეგმისთვის,

3:57 რადგან Astra-ზე მოთხოვნა, ციტატა, უპრეცედენტოა: პირველი პროდუქტი რიგით მეტი გადახდისთვის. არმინმა თავისი ქარხნის სრული გადატვირთვა მოახდინა. ის არის მოთხოვნა. რაც მიგვიყვანს პარასკევის Ask HN-მდე: შეგვიძლია თუ არა შევზღუდოთ AI სიახლეების ნაკადი, ექვსას ორმოცდათექვსმეტი ქულა, რადგან, ციტატა, ყოველ ჯერზე, როდესაც OpenAI-ში ან Anthropic-ში ვინმე აფურთხებს, არის ათეულში მოხვედრილი პოსტი.

4:17 პასუხები იყო ფილტრები: hcker dot news შლის AI ისტორიებს BERT კლასიფიკატორით, რომელიც გაწვრთნილია რვა ათას მაგალითზე, AI AI-ს წასაშლელად, ბუნებრივად ნაკვები; და uBlock regex, რომელიც AI-ს რეგულარულად ემთხვევა, ასევე შლის ელ.ფოსტას, ყოველდღიურს, მთავარს, დომენს და მატარებელს, ასე რომ regex, როგორც ყოველთვის, არის ბოროტმოქმედი. იმავე შუადღეს, ოთხას თხუთმეტი კომენტარი კამათობდა Claude-ის მხარდაჭერის გვერდზე, რომელიც ამბობდა, რომ Claude თვრამეტი პლუსია.

4:38 გვერდი მაისით არის დათარიღებული. არაფერი შეცვლილა. ის AI სიახლეებიც კი, რომლებიც სიახლე არ არის, სიახლეა, რაც, სამართლიანობისთვის, ასევე ჩემი ბიზნეს მოდელია. თუ ამის წაკითხვა გირჩევნიათ, ვიდრე ჩემი მოსმენა, diff ყოველ დილას თქვენს შემოსულებშია — უფასო daily diff dot dev-ზე, ბმული ქვემოთ. ეს არის, გარდაუვალია, AI სიახლე. ასე რომ — დღევანდელი განაჩენი ოცდათხუთმეტი საათის პროგრამული უზრუნველყოფის ქარხანაზე: REVERT. სამოცდაცხრამეტი კომიტი, რომელიც არავის წაუკითხავს, კოდის ბაზა არ არის, ეს არის ვალდებულება git

5:04 ჟურნალით; Astra შთამბეჭდავია, და ქარხანა არის ის ნაწილი, რომელიც უნდა უკან დაიხიოს. და ეს არის დღევანდელი განსხვავება. მე ვარ ნიკო Axrisi-დან. შეაერთეთ პასუხისმგებლობით.

წყაროები

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

მსგავსი ვიდეოები

daily · ka · 30 სექ. 2026

OpenAI DevDay 2026: 20+ განცხადება, „წერტილებიდან“ GPT-6.1 Sol-მდე

OpenAI-ის DevDay 2026-ის ძირითადი მოხსენება, განმარტებულია: „წერტილები“ (ყოველთვის ჩართული აგენტები საკუთარი ღრუბლოვანი კომპიუტერით), ChatGPT Space და Pages, GPT-6.1 Sol 2$ / 10$-ად მილიონ ტოკენზე, Ul

8:13 ↗
daily · ka · 1 ოქტ. 2026

Gemini 4 Argon Google-ის საუკეთესო მოდელია. ჯერ ვერ გამოიყენებთ.

Google-მა გამოაცხადა Gemini 4 Argon, თავისი ახალი სასაზღვრო მოდელი, და მხოლოდ სანდო კიბერ დამცველებს შეუძლიათ მისი გამოყენება. აი, რას აჩვენებს Google-ის საკუთარი 19-სტრიქონიანი საორიენტაციო ცხრილი, რ

4:53 ↗
daily · ka · 2 ოქტ. 2026

Git-ის ახალი ნაგულისხმევი ჰეში – რას ნიშნავს ეს

Git-ის შემოთავაზებული SHA-256 ნაგულისხმევი ქმნის თავსებადობის ზღვარს ახალი საცავებისთვის. ჩვენ ვამოწმებთ ოფიციალურ გეგმას, სკოტ ჩაკონის წინააღმდეგობას და GitHub-ის მოქმედი წინასწარი გადახედვის გამონაკ

4:52 ↗
daily · ka · 30 სექ. 2026

როგორ გამოვავლინოთ Claude-ის ნერფი (რეალური მონაცემებით)

ხალხი ამბობს, რომ Claude ყოველ გაშვებიდან რამდენიმე კვირის შემდეგ სულელდება. ერთმა დეველოპერმა Claude Opus 5.5-ს გაშვების კვირიდან 30-დღიანი საათი დაუყენა გაყინული შეკითხვებით, დამაგრებული Claude Code

5:07 ↗