+− THE DAILY DIFFdev & AI news
REVERT

آرمین رونچر نے GPT-6 آسٹرا کو 35 گھنٹے اکیلا چھوڑ دیا۔

آرمین رونچر (Flask، Jinja) نے GPT-6 آسٹرا کو ایک پرامپٹ دیا اور اسے 35 گھنٹے اکیلا چھوڑ دیا: تقریباً ایک بلین ٹوکنز، تقریباً 1,200 ڈالر، 79 کمٹس، 75,000 لائنز — اور "بالکل بے کار"۔

آرمین رونچر (Flask، Jinja) نے GPT-6 آسٹرا کو ایک پرامپٹ دیا اور اسے 35 گھنٹے اکیلا چھوڑ دیا: تقریباً ایک بلین ٹوکنز، تقریباً 1,200 ڈالر، 79 کمٹس، 75,000 لائنز — اور "بالکل بے کار"۔ جو کوڈ اس نے دوبارہ حاصل کیا وہ ایک کہانی ہے: C فائلز جنہیں پائتھن سٹرنگ-سپلائسنگ ہیرڈاکس کے ذریعے پیچ کیا گیا، پائتھن Node کو جنم دیتا ہوا جو پاورشیل کو جنم دیتا ہے، یونٹ ٹیسٹ جن میں سفید جگہ ہٹا دی گئی کیونکہ ٹوکنز میں 10% سستا ہوتا ہے۔ دو پیمائشیں اس کی حمایت کرتی ہیں: Earendil کے SlopCodeBench نمبرز (ایجنٹ کوڈ انسانی ریپوز سے تقریباً دو گنا زیادہ طویل اور گھٹا ہوا، 0% سخت پاس ریٹ) اور Quesma کا 1,500 ڈالر کا RTK کا بینچ مارک (79k ستارے، اپنے کاؤنٹر پر "89% ٹوکنز محفوظ کیے گئے"، DeepSeek کے ساتھ فی ٹاسک +17%)۔ اس کے علاوہ: Cognition کا SWE-2 (Kimi K3 ایک ٹرینچ کوٹ میں، Terminal-Bench 2.1 پر 92.8 بمقابلہ Terminal-Bench 4 پر 27.3)، OpenAI کا Agents API اور 200 ڈالر کے پرو سائن اپس کو روکا گیا، اور جمعہ کی ہیکر نیوز نے کم AI خبروں کی درخواست کی۔ فیصلہ: REVERT۔

تحریری ایڈیشن پڑھیں (انگریزی) ↗

اس ویڈیو میں کیا شامل ہے

  • آرمین رونچر: 35 گھنٹے کی بے توجہ GPT-6 آسٹرا، ~$1,200، 79 کمٹس، +75k لائنز، کچھ بھی SHIP IT نہیں ہوا۔
  • Earendil / SlopCodeBench: ایجنٹ کوڈ انسانی ریپوز سے تقریباً 2 گنا زیادہ طویل اور گھٹا ہوا؛ سخت پاس ریٹ 0%
  • Quesma: RTK 89% ٹوکنز بچانے کی اطلاع دیتا ہے، لیکن DeepSeek کے ساتھ Terminal-Bench لاگت 17% بڑھ جاتی ہے؛ ایک دوبارہ لکھنے کا لوپ لگاتار 339 بار ناکام ہوا۔
  • Cognition SWE-2: Kimi K3 سے پوسٹ ٹرینڈ، FrontierCode پر Fable 5.1 سے مطابقت رکھتا ہے تیسری قیمت پر؛ TB 2.1 92.8 بمقابلہ TB 4 27.3؛ Devin Voice
  • OpenAI Agents API (Codex ہارنس بطور سروس، صرف امریکہ، کوئی ZDR نہیں)؛ آسٹرا کی مانگ کی وجہ سے 200 ڈالر کے پرو سائن اپس کو روکا گیا۔

ترجمہ شدہ ٹرانسکرپٹ

اصل انگریزی بیان سے ترجمہ کیا گیا۔ دستیاب آڈیو اور کیپشنز یوٹیوب کے زیر انتظام ہیں۔

0:00 آرمین رونچر، وہ شخص جس نے Flask لکھا، نے GPT-6 آسٹرا کو ایک واحد پرامپٹ دیا اور اسے پینتیس گھنٹے اکیلا چھوڑ دیا۔ یہ پچھتر ہزار لائنوں کا کوڈ لے کر واپس آیا اور، اس کے الفاظ میں، بالکل بے کار، جو اسے سب سے زیادہ حقیقت پسندانہ سافٹ ویئر فیکٹری بناتا ہے جو کبھی بنی۔ اس نے بدھ کو یہ تحریر پوسٹ کی۔ جمعرات کو، Cognition نے SWE-2 اور OpenAI نے Agents API جاری کیا اور اپنے دو سو ڈالر کے پلان کے لیے سائن اپس کو روکا،

0:24 کیونکہ آسٹرا نے سرورز کو ہڑپ کر لیا تھا۔ اور جمعہ کو یہ تحریر ہیکر نیوز کے فرنٹ پیج پر پہنچی، ایک پوسٹ کے چند قطار نیچے جس میں ہیکر نیوز سے درخواست کی گئی تھی کہ وہ AI کے بارے میں پوسٹ کرنا بند کرے۔ اس ویڈیو میں: بے نگرانی آسٹرا کا ڈیڑھ دن کیا پیدا کرتا ہے، دو پیمائشیں جو گندگی کو ایک عدد میں بدل دیتی ہیں، سترہ ہزار ستاروں والے ایک ٹول کو کیوں آپ کا بل بڑا بناتا ہے، اور ہیکر نیوز نے AI کو کیسے فلٹر کرنے کی کوشش کی، AI کا استعمال کرتے ہوئے۔ آج جمعہ، 11 ستمبر ہے، اور یہ The Daily Diff ہے۔

0:53 فیکٹری۔ ایک پرامپٹ: ورچوئل تھریڈز اور لیکسیکل کے ساتھ ایک پائتھن بنائیں۔ آسٹرا نے اپنے نوٹس رکھے، اپنے ذیلی ایجنٹس کو تیار کیا، اور تب تک چلتا رہا جب تک آرمین نے پلگ نہیں کھینچا، ڈیڑھ دن اور تقریباً بارہ سو ڈالر بعد۔ اکہتر کمٹس، یعنی پندرہ اور آدھے ڈالر فی کمٹ، جو تقریباً وہی ہے جو ایک انسان چارج کرتا ہے، سوائے اس کے کہ انسان بالآخر رک جاتا ہے۔ کوڈ کہانی ہے۔ ایڈٹ ٹول کے بجائے، آسٹرا C فائلوں کو پائتھن ہیرڈاکس کے ذریعے پیچ کرتا ہے جو فائل کو پڑھتے ہیں، ایک فنکشن کو سٹرنگ-ریپلیس کرتے ہیں، اور اسے واپس لکھتے ہیں۔

1:20 ایک ونڈوز ٹیسٹ چلانے کے لیے اس نے پائتھن لکھا جس نے Node کو جنم دیا جس نے پاورشیل کو جنم دیا، ایک کال اسٹیک جس کے پاس پاسپورٹ تھا۔ اس نے جو یونٹ ٹیسٹ کمٹ کیے ان میں بالکل کوئی سفید جگہ نہیں ہے، کیونکہ انڈینٹیشن کے بغیر وہ ٹوکنز میں دس فیصد سستے ہوتے ہیں۔ اور ٹاسک لسٹ ایک، دو، تین سے ٹاسک 8b2c2b2b چیک پوائنٹ پر منتقل ہو گئی۔ ایک، جس سے آپ کو پتہ چلتا ہے کہ انٹرن بہت دیر تک اکیلا رہا ہے۔ آرمین کا نظریہ: ماڈل کو طویل کاموں کو ختم کرنے پر انعام دیا جاتا ہے اور شاید ہی بدصورت کوڈ کے لیے سزا دی جاتی ہے، اس لیے ٹوکن-گولفڈ ٹول کالز کوڈ بیس میں لیک ہو جاتے ہیں،

1:48 اور جتنے کم انسان دیکھتے ہیں، اتنا ہی کم فرق پڑتا ہے۔ اس نے اس حصے کو "It's AGI If You Don't Look" کا عنوان دیا۔ ہیکر نیوز نے معاشیات شامل کیں: زیادہ کوڈ کا مطلب ہے اسے برقرار رکھنے کے لیے زیادہ ٹوکنز، جو گندگی کو بگ نہیں بلکہ ایک سبسکرپشن بناتا ہے۔ کیا آپ گندگی کی پیمائش کر سکتے ہیں؟ آرمین کی اپنی کمپنی نے اس ہفتے کوشش کی۔ Earendil نے SlopCodeBench نمبرز چلائے: ایجنٹ کوڈ تقریباً دو گنا زیادہ طویل اور اس انسانی ریپوز کے مقابلے میں دو گنا زیادہ گھٹا ہوا ہے جس سے اس کا موازنہ کیا جاتا ہے،

2:10 اور جب بینچ مارک چیک پوائنٹس کے درمیان ایجنٹ کی میموری کو مٹا دیتا ہے، ان کے تجربہ کردہ ہر ماڈل کے لیے سخت پاس ریٹ صفر ہے۔ انہوں نے جو سب سے قابل اعتماد گندگی کا میٹرک پایا وہ خام لائن کی گنتی تھی، جو اس لمحے کام کرنا بند کر دیتی ہے جب کوئی اس کے لیے آپٹیمائز کرتا ہے، تو براہ کرم ماڈلز کو نہ بتائیں۔ پھر بٹوا۔ RTK کے پاس 79 ہزار گٹ ہب ستارے اور یوٹیوب تھمب نیلز ہیں جو آپ کے کلاڈ کوڈ بل کو نصف کرنے کا وعدہ کرتے ہیں؛ یہ ایجنٹ کے پڑھنے سے پہلے ٹرمینل آؤٹ پٹ کو کمپریس کرتا ہے۔ Quesma نے اسے Terminal-Bench پر پندرہ سو ڈالر کے ٹوکنز کے لیے چلایا۔ ٹرمینل آؤٹ پٹ کو ایجنٹ کے پڑھنے سے پہلے کمپریس کرتا ہے۔ Quesma نے اسے Terminal-Bench پر پندرہ سو ڈالر کے ٹوکنز کے لیے چلایا۔

2:34 Quesma نے اسے Terminal-Bench پر پندرہ سو ڈالر کے ٹوکنز کے لیے چلایا۔ Fable کے ساتھ بل پانچ فیصد گر گیا، تقریباً تمام ایک کام سے؛ DeepSeek کے ساتھ اوسط کام سترہ فیصد زیادہ مہنگا ہو گیا۔ اسی دوران RTK کے اپنے کاؤنٹر نے 89 فیصد بچت کی اطلاع دی، کیونکہ یہ ہٹائے گئے بائٹس کو شمار کرتا ہے، نہ کہ اضافی موڑ کو: ایک سمارٹ میٹر جو پڑوسی کا بل بناتا ہے۔ اور ایک ورژن بگ نے فائنڈ کو ایک کمانڈ میں دوبارہ لکھا جو ناکام ہو گیا، تین سو انتالیس بار لگاتار، نو گنا زیادہ قیمت پر۔

3:01 وہ ٹول جو ٹوکنز کو مارتا ہے اس میں ایک لوپ ہے۔ خود سیلاب۔ Cognition کا SWE-2 Kimi K3 ہے، اوپن چینی ماڈل، پوسٹ ٹرینڈ کیا گیا جب تک کہ یہ Cognition کے اپنے بینچ مارک پر Fable 5.1 سے مطابقت نہیں رکھتا تیسری قیمت پر؛ ہیکر نیوز: تمام امریکی AI ماڈلز بنیادی طور پر Kimi کیوں ہیں ایک ٹرینچ کوٹ میں۔ Terminal-Bench 2.1 پر یہ پوری ٹیبل میں سرفہرست ہے؛ Terminal-Bench 4 پر، وہ جسے ابھی تک کسی نے یاد نہیں کیا، یہ Fable کے چھپن کے مقابلے میں ستائیس اسکور کرتا ہے،

3:28 لہذا سلائیڈ ڈیک بینچ مارکس پر بہترین کالم وہ امتحان ہے جو ہر کوئی پہلے ہی پاس کر چکا ہے۔ Cognition نے Devin Voice کا بھی اعلان کیا، آپ کا پسندیدہ AI سافٹ ویئر انجینئر کو ابھی ایک لینڈ لائن ملی ہے، کیونکہ ایک چیز جو ایجنٹک کوڈنگ میں غائب تھی وہ انتظار کا موسیقی تھا۔ OpenAI، اسی دن: Agents API، جو Codex ہارنس ہے جو ایک سروس کے طور پر فروخت ہوتا ہے۔ OpenAI سینڈ باکس چلاتا ہے، صرف امریکی ڈیٹا ریزیڈنسی، کوئی زیرو ڈیٹا ریٹینشن نہیں، لہذا ایجنٹ آپ کے کوڈ بیس کو بالکل اسی طرح یاد رکھتا ہے جیسے ChatGPT کرتا ہے۔ پھر OpenAI نے دو سو ڈالر کے پرو پلان کے لیے سائن اپس کو روک دیا،

3:57 کیونکہ آسٹرا کی مانگ، "بے مثال" ہے: ویٹ لسٹ والا پہلا پروڈکٹ زیادہ ادائیگی کرنے کے لیے۔ آرمین نے اپنی فیکٹری پر مکمل ری سیٹ کیا۔ وہ ہی مانگ ہے۔ جو ہمیں جمعہ کے Ask HN پر لاتا ہے: کیا ہم AI خبروں کے سیلاب کو محدود کر سکتے ہیں؟ چھ سو چھپن پوائنٹس، کیونکہ، "ہر بار جب OpenAI یا Anthropic میں کوئی گڑبڑ کرتا ہے، تو ایک ٹاپ ٹین پوسٹ ہوتی ہے۔

4:17 جوابات فلٹرز تھے: hcker.news AI کہانیوں کو BERT کے ساتھ ہٹاتا ہے آٹھ ہزار مثالوں پر تربیت یافتہ کلاسیفائر، AI کو AI کو حذف کرنے کے لیے، گراس-فیڈ؛ اور ایک uBlock ریجیکس جو A-I کو کیس-انسنسیٹولی میچ کرتا ہے وہ بھی حذف کرتا ہے ای میل، ڈیلی، مین، ڈومین اور ٹرین، لہذا ریجیکس، ہمیشہ کی طرح، ولن ہے۔ اسی دوپہر، چار سو پندرہ کمنٹس ایک کلاڈ سپورٹ پیج کے بارے میں بحث کی گئی کہ کلاڈ اٹھارہ پلس ہے۔

4:38 یہ صفحہ مئی کا ہے۔ کچھ نہیں بدلا۔ یہاں تک کہ وہ AI خبریں جو خبر نہیں ہیں وہ بھی خبر ہیں، جو، منصفانہ طور پر، میرا کاروباری ماڈل بھی ہے۔ اگر آپ اسے سننے کے بجائے پڑھنا پسند کریں گے، تو یہ ڈیف ہر صبح آپ کے ان باکس میں پہنچ جاتا ہے — daily diff.dev پر مفت، لنک نیچے ہے۔ یہ، ناگزیر طور پر، AI خبریں ہیں۔ تو — پینتیس گھنٹے کی سافٹ ویئر فیکٹری پر آج کا فیصلہ: REVERT۔ ستائیس کمٹس جنہیں کسی نے نہیں پڑھا وہ کوڈ بیس نہیں ہیں، یہ گٹ لاگ کے ساتھ ایک ذمہ داری ہے؛

5:04 آسٹرا متاثر کن ہے، اور فیکٹری وہ حصہ ہے جسے واپس کرنا ہے۔ اور آج کے لیے بس یہی ہے۔ میں Axrisi سے Niko ہوں۔ ذمہ داری سے ضم کریں۔

ذرائع

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

متعلقہ ویڈیوز

daily · ur · 1 اکتوبر، 2026

جیمنی 4 آرگون گوگل کا بہترین ماڈل ہے۔ آپ اسے ابھی استعمال نہیں کر سکتے۔

گوگل نے اپنے نئے فرنٹیئر ماڈل جیمنی 4 آرگون کا اعلان کیا ہے، اور صرف قابل اعتماد سائبر ڈیفنڈر ہی اسے استعمال کر سکتے ہیں۔ یہاں گوگل کے اپنے 19 قطاروں والے بینچ مارک ٹیبل، آزاد لیڈر بورڈ کی پیمائش، اور

4:53 ↗