+− THE DAILY DIFFdev & AI news
REVERT

ארמין רונאכר השאיר את GPT-6 אסטרה לבד ל-35 שעות.

ארמין רונאכר (Flask, Jinja) נתן ל-GPT-6 אסטרה הנחיה אחת והשאיר אותו לבד ל-35 שעות: כשמיליארד טוקנים, כ-1,200$, 79 קומיטים, 75,000 שורות — ו"שום דבר בעל ערך לחלוטין".

ארמין רונאכר (Flask, Jinja) נתן ל-GPT-6 אסטרה הנחיה אחת והשאיר אותו לבד ל-35 שעות: כשמיליארד טוקנים, כ-1,200$, 79 קומיטים, 75,000 שורות — ו"שום דבר בעל ערך לחלוטין". הקוד ששוחזר הוא הסיפור: קבצי C מתוקנים על ידי Python string-splicing heredocs, Python שמוליד Node שמוליד PowerShell, בדיקות יחידה עם רווחים שהוסרו מכיוון שהם זולים ב-10% בטוקנים. שתי מדידות תומכות בו: מספרי SlopCodeBench של Earendil (קוד סוכן כפול ומעוכל פי שניים ממאגרי אנוש, 0% שיעור מעבר מוחלט) והבנצ'מרק של Quesma בסך 1,500$ של RTK (79k כוכבים, "89% טוקנים נחסכו" על פי מונה משלו, +17% למשימה עם DeepSeek). כמו כן: SWE-2 של Cognition (Kimi K3 במעיל גשם, 92.8 ב-Terminal-Bench 2.1 לעומת 27.3 ב-Terminal-Bench 4), ה-Agents API של OpenAI וההשעיה של ההרשמות ל-200$ Pro, ו-Hacker News של יום שישי שביקש פחות חדשות AI. פסק דין: REVERT.

קראו את המהדורה הכתובה (אנגלית) ↗

מה מכסה הסרטון הזה

  • ארמין רונאכר: 35 שעות של GPT-6 אסטרה ללא השגחה, כ-1,200$, 79 קומיטים, +75k שורות, שום דבר לא נשלח
  • Earendil / SlopCodeBench: קוד סוכן ~פי 2 ורבוזי ומעוכל ממאגרי אנוש; שיעור מעבר מוחלט 0%
  • Quesma: RTK מדווח על 89% טוקנים שנחסכו, אך עלויות Terminal-Bench עולות ב-17% עם DeepSeek; לולאת שכתוב נכשלה 339 פעמים ברציפות
  • Cognition SWE-2: אומן מ-Kimi K3, תואם ל-Fable 5.1 ב-FrontierCode בשליש מהמחיר; TB 2.1 92.8 לעומת TB 4 27.3; Devin Voice
  • OpenAI Agents API (רתמת Codex כשירות, US-only, ללא ZDR); הרשמות ל-Pro בסך 200$ הושעו עקב דרישת אסטרה

תמליל מתורגם

תורגם מהקריינות המקורית באנגלית. זמינות אודיו וכתוביות נשלטת על ידי YouTube.

0:00 ארמין רונאכר, האיש שכתב את Flask, נתן ל-GPT-6 אסטרה הנחיה בודדת ו- השאיר אותו לבד למשך שלושים וחמש שעות. הוא חזר עם שבעים וחמישה אלף שורות קוד ו- לדבריו, שום דבר בעל ערך לחלוטין, מה שהופך אותו למפעל התוכנה המציאותי ביותר שנבנה אי פעם. הוא פרסם את הסיכום ביום רביעי. ביום חמישי, Cognition השיקה את SWE-2, ו-OpenAI השיקה Agents API והשהתה הרשמות לתוכנית הדו-מאות דולר שלה,

0:24 כי אסטרה אכלה את השרתים. וביום שישי הגיע הסיכום לעמוד הראשי של Hacker News, כמה שורות מתחת לפוסט שביקש מ-Hacker News בבקשה להפסיק לפרסם על AI. בסרטון זה: מה מייצר יום וחצי של אסטרה ללא השגחה, שתי מדידות שהופכות רשלנות למספר, מדוע כלי עם שבעים ותשע אלף כוכבים מגדיל את החשבון שלך, וכיצד Hacker News ניסה לסנן AI, באמצעות AI. היום שישי, ה-11 בספטמבר, וזהו ה-The Daily Diff.

0:53 המפעל. הנחיה אחת: בנה פייתון עם תרדים וירטואליים וקביעת היקף לקסיקלית. אסטרה שמרה הערות משלה, הקימה סוכני משנה משלה, ורצה עד שארמין ניתק את התקע, יום וחצי וכשאלף מאתיים דולר מאוחר יותר. שבעים ותשעה קומיטים, כלומר חמישה עשר וחצי דולר לקומיט, שזה בערך מה שבן אדם גובה, אלא שבן האדם בסופו של דבר מפסיק. הקוד הוא הסיפור. במקום כלי העריכה, אסטרה מתקנת קבצי C על ידי צינורות heredocs של פייתון שקוראים את הקובץ, מחליפים מחרוזת פונקציה, וכותבים אותו בחזרה.

1:20 כדי להריץ בדיקת Windows אחת הוא כתב פייתון שהוליד Node שהוליד PowerShell, ערימת קריאות עם דרכון. לבדיקות היחידה שהוא העלה אין רווחים כלל, כי ללא הזחה הן זולות בעשרה אחוזים בטוקנים. ורשימת המשימות נסחפה מאחת, שתיים, שלוש למשימה 8b2c2b2b נקודת ביקורת אחת, וכך אתה יודע שהמתמחה היה לבד יותר מדי זמן. התיאוריה של ארמין: המודל מתוגמל על סיום משימות ארוכות ובקושי נענש על קוד מכוער, כך שקריאות כלים "מטופשות" זולגות לבסיס הקוד,

1:48 וככל שפחות בני אדם מסתכלים, כך זה פחות חשוב. הוא קרא לקטע הזה "זה AGI אם אתה לא מסתכל". Hacker News הוסיף את הכלכלה: יותר קוד פירושו יותר טוקנים לתחזוקתו, מה שהופך רשלנות לא לבאג אלא למנוי. האם אפשר למדוד רשלנות? החברה של ארמין עצמו ניסתה השבוע. Earendil הריצה את מספרי SlopCodeBench: קוד סוכן הוא בערך פי שניים ורבוזי ו- פי שניים "שחוק" ממאגרי הקוד האנושיים מולם הוא מושווה,

2:10 וכאשר הבנצ'מרק מוחק את זיכרון הסוכן בין נקודות ביקורת, שיעור המעבר הקפדני לכל מודל שנבדק הוא אפס. מדד הרשלנות האמין ביותר שהם מצאו היה ספירת השורות הגולמית, שמפסיקה לעבוד ברגע שמישהו מבצע אופטימיזציה עבורה, אז בבקשה אל תספרו למודלים. ואז הארנק. ל-RTK יש שבעים ותשעה אלף כוכבי GitHub ותמונות ממוזערות ביוטיוב שמבטיחות לחצות את חשבון Claude Code שלך; הוא דוחס פלט מסוף לפני שהסוכן

2:34 קורא אותו. Quesma הרצה אותו ב-Terminal-Bench תמורת אלף וחמש מאות דולר בטוקנים. עם Fable החשבון ירד בחמישה אחוזים, כמעט הכל ממשימה אחת; עם DeepSeek המשימה הממוצעת התייקרה בשבעה עשר אחוזים. בינתיים, המונה של RTK עצמו דיווח על שמונים ותשעה אחוזים שנחסכו, כי הוא סופר בייטות שהוסרו, לא סיבובים נוספים שנגרמו: מונה חכם ש- מחייב את השכן. ובאג גרסה אחד שכתב מחדש את find לפקודה שנכשלה, שלוש מאות שלושים ותשע פעמים ברציפות, בתשעה מונים מהמחיר.

3:01 לכלי שהורג טוקנים יש לולאה. השטפון עצמו. SWE-2 של Cognition הוא Kimi K3, המודל הסיני הפתוח, שאומן לאחר מכן עד שהוא תואם ל-Fable 5.1 בבנצ'מרק של Cognition עצמה ב- שליש מהמחיר; Hacker News: מדוע כל מודלי ה-AI האמריקאים הם בעצם Kimi במעיל גשם. ב-Terminal-Bench 2.1 הוא מוביל את כל הטבלה; ב-Terminal-Bench 4, זה שאף אחד עדיין לא שינן, הוא מקבל עשרים ושבע לעומת חמישים ושש של Fable,

3:28 אז בבנצ'מרקים של המצגת העמודה הטובה ביותר היא המבחן שכולם כבר עברו. Cognition גם הכריזה על Devin Voice, מהנדס התוכנה האהוב עליך ב-AI קיבל קו קווי, כי הדבר היחיד שחסר בקידוד סוכני היה מוזיקת המתנה. OpenAI, באותו יום: ה-Agents API, שהוא רתמת Codex הנמכרת כשירות. OpenAI מריצה את הסנדבוקס, תושבות נתונים בארה"ב בלבד, ללא שמירת נתונים אפסית, כך שהסוכן זוכר את בסיס הקוד שלך בדיוק כמו ש-ChatGPT זוכר. ואז OpenAI השהתה את ההרשמות לתוכנית ה-Pro בסך מאתיים דולר,

3:57 כי הביקוש לאסטרה הוא, בציטוט, חסר תקדים: המוצר הראשון עם רשימת המתנה לשלם יותר. ארמין שרף איפוס מלא במפעל שלו. הוא הביקוש. מה שמביא אותנו ל-Ask HN של יום שישי: האם נוכל בבקשה להגביל את שטף חדשות ה-AI, שש מאות חמישים ושישה נקודות, כי, בציטוט, כל פעם שמישהו ב-OpenAI או Anthropic "משחרר רוח", יש פוסט בעשירייה הראשונה.

4:17 התשובות היו פילטרים: hcker dot news מסיר סיפורי AI עם מסווג BERT שאומן על שמונת אלפים דוגמאות, AI למחיקת AI, "גידול טבעי"; וביטוי רגולרי של uBlock התואם AI ללא תלות ברישיות גם מוחק אימייל, יומי, ראשי, דומיין ורכבת, כך שהביטוי הרגולרי, כתמיד, הוא הנבל. באותו אחר הצהריים, ארבע מאות חמישה עשר תגובות התווכחו על דף תמיכה של Claude שאומר ש-Claude מיועד לגילאי שמונה עשרה פלוס.

4:38 הדף מתוארך למאי. שום דבר לא השתנה. אפילו חדשות ה-AI שאינן חדשות הן חדשות, וזה, אם להיות הוגן, גם המודל העסקי שלי. אם אתה מעדיף לקרוא זאת מאשר לשמוע אותי אומר זאת, ה-diff נוחת בתיבת הדואר הנכנס שלך בכל בוקר — בחינם ב-the daily diff dot dev, קישור למטה. זה, באופן בלתי נמנע, חדשות AI. אז — פסק הדין של היום על מפעל התוכנה בן שלושים וחמש השעות: REVERT. שבעים ותשעה קומיטים שאף אחד לא קרא אינם בסיס קוד, זוהי התחייבות עם יומן git

5:04 ; אסטרה מרשימה, והמפעל הוא החלק שיש לבטל. וזה ה-diff להיום. אני ניקו מ-Axrisi. Merge באחריות.

מקורות

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

סרטונים קשורים

daily · he · 1 באוק׳ 2026

ג'מיני 4 ארגון הוא המודל הטוב ביותר של גוגל. אתם עדיין לא יכולים להשתמש בו.

גוגל הכריזה על ג'מיני 4 ארגון, מודל החזית החדש שלה, ורק מגיני סייבר מהימנים יכולים להשתמש בו. הנה מה שמראה טבלת הבנצ'מרק של גוגל עצמה, מה מדד לוח המובילים העצמאי, ומתי מפתחים עשויים לקבל אותו. פסק דין

4:53 ↗