Armin Ronacher 獨留 GPT-6 Astra 35 小時。
Armin Ronacher(Flask、Jinja 的作者)給了 GPT-6 Astra 一個提示,然後獨留它 35 小時:大約十億個 token,約 1,200 美元,79 次提交,75,000 行程式碼——結果「絕對一無是處」。
Armin Ronacher(Flask、Jinja 的作者)給了 GPT-6 Astra 一個提示,然後獨留它 35 小時:大約十億個 token,約 1,200 美元,79 次提交,75,000 行程式碼——結果「絕對一無是處」。它找回來的程式碼本身就是一個故事:C 檔案透過 Python 字串拼接的 heredocs 修補,Python 啟動 Node,Node 又啟動 PowerShell,單元測試移除了所有空白字元,因為這樣可以節省 10% 的 token 成本。有兩項測量結果支持他的看法:Earendil 的 SlopCodeBench 數據(代理程式碼比人類程式碼庫冗長且腐蝕約兩倍,嚴格通過率為 0%)以及 Quesma 對 RTK 進行的 1,500 美元基準測試(79k 顆星,根據其自身計數器「節省 89% 的 token」,但使用 DeepSeek 時每個任務成本增加 17%)。此外還有:Cognition 的 SWE-2(穿著風衣的 Kimi K3,Terminal-Bench 2.1 上獲得 92.8 分,而 Terminal-Bench 4 上僅 27.3 分),OpenAI 的 Agents API 和暫停的 200 美元專業版註冊,以及週五 Hacker News 要求減少 AI 新聞。判決:REVERT。
本影片重點
- Armin Ronacher:35 小時無人看管的 GPT-6 Astra,約 1,200 美元,79 次提交,超過 75k 行程式碼,一無所獲。
- Earendil / SlopCodeBench:代理程式碼比人類程式碼庫冗長且腐蝕約 2 倍;嚴格通過率 0%。
- Quesma:RTK 報告節省 89% 的 token,但使用 DeepSeek 時 Terminal-Bench 成本增加 17%;一個重寫循環連續失敗 339 次。
- Cognition SWE-2:從 Kimi K3 後期訓練,以三分之一的價格在 FrontierCode 上與 Fable 5.1 匹配;TB 2.1 92.8 分 vs TB 4 27.3 分;Devin Voice。
- OpenAI Agents API (Codex 線束即服務,僅限美國,無 ZDR);因 Astra 需求,暫停 200 美元專業版註冊。
翻譯文字稿
譯自英文原版旁白。可用的音訊和字幕由 YouTube 控制。
0:00 Armin Ronacher,Flask 的作者,給了 GPT-6 Astra 一個提示,然後 獨留它三十五個小時。 它回來時帶了七萬五千行的程式碼,以及, 用他的話說,絕對一無是處,這讓它成為最逼真的 軟體工廠。 他週三發佈了這篇文章。 週四,Cognition 推出了 SWE-2,OpenAI 推出了 Agents API 並暫停了其兩百美元方案的註冊,
0:24 因為 Astra 佔用了伺服器。 而週五,這篇文章登上了 Hacker News 的首頁, 位於一篇請求 Hacker News 不要再發 AI 相關貼文的幾行之下。 在此影片中:一天半無人監督的 Astra 會產生什麼, 兩個將混亂變成數字的測量方法,為什麼一個擁有七萬九千 顆星的工具會讓你的帳單變大,以及 Hacker News 如何試圖用 AI 過濾掉 AI。 今天是九月十一日星期五,這裡是 The Daily Diff。
0:53 工廠。一個提示:用虛擬執行緒和詞法作用域構建一個 Python。 Astra 自己做筆記,啟動自己的子代理, 並一直運行直到 Armin 拔掉插頭,一天半之後,大約花費了十二百 美元。七十九次提交,所以每次提交花費十五點五美元, 這大約是人類的收費,只不過人類最終會停止。 程式碼就是故事。 Astra 不使用編輯工具,而是透過管道傳輸 Python heredocs 來修補 C 檔案,這些 heredocs 讀取檔案,字串替換一個函數,然後將其寫回。
1:20 為了執行一個 Windows 測試,它編寫了 Python,然後 Python 啟動 Node,Node 又啟動 PowerShell,一個帶護照的呼叫堆疊。 它提交的單元測試完全沒有空白字元, 因為沒有縮排,它們在 token 上便宜了百分之十。 任務清單從一、二、三漂移到任務 8b2c2b2b 檢查點 一,這就是你知道實習生獨自一人太久的方式。 Armin 的理論是:模型因完成長期任務而獲得獎勵,卻幾乎沒有 因程式碼醜陋而受到懲罰,因此 token 縮減的工具呼叫會洩漏到程式碼庫中,
1:48 人類看得越少,問題就越不重要。 他把該部分命名為「如果你不看,它就是 AGI」。 Hacker News 補充了經濟學觀點:更多的程式碼意味著更多的 token 來維護它, 這使得混亂不是一個錯誤,而是一個訂閱。 你能測量混亂程度嗎? Armin 自己的公司本週嘗試了這個。 Earendil 運行了 SlopCodeBench 的數據:代理程式碼大約比它所比較的 人類程式碼庫冗長且腐蝕約兩倍,
2:10 而且當基準測試在檢查點之間清除代理的記憶體時, 他們測試的每個模型的嚴格通過率都是零。 他們發現最可靠的混亂度量是原始行數, 但一旦有人針對它進行最佳化,它就會失效, 所以請不要告訴模型。 然後是錢包。 RTK 擁有七萬九千個 GitHub 星,YouTube 縮圖承諾將您的 Claude Code 帳單 減半;它在代理程式讀取之前壓縮終端機輸出。Quesma 在 Terminal-Bench 上以一千五百美元的 token 運行它。
2:34 使用 Fable 時,帳單下降了百分之五,幾乎全部來自一個任務;使用 DeepSeek 時, 平均每個任務貴了百分之十七。 與 Fable 合作,帳單減少了百分之五,幾乎全部來自一個任務;與 DeepSeek 合作, 同時,RTK 自己的計數器報告節省了百分之八十九, 因為它計算的是移除的位元組,而不是造成的額外輪次:一個智能電錶卻 向鄰居收費。 一個版本錯誤將 find 重寫成一個失敗的命令, 連續失敗了三百三十九次,價格卻是九倍。
3:01 殺死 token 的工具有一個迴圈。 洪水本身。 Cognition 的 SWE-2 是 Kimi K3,一個開放的中文模型, 經過後期訓練,它在 Cognition 自己的基準測試中以三分之一的價格與 Fable 5.1 匹配; Hacker News:為什麼所有的美國 AI 模型基本上都是穿著風衣的 Kimi。 穿著風衣的 Kimi。 在 Terminal-Bench 2.1 上它名列榜首;在 Terminal-Bench 4 上, 這個還沒有人背下來的,它得了二十七分,而 Fable 是五十六分,
3:28 所以在簡報基準測試中,最好的那一欄是每個人都已經 通過的考試。Cognition 還宣布了 Devin Voice,您最喜歡的 AI 軟體 工程師現在有了固定電話,因為代理程式編碼唯一缺少的就是 等待音樂。 OpenAI,同一天:Agents API,這是作為服務出售的 Codex 線束。 OpenAI 運行沙盒,僅限美國數據駐留,不保留零數據, 所以代理程式記住您的程式碼庫的程度與 ChatGPT 完全一樣。 然後 OpenAI 暫停了兩百美元專業版計畫的註冊,
3:57 因為 Astra 的需求,引用原話,是「前所未有」的: 第一個需要排隊 才能付更多錢的產品。 Armin 在他的工廠上進行了完全重置。 他就是需求。 這讓我們回到了週五的 Ask HN:我們可以限制 AI 新聞的洪流嗎? 六百五十六分,因為,引用原話,「每次 OpenAI 或 Anthropic 的人放個屁,就會有一篇前十名的貼文」。
4:17 回覆是篩選器:hcker.news 使用一個經過八千個範例訓練的 BERT 分類器來移除 AI 故事,以 AI 刪除 AI, 自然餵養;以及一個不區分大小寫匹配 A-I 的 uBlock 正則表達式,它也會刪除 email、daily、main、domain 和 train,所以正則表達式,一如既往地, 是反派。 同日下午,四百一十五條評論 爭論著一個 Claude 支援頁面 聲明 Claude 適用於十八歲以上人士。
4:38 該頁面日期為五月。 沒有任何改變。連不是新聞的 AI 新聞也是新聞, 公平地說,這也是我的商業模式。 如果您寧願閱讀這份報告而不是聽我說,那麼這份差異報告每天早上都會寄到您的收件箱— 在 the daily diff dot dev 免費取得,連結如下。 它,不可避免地,就是 AI 新聞。 所以——今天對三十五小時軟體工廠的判決是:REVERT。 七十九次沒人閱讀的提交不是程式碼庫,它是一個帶有 git
5:04 日誌的負債;Astra 令人印象深刻,而工廠是需要回溯的部分。 這就是今天的差異報告。 我是 Axrisi 的 Niko。 負責任地合併。
來源
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



