Armin Ronacher 独自留下了 GPT-6 Astra 35 小时。
Armin Ronacher (Flask, Jinja) 给 GPT-6 Astra 一个提示,然后让它独自运行了 35 小时:大约十亿个 token,约 1,200 美元,79 次提交,75,000 行代码 — 结果是“绝对没有任何价值”。
Armin Ronacher (Flask, Jinja) 给 GPT-6 Astra 一个提示,然后让它独自运行了 35 小时:大约十亿个 token,约 1,200 美元,79 次提交,75,000 行代码 — 结果是“绝对没有任何价值”。它恢复的代码本身就是故事:通过 Python 字符串拼接 heredoc 打补丁的 C 文件,Python 启动 Node,Node 再启动 PowerShell,以及因删除空格可节省 10% token 而去除了所有空格的单元测试。两项测量结果支持了他的观点:Earendil 的 SlopCodeBench 数据(代理代码比人类代码仓库冗长且腐蚀约两倍,严格通过率为 0%)和 Quesma 对 RTK(7.9 万颗星,“自身计数器显示节省了 89% 的 token”,使用 DeepSeek 时每个任务成本增加 17%)的 1,500 美元基准测试。此外还有:Cognition 的 SWE-2(穿着风衣的 Kimi K3,Terminal-Bench 2.1 上得分为 92.8,Terminal-Bench 4 上为 27.3),OpenAI 的 Agents API 和暂停的 200 美元 Pro 版注册,以及周五 Hacker News 上要求减少 AI 新闻的帖子。结论:REVERT。
本视频涵盖的内容
- Armin Ronacher:GPT-6 Astra 无人看管 35 小时,约 1,200 美元,79 次提交,增加 7.5 万行代码,没有任何成果交付。
- Earendil / SlopCodeBench:代理代码比人类代码仓库冗长且腐蚀约 2 倍;严格通过率为 0%。
- Quesma:RTK 报告节省了 89% 的 token,但使用 DeepSeek 时 Terminal-Bench 成本增加了 17%;重写循环连续失败了 339 次。
- Cognition SWE-2:基于 Kimi K3 后训练,在 FrontierCode 上以三分之一的价格与 Fable 5.1 匹配;TB 2.1 得分 92.8,TB 4 得分 27.3;Devin Voice。
- OpenAI Agents API(作为服务提供的 Codex harness,仅限美国,无 ZDR);因 Astra 需求暂停 200 美元专业版注册。
翻译的文字记录
译自英文原版旁白。可用音频和字幕由 YouTube 控制。
0:00 编写 Flask 的 Armin Ronacher 给了 GPT-6 Astra 一个简单的提示,然后 让它独自运行了三十五小时。 它返回了七万五千行代码,并且用他的话说, 绝对没有任何价值,这使其成为有史以来最真实的 软件工厂。 他周三发布了这份报告。 周四,Cognition 发布了 SWE-2,OpenAI 发布了 Agents API 并暂停了其两百美元套餐的注册,
0:24 因为 Astra 占用了服务器。 周五,这份报告登上了 Hacker News 的头版, 就在一篇请求 Hacker News 停止发布关于 AI 帖子的下面几行。 在此视频中:Astra 无人监督一天半的产出, 将混乱量化的两个测量方法,为什么一个拥有七万九千颗星的工具 会增加你的账单,以及 Hacker News 如何尝试使用 AI 来过滤 AI。 AI,使用 AI。 今天是 9 月 11 日星期五,这是 The Daily Diff。
0:53 工厂。一个提示:用虚拟线程和词法作用域构建一个 Python。 Astra 记录了自己的笔记,启动了自己的子代理, 然后一直运行,直到 Armin 拔掉插头,一天半后,大约花费了一千二百美元。 七十九次提交,所以每次提交花费十五美元半, 这大致是人类的收费,只不过人类最终会停止。 代码就是故事。 Astra 没有使用编辑工具,而是通过管道传输 Python heredoc 来修补 C 文件,这些 heredoc 读取文件,字符串替换一个函数,然后写回去。
1:20 为了运行一个 Windows 测试,它编写了 Python,然后 Python 启动 Node,Node 又启动了 PowerShell,一个带有护照的调用堆栈。 它提交的单元测试根本没有空格, 因为没有缩进,它们在 token 上便宜了百分之十。 任务列表从一、二、三漂移到了任务 8b2c2b2b 检查点 一,这就是你知道实习生独自待太久了。 Armin 的理论:模型因完成长期任务而获得奖励,但对丑陋的代码几乎没有 惩罚,所以 token 高尔夫化的工具调用泄露到代码库中,
1:48 并且越少人类查看,就越不重要。 他把这部分标题为“如果你不看,那就是通用人工智能”。 Hacker News 补充了经济学观点:更多的代码意味着更多的 token 来维护它, 这使得混乱不是一个 Bug,而是一种订阅。 你能测量混乱吗? Armin 自己的公司本周尝试了。 Earendil 运行了 SlopCodeBench 的数据:代理代码比人类仓库冗长约两倍, 并且腐蚀程度是其两倍。
2:10 当基准测试在检查点之间清除代理的内存时, 他们测试的每个模型的严格通过率都是零。 他们发现最可靠的混乱指标是原始行数, 但一旦有人为此优化,它就不再起作用了, 所以请不要告诉模型。 然后是钱包。 RTK 在 GitHub 上有七万九千颗星,YouTube 缩略图承诺可以 将你的 Claude 代码账单减半;它在代理读取终端输出之前对其进行压缩。
2:34 Quesma 在 Terminal-Bench 上使用了一千五百美元的 token 运行它。 使用 Fable,账单下降了百分之五,几乎都来自一个任务;使用 DeepSeek, 平均每个任务的成本增加了百分之十七。 同时,RTK 自己的计数器报告节省了百分之八十九, 因为它计算的是移除的字节数,而不是造成的额外回合数:一个智能电表,却 向邻居收费。 一个版本错误将 find 重写成一个失败的命令, 连续失败了三百三十九次,价格是九倍。
3:01 这个吞噬 token 的工具有一个循环。 洪水本身。 Cognition 的 SWE-2 是 Kimi K3,这个开源的中文模型, 经过后期训练,使其在 Cognition 自己的基准测试中以三分之一的价格与 Fable 5.1 匹配; Hacker News:为什么所有的美国 AI 模型基本上都是穿着风衣的 Kimi。 Kimi,穿着风衣。 在 Terminal-Bench 2.1 上它位居榜首;在 Terminal-Bench 4 上, 这个还没人记住的基准上,它得了二十七分,而 Fable 是五十六分,
3:28 所以在幻灯片基准测试中,最好的那一列是每个人都 已经通过的考试。Cognition 还宣布了 Devin Voice,你最喜欢的 AI 软件 工程师刚有了一部固定电话,因为智能编码唯一缺少的就是 等候音乐。 OpenAI,同一天:Agents API,作为服务出售的 Codex harness。 OpenAI 运行沙盒,仅限美国数据驻留,不支持零数据保留, 因此代理记住你的代码库的程度与 ChatGPT 记住的完全一样。 然后 OpenAI 暂停了二百美元专业版计划的注册,
3:57 因为 Astra 的需求,“前所未有”: 第一个有等待名单的产品 需要支付更多费用。 Armin 对他的工厂进行了全面重置。 他就是需求。 这就引出了周五的 Ask HN:我们能不能限制一下 AI 新闻的洪流, 六百五十六个赞,因为,引用一下,“每当 OpenAI 或 Anthropic 的人放个屁,就会有一个热门帖子。”
4:17 回复是过滤器:hcker.news 使用一个基于八千个例子训练的 BERT 分类器来删除 AI 故事,以 AI 删除 AI, 天然饲养;一个不区分大小写匹配 A-I 的 uBlock 正则表达式也会删除 email、daily、main、domain 和 train,所以正则表达式,一如既往, 是罪魁祸首。 同一天下午,四百一十五条评论 就一个 Claude 支持页面争论不休, 该页面称 Claude 适合十八岁以上用户。
4:38 该页面日期为五月。 什么也没变。甚至不是新闻的 AI 新闻也是新闻, 公平地说,这也是我的商业模式。 如果你想阅读而不是听我说,每天早上你的收件箱里都会收到 diff ——免费订阅 the daily diff dot dev,链接如下。 它不可避免地是 AI 新闻。 所以——今天对这个三十五小时软件工厂的裁决是:REVERT。 七十九次无人阅读的提交不是一个代码库,而是一个带有 git
5:04 日志的负债;Astra 令人印象深刻,但工厂这部分需要回滚。 这就是今天的 diff。 我是 Axrisi 的 Niko。 负责任地合并。
来源
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



