+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Gemini 4 Argon 是 Google 最好的模型。你还不能使用它。

Google 发布了其新的前沿模型 Gemini 4 Argon,目前只有受信任的网络防御者才能使用。

Google 发布了其新的前沿模型 Gemini 4 Argon,目前只有受信任的网络防御者才能使用。以下是 Google 自己的 19 行基准测试表格显示的内容、独立排行榜的测量结果,以及开发者何时可能获得它。结论:NEEDS REVIEW。

阅读书面版(英文) ↗

本视频涵盖的内容

  • Gemini 4 Argon:一百万个输出令牌,输入 2 美元,但你还不能用
  • Google 内部:Argon 代理将 C++ 移植到 Rust
  • Google 自己的表格:Argon 在 19 行中独占 13 行鳌头
  • 网络宣传:可自行打补丁,防御者无护栏
  • 外部数据:Artificial Analysis 称 53,Opus 5.5 为 58

翻译的文字记录

译自英文原版旁白。可用音频和字幕由 YouTube 控制。

Gemini 4 Argon:一百万个输出令牌,输入 2 美元,但你还不能用

0:00 你可能会认为发布就意味着你可以使用该模型。 Google 刚刚发布了 Gemini 4 Argon,除非你是一个受信任的网络 防御者,否则你无法使用它。 在本视频中:Google 的表格显示了什么? 外部测试人员测量了什么? 你何时能获得它? 你可能已经看过了那些炒作视频。 我反而阅读了基准测试表格,其中有两行从未出现在该

0:20 帖子的正文中。我将在最后讨论它们。 今天是 10 月 1 日星期四,这里是 The Daily Diff。 今天有两个故事,重头戏是 Gemini 4 Argon, Google 称之为前沿智能的新纪元。 一个答案现在可以达到一百万个令牌,高于六万四千个, 这相当于一次回复中包含了数部小说。 发布价格是每百万个输入令牌 2 美元,输出 10 美元。 这与 OpenAI 为我昨天介绍的 GPT 6.1 Sol 收费完全相同,

0:48 而 Sol 是你可以实际购买的模型。 在 Google 内部,它已经投入使用了。

Google 内部:Argon 代理将 C++ 移植到 Rust

0:54 Google 表示 Argon 代理正在公司范围内将 C 和 C++ 移植到 Rust, Fuchsia 内核多达八十万行。 在 Hacker News 上,一位工程师回忆起 Google 的 C++ 团队甚至不会 考虑 Rust,而是选择了 Carbon。 现在,一个模型正在完成他们争论不休的迁移。

Google 自己的表格:Argon 在 19 行中独占 13 行鳌头

1:12 现在是表格部分。 Google 将 Argon 与 GPT 6 Astra、Claude Fable 和 Claude Opus 在 19 行中进行比较,Argon 在其中 13 行中拔得头筹。 标题是 DeepSWE,一个长时间的编码基准测试,达到 78%, 领先约 4 个百分点。 最奇怪的胜利是法律起草,Argon 获得 20%,而 其他模型则保持个位数。 这是所有人都不及格的测试中最好的成绩,在幻灯片

1:38 基准测试中,这是无可匹敌的,这很重要。

网络宣传:可自行打补丁,防御者无护栏

1:41 真正的卖点是安全性。 Google 表示 Argon 可以自行发现、验证和修补关键漏洞, 并且受信任的防御者可以在没有网络护栏的情况下使用它。 Wiz 使用它在一个医院软件中发现了一个早期模型 遗漏的关键漏洞。一个小细节。 Wiz 属于 Google,因为一笔 320 亿美元的交易已于 3 月达成。 因此,帖子中的黑盒黑客测试是 Google 公司对 Google 模型进行评级。在 bug 修复排行榜上,三个模型分享了 68%

2:10 的份额,最左边的条形图属于 Grok。 那么外部测试人员测量了什么?

外部数据:Artificial Analysis 称 53,Opus 5.5 为 58

2:15 我能找到的包含 Argon 的独立排行榜是 Artificial Analysis。它在其智能指数上对 Argon 评分 53 分, 在最高设置下,这与 Astra 和 Fable 持平。 Claude Opus 5.5 领先 5 分。 一周前我告诉过你 Opus 在那里名列榜首,它仍然保持着。 对于 Google 来说,公平的部分是账单。 在该指数上,Argon 每次运行任务的成本约为 2 美元, 大约是 Opus 成本的三分之一。

你何时能用上它:“所以请耐心等待”

2:42 你何时能获得它? Google 不会给出具体日期。 该帖子承诺将尽快向开发者、企业和消费者提供访问权限, 付费 API 客户优先。 Sundar Pichai 在 X 上的帖子写道,“所以请耐心等待”。 在此之前,访问权限通过 Fairwind 运行,这是 Google 一个月前 与 Gemini 3.8 Flash Cyber 合作启动的项目。 它有超过 650 个合作伙伴,他们可能只将 Argon 交给他们的

3:05 安全团队,并且必须跟踪谁使用了它。 Hacker News 对此反应良好。 一位评论者写道:“Gemini 未能摆脱无法发布模型的指控。” 另一个人预测模型会变成“空头产品”,表格上的一堆数字。 与此同时,Netlify 重建了 Edge Functions,每天运行约十亿次。

Netlify Edge Functions:V8 isolates 到 microVMs,速度约快 5 倍

3:23 他们从托管服务中的 V8 isolates 迁移到 Netlify 自己网络中的 Firecracker microVMs, 并且热调用时间从最高 40 毫秒下降到大约 6 毫秒。 Hacker News 指出 Cloudflare Workers 也是 V8 isolates 并且运行速度快得多,所以大部分的提升看起来是请求不再离开 机房。另一位评论者担心快照问题, 因为克隆的 microVMs 可以共享随机数状态, 这就是你得到两个相同 UUID 的原因。 冷启动,当一个区域从未见过你的函数时,

3:50 会影响大约 1% 的调用,大约需要 9 毫秒。 而 microVM 本身是 Firecracker,这是 Amazon 为 Lambda 构建的, 所以一位评论者建议你下次诅咒 AWS 时记住这一点。 现在,那两行。

Google 帖子中从未提及的两行

4:06 在 FrontierSWE 和 Terminal-bench 这两个帖子正文从未提及的编码测试中, Argon 在 Google 自己的表格中排名倒数第一,在四款模型中。 Terminal-bench 将代理放入真实的 shell 中,这是我们大多数人使用它的方式, Opus 领先它 9 个百分点。 如果你宁愿阅读而不是听我讲,diff 每天早上都会免费发送到你的收件箱, 网址是 daily diff dot dev,链接在下方。 所以,今天对 Gemini 4 Argon 的结论是。

结论:NEEDS REVIEW,等我能真正使用它时再评价

4:29 NEEDS REVIEW。我会这样标记它,因为我找到的独立数据显示它并列第二, 而我关心的两行编码测试中它排名最后, 所以我会在我能真正使用它的时候进行适当的评估。 订阅,点击小铃铛,在评论中告诉我你是否会给出不同的评价。 这就是今天的 diff。 我是来自 Axrisi 的 Niko。 负责任地合并。 SHIP IT。

来源

  1. Googleblog.google
  2. Hacker Newsnews.ycombinator.com
  3. Fairwind Programdeepmind.google
  4. Artificial Analysisartificialanalysis.ai
  5. Sundar Pichaix.com
  6. Demis Hassabisx.com
  7. Google completes acquisition of Wizcloud.google.com
  8. Netlifywww.netlify.com
  9. Hacker Newsnews.ycombinator.com

相关视频