+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Gemini 4 Argon 是 Google 最好的模型。您還不能使用它。

Google 宣布推出其新的尖端模型 Gemini 4 Argon,目前只有值得信賴的網路防禦者可以使用。

Google 宣布推出其新的尖端模型 Gemini 4 Argon,目前只有值得信賴的網路防禦者可以使用。以下是 Google 自己的 19 行基準測試表所顯示的內容,獨立排行榜的測量結果,以及開發人員何時可能獲得它。判決:NEEDS REVIEW。

閱讀書面版(英文) ↗

本影片重點

  • Gemini 4 Argon:一百萬個輸出代幣,兩個美元的輸入,而且您還不能使用它
  • Google 內部:Argon 代理將 C++ 移植到 Rust
  • Google 自己的表格:Argon 在 19 行中領先 13 行
  • 網路推廣:自行修補,防禦者沒有防護措施
  • 外部數據:Artificial Analysis 稱 53,Opus 5.5 為 58

翻譯文字稿

譯自英文原版旁白。可用的音訊和字幕由 YouTube 控制。

Gemini 4 Argon:一百萬個輸出代幣,兩個美元的輸入,而且您還不能使用它

0:00 您可能會認為發布就代表您能獲得該模型。 Google 剛剛發布了 Gemini 4 Argon,除非您是值得信賴的網路 防禦者,否則您無法觸及它。 在本影片中:Google 的表格顯示了什麼? 外部測試人員測量了什麼? 以及您何時能獲得它? 您可能已經看過炒作影片了。 我反而閱讀了基準測試表,其中有兩行從未出現在

0:20 貼文內容中。我會在最後提到它們。 今天是 10 月 1 日星期四,這裡是 The Daily Diff。 今天有兩個故事,其中一個大新聞是 Gemini 4 Argon, Google 稱之為其「下一個時代的尖端智能」。 一個回答現在可以達到一百萬個代幣,從六萬四千個代幣增加, 這相當於單一回復中包含數本小說。 發布價格是每百萬個輸入代幣兩美元,輸出代幣十美元。 這與 OpenAI 對 GPT 6.1 Sol 的收費完全相同,

0:48 我昨天介紹的模型,而 Sol 是您可以實際購買的模型。 在 Google 內部,它已經開始運作。

Google 內部:Argon 代理將 C++ 移植到 Rust

0:54 Google 表示 Argon 代理正在將 C 和 C++ 移植到 Rust,遍及整個 公司,Fuchsia 核心多達八十萬行程式碼。 在 Hacker News 上,一位工程師回憶起 Google 的 C++ 團隊甚至不願 考慮 Rust,反而選擇了 Carbon。 現在,一個模型正在進行他們曾經爭論的遷移工作。

Google 自己的表格:Argon 在 19 行中領先 13 行

1:12 現在來看表格。 Google 將 Argon 與 GPT 6 Astra、Claude Fable 和 Claude Opus 並列在 19 行中,Argon 在其中 13 行中脫穎而出。 頭條是 DeepSWE,一個長編碼基準測試,以 78% 的成績領先, 領先約四個百分點。 最奇怪的勝利是法律草擬,Argon 獲得 20% 的分數,而 其他模型則保持在個位數。 這是所有人不及格的測試中最高的成績,而在簡報

1:38 基準測試中,這是無可匹敵的,這才是關鍵。

網路推廣:自行修補,防禦者沒有防護措施

1:41 真正的賣點是安全性。 Google 表示 Argon 可以自行發現、驗證和修補關鍵漏洞, 並且值得信賴的防禦者可以在沒有網路防護措施的情況下使用它。 Wiz 使用它在醫院軟體中發現了一個關鍵漏洞,這是早期模型 所遺漏的。一個小細節。 Wiz 屬於 Google,因為一項價值 320 億美元的交易於三月完成。 因此,貼文中的黑箱駭客測試是由 Google 公司評估 Google 模型。而在錯誤修復排行榜上,三個模型分享了 68%

2:10 的成績,最左邊的條形圖屬於 Grok。 那麼外部測試人員測量了什麼?

外部數據:Artificial Analysis 稱 53,Opus 5.5 為 58

2:15 我能找到的帶有 Argon 的獨立排行榜是 Artificial Analysis。它在其智能指數上給 Argon 打了 53 分, 在高設定下,這使其與 Astra 和 Fable 並列。 Claude Opus 5.5 領先五分。 一周前我告訴您 Opus 在那裡獲得了最高點,而且它仍然保持著。 對 Google 來說公平的部分是費用。 Argon 在該指數上每次任務的運行成本約為兩美元, 大約是 Opus 成本的三分之一。

您何時能獲得它:「所以請耐心等待」

2:42 那麼您何時能獲得它? Google 不會給出日期。 該貼文承諾盡快向開發人員、企業和消費者開放, 付費 API 客戶優先。 Sundar Pichai 在 X 上的貼文說:「所以請耐心等待。」 在此之前,訪問權限通過 Fairwind 運行,這是 Google 一個月前開始的 計劃,使用 Gemini 3.8 Flash Cyber。 它有超過 650 個合作夥伴,他們可能只會將 Argon 交給他們的

3:05 安全團隊,並且必須追蹤誰在使用它。 Hacker News 對此反應良好。 一位評論者寫道:「Gemini 沒能擺脫無法發布模型的指控。」 另一位預測模型會變成虛假產品,只是一堆表格上的數字。 同時,Netlify 重建了每天運行約十億次的 Edge Functions。

Netlify Edge Functions:V8 isolates 到 microVMs,速度約快 5 倍

3:23 它們從託管服務中的 V8 isolates 轉移到 Netlify 自己網路中的 Firecracker microVMs, 熱呼叫從最多 40 毫秒下降到 約 6 毫秒。Hacker News 指出 Cloudflare Workers 也是 V8 isolates 並且運行速度快得多,所以大部分的勝利看起來是請求不再離開 建築物。另一位評論者擔心快照, 因為複製的 microVMs 可以共享隨機數狀態, 這就是您如何獲得兩個相同的 UUID 的方式。 冷啟動,當一個區域從未見過您的功能時,

3:50 約佔呼叫的 1%,耗時約 9 毫秒。 而 microVM 本身是 Firecracker,這是 Amazon 為 Lambda 構建的, 所以一位評論者建議您下次咒罵 AWS 時記住這一點。 現在,那兩行。

Google 貼文從未提及的兩行

4:06 在 FrontierSWE 和 Terminal-bench 這兩個貼文內容從未提及的編碼測試中, Argon 在 Google 自己的表格中,在四個模型中排名最後。 Terminal-bench 將代理放入實際的 shell 中,這是我們大多數人會使用它的方式, Opus 以九分領先。 如果您寧願閱讀這份內容而不是聽我說,The Daily Diff 每天早上都會免費寄送到您的收件箱, 網址是 thedailydiff.dev,連結在下方。 所以,今天對 Gemini 4 Argon 的判決是。

判決:NEEDS REVIEW,等到我能實際使用它那天

4:29 NEEDS REVIEW。我會這樣標記它,因為我找到的獨立數據顯示它並列第二, 而我關心的兩行編碼測試顯示它排名最後, 所以等到我能實際使用它那天,我會好好地審查它。 訂閱,點擊小鈴鐺,並在評論中告訴我您是否會給出不同的標記。 這就是今天的 The Daily Diff。 我是 Axrisi 的 Niko。 負責任地合併。 SHIP IT。

來源

  1. Googleblog.google
  2. Hacker Newsnews.ycombinator.com
  3. Fairwind Programdeepmind.google
  4. Artificial Analysisartificialanalysis.ai
  5. Sundar Pichaix.com
  6. Demis Hassabisx.com
  7. Google completes acquisition of Wizcloud.google.com
  8. Netlifywww.netlify.com
  9. Hacker Newsnews.ycombinator.com

相關影片