+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Gemini 4 Argon 是 Google 最好的模型。你暫時還不能用它。

Google 宣佈推出其全新尖端模型 Gemini 4 Argon,目前只有受信任的網絡防禦者才能使用。

Google 宣佈推出其全新尖端模型 Gemini 4 Argon,目前只有受信任的網絡防禦者才能使用。以下是 Google 自己的 19 行基準測試表所顯示的結果、獨立排行榜的測量結果,以及開發人員何時才能獲得它。判決:NEEDS REVIEW。

閱讀書面版本(英文) ↗

本影片涵蓋的內容

  • Gemini 4 Argon:百萬輸出代幣,2 美元輸入,但你還不能用它
  • Google 內部:Argon 代理將 C++ 移植到 Rust
  • Google 自己的表格:Argon 在 19 行中佔據 13 行榜首
  • 網絡宣傳:自行修補,防禦者無護欄
  • 外部數據:Artificial Analysis 稱 53,Opus 5.5 達到 58

翻譯的文字記錄

從英文原文旁白翻譯。可用的音頻和字幕由 YouTube 控制。

Gemini 4 Argon:百萬輸出代幣,2 美元輸入,但你還不能用它

0:00 你可能會認為發佈就意味著你可以拿到模型。 Google 剛剛發佈了 Gemini 4 Argon,除非你是受信任的網絡 防禦者,否則你還不能接觸它。 在這段影片中:Google 的表格顯示了什麼? 外部測試人員測量了什麼? 以及你何時能拿到它? 你可能已經看過那些炒作影片了。 我反而閱讀了基準測試表格,其中有兩行從未出現在

0:20 文章的文字中。我會在結尾提及它們。 今天是 10 月 1 日星期四,這裡是 The Daily Diff。 今天有兩個故事,其中一個大新聞是 Gemini 4 Argon, Google 稱之為其下一代尖端智慧。 一個答案現在可以運行到一百萬個代幣,從六萬四千個增加, 這相當於單次回覆中包含數本小說。 發佈價格為每百萬個輸入代幣 2 美元,輸出代幣 10 美元。 這與 OpenAI 對 GPT 6.1 Sol 的收費完全相同,

0:48 我昨天介紹的模型,而 Sol 是你真正可以購買的模型。 在 Google 內部,它已經投入使用。

Google 內部:Argon 代理將 C++ 移植到 Rust

0:54 Google 表示 Argon 代理正在將 C 和 C++ 移植到 Rust, 遍及整個公司,Fuchsia 核心有多達八十萬行程式碼。 在 Hacker News 上,一位工程師回憶起 Google 的 C++ 團隊甚至不曾 考慮 Rust,反而選擇了 Carbon。 現在,一個模型正在執行他們曾經爭論的遷移工作。

Google 自己的表格:Argon 在 19 行中佔據 13 行榜首

1:12 現在來看表格。 Google 將 Argon 與 GPT 6 Astra、Claude Fable 和 Claude Opus 在 19 行中進行比較,Argon 在其中 13 行中脫穎而出。 頭條新聞是 DeepSWE,一個長時間的編碼基準測試,達到了 78%, 領先約 4 個百分點。 最奇怪的勝利是法律草稿,Argon 得分 20%,而 其他模型則保持個位數。 這是在所有人都會失敗的測試中取得的最好成績,而且在幻燈片

1:38 基準測試中,這是無可匹敵的,這才是重要的。

網絡宣傳:自行修補,防禦者無護欄

1:41 真正的賣點是安全性。 Google 表示 Argon 可以自行發現、驗證和修補關鍵漏洞, 而且受信任的防禦者可以在沒有網絡護欄的情況下獲得它。 Wiz 用它在醫院軟體中發現了一個關鍵漏洞,這是早期模型 錯過的。一個小細節。 Wiz 屬於 Google,因為 320 億美元的交易於 3 月完成。 所以文章中的黑箱駭客測試是一個 Google 公司在評估一個 Google 模型。在漏洞修復排行榜上,三個模型共享 68%,

2:10 而最左邊的長條屬於 Grok。 那麼,外部測試人員測量了什麼?

外部數據:Artificial Analysis 稱 53,Opus 5.5 達到 58

2:15 我能找到帶有 Argon 的獨立排行榜是 Artificial Analysis。它在智慧指數上給 Argon 評分 53, 在「高」設定下,這與 Astra 和 Fable 並列。 Claude Opus 5.5 領先五分。 一週前我告訴你 Opus 在那裡名列前茅,它仍然保持著這個位置。 對 Google 而言公平的部分是費用。 Argon 在該指數上每次任務運行成本約 2 美元, 大約是 Opus 成本的三分之一。

你何時能拿到它:「所以請耐心等待」

2:42 那麼你何時能拿到它? Google 不會給出日期。 文章承諾開發人員、企業和消費者將盡快獲得訪問權限, 付費 API 客戶優先。 Sundar Pichai 在 X 上的文章寫道:「所以請耐心等待」。 在此之前,訪問權限通過 Fairwind 運行,這是 Google 一個月前 與 Gemini 3.8 Flash Cyber 啟動的計畫。 它有超過 650 個合作夥伴,他們可能只將 Argon 交給他們的

3:05 安全團隊,並且必須追蹤誰在使用它。 Hacker News 對此反應良好。 一位評論者寫道:「Gemini 沒能擺脫無法發佈模型的指控」。 另一位預測模型會變成虛假產品,只是一堆表格上的數字。 與此同時,Netlify 重建了 Edge Functions,每天運行約十億次。

Netlify Edge Functions:從 V8 isolates 到 microVMs,速度約快 5 倍

3:23 它們每天運行約十億次。 他們從託管服務中的 V8 isolates 轉移到 Netlify 自己網絡內的 Firecracker microVMs, 熱啟動時間從最長 40 毫秒降至約 6 毫秒。 Hacker News 指出 Cloudflare Workers 也是 V8 isolates, 並且運行速度更快,所以大部分的提升看起來像是請求不再 離開建築物。另一位評論者擔心快照, 因為克隆的 microVMs 可以共享隨機數狀態, 這就是你如何得到兩個相同的 UUID 的方法。

3:50 冷啟動,當一個區域從未見過你的函數時, 大約會佔據 1% 的呼叫,並需要大約 9 毫秒。 而 microVM 本身是 Firecracker,這是 Amazon 為 Lambda 構建的, 所以一位評論者建議你在下次咒罵 AWS 時記住這一點。

Google 文章中從未提及的兩行

4:06 現在,那兩行。 在 FrontierSWE 和 Terminal-bench 這兩個文章中從未提及的編碼測試中, Argon 在 Google 自己的表格中在四個模型中排名最後。 Terminal-bench 將代理放入真實的 shell 中,這是我們大多數人使用它的方式, Opus 以九分領先。 如果你寧願閱讀而不是聽我說,The Daily Diff 每天早上都會免費 發送到你的收件箱,網址在 thedailydiff.dev,連結如下。

判決:NEEDS REVIEW,等我能真正使用它那天

4:29 那麼,今天對 Gemini 4 Argon 的判決是。 NEEDS REVIEW。我會這樣標註它,因為我找到的獨立數據顯示它 並列第二,而我關心的兩行編碼測試中它排名最後, 所以我會在能夠實際使用它那天進行適當的審查。 訂閱,點擊鈴鐺,並在評論中告訴我你是否會 有不同的看法。這就是今天的 The Daily Diff。 我是 Axrisi 的 Niko。 Merge responsibly。

來源

  1. Googleblog.google
  2. Hacker Newsnews.ycombinator.com
  3. Fairwind Programdeepmind.google
  4. Artificial Analysisartificialanalysis.ai
  5. Sundar Pichaix.com
  6. Demis Hassabisx.com
  7. Google completes acquisition of Wizcloud.google.com
  8. Netlifywww.netlify.com
  9. Hacker Newsnews.ycombinator.com

相關影片