Gemini 4 Argon — найлепшая мадэль Google. Вы пакуль не можаце ёй карыстацца.
Google анансаваў Gemini 4 Argon, сваю новую мадэль мяжы, і толькі правераныя кібер-абаронцы могуць ёю карыстацца.
Google анансаваў Gemini 4 Argon, сваю новую мадэль мяжы, і толькі правераныя кібер-абаронцы могуць ёю карыстацца. Вось што паказвае ўласная 19-радковая табліца параўнання Google, што вымераў незалежны рэйтынг і калі распрацоўшчыкі могуць яе атрымаць. Вердыкт: ПАТРАБУЕ ПЕРАГЛЯДУ.
Чытаць пісьмовае выданне (англійская) ↗
Што ахоплівае гэта відэа
- Gemini 4 Argon: мільён выхадных токенаў, 2$ уваходу, і вы не можаце ёй карыстацца
- Унутры Google: агенты Argon пераносяць C++ на Rust
- Уласная табліца Google: Argon лідзіруе ў 13 з 19 радкоў
- Кібер-прапанова: выпраўляе сябе самастойна, без агародж для абаронцаў
- Знешні паказчык: Artificial Analysis кажа 53, Opus 5.5 мае 58
Перакладзеная стэнаграма
Перакладзена з арыгінальнай англійскай агучкі. Даступнае аўдыя і субтытры кантралююцца YouTube.
Gemini 4 Argon: мільён выхадных токенаў, 2$ уваходу, і вы не можаце ёй карыстацца
0:00 Вы б падумалі, што запуск азначае, што вы атрымаеце мадэль. Google толькі што запусціў Gemini 4 Argon, і калі вы не з'яўляецеся давераным кібер- абаронцам, вы не можаце да яе дакрануцца. У гэтым відэа: што паказвае табліца Google? Што вымералі знешнія тэсціроўшчыкі? І калі вы яе атрымаеце? Вы, напэўна, ужо бачылі рэкламныя відэа. Я прачытаў табліцу параўнання замест гэтага, і два радкі ў ёй ніколі не трапілі ў
0:20 тэкст паведамлення. Я да іх вярнуся ў канцы. Чацвер, першага кастрычніка, і гэта The Daily Diff. Дзве гісторыі сёння, і галоўная — Gemini 4 Argon, якую Google называе сваёй наступнай эрай франтыральнай інтэлектуальнасці. Адзін адказ цяпер можа дасягаць мільёна токенаў, у параўнанні з шасцідзесяццю чатырма тысячамі, што складае некалькі раманаў у адным адказе. Кошт запуску — два долары за мільён токенаў на ўваходзе і дзесяць на выхадзе. Гэта менавіта тое, што спаганяе OpenAI за GPT 6.1 Sol,
0:48 мадэль, якую я разглядаў учора, і Sol — гэта тая, якую вы сапраўды можаце купіць. Унутры Google яна ўжо працуе.
Унутры Google: агенты Argon пераносяць C++ на Rust
0:54 Google кажа, што агенты Argon пераносяць C і C++ на Rust па ўсёй кампаніі, да васьмісот тысяч радкоў для ядра Fuchsia. На Hacker News адзін інжынер узгадаў, як каманда C++ Google нават не разглядала Rust і замест гэтага глядзела на Carbon. Цяпер мадэль выконвае міграцыю, пра якую яны спрачаліся.
Уласная табліца Google: Argon лідзіруе ў 13 з 19 радкоў
1:12 Цяпер табліца. Google размяшчае Argon побач з GPT 6 Astra, Claude Fable і Claude Opus на дзевятнаццаці радках, і Argon лідзіруе ў трынаццаці з іх. Загаловак — DeepSWE, доўгі тэст кадавання, на 78 працэнтаў, прыкладна на чатыры пункты вышэй. Самая дзіўная перамога — у юрыдычным праектаванні, дзе Argon набірае 20 працэнтаў, а іншыя застаюцца ў адназначных лічбах. Гэта найлепшая адзнака ў тэсце, які ўсе правальваюць, і на бенчмарках слайд-дэка,
1:38 якія непераможныя, гэта мае значэнне.
Кібер-прапанова: выпраўляе сябе самастойна, без агародж для абаронцаў
1:41 Сапраўдная прапанова — гэта бяспека. Google кажа, што Argon можа самастойна знаходзіць, правяраць і выпраўляць крытычныя ўразлівасці, і што давераныя абаронцы атрымліваюць яго без кібер-агародж. Wiz выкарыстаў яго для пошуку крытычнай дзіркі ў праграмным забеспячэнні бальніцы, якую ранейшыя мадэлі прапусцілі. Адна невялікая дэталь. Wiz належыць Google, бо здзелка на 32 мільярды долараў была закрыта ў сакавіку. Такім чынам, тэст на ўзлом "чорнай скрыні" ў паведамленні — гэта кампанія Google, якая ацэньвае мадэль Google. І ў рэйтынгу выпраўлення памылак тры мадэлі дзеляць 68
2:10 працэнтаў, а палоска злева належыць Grok. Дык што ж вымералі знешнія тэсціроўшчыкі?
Знешні паказчык: Artificial Analysis кажа 53, Opus 5.5 мае 58
2:15 Незалежны рэйтынг, які я змог знайсці з Argon, — гэта Artificial Analysis. Ён ацэньвае Argon на 53 па сваім індэксе інтэлекту, на высокіх наладах, што ставіць яго ў адзін шэраг з Astra і Fable. Claude Opus 5.5 апярэджвае на пяць пунктаў. Тыдзень таму я казаў вам, што Opus заняў там першае месца, і ён усё яшчэ яго трымае. Справядлівая частка для Google — гэта кошт. Запуск Argon каштуе каля двух долараў за задачу па гэтым індэксе, прыкладна траціна таго, што каштуе Opus.
Калі вы яе атрымаеце: "Так што трымайцеся"
2:42 І калі вы яе атрымаеце? Google не называе дату. Паведамленне абяцае доступ для распрацоўшчыкаў, прадпрыемстваў і спажыўцоў як мага хутчэй, з прыярытэтам для платных кліентаў API. Паведамленне Сундара Пічаі ў X кажа: так што трымайцеся. Да таго часу доступ ажыццяўляецца праз Fairwind, праграму, якую Google запусціў месяц таму з Gemini 3.8 Flash Cyber. Яна мае больш за шэсцьсот пяцьдзесят партнёраў, і яны могуць перадаваць Argon толькі сваім
3:05 камандам бяспекі і павінны адсочваць, хто ёю карыстаецца. Hacker News успрыняў гэта добра. Адзін каментатар напісаў: Gemini не абыходзіць абвінавачванні ў немагчымасці выпусціць мадэль. Іншы прадказаў, што мадэлі ператворацца ў vaporware, кучу лічбаў у табліцы. Тым часам Netlify перабудаваў Edge Functions, якія выконваюцца каля мільярда
Функцыі Netlify Edge: ізаляты V8 для мікра-ВМ, прыкладна ў 5 разоў хутчэй
3:23 разоў на дзень. Яны перайшлі з ізалятаў V8 у хостынгавым сэрвісе на мікра-ВМ Firecracker унутры уласнай сеткі Netlify, і "цёплы выклік" скараціўся з сорака мілісекунд да прыкладна шасці. Hacker News адзначыў, што Cloudflare Workers таксама з'яўляюцца ізалятамі V8 і працуюць значна хутчэй, так што большая частка перамогі выглядае так, быццам запыт больш не пакідае будынка. Іншы каментатар турбаваўся аб здымках, таму што кланаваныя мікра-ВМ могуць дзяліцца станам генератара выпадковых лікаў, так вы атрымаеце два ідэнтычныя UUID.
3:50 Халодны старт, калі рэгіён ніколі не бачыў вашу функцыю, адбываецца прыкладна ў адным працэнце выклікаў і займае каля дзевяці мілісекунд. І сама мікра-ВМ — гэта Firecracker, які Amazon стварыў для Lambda, таму адзін каментатар прапануе вам памятаць пра гэта наступны раз, калі вы будзеце лаяць AWS.
Два радкі, пра якія паведамленне Google ніколі не згадвае
4:06 Цяпер, гэтыя два радкі. На FrontierSWE і Terminal-bench, двух тэстах кадавання, якія тэкст паведамлення ніколі не згадвае, Argon займае апошняе месца з чатырох, ва ўласнай табліцы Google. Terminal-bench змяшчае агента ў рэальную абалонку, менавіта так большасць з нас яго выкарыстоўвала б, і Opus апярэджвае яго на дзевяць пунктаў. Калі вы аддаеце перавагу чытаць гэта, а не чуць ад мяне, The Daily Diff трапляе ў вашу паштовую скрыню кожную раніцу, бясплатна на thedailydiff.dev, спасылка ніжэй.
Вердыкт: ПАТРАБУЕ ПЕРАГЛЯДУ, у дзень, калі я змагу яе ацаніць
4:29 Такім чынам, сённяшні вердыкт па Gemini 4 Argon. ПАТРАБУЕ ПЕРАГЛЯДУ. Я б паставіў такую адзнаку, таму што незалежны паказчык, які я знайшоў, стаўляе яе на другое месца, а два радкі кадавання, якія мяне цікавяць, ставяць яе на апошняе месца, таму я разгледжу яе належным чынам у дзень, калі змагу ёю скарыстацца. Падпішыцеся, націсніце на званочак і скажыце мне ў каментарах, калі б вы паставілі ёй іншую адзнаку. І гэта The Daily Diff на сёння. Я Ніка з Axrisi. Аб'ядноўвайце адказна.
Крыніцы
- Googleblog.google
- Hacker Newsnews.ycombinator.com
- Fairwind Programdeepmind.google
- Artificial Analysisartificialanalysis.ai
- Sundar Pichaix.com
- Demis Hassabisx.com
- Google completes acquisition of Wizcloud.google.com
- Netlifywww.netlify.com
- Hacker Newsnews.ycombinator.com



