Gemini 4 Argon е най-добрият модел на Google. Все още не можете да го използвате.
Google обяви Gemini 4 Argon, своя нов граничен модел, и само доверени киберзащитници могат да го използват.
Google обяви Gemini 4 Argon, своя нов граничен модел, и само доверени киберзащитници могат да го използват. Ето какво показва собствената 19-редова бенчмарк таблица на Google, какво измери независимата класация и кога разработчиците може да го получат. Присъда: НЕОБХОДИМ Е ПРЕГЛЕД.
Прочетете писменото издание (английски) ↗
Какво обхваща този видеоклип
- Gemini 4 Argon: един милион изходни токени, $2 вход и не можете да го използвате
- Вътре в Google: агенти на Argon прехвърлят C++ към Rust
- Собствената таблица на Google: Argon оглавява 13 от 19 реда
- Кибер предложението: поправя сам, без предпазни мерки за защитници
- Външното число: Artificial Analysis казва 53, Opus 5.5 има 58
Преведен препис
Преведено от оригиналния английски разказ. Наличните аудио и субтитри се контролират от YouTube.
Gemini 4 Argon: един милион изходни токени, $2 вход и не можете да го използвате
0:00 Бихте си помислили, че стартирането означава, че получавате модела. Google току-що пусна Gemini four Argon и освен ако не сте доверен кибер защитник, не можете да го докоснете. В това видео: какво показва таблицата на Google? Какво измериха външните тестери? И кога ще го получите? Вероятно вече сте виждали рекламните видеоклипове. Аз прочетох таблицата с бенчмаркове вместо това, и два реда от нея никога не попаднаха в
0:20 текста на публикацията. Ще стигна до тях накрая. Четвъртък е, първи октомври, и това е The Daily Diff. Две истории днес, а голямата е Gemini four Argon, който Google нарича своята следваща ера на гранична интелигентност. Един отговор вече може да достигне до един милион токени, от шейсет и четири хиляди, което са няколко романа в един отговор. Стартовата цена е два долара на милион токени вход и десет изход. Това е точно това, което OpenAI таксува за GPT six point one Sol,
0:48 моделът, който покрих вчера, а Sol е този, който всъщност можете да купите. Вътре в Google, той вече работи.
Вътре в Google: агенти на Argon прехвърлят C++ към Rust
0:54 Google казва, че агентите на Argon пренасят C и C++ към Rust в цялата компания, до осемстотин хиляди реда за ядрото на Fuchsia. В Hacker News един инженер си спомни, когато екипът на Google за C++ дори нямаше да разгледа Rust и вместо това погледна Carbon. Сега модел прави миграцията, за която те спориха.
Собствената таблица на Google: Argon оглавява 13 от 19 реда
1:12 Сега таблицата. Google поставя Argon до GPT six Astra, Claude Fable и Claude Opus на деветнадесет реда, и Argon излиза начело в тринадесет от тях. Заглавието е DeepSWE, дълъг бенчмарк за кодиране, на седемдесет и осем процента, около четири точки по-добър. Най-странната победа е в правното изготвяне, където Argon постига двадесет процента, а другите остават в едноцифрени числа. Това е най-добрата оценка на тест, на който всички се провалят, и на слайд-дек
1:38 бенчмарковете, които са непобедени, това е важно.
Кибер предложението: поправя сам, без предпазни мерки за защитници
1:41 Истинското предложение е сигурността. Google казва, че Argon може сам да намира, валидира и поправя критични уязвимости, и че доверените защитници го получават без киберзащитни мерки. Wiz го използва, за да открие критична дупка в болничен софтуер, която по-ранните модели бяха пропуснали. Един малък детайл. Wiz принадлежи на Google, откакто сделка за тридесет и два милиарда долара беше приключена през март. Така че тестът за хакване на черна кутия в публикацията е компания на Google, оценяваща модел на Google. И в класацията за поправка на бъгове, три модела си поделят шейсет и осем
2:10 процента, а лентата в най-ляво принадлежи на Grok. И така, какво измериха външните тестери?
Външното число: Artificial Analysis казва 53, Opus 5.5 има 58
2:15 Независимата класация, която можах да намеря с Argon в нея, е Artificial Analysis. Тя оценява Argon с петдесет и три по своя индекс за интелигентност, при висока настройка, което го изравнява с Astra и Fable. Claude Opus five point five е пет точки напред. Преди седмица ви казах, че Opus е заел първото място там, и все още го държи. Справедливата част за Google е сметката. Едно изпълнение на Argon струва около два долара на задача по този индекс, грубо една трета от цената на Opus.
Кога ще го получите: „Затова дръжте здраво“
2:42 И кога ще го получите? Google няма да даде дата. Публикацията обещава достъп за разработчици, предприятия и потребители възможно най-скоро, като първи ще са клиентите на платения API. Публикацията на Сундар Пичай в X казва: „Затова дръжте здраво“. Дотогава достъпът преминава през Fairwind, програмата, която Google стартира преди месец с Gemini three point eight Flash Cyber. Има над шестстотин и петдесет партньори и те могат да предадат Argon само на своите
3:05 екипи по сигурността и трябва да следят кой го използва. Hacker News го прие добре. Един коментатор написа: „Gemini не побеждава твърденията, че не може да пусне модел.“ Друг предсказа, че моделите се превръщат във vaporware, куп числа в таблица. Междувременно Netlify преработи Edge Functions, които се изпълняват около един милиард
Netlify Edge Functions: V8 isolates към microVMs, около 5 пъти по-бързи
3:23 пъти на ден. Те преминаха от V8 изолати в хоствана услуга към Firecracker microVMs в собствената мрежа на Netlify, и топлото повикване спадна от до четиридесет милисекунди до около шест. Hacker News посочи, че Cloudflare Workers също са V8 изолати и работят много по-бързо, така че по-голямата част от печалбата изглежда е, че заявката вече не напуска сградата. Друг коментатор се притесни за снимките, защото клонираните microVMs могат да споделят състоянието на произволни числа, което е начинът да получите два идентични UUID.
3:50 Студен старт, когато даден регион никога не е виждал вашата функция, засяга около един процент от обажданията и отнема около девет милисекунди. Самата microVM е Firecracker, която Amazon създаде за Lambda, така че един коментатор предлага да си спомните това следващия път, когато проклинате AWS.
Двата реда, които публикацията на Google никога не споменава
4:06 Сега, тези два реда. На FrontierSWE и Terminal-bench, два теста за кодиране, които текстът на публикацията никога не споменава, Argon е последен от четири, в собствената таблица на Google. Terminal-bench поставя агент в истински шел, което е начинът, по който повечето от нас биха го използвали, и Opus го води с девет точки. Ако предпочитате да прочетете това, отколкото да ме чуете да го казвам, diff-ът пристига във вашата пощенска кутия всяка сутрин, безплатно на the daily diff dot dev, линк по-долу.
Присъда: НЕОБХОДИМ Е ПРЕГЛЕД, в деня, когато мога да го нарека
4:29 И така, днешната присъда за Gemini four Argon. НЕОБХОДИМ Е ПРЕГЛЕД. Бих го отбелязал по този начин, защото независимото число, което намерих, го поставя на второ място, а двата реда за кодиране, които ме интересуват, го поставят последен, така че ще го прегледам правилно в деня, когато мога да го изпробвам. Абонирайте се, натиснете камбанката и ми кажете в коментарите дали бихте го отбелязали по различен начин. И това е diff-ът за днес. Аз съм Нико от Axrisi. Обединявайте отговорно.
Източници
- Googleblog.google
- Hacker Newsnews.ycombinator.com
- Fairwind Programdeepmind.google
- Artificial Analysisartificialanalysis.ai
- Sundar Pichaix.com
- Demis Hassabisx.com
- Google completes acquisition of Wizcloud.google.com
- Netlifywww.netlify.com
- Hacker Newsnews.ycombinator.com



