+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Gemini 4 Argon — найкраща модель Google. Ви поки що не можете її використовувати.

Google анонсувала Gemini 4 Argon, свою нову передову модель, і тільки довірені кіберзахисники можуть її використовувати.

Google анонсувала Gemini 4 Argon, свою нову передову модель, і тільки довірені кіберзахисники можуть її використовувати. Ось що показує власна 19-рядкова таблиця тестів Google, що виміряв незалежний лідерборд, і коли розробники можуть отримати до неї доступ. Вирок: ПОТРЕБУЄ ПЕРЕВІРКИ.

Читати письмову версію (англійською) ↗

Що охоплює це відео

  • Gemini 4 Argon: мільйон вихідних токенів, $2 вхідних, і ви не можете її використовувати
  • Всередині Google: агенти Argon переносять C++ на Rust
  • Власна таблиця Google: Argon лідирує в 13 з 19 рядків
  • Кібер-пропозиція: патчі самостійно, без захисних механізмів для оборонців
  • Зовнішній показник: Artificial Analysis каже 53, Opus 5.5 має 58

Перекладена стенограма

Перекладено з оригінальної англійської розповіді. Доступне аудіо та субтитри контролюються YouTube.

Gemini 4 Argon: мільйон вихідних токенів, $2 вхідних, і ви не можете її використовувати

0:00 Ви могли б подумати, що запуск означає, що ви отримуєте модель. Google щойно запустив Gemini 4 Argon, і якщо ви не довірений кібер- захисник, ви не можете її торкнутися. У цьому відео: що показує таблиця Google? Що виміряли зовнішні тестувальники? І коли ви її отримаєте? Ви, мабуть, вже бачили рекламні відео. Натомість я прочитав таблицю тестів, і два рядки в ній так і не потрапили до

0:20 тексту допису. Я повернуся до них наприкінці. Сьогодні четвер, перше жовтня, і це The Daily Diff. Дві історії сьогодні, і велика — це Gemini 4 Argon, яку Google називає своєю наступною епохою передового інтелекту. Одна відповідь тепер може сягати мільйона токенів, порівняно з шістдесятьма чотирма тисячами, що становить кілька романів в одній відповіді. Ціна запуску — два долари за мільйон токенів на вхід і десять на вихід. Це саме те, що OpenAI стягує за GPT 6.1 Sol,

0:48 модель, яку я розглядав учора, і Sol — це та, яку ви насправді можете купити. Всередині Google вона вже працює.

Всередині Google: агенти Argon переносять C++ на Rust

0:54 Google каже, що агенти Argon переносять C і C++ на Rust по всій компанії, до восьмисот тисяч рядків для ядра Fuchsia. На Hacker News один інженер пригадав, як команда C++ Google навіть не розглядала Rust і замість цього дивилася на Carbon. Тепер модель робить міграцію, про яку вони сперечалися.

Власна таблиця Google: Argon лідирує в 13 з 19 рядків

1:12 Тепер таблиця. Google ставить Argon поруч з GPT 6 Astra, Claude Fable та Claude Opus у дев'ятнадцяти рядках, і Argon виходить на перше місце в тринадцяти з них. Заголовок — DeepSWE, довгий бенчмарк кодування, на сімдесяти восьми відсотках, приблизно на чотири пункти вище. Найдивовижніша перемога — у розробці юридичних документів, де Argon набирає двадцять відсотків, а інші залишаються в однозначних цифрах. Це найкраща оцінка на тесті, який усі провалюють, і на бенчмарках зі слайдів,

1:38 які неперевершені, це має значення.

Кібер-пропозиція: патчі самостійно, без захисних механізмів для оборонців

1:41 Справжня пропозиція — безпека. Google каже, що Argon може самостійно знаходити, перевіряти та виправляти критичні вразливості, і що довірені захисники отримують її без кібер-захисних механізмів. Wiz використала її, щоб знайти критичну діру в програмному забезпеченні лікарні, яку попередні моделі пропустили. Одна маленька деталь. Wiz належить Google, оскільки угода на тридцять два мільярди доларів була закрита в березні. Отже, тест на хакерство за принципом чорного ящика в дописі — це компанія Google, яка оцінює модель Google. І в лідерборді з виправлення помилок три моделі поділяють шістдесят вісім

2:10 відсотків, а стовпець на крайньому лівому краю належить Grok. Отже, що виміряли зовнішні тестувальники?

Зовнішній показник: Artificial Analysis каже 53, Opus 5.5 має 58

2:15 Незалежний лідерборд, який я зміг знайти з Argon, це Artificial Analysis. Він оцінює Argon на п'ятдесят три за своїм індексом інтелекту, на високій позначці, що зрівнює його з Astra та Fable. Claude Opus 5.5 випереджає на п'ять пунктів. Тиждень тому я казав вам, що Opus зайняв там перше місце, і він все ще його утримує. Справедлива частина для Google — це рахунок. Запуск Argon коштує близько двох доларів за завдання за цим індексом, приблизно третину від вартості Opus.

Коли ви її отримаєте: «Тож тримайтеся»

2:42 І коли ви її отримаєте? Google не називає дату. Допис обіцяє доступ для розробників, підприємств і споживачів якомога швидше, спочатку для платних клієнтів API. Допис Сундара Пічаї на X каже: «Тож тримайтеся» (so hold tight). До того часу доступ здійснюється через Fairwind, програму, яку Google запустила місяць тому з Gemini 3.8 Flash Cyber. Вона має понад шістсот п'ятдесят партнерів, і вони можуть передавати Argon лише своїм

3:05 командам безпеки та повинні відстежувати, хто її використовує. Hacker News сприйняли це добре. Один коментатор написав: «Gemini не спростовує звинувачення в тому, що не може випустити модель». Інший передбачив, що моделі перетворюються на vaporware, купу чисел у таблиці. Тим часом Netlify перебудувала Edge Functions, які виконуються близько мільярда

Netlify Edge Functions: від ізолятів V8 до мікро-ВМ, приблизно в 5 разів швидше

3:23 разів на день. Вони перейшли від ізолятів V8 у розміщеному сервісі до мікро-ВМ Firecracker у власній мережі Netlify, і час теплого виклику зменшився з сорока мілісекунд до близько шести. Hacker News зазначив, що Cloudflare Workers також є ізолятами V8 і працюють набагато швидше, тому більша частина переваги виглядає так, ніби запит більше не виходить за межі будівлі. Інший коментатор турбувався про знімки, оскільки клоновані мікро-ВМ можуть спільно використовувати стан генератора випадкових чисел, саме так ви отримуєте два ідентичних UUID.

3:50 Холодний старт, коли регіон ніколи не бачив вашу функцію, відбувається приблизно в одному відсотку викликів і займає близько дев'яти мілісекунд. Сама мікро-ВМ — це Firecracker, яку Amazon створила для Lambda, тому один коментатор пропонує пам'ятати про це наступного разу, коли ви будете лаяти AWS.

Два рядки, які ніколи не згадуються в дописі Google

4:06 Тепер, ті два рядки. На FrontierSWE та Terminal-bench, двох тестах кодування, які ніколи не згадуються в тексті допису, Argon посідає останнє місце з чотирьох, у власній таблиці Google. Terminal-bench розміщує агента в реальній оболонці, саме так більшість із нас використовували б його, і Opus випереджає його на дев'ять пунктів. Якщо ви хочете це прочитати, а не чути від мене, The Daily Diff приходить на вашу поштову скриньку щоранку, безкоштовно на the daily diff dot dev, посилання нижче.

Вирок: ПОТРЕБУЄ ПЕРЕВІРКИ, день, коли я зможу це назвати

4:29 Отже, сьогоднішній вердикт щодо Gemini 4 Argon. ПОТРЕБУЄ ПЕРЕВІРКИ. Я б поставив такий штамп, тому що незалежний показник, який я знайшов, ставить його на друге місце, а два рядки кодування, які мене цікавлять, мають його останнім, тому я перегляну його належним чином того дня, коли зможу його викликати. Підпишіться, натисніть дзвіночок і скажіть мені в коментарях, чи поставили б ви інший штамп. І це The Daily Diff на сьогодні. Я Ніко з Axrisi. Об'єднуйте відповідально.

Джерела

  1. Googleblog.google
  2. Hacker Newsnews.ycombinator.com
  3. Fairwind Programdeepmind.google
  4. Artificial Analysisartificialanalysis.ai
  5. Sundar Pichaix.com
  6. Demis Hassabisx.com
  7. Google completes acquisition of Wizcloud.google.com
  8. Netlifywww.netlify.com
  9. Hacker Newsnews.ycombinator.com

Пов'язані відео