Gemini 4 Argon to najlepszy model Google. Nie możesz go jeszcze używać.
Google ogłosiło Gemini 4 Argon, swój nowy, przełomowy model, dostępny tylko dla zaufanych obrońców cybernetycznych.
Google ogłosiło Gemini 4 Argon, swój nowy, przełomowy model, dostępny tylko dla zaufanych obrońców cybernetycznych. Oto, co pokazuje własna 19-wierszowa tabela porównawcza Google, co zmierzył niezależny ranking i kiedy programiści mogą go otrzymać. Werdykt: NEEDS REVIEW.
Przeczytaj wydanie pisemne (angielski) ↗
Co obejmuje ten film
- Gemini 4 Argon: milion tokenów wyjściowych, 2 $ wejścia, a nie możesz go używać
- Wewnątrz Google: agenci Argon portują C++ na Rust
- Własna tabela Google: Argon na czele w 13 z 19 wierszy
- Prezentacja cybernetyczna: samodzielne łatanie, brak zabezpieczeń dla obrońców
- Liczba zewnętrzna: Artificial Analysis mówi 53, Opus 5.5 ma 58
Przetłumaczona transkrypcja
Przetłumaczono z oryginalnej narracji angielskiej. Dostępne audio i napisy są kontrolowane przez YouTube.
Gemini 4 Argon: milion tokenów wyjściowych, 2 $ wejścia, a nie możesz go używać
0:00 Można by pomyśleć, że uruchomienie oznacza, że otrzymujesz model. Google właśnie uruchomiło Gemini 4 Argon, i chyba że jesteś zaufanym cyber- obrońcą, nie możesz go dotknąć. W tym filmie: co pokazuje tabela Google? Co zmierzyli zewnętrzni testerzy? I kiedy go dostaniesz? Prawdopodobnie widziałeś już filmy promocyjne. Zamiast tego przeczytałem tabelę porównawczą, a dwa wiersze w niej nigdy nie trafiły do
0:20 tekstu posta. Dojdę do nich na końcu. Jest czwartek, pierwszego października, i to jest The Daily Diff. Dziś dwie historie, a ta duża to Gemini 4 Argon, które Google nazywa swoją nową erą inteligencji granicznej. Jedna odpowiedź może teraz mieć milion tokenów, w porównaniu do sześćdziesięciu czterech tysięcy, co stanowi kilka powieści w jednej odpowiedzi. Cena uruchomienia to dwa dolary za milion tokenów wejścia i dziesięć wyjścia. To dokładnie to, co OpenAI pobiera za GPT 6.1 Sol,
0:48 model, o którym mówiłem wczoraj, a Sol to model, który faktycznie możesz kupić. Wewnątrz Google już pracuje.
Wewnątrz Google: agenci Argon portują C++ na Rust
0:54 Google twierdzi, że agenci Argon portują C i C++ na Rust w całej firmie, do ośmiuset tysięcy linii dla jądra Fuchsia. Na Hacker News, jeden inżynier przypomniał sobie, kiedy zespół C++ Google nawet nie rozważał Rust i zamiast tego patrzył na Carbon. Teraz model dokonuje migracji, o którą się spierali.
Własna tabela Google: Argon na czele w 13 z 19 wierszy
1:12 Teraz tabela. Google umieszcza Argon obok GPT 6 Astra, Claude Fable i Claude Opus na dziewiętnastu wierszach, a Argon jest na czele w trzynastu z nich. Głównym nagłówkiem jest DeepSWE, długi test kodowania, z wynikiem siedemdziesięciu ośmiu procent, około czterech punktów przewagi. Najdziwniejszym zwycięstwem jest tworzenie projektów prawnych, gdzie Argon zdobywa dwadzieścia procent, a inne pozostają w jednocyfrowych wynikach. To najlepsza ocena w teście, w którym wszyscy zawodzą, a na testach z prezentacji
1:38 slajdów, które są niepokonane, to się liczy.
Prezentacja cybernetyczna: samodzielne łatanie, brak zabezpieczeń dla obrońców
1:41 Prawdziwa oferta to bezpieczeństwo. Google twierdzi, że Argon może samodzielnie znajdować, weryfikować i łatać krytyczne luki, a zaufani obrońcy otrzymują go bez cyberzabezpieczeń. Wiz użył go do znalezienia krytycznej dziury w oprogramowaniu szpitalnym, której wcześniejsze modele nie zauważyły. Jeden mały szczegół. Wiz należy do Google, ponieważ transakcja o wartości trzydziestu dwóch miliardów dolarów została zamknięta w marcu. Więc test hakerski czarnej skrzynki w poście to firma Google oceniająca model Google. A w rankingu naprawiania błędów, trzy modele dzielą sześćdziesiąt osiem
2:10 procent, a pasek po lewej stronie należy do Grok. Więc co zmierzyli zewnętrzni testerzy?
Liczba zewnętrzna: Artificial Analysis mówi 53, Opus 5.5 ma 58
2:15 Niezależny ranking, który znalazłem z Argonem, to Artificial Analysis. Ocenia Argona na pięćdziesiąt trzy w swoim indeksie inteligencji, na wysokim ustawieniu, co wiąże go z Astrą i Fable. Claude Opus 5.5 jest pięć punktów przed nim. Tydzień temu mówiłem, że Opus zajął tam pierwsze miejsce, i nadal je utrzymuje. Sprawiedliwa część dla Google to rachunek. Uruchomienie Argona kosztuje około dwa dolary za zadanie w tym indeksie, mniej więcej jedna trzecia tego, co kosztuje Opus.
Kiedy go dostaniesz: „Więc trzymaj się mocno”
2:42 I kiedy go dostaniesz? Google nie poda daty. Post obiecuje dostęp dla programistów, przedsiębiorstw i konsumentów tak szybko, jak to możliwe, z klientami płatnego API na pierwszym miejscu. Post Sundara Pichai na X mówi, więc trzymaj się mocno. Do tego czasu dostęp odbywa się poprzez Fairwind, program, który Google rozpoczął miesiąc temu z Gemini 3.8 Flash Cyber. Ma ponad sześćset pięćdziesiąt partnerów i mogą oni przekazać Argona tylko swoim
3:05 zespołom bezpieczeństwa i muszą śledzić, kto go używa. Hacker News dobrze to przyjął. Jeden komentator napisał: „Gemini nie bije zarzutów o niemożność wydania modelu”. Inny przewidział, że modele zamienią się w vaporware, zbiór liczb w tabeli. Tymczasem Netlify przebudowało Edge Functions, które uruchamiają się około miliarda
Netlify Edge Functions: od izolacji V8 do mikro-VM, około 5 razy szybciej
3:23 razy dziennie. Przeszli z izolacji V8 w hostowanej usłudze do mikro-VM Firecracker w własnej sieci Netlify, a ciepłe wywołanie spadło z nawet czterdziestu milisekund do około sześciu. Hacker News wskazało, że Cloudflare Workers to również izolacje V8 i działają znacznie szybciej, więc większość zwycięstwa wygląda na to, że żądanie nie opuszcza już budynku. Inny komentator martwił się o migawki, ponieważ sklonowane mikro-VM mogą dzielić stan liczb losowych, czyli w ten sposób otrzymujesz dwa identyczne UUID.
3:50 Zimny start, gdy region nigdy nie widział twojej funkcji, dotyka około jednego procenta wywołań i zajmuje około dziewięciu milisekund. A samo mikro-VM to Firecracker, który Amazon zbudował dla Lambda, więc jeden komentator sugeruje, abyś o tym pamiętał następnym razem, gdy będziesz przeklinać AWS.
Dwa wiersze, o których post Google nigdy nie wspomina
4:06 Teraz, te dwa wiersze. Na FrontierSWE i Terminal-bench, dwóch testach kodowania, o których tekst posta nigdy nie wspomina, Argon jest ostatni z czterech, w własnej tabeli Google. Terminal-bench umieszcza agenta w prawdziwej powłoce, czyli tak, jak większość z nas by go używała, a Opus prowadzi go o dziewięć punktów. Jeśli wolisz to przeczytać, niż usłyszeć, jak to mówię, The Daily Diff ląduje w twojej skrzynce odbiorczej każdego ranka, za darmo na daily diff dot dev, link poniżej.
Werdykt: NEEDS REVIEW, w dniu, w którym będę mógł to nazwać
4:29 Więc, dzisiejszy werdykt w sprawie Gemini 4 Argon. NEEDS REVIEW. Zaznaczyłbym to w ten sposób, ponieważ niezależna liczba, którą znalazłem, stawia go na drugim miejscu, a dwa wiersze kodowania, na których mi zależy, stawiają go na ostatnim miejscu, więc zrecenzuję go należycie w dniu, w którym będę mógł go nazwać. Subskrybuj, naciśnij dzwonek i powiedz mi w komentarzach, czy zaznaczyłbyś to inaczej. I to jest The Daily Diff na dziś. Jestem Niko z Axrisi. Łącz odpowiedzialnie.
Źródła
- Googleblog.google
- Hacker Newsnews.ycombinator.com
- Fairwind Programdeepmind.google
- Artificial Analysisartificialanalysis.ai
- Sundar Pichaix.com
- Demis Hassabisx.com
- Google completes acquisition of Wizcloud.google.com
- Netlifywww.netlify.com
- Hacker Newsnews.ycombinator.com



