+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Gemini 4 Argon är Googles bästa modell. Du kan inte använda den än.

Google meddelade Gemini 4 Argon, sin nya "frontier model", och endast betrodda cyberförsvarare kan använda den.

Google meddelade Gemini 4 Argon, sin nya "frontier model", och endast betrodda cyberförsvarare kan använda den. Här är vad Googles egen 19-radiga jämförelsetabell visar, vad den oberoende topplistan mätte, och när utvecklare kan få den. Bedömning: NEEDS REVIEW.

Läs den skrivna upplagan (engelska) ↗

Vad den här videon täcker

  • Gemini 4 Argon: en miljon utdata-tokens, $2 in, och du kan inte använda den
  • Inne på Google: Argon-agenter porterar C++ till Rust
  • Googles egen tabell: Argon toppar 13 av 19 rader
  • Cyberpitch: patchar sig själv, inga skyddsräcken för försvarare
  • Det externa numret: Artificial Analysis säger 53, Opus 5.5 har 58

Översatt transkription

Översatt från den ursprungliga engelska berättelsen. Tillgängligt ljud och undertexter styrs av YouTube.

Gemini 4 Argon: en miljon utdata-tokens, $2 in, och du kan inte använda den

0:00 Man skulle kunna tro att en lansering betyder att man får modellen. Google har just lanserat Gemini fyra Argon, och om du inte är en betrodd cyber- försvarare kan du inte röra den. I den här videon: vad visar Googles tabell? Vad mätte externa testare? Och när får du den? Du har förmodligen redan sett hype-videorna. Jag läste istället jämförelsetabellen, och två rader i den kom aldrig med i

0:20 inläggets text. Jag återkommer till dem i slutet. Det är torsdag, första oktober, och detta är The Daily Diff. Två nyheter idag, och den stora är Gemini fyra Argon, som Google kallar sin nästa era av frontier intelligence. Ett svar kan nu vara upp till en miljon tokens, upp från sextiofyra tusen, vilket är flera romaner i ett enda svar. Lanseringspriset är två dollar per miljon tokens in och tio ut. Det är exakt vad OpenAI tar för GPT sex punkt ett Sol,

0:48 modellen jag täckte igår, och Sol är en du faktiskt kan köpa. Inne på Google är den redan i drift.

Inne på Google: Argon-agenter porterar C++ till Rust

0:54 Google säger att Argon-agenter porterar C och C++ till Rust över hela företaget, upp till åttahundratusen rader för Fuchsia-kärnan. På Hacker News mindes en ingenjör när Googles C++-team inte ens ville överväga Rust och tittade på Carbon istället. Nu gör en modell den migrering de diskuterade.

Googles egen tabell: Argon toppar 13 av 19 rader

1:12 Nu tabellen. Google placerar Argon bredvid GPT sex Astra, Claude Fable och Claude Opus på nitton rader, och Argon kommer ut som vinnare i tretton av dem. Rubriken är DeepSWE, ett långt kodningsbenchmark, på sjuttiåtta procent, ungefär fyra poäng före. Den märkligaste vinsten är juridisk utformning, där Argon får tjugo procent och de andra håller sig på ensiffriga tal. Det är det bästa betyget på ett prov som alla misslyckas med, och på slide-deck-

1:38 benchmarks, som är obesegrade, räknas det.

Cyberpitch: patchar sig själv, inga skyddsräcken för försvarare

1:41 Den verkliga pitchen är säkerhet. Google säger att Argon kan hitta, validera och patcha kritiska sårbarheter på egen hand, och att betrodda försvarare får den utan cyber-skyddsräcken. Wiz använde den för att hitta ett kritiskt hål i sjukhusprogramvara som tidigare modeller hade missat. En liten detalj. Wiz tillhör Google, sedan en affär på trettiotvå miljarder dollar avslutades i mars. Så det svartlåde-hackningstestet i inlägget är ett Google-företag som betygsätter en Google- modell. Och på buggfixnings-topplistan delar tre modeller sextioåtta

2:10 procent, och stapeln längst till vänster tillhör Grok. Så vad mätte externa testare?

Det externa numret: Artificial Analysis säger 53, Opus 5.5 har 58

2:15 Den oberoende topplistan jag kunde hitta med Argon på är Artificial Analysis. Den betygsätter Argon femtiotre på sitt intelligensindex, på den höga inställningen, vilket knyter den till Astra och Fable. Claude Opus fem punkt fem ligger fem poäng före. För en vecka sedan berättade jag att Opus tog topplatsen där, och den håller fortfarande den. Den rättvisa delen för Google är räkningen. En Argon-körning kostar cirka två dollar per uppgift på det indexet, ungefär en tredjedel av vad Opus kostar.

När får du den: "Så håll ut"

2:42 Och när får du den? Google kommer inte att ge ett datum. Inlägget lovar tillgång för utvecklare, företag och konsumenter så snart som möjligt, med betalda API-kunder först. Sundar Pichais inlägg på X säger, så håll ut. Fram tills dess sker åtkomst via Fairwind, programmet Google startade för en månad sedan med Gemini tre punkt åtta Flash Cyber. Det har över sexhundrafemtio partners, och de får endast ge Argon till sina

3:05 säkerhetsteam och måste spåra vem som använder den. Hacker News tog det väl. En kommentator skrev, Gemini slår inte "kan inte släppa en modell"-anklagelserna. En annan förutspådde att modeller förvandlas till vaporware, en massa siffror på en tabell. Samtidigt byggde Netlify om Edge Functions, som körs ungefär en miljard

Netlify Edge Functions: V8-isolat till mikro-VM:ar, cirka 5x snabbare

3:23 gånger om dagen. De flyttade från V8-isolat i en hostad tjänst till Firecracker mikro-VM:ar inom Netlifies eget nätverk, och ett "varmt samtal" sjönk från upp till fyrtio millisekunder till ungefär sex. Hacker News påpekade att Cloudflare Workers också är V8-isolat och körs mycket snabbare, så det mesta av vinsten ser ut att vara att begäran inte längre lämnar byggnaden. En annan kommentator oroade sig för snapshots, eftersom klonade mikro-VM:ar kan dela slumptalstillstånd, vilket är hur man får två identiska UUID:er.

3:50 En kallstart, när en region aldrig har sett din funktion, träffar ungefär en procent av samtalen och tar cirka nio millisekunder. Och själva mikro-VM:en är Firecracker, som Amazon byggde för Lambda, så en kommentator föreslår att du kommer ihåg det nästa gång du svär över AWS.

De två raderna Googles inlägg aldrig nämner

4:06 Nu, de där två raderna. På FrontierSWE och Terminal-bench, två kodningstester som inläggets text aldrig nämner, kommer Argon sist av fyra, på Googles egen tabell. Terminal-bench placerar en agent i ett riktigt skal, vilket är hur de flesta av oss skulle använda den, och Opus leder den med nio poäng. Om du hellre vill läsa detta än höra mig säga det, landar diffen i din inkorg varje morgon, gratis på thedaily diff dot dev, länk nedan.

Bedömning: NEEDS REVIEW, den dag jag kan kalla den

4:29 Så, dagens bedömning av Gemini fyra Argon. NEEDS REVIEW. Jag skulle stämpla den så för att det oberoende numret jag hittade har den på delad andraplats, och de två kodningsraderna jag bryr mig om har den sist, så jag kommer att granska den ordentligt den dag jag kan kalla den. Prenumerera, tryck på klockan och berätta i kommentarerna om du skulle ha stämplat den annorlunda. Och det var diffen för idag. Jag är Niko från Axrisi. Slå samman ansvarsfullt.

Källor

  1. Googleblog.google
  2. Hacker Newsnews.ycombinator.com
  3. Fairwind Programdeepmind.google
  4. Artificial Analysisartificialanalysis.ai
  5. Sundar Pichaix.com
  6. Demis Hassabisx.com
  7. Google completes acquisition of Wizcloud.google.com
  8. Netlifywww.netlify.com
  9. Hacker Newsnews.ycombinator.com

Relaterade videor