+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Gemini 4 Argon este cel mai bun model de la Google. Încă nu îl poți folosi.

Google a anunțat Gemini 4 Argon, noul său model de frontieră, iar doar apărătorii cibernetici de încredere îl pot folosi.

Google a anunțat Gemini 4 Argon, noul său model de frontieră, iar doar apărătorii cibernetici de încredere îl pot folosi. Iată ce arată propriul tabel de referință al Google, cu 19 rânduri, ce a măsurat clasamentul independent și când ar putea ajunge la dezvoltatori. Verdict: NEEDS REVIEW.

Citiți ediția scrisă (engleză) ↗

Ce acoperă acest videoclip

  • Gemini 4 Argon: un milion de token-uri de ieșire, 2 $ intrare, și nu îl poți folosi
  • În interiorul Google: agenți Argon portează C++ la Rust
  • Tabelul propriu al Google: Argon conduce în 13 din 19 rânduri
  • Piața cibernetică: se repară singur, fără măsuri de siguranță pentru apărători
  • Numărul din exterior: Artificial Analysis spune 53, Opus 5.5 are 58

Transcrierea tradusă

Tradus din narațiunea originală în engleză. Audio-ul și subtitrările disponibile sunt controlate de YouTube.

Gemini 4 Argon: un milion de token-uri de ieșire, 2 $ intrare, și nu îl poți folosi

0:00 Ai crede că o lansare înseamnă că obții modelul. Google tocmai a lansat Gemini 4 Argon, și dacă nu ești un apărător cibernetic de încredere, nu te poți atinge de el. În acest videoclip: ce arată tabelul Google? Ce au măsurat testerii externi? Și când îl vei primi? Probabil că ai văzut deja videoclipurile de promovare. Am citit în schimb tabelul de referință, iar două rânduri din el nu au ajuns niciodată în

0:20 textul postării. Voi ajunge la ele la sfârșit. Este joi, 1 octombrie, și acesta este The Daily Diff. Două știri astăzi, iar cea importantă este Gemini 4 Argon, pe care Google o numește noua sa eră a inteligenței de frontieră. Un răspuns poate rula acum până la un milion de token-uri, de la șaizeci și patru de mii, ceea ce înseamnă mai multe romane într-un singur răspuns. Prețul de lansare este de doi dolari per milion de token-uri de intrare și zece de ieșire. Asta este exact ceea ce cere OpenAI pentru GPT 6.1 Sol,

0:48 modelul pe care l-am acoperit ieri, iar Sol este unul pe care îl poți cumpăra de fapt. În interiorul Google, este deja la lucru.

În interiorul Google: agenți Argon portează C++ la Rust

0:54 Google spune că agenții Argon portează C și C++ la Rust în toată compania, până la opt sute de mii de linii pentru kernel-ul Fuchsia. Pe Hacker News, un inginer și-a amintit când echipa C++ de la Google nici măcar nu ar fi luat în considerare Rust și s-a uitat la Carbon în schimb. Acum un model face migrarea despre care ei au argumentat.

Tabelul propriu al Google: Argon conduce în 13 din 19 rânduri

1:12 Acum tabelul. Google pune Argon lângă GPT 6 Astra, Claude Fable și Claude Opus pe nouăsprezece rânduri, iar Argon iese în frunte în treisprezece dintre ele. Titlul este DeepSWE, un benchmark lung de codare, la șaptezeci și opt la sută, cu aproximativ patru puncte avans. Cea mai ciudată victorie este redactarea legală, unde Argon obține douăzeci la sută, iar celelalte rămân în cifre unitare. Este cea mai bună notă la un test pe care toată lumea îl pică, iar pe benchmark-urile din

1:38 slide-deck, care sunt imbatabile, asta contează.

Piața cibernetică: se repară singur, fără măsuri de siguranță pentru apărători

1:41 Miza reală este securitatea. Google spune că Argon poate găsi, valida și patch-ui vulnerabilități critice singur, și că apărătorii de încredere îl primesc fără măsuri de siguranță cibernetice. Wiz l-a folosit pentru a găsi o lacună critică într-un software de spital pe care modelele anterioare o rataseră. Un mic detaliu. Wiz aparține Google, de când o afacere de treizeci și două de miliarde de dolari s-a încheiat în martie. Deci, testul de hacking black-box din postare este o companie Google care evaluează un model Google. Iar în clasamentul de remediere a erorilor, trei modele împart șaizeci și opt la sută,

2:10 iar bara din stânga extremă aparține lui Grok. Deci ce au măsurat testerii externi?

Numărul din exterior: Artificial Analysis spune 53, Opus 5.5 are 58

2:15 Clasamentul independent pe care l-am putut găsi cu Argon pe el este Artificial Analysis. Acesta evaluează Argon cu cincizeci și trei la indexul său de inteligență, la setarea înaltă, ceea ce îl leagă de Astra și Fable. Claude Opus 5.5 este cu cinci puncte înainte. Acum o săptămână v-am spus că Opus a ocupat primul loc acolo, și încă îl deține. Partea echitabilă pentru Google este factura. O rulare Argon costă aproximativ doi dolari per sarcină pe acel index, aproximativ o treime din costul lui Opus.

Când îl vei primi: „Așa că ține-te bine”

2:42 Și când îl vei primi? Google nu va da o dată. Postarea promite acces pentru dezvoltatori, întreprinderi și consumatori cât mai curând posibil, cu clienții API plătitori primii. Postarea lui Sundar Pichai pe X spune, așa că ține-te bine. Până atunci, accesul se face prin Fairwind, programul pe care Google l-a început acum o lună cu Gemini 3.8 Flash Cyber. Are peste șase sute cincizeci de parteneri, și ei pot oferi Argon doar echipelor lor

3:05 de securitate și trebuie să urmărească cine îl folosește. Hacker News a primit-o bine. Un comentator a scris, Gemini nu bate acuzațiile că nu poate lansa un model. Altul a prezis că modelele se transformă în vaporware, o grămadă de numere pe un tabel. Între timp, Netlify a reconstruit Edge Functions, care rulează de aproximativ un miliard

Netlify Edge Functions: de la izolații V8 la microVM-uri, aproximativ de 5 ori mai rapid

3:23 de ori pe zi. S-au mutat de la izolații V8 într-un serviciu găzduit la microVM-uri Firecracker în rețeaua proprie a Netlify, iar un apel cald a scăzut de la până la patruzeci de milisecunde la aproximativ șase. Hacker News a subliniat că Cloudflare Workers sunt și ele izolații V8 și rulează mult mai repede, deci majoritatea câștigului pare să fie faptul că cererea nu mai părăsește clădirea. Un alt comentator și-a făcut griji cu privire la snapshot-uri, deoarece microVM-urile clonate pot partaja starea numerelor aleatoare, adică cum obții două UUID-uri identice.

3:50 O pornire la rece, când o regiune nu a văzut niciodată funcția ta, atinge aproximativ un procent din apeluri și durează în jur de nouă milisecunde. Iar microVM-ul în sine este Firecracker, pe care Amazon l-a construit pentru Lambda, așa că un comentator sugerează să îți amintești asta data viitoare când înjuri AWS.

Cele două rânduri pe care postarea Google nu le menționează niciodată

4:06 Acum, acele două rânduri. Pe FrontierSWE și Terminal-bench, două teste de codare pe care textul postării nu le menționează niciodată, Argon este ultimul dintre patru, în propriul tabel al Google. Terminal-bench plasează un agent într-un shell real, care este modul în care majoritatea dintre noi l-am folosi, iar Opus îl conduce cu nouă puncte. Dacă preferați să citiți asta decât să mă auziți spunând-o, The Diff ajunge în inbox-ul vostru în fiecare dimineață, gratuit la The Daily Diff.dev, link mai jos.

Verdict: NEEDS REVIEW, ziua în care o pot numi

4:29 Deci, verdictul de astăzi despre Gemini 4 Argon. NEEDS REVIEW. L-aș ștampila așa pentru că numărul independent pe care l-am găsit îl plasează la egalitate pe locul al doilea, iar cele două rânduri de codare care mă interesează îl plasează pe ultimul loc, așa că îl voi revizui corect în ziua în care îl voi putea apela. Abonați-vă, apăsați clopoțelul și spuneți-mi în comentarii dacă l-ați fi ștampilat diferit. Și asta e diferența pentru azi. Sunt Niko de la Axrisi. Îmbină responsabil.

Surse

  1. Googleblog.google
  2. Hacker Newsnews.ycombinator.com
  3. Fairwind Programdeepmind.google
  4. Artificial Analysisartificialanalysis.ai
  5. Sundar Pichaix.com
  6. Demis Hassabisx.com
  7. Google completes acquisition of Wizcloud.google.com
  8. Netlifywww.netlify.com
  9. Hacker Newsnews.ycombinator.com

Videoclipuri similare