+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Gemini 4 Argon é o melhor modelo do Google. Você não pode usá-lo ainda.

O Google anunciou o Gemini 4 Argon, seu novo modelo de fronteira, e apenas defensores cibernéticos confiáveis podem usá-lo.

O Google anunciou o Gemini 4 Argon, seu novo modelo de fronteira, e apenas defensores cibernéticos confiáveis podem usá-lo. Aqui está o que a própria tabela de benchmark de 19 linhas do Google mostra, o que o ranking independente mediu e quando os desenvolvedores poderão obtê-lo. Veredito: NEEDS REVIEW.

Leia a edição escrita (Inglês) ↗

O que este vídeo aborda

  • Gemini 4 Argon: um milhão de tokens de saída, US$ 2 de entrada, e você não pode usá-lo
  • Dentro do Google: agentes Argon portam C++ para Rust
  • A própria tabela do Google: Argon lidera 13 das 19 linhas
  • A proposta cibernética: corrige por conta própria, sem guardrails para defensores
  • O número externo: Artificial Analysis diz 53, Opus 5.5 tem 58

Transcrição traduzida

Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.

Gemini 4 Argon: um milhão de tokens de saída, US$ 2 de entrada, e você não pode usá-lo

0:00 Você pensaria que um lançamento significa que você obtém o modelo. O Google acabou de lançar o Gemini 4 Argon, e a menos que você seja um defensor cibernético confiável, você não pode tocá-lo. Neste vídeo: o que a tabela do Google mostra? O que os testadores externos mediram? E quando você o obtém? Você provavelmente já viu os vídeos de hype. Eu li a tabela de benchmark em vez disso, e duas linhas nela nunca chegaram ao

0:20 texto da postagem. Chegarei a elas no final. É quinta-feira, primeiro de outubro, e este é The Daily Diff. Duas histórias hoje, e a grande é Gemini 4 Argon, que o Google chama de sua próxima era de inteligência de fronteira. Uma resposta agora pode chegar a um milhão de tokens, acima de sessenta e quatro mil, o que são vários romances em uma única resposta. O preço de lançamento é de dois dólares por milhão de tokens de entrada e dez de saída. Isso é exatamente o que a OpenAI cobra por GPT 6.1 Sol,

0:48 o modelo que cobri ontem, e Sol é um que você pode realmente comprar. Dentro do Google, já está em funcionamento.

Dentro do Google: agentes Argon portam C++ para Rust

0:54 O Google diz que agentes Argon estão portando C e C++ para Rust em toda a empresa, até oitocentas mil linhas para o kernel do Fuchsia. No Hacker News, um engenheiro lembrou quando a equipe de C++ do Google nem sequer consideraria Rust e olhou para Carbon em vez disso. Agora um modelo está fazendo a migração sobre a qual eles discutiram.

A própria tabela do Google: Argon lidera 13 das 19 linhas

1:12 Agora a tabela. O Google coloca Argon ao lado de GPT 6 Astra, Claude Fable e Claude Opus em dezenove linhas, e Argon sai na frente em treze delas. O destaque é o DeepSWE, um longo benchmark de codificação, com setenta e oito por cento, cerca de quatro pontos à frente. A vitória mais estranha é a redação legal, onde Argon pontua vinte por cento e os outros ficam em um dígito. É a melhor nota em um teste que todos falham, e nos benchmarks de slides,

1:38 que são imbatíveis, isso conta.

A proposta cibernética: corrige por conta própria, sem guardrails para defensores

1:41 A verdadeira proposta é a segurança. O Google diz que Argon pode encontrar, validar e corrigir vulnerabilidades críticas por conta própria, e que defensores confiáveis o obtêm sem guardrails cibernéticos. A Wiz o usou para encontrar uma falha crítica em um software hospitalar que modelos anteriores haviam perdido. Um pequeno detalhe. A Wiz pertence ao Google, desde que um acordo de trinta e dois bilhões de dólares foi fechado em março. Então, o teste de hacking de caixa preta na postagem é uma empresa do Google classificando um modelo do Google. E no ranking de correção de bugs, três modelos compartilham sessenta e oito

2:10 por cento, e a barra na extrema esquerda pertence ao Grok. Então, o que os testadores externos mediram?

O número externo: Artificial Analysis diz 53, Opus 5.5 tem 58

2:15 O ranking independente que consegui encontrar com Argon nele é o Artificial Analysis. Ele pontua Argon cinquenta e três em seu índice de inteligência, na configuração alta, o que o empata com Astra e Fable. Claude Opus 5.5 está cinco pontos à frente. Há uma semana eu disse que Opus havia conquistado o primeiro lugar lá, e ele ainda o mantém. A parte justa para o Google é a conta. Uma execução do Argon custa cerca de dois dólares por tarefa nesse índice, aproximadamente um terço do custo do Opus.

Quando você o obtém: "Então aguente firme"

2:42 E quando você o obtém? O Google não dará uma data. A postagem promete acesso para desenvolvedores, empresas e consumidores o mais rápido possível, com clientes de API pagantes primeiro. A postagem de Sundar Pichai no X diz: então, aguente firme. Até então, o acesso é feito através do Fairwind, o programa que o Google iniciou há um mês com Gemini 3.8 Flash Cyber. Ele tem mais de seiscentos e cinquenta parceiros, e eles só podem entregar Argon às suas

3:05 equipes de segurança e devem rastrear quem o usa. O Hacker News recebeu bem. Um comentarista escreveu: Gemini não supera as alegações de não poder lançar um modelo. Outro previu que os modelos se transformam em vaporware, um monte de números em uma tabela. Enquanto isso, a Netlify reconstruiu as Edge Functions, que executam cerca de um bilhão

Netlify Edge Functions: de isolados V8 a microVMs, cerca de 5x mais rápido

3:23 de vezes por dia. Eles passaram de isolados V8 em um serviço hospedado para microVMs Firecracker dentro da própria rede da Netlify, e uma chamada quente caiu de até quarenta milissegundos para cerca de seis. O Hacker News apontou que os Cloudflare Workers também são isolados V8 e rodam muito mais rápido, então a maior parte do ganho parece ser que a solicitação não está mais saindo do prédio. Outro comentarista se preocupou com os snapshots, porque microVMs clonadas podem compartilhar o estado do número aleatório, que é como você obtém dois UUIDs idênticos.

3:50 Uma inicialização a frio, quando uma região nunca viu sua função, atinge cerca de um por cento das chamadas e leva cerca de nove milissegundos. E a própria microVM é Firecracker, que a Amazon construiu para o Lambda, então um comentarista sugere que você se lembre disso da próxima vez que xingar a AWS.

As duas linhas que a postagem do Google nunca menciona

4:06 Agora, essas duas linhas. No FrontierSWE e Terminal-bench, dois testes de codificação que o texto da postagem nunca menciona, Argon fica em último lugar entre quatro, na própria tabela do Google. O Terminal-bench coloca um agente em um shell real, que é como a maioria de nós o usaria, e Opus o lidera por nove pontos. Se você preferir ler isso a me ouvir dizer, o diff chega à sua caixa de entrada todas as manhãs, gratuitamente em thedailydiff.dev, link abaixo.

Veredito: NEEDS REVIEW, no dia em que eu puder chamá-lo

4:29 Então, o veredito de hoje sobre Gemini 4 Argon. NEEDS REVIEW. Eu o carimbaria assim porque o número independente que encontrei o coloca empatado em segundo, e as duas linhas de codificação com as quais me importo o colocam em último, então o revisarei adequadamente no dia em que puder chamá-lo. Assine, ative o sino e diga-me nos comentários se você o teria carimbado de forma diferente. E essa é a diferença de hoje. Eu sou Niko da Axrisi. Faça o merge de forma responsável.

Fontes

  1. Googleblog.google
  2. Hacker Newsnews.ycombinator.com
  3. Fairwind Programdeepmind.google
  4. Artificial Analysisartificialanalysis.ai
  5. Sundar Pichaix.com
  6. Demis Hassabisx.com
  7. Google completes acquisition of Wizcloud.google.com
  8. Netlifywww.netlify.com
  9. Hacker Newsnews.ycombinator.com

Vídeos relacionados