Gemini 4 Argon é o melhor modelo do Google. Você não pode usá-lo ainda.
O Google anunciou o Gemini 4 Argon, seu novo modelo de fronteira, e apenas defensores cibernéticos confiáveis podem usá-lo.
O Google anunciou o Gemini 4 Argon, seu novo modelo de fronteira, e apenas defensores cibernéticos confiáveis podem usá-lo. Aqui está o que a própria tabela de benchmark de 19 linhas do Google mostra, o que o ranking independente mediu e quando os desenvolvedores poderão obtê-lo. Veredito: NEEDS REVIEW.
Leia a edição escrita (Inglês) ↗
O que este vídeo aborda
- Gemini 4 Argon: um milhão de tokens de saída, US$ 2 de entrada, e você não pode usá-lo
- Dentro do Google: agentes Argon portam C++ para Rust
- A própria tabela do Google: Argon lidera 13 das 19 linhas
- A proposta cibernética: corrige por conta própria, sem guardrails para defensores
- O número externo: Artificial Analysis diz 53, Opus 5.5 tem 58
Transcrição traduzida
Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.
Gemini 4 Argon: um milhão de tokens de saída, US$ 2 de entrada, e você não pode usá-lo
0:00 Você pensaria que um lançamento significa que você obtém o modelo. O Google acabou de lançar o Gemini 4 Argon, e a menos que você seja um defensor cibernético confiável, você não pode tocá-lo. Neste vídeo: o que a tabela do Google mostra? O que os testadores externos mediram? E quando você o obtém? Você provavelmente já viu os vídeos de hype. Eu li a tabela de benchmark em vez disso, e duas linhas nela nunca chegaram ao
0:20 texto da postagem. Chegarei a elas no final. É quinta-feira, primeiro de outubro, e este é The Daily Diff. Duas histórias hoje, e a grande é Gemini 4 Argon, que o Google chama de sua próxima era de inteligência de fronteira. Uma resposta agora pode chegar a um milhão de tokens, acima de sessenta e quatro mil, o que são vários romances em uma única resposta. O preço de lançamento é de dois dólares por milhão de tokens de entrada e dez de saída. Isso é exatamente o que a OpenAI cobra por GPT 6.1 Sol,
0:48 o modelo que cobri ontem, e Sol é um que você pode realmente comprar. Dentro do Google, já está em funcionamento.
Dentro do Google: agentes Argon portam C++ para Rust
0:54 O Google diz que agentes Argon estão portando C e C++ para Rust em toda a empresa, até oitocentas mil linhas para o kernel do Fuchsia. No Hacker News, um engenheiro lembrou quando a equipe de C++ do Google nem sequer consideraria Rust e olhou para Carbon em vez disso. Agora um modelo está fazendo a migração sobre a qual eles discutiram.
A própria tabela do Google: Argon lidera 13 das 19 linhas
1:12 Agora a tabela. O Google coloca Argon ao lado de GPT 6 Astra, Claude Fable e Claude Opus em dezenove linhas, e Argon sai na frente em treze delas. O destaque é o DeepSWE, um longo benchmark de codificação, com setenta e oito por cento, cerca de quatro pontos à frente. A vitória mais estranha é a redação legal, onde Argon pontua vinte por cento e os outros ficam em um dígito. É a melhor nota em um teste que todos falham, e nos benchmarks de slides,
1:38 que são imbatíveis, isso conta.
A proposta cibernética: corrige por conta própria, sem guardrails para defensores
1:41 A verdadeira proposta é a segurança. O Google diz que Argon pode encontrar, validar e corrigir vulnerabilidades críticas por conta própria, e que defensores confiáveis o obtêm sem guardrails cibernéticos. A Wiz o usou para encontrar uma falha crítica em um software hospitalar que modelos anteriores haviam perdido. Um pequeno detalhe. A Wiz pertence ao Google, desde que um acordo de trinta e dois bilhões de dólares foi fechado em março. Então, o teste de hacking de caixa preta na postagem é uma empresa do Google classificando um modelo do Google. E no ranking de correção de bugs, três modelos compartilham sessenta e oito
2:10 por cento, e a barra na extrema esquerda pertence ao Grok. Então, o que os testadores externos mediram?
O número externo: Artificial Analysis diz 53, Opus 5.5 tem 58
2:15 O ranking independente que consegui encontrar com Argon nele é o Artificial Analysis. Ele pontua Argon cinquenta e três em seu índice de inteligência, na configuração alta, o que o empata com Astra e Fable. Claude Opus 5.5 está cinco pontos à frente. Há uma semana eu disse que Opus havia conquistado o primeiro lugar lá, e ele ainda o mantém. A parte justa para o Google é a conta. Uma execução do Argon custa cerca de dois dólares por tarefa nesse índice, aproximadamente um terço do custo do Opus.
Quando você o obtém: "Então aguente firme"
2:42 E quando você o obtém? O Google não dará uma data. A postagem promete acesso para desenvolvedores, empresas e consumidores o mais rápido possível, com clientes de API pagantes primeiro. A postagem de Sundar Pichai no X diz: então, aguente firme. Até então, o acesso é feito através do Fairwind, o programa que o Google iniciou há um mês com Gemini 3.8 Flash Cyber. Ele tem mais de seiscentos e cinquenta parceiros, e eles só podem entregar Argon às suas
3:05 equipes de segurança e devem rastrear quem o usa. O Hacker News recebeu bem. Um comentarista escreveu: Gemini não supera as alegações de não poder lançar um modelo. Outro previu que os modelos se transformam em vaporware, um monte de números em uma tabela. Enquanto isso, a Netlify reconstruiu as Edge Functions, que executam cerca de um bilhão
Netlify Edge Functions: de isolados V8 a microVMs, cerca de 5x mais rápido
3:23 de vezes por dia. Eles passaram de isolados V8 em um serviço hospedado para microVMs Firecracker dentro da própria rede da Netlify, e uma chamada quente caiu de até quarenta milissegundos para cerca de seis. O Hacker News apontou que os Cloudflare Workers também são isolados V8 e rodam muito mais rápido, então a maior parte do ganho parece ser que a solicitação não está mais saindo do prédio. Outro comentarista se preocupou com os snapshots, porque microVMs clonadas podem compartilhar o estado do número aleatório, que é como você obtém dois UUIDs idênticos.
3:50 Uma inicialização a frio, quando uma região nunca viu sua função, atinge cerca de um por cento das chamadas e leva cerca de nove milissegundos. E a própria microVM é Firecracker, que a Amazon construiu para o Lambda, então um comentarista sugere que você se lembre disso da próxima vez que xingar a AWS.
As duas linhas que a postagem do Google nunca menciona
4:06 Agora, essas duas linhas. No FrontierSWE e Terminal-bench, dois testes de codificação que o texto da postagem nunca menciona, Argon fica em último lugar entre quatro, na própria tabela do Google. O Terminal-bench coloca um agente em um shell real, que é como a maioria de nós o usaria, e Opus o lidera por nove pontos. Se você preferir ler isso a me ouvir dizer, o diff chega à sua caixa de entrada todas as manhãs, gratuitamente em thedailydiff.dev, link abaixo.
Veredito: NEEDS REVIEW, no dia em que eu puder chamá-lo
4:29 Então, o veredito de hoje sobre Gemini 4 Argon. NEEDS REVIEW. Eu o carimbaria assim porque o número independente que encontrei o coloca empatado em segundo, e as duas linhas de codificação com as quais me importo o colocam em último, então o revisarei adequadamente no dia em que puder chamá-lo. Assine, ative o sino e diga-me nos comentários se você o teria carimbado de forma diferente. E essa é a diferença de hoje. Eu sou Niko da Axrisi. Faça o merge de forma responsável.
Fontes
- Googleblog.google
- Hacker Newsnews.ycombinator.com
- Fairwind Programdeepmind.google
- Artificial Analysisartificialanalysis.ai
- Sundar Pichaix.com
- Demis Hassabisx.com
- Google completes acquisition of Wizcloud.google.com
- Netlifywww.netlify.com
- Hacker Newsnews.ycombinator.com



