Gemini 4 Argon é o melhor modelo da Google. Ainda não o pode usar.
A Google anunciou o Gemini 4 Argon, o seu novo modelo de ponta, e apenas defensores cibernéticos de confiança o podem usar.
A Google anunciou o Gemini 4 Argon, o seu novo modelo de ponta, e apenas defensores cibernéticos de confiança o podem usar. Eis o que a própria tabela de referência de 19 linhas da Google mostra, o que a classificação independente mediu e quando os programadores o poderão ter. Veredito: NEEDS REVIEW.
Ler a edição escrita (Inglês) ↗
O que este vídeo aborda
- Gemini 4 Argon: um milhão de tokens de saída, 2 $ de entrada, e não o pode usar
- Dentro da Google: agentes Argon portam C++ para Rust
- Tabela da própria Google: Argon lidera em 13 das 19 linhas
- O discurso cibernético: corrige por conta própria, sem guardrails para defensores
- O número externo: Artificial Analysis diz 53, Opus 5.5 tem 58
Transcrição traduzida
Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.
Gemini 4 Argon: um milhão de tokens de saída, 2 $ de entrada, e não o pode usar
0:00 Poderíamos pensar que um lançamento significa que obtém o modelo. A Google acabou de lançar o Gemini 4 Argon, e a menos que seja um ciber defensor de confiança, não lhe pode tocar. Neste vídeo: o que mostra a tabela da Google? O que mediram os testadores externos? E quando o obtém? Provavelmente já viu os vídeos de "hype". Li a tabela de referência, e duas linhas nela nunca chegaram ao
0:20 texto da publicação. Chegarei a elas no final. É quinta-feira, primeiro de outubro, e este é o The Daily Diff. Duas histórias hoje, e a grande é o Gemini 4 Argon, que a Google chama a sua próxima era de inteligência de ponta. Uma resposta pode agora ter um milhão de tokens, acima dos sessenta e quatro mil, o que são vários romances numa única resposta. O preço de lançamento é de dois dólares por milhão de tokens de entrada e dez de saída. É exatamente o que a OpenAI cobra pelo GPT 6.1 Sol,
0:48 o modelo que cobri ontem, e o Sol é um que pode realmente comprar. Dentro da Google, já está a trabalhar.
Dentro da Google: agentes Argon portam C++ para Rust
0:54 A Google diz que os agentes Argon estão a portar C e C++ para Rust em toda a empresa, até oitocentas mil linhas para o kernel do Fuchsia. No Hacker News, um engenheiro lembrou-se de quando a equipa de C++ da Google nem sequer consideraria o Rust e olhou para o Carbon em vez disso. Agora um modelo está a fazer a migração sobre a qual eles discutiram.
Tabela da própria Google: Argon lidera em 13 das 19 linhas
1:12 Agora a tabela. A Google coloca o Argon ao lado do GPT 6 Astra, Claude Fable e Claude Opus em dezanove linhas, e o Argon sai por cima em treze delas. A manchete é DeepSWE, uma referência de codificação longa, com setenta e oito por cento, cerca de quatro pontos à frente. A vitória mais estranha é a redação legal, onde o Argon pontua vinte por cento e os outros permanecem em um dígito. É a melhor nota num teste em que todos falham, e nas referências de "slide-deck"
1:38 que são imbatíveis, isso conta.
O discurso cibernético: corrige por conta própria, sem guardrails para defensores
1:41 A verdadeira proposta é a segurança. A Google diz que o Argon pode encontrar, validar e corrigir vulnerabilidades críticas por conta própria, e que os defensores de confiança o obtêm sem guardrails cibernéticos. A Wiz usou-o para encontrar uma falha crítica num software hospitalar que modelos anteriores tinham perdido. Um pequeno detalhe. A Wiz pertence à Google, desde que um negócio de trinta e dois mil milhões de dólares foi fechado em março. Portanto, o teste de hacking de caixa preta na publicação é uma empresa da Google a classificar um modelo da Google. E na classificação de correção de bugs, três modelos partilham sessenta e oito
2:10 por cento, e a barra na extrema esquerda pertence ao Grok. Então, o que mediram os testadores externos?
O número externo: Artificial Analysis diz 53, Opus 5.5 tem 58
2:15 A classificação independente que consegui encontrar com o Argon é a Artificial Analysis. Ela pontua o Argon cinquenta e três no seu índice de inteligência, na configuração alta, o que o empata com o Astra e o Fable. Claude Opus 5.5 está cinco pontos à frente. Há uma semana disse-lhe que o Opus tinha o primeiro lugar lá, e ainda o mantém. A parte justa para a Google é a fatura. Uma execução do Argon custa cerca de dois dólares por tarefa nesse índice, aproximadamente um terço do que o Opus custa.
Quando o obtém: "Então aguarde"
2:42 E quando o obtém? A Google não dará uma data. A publicação promete acesso para programadores, empresas e consumidores o mais rápido possível, com clientes de API pagas primeiro. A publicação de Sundar Pichai no X diz, então aguarde. Até então, o acesso é feito através do Fairwind, o programa que a Google começou há um mês com o Gemini 3.8 Flash Cyber. Tem mais de seiscentos e cinquenta parceiros, e eles só podem entregar o Argon às suas
3:05 equipas de segurança e devem rastrear quem o usa. O Hacker News aceitou bem. Um comentador escreveu, Gemini não está a vencer as alegações de que não pode lançar um modelo. Outro previu que os modelos se transformam em vaporware, um monte de números numa tabela. Entretanto, a Netlify reconstruiu as Edge Functions, que são executadas cerca de mil milhões
Netlify Edge Functions: Isolados V8 para microVMs, cerca de 5x mais rápido
3:23 de vezes por dia. Eles passaram de isolados V8 num serviço alojado para microVMs Firecracker dentro da rede da própria Netlify, e uma chamada "quente" caiu de até quarenta milissegundos para cerca de seis. O Hacker News salientou que os Cloudflare Workers também são isolados V8 e são executados muito mais rápido, então a maior parte da vitória parece que o pedido já não está a sair do edifício. Outro comentador preocupou-se com os "snapshots", porque microVMs clonadas podem partilhar o estado do número aleatório, que é como se obtêm dois UUIDs idênticos.
3:50 Um arranque a frio, quando uma região nunca viu a sua função, atinge cerca de um por cento das chamadas e leva cerca de nove milissegundos. E a própria microVM é Firecracker, que a Amazon construiu para a Lambda, então um comentador sugere que se lembre disso da próxima vez que amaldiçoar a AWS.
As duas linhas que a publicação da Google nunca menciona
4:06 Agora, essas duas linhas. Em FrontierSWE e Terminal-bench, dois testes de codificação que o texto da publicação nunca menciona, o Argon fica em último lugar entre quatro, na própria tabela da Google. O Terminal-bench coloca um agente numa "shell" real, que é como a maioria de nós o usaria, e o Opus lidera por nove pontos. Se preferir ler isto em vez de me ouvir dizer, o "diff" chega à sua caixa de entrada todas as manhãs, gratuitamente em the daily diff dot dev, link abaixo.
Veredito: NEEDS REVIEW, no dia em que o puder ligar
4:29 Então, o veredito de hoje sobre o Gemini 4 Argon. NEEDS REVIEW. Eu o classificaria assim porque o número independente que encontrei o tem empatado em segundo, e as duas linhas de codificação que me importam o têm em último, então o revisarei adequadamente no dia em que o puder ligar. Subscreva, toque na campainha, e diga-me nos comentários se o teria classificado diferentemente. E esse é o "diff" de hoje. Eu sou o Niko da Axrisi. Junte-se responsavelmente.
Fontes
- Googleblog.google
- Hacker Newsnews.ycombinator.com
- Fairwind Programdeepmind.google
- Artificial Analysisartificialanalysis.ai
- Sundar Pichaix.com
- Demis Hassabisx.com
- Google completes acquisition of Wizcloud.google.com
- Netlifywww.netlify.com
- Hacker Newsnews.ycombinator.com



