Gemini 4 Argon es el mejor modelo de Google. Aún no puedes usarlo.
Google anunció Gemini 4 Argon, su nuevo modelo de frontera, y solo los ciberdefensores de confianza pueden usarlo.
Google anunció Gemini 4 Argon, su nuevo modelo de frontera, y solo los ciberdefensores de confianza pueden usarlo. Aquí te mostramos lo que la propia tabla de evaluación de 19 filas de Google revela, lo que midió la clasificación independiente y cuándo los desarrolladores podrían tenerlo. Veredicto: NECESITA REVISIÓN.
Leer la edición escrita (inglés) ↗
Qué cubre este vídeo
- Gemini 4 Argon: un millón de tokens de salida, 2$ de entrada, y no puedes usarlo
- Dentro de Google: agentes Argon portan C++ a Rust
- Tabla de Google: Argon lidera 13 de 19 filas
- La propuesta cibernética: se parchea solo, sin barreras de seguridad para los defensores
- El número externo: Artificial Analysis dice 53, Opus 5.5 tiene 58
Transcripción traducida
Traducido de la narración original en inglés. El audio y los subtítulos disponibles están controlados por YouTube.
Gemini 4 Argon: un millón de tokens de salida, 2$ de entrada, y no puedes usarlo
0:00 Uno pensaría que un lanzamiento significa que puedes obtener el modelo. Google acaba de lanzar Gemini 4 Argon, y a menos que seas un ciberdefensor de confianza, no puedes tocarlo. En este vídeo: ¿qué muestra la tabla de Google? ¿Qué midieron los probadores externos? ¿Y cuándo lo conseguirás? Probablemente ya hayas visto los vídeos promocionales. Yo leí la tabla de evaluación en su lugar, y dos filas de ella nunca llegaron al
0:20 texto de la publicación. Las abordaré al final. Es jueves, 1 de octubre, y esto es The Daily Diff. Dos historias hoy, y la más importante es Gemini 4 Argon, que Google llama su próxima era de inteligencia de frontera. Una respuesta puede ahora llegar a un millón de tokens, frente a sesenta y cuatro mil, lo que equivale a varias novelas en una sola respuesta. El precio de lanzamiento es de dos dólares por millón de tokens de entrada y diez de salida. Eso es exactamente lo que OpenAI cobra por GPT 6.1 Sol,
0:48 el modelo que cubrí ayer, y Sol es uno que realmente puedes comprar. Dentro de Google, ya está en funcionamiento.
Dentro de Google: agentes Argon portan C++ a Rust
0:54 Google dice que los agentes de Argon están portando C y C++ a Rust en toda la compañía, hasta ochocientas mil líneas para el kernel de Fuchsia. En Hacker News, un ingeniero recordó cuando el equipo de C++ de Google ni siquiera consideraría Rust y en su lugar se fijó en Carbon. Ahora un modelo está haciendo la migración sobre la que discutieron.
Tabla de Google: Argon lidera 13 de 19 filas
1:12 Ahora la tabla. Google compara Argon con GPT 6 Astra, Claude Fable y Claude Opus en diecinueve filas, y Argon sale victorioso en trece de ellas. El titular es DeepSWE, un largo benchmark de codificación, con setenta y ocho por ciento, aproximadamente cuatro puntos de ventaja. La victoria más extraña es en la redacción legal, donde Argon puntúa veinte por ciento y los otros se mantienen en un solo dígito. Es la mejor nota en una prueba en la que todos suspenden, y en los benchmarks del
1:38 slide-deck, que están invictos, eso cuenta.
La propuesta cibernética: se parchea solo, sin barreras de seguridad para los defensores
1:41 El verdadero argumento es la seguridad. Google dice que Argon puede encontrar, validar y parchear vulnerabilidades críticas por sí mismo, y que los defensores de confianza lo obtienen sin barreras cibernéticas. Wiz lo utilizó para encontrar un agujero crítico en el software hospitalario que modelos anteriores habían pasado por alto. Un pequeño detalle. Wiz pertenece a Google, desde que se cerró un acuerdo de treinta y dos mil millones de dólares en marzo. Así que la prueba de hackeo de caja negra en el post es una compañía de Google calificando un modelo de Google. Y en la tabla de clasificación de reparación de errores, tres modelos comparten sesenta y ocho
2:10 por ciento, y la barra de la izquierda pertenece a Grok. ¿Entonces qué midieron los probadores externos?
El número externo: Artificial Analysis dice 53, Opus 5.5 tiene 58
2:15 La clasificación independiente que pude encontrar con Argon es Artificial Analysis. Puntuó a Argon cincuenta y tres en su índice de inteligencia, en la configuración alta, lo que lo empata con Astra y Fable. Claude Opus 5.5 se sitúa cinco puntos por delante. Hace una semana te dije que Opus ocupaba el primer puesto allí, y todavía lo mantiene. La parte justa para Google es la factura. Una ejecución de Argon cuesta aproximadamente dos dólares por tarea en ese índice, aproximadamente un tercio de lo que cuesta Opus.
¿Cuándo lo obtendrás?: "Así que espera"
2:42 ¿Y cuándo lo obtendrás? Google no dará una fecha. La publicación promete acceso para desarrolladores, empresas y consumidores lo antes posible, con los clientes de la API de pago primero. La publicación de Sundar Pichai en X dice, así que espera. Hasta entonces, el acceso se realiza a través de Fairwind, el programa que Google inició hace un mes con Gemini 3.8 Flash Cyber. Tiene más de seiscientos cincuenta socios, y solo pueden entregar Argon a sus
3:05 equipos de seguridad y deben rastrear quién lo usa. Hacker News se lo tomó bien. Un comentarista escribió: Gemini no supera las acusaciones de no poder lanzar un modelo. Otro predijo que los modelos se convertirán en vaporware, un montón de números en una tabla. Mientras tanto, Netlify reconstruyó Edge Functions, que se ejecutan aproximadamente mil millones
Netlify Edge Functions: de aislamientos V8 a microVMs, unas 5 veces más rápido
3:23 de veces al día. Pasaron de aislamientos V8 en un servicio alojado a microVMs Firecracker dentro de la propia red de Netlify, y una llamada en caliente se redujo de hasta cuarenta milisegundos a aproximadamente seis. Hacker News señaló que Cloudflare Workers también son aislamientos V8 y se ejecutan mucho más rápido, por lo que la mayor parte de la mejora parece ser que la solicitud ya no sale del edificio. Otro comentarista se preocupó por las instantáneas, porque los microVMs clonados pueden compartir el estado de los números aleatorios, que es cómo se obtienen dos UUIDs idénticos.
3:50 Un arranque en frío, cuando una región nunca ha visto tu función, afecta aproximadamente al uno por ciento de las llamadas y tarda alrededor de nueve milisegundos. Y la propia microVM es Firecracker, que Amazon construyó para Lambda, así que un comentarista sugiere que lo recuerdes la próxima vez que maldigas a AWS.
Las dos filas que el artículo de Google nunca menciona
4:06 Ahora, esas dos filas. En FrontierSWE y Terminal-bench, dos pruebas de codificación que el texto de la publicación nunca menciona, Argon queda el último de cuatro, en la propia tabla de Google. Terminal-bench coloca un agente en un shell real, que es como la mayoría de nosotros lo usaríamos, y Opus lo lidera por nueve puntos. Si prefieres leer esto que oírme decirlo, el diff llega a tu bandeja de entrada cada mañana, gratis en the daily diff dot dev, enlace abajo.
Veredicto: NECESITA REVISIÓN, el día que pueda probarlo
4:29 Así que, el veredicto de hoy sobre Gemini 4 Argon. NECESITA REVISIÓN. Lo etiquetaría así porque el número independiente que encontré lo tiene empatado en segundo lugar, y las dos filas de codificación que me importan lo tienen en último lugar, así que lo revisaré correctamente el día que pueda probarlo. Suscríbete, pulsa la campana y dime en los comentarios si lo habrías etiquetado de forma diferente. Y eso es el diff por hoy. Soy Niko de Axrisi. Fusiona con responsabilidad.
Fuentes
- Googleblog.google
- Hacker Newsnews.ycombinator.com
- Fairwind Programdeepmind.google
- Artificial Analysisartificialanalysis.ai
- Sundar Pichaix.com
- Demis Hassabisx.com
- Google completes acquisition of Wizcloud.google.com
- Netlifywww.netlify.com
- Hacker Newsnews.ycombinator.com



