Noticias Google
Google presenta Gemini 4 Argon: benchmarks, precio y acceso

Google anuncia Gemini 4 Argon. Compara sus benchmarks con GPT-6 Astra y Claude Opus 5.5, el precio introductorio de la API y quién puede acceder primero.
Google presentó Gemini 4 Argon el 30 de septiembre. Su nuevo modelo está pensado para tareas profesionales largas, programación y defensa de ciberseguridad. El acceso comienza con participantes de Fairwind, su programa para defensores de seguridad. La apertura al público será gradual.
El anuncio llega un día después de OpenAI DevDay 2026 y dos días después del lanzamiento de Claude Sonnet 5.5. Para comparar esta tanda de modelos, importa mirar la tarea concreta, el coste de completarla y quién puede usarlos hoy.
Gemini 4 Argon vs. GPT-6 Astra y Claude Opus 5.5
Estos gráficos reproducen seis evaluaciones de la tabla del lanzamiento. Puedes cambiar de prueba y revisar la misma escala de 0 a 100. El rótulo «Lidera» identifica el mejor resultado entre los cuatro modelos mostrados.
Elige la tarea. Compara los modelos.
AutomationBench
Mayor es mejorEjecución de tareas empresariales de principio a fin. Puntuación, %.
- Gemini 4 ArgonLidera
- 51,3%
- GPT-6 Astra
- 41,4%
- Claude Fable 5.1
- 31,4%
- Claude Opus 5.5
- 42,5%
Argon supera a Opus 5.5 por 8,8 puntos porcentuales en esta evaluación.
DeepSWE v1.1
Mayor es mejorIngeniería de software con tareas de larga duración. Puntuación, %.
- Gemini 4 ArgonLidera
- 77,9%
- GPT-6 Astra
- 74,1%
- Claude Fable 5.1
- 67,4%
- Claude Opus 5.5
- 74,2%
Argon lidera entre los cuatro modelos de la tabla de Google. La diferencia con Opus 5.5 es de 3,7 puntos.
Terminal-Bench 4.0
Mayor es mejorTareas con agentes en una terminal. Puntuación, %.
- Gemini 4 Argon
- 57,4%
- GPT-6 Astra
- 58,2%
- Claude Fable 5.1
- 57,9%
- Claude Opus 5.5Lidera
- 66,4%
Aquí lidera Opus 5.5. Argon queda 9 puntos por debajo. Un modelo puede ganar en un benchmark y perder en otro.
FrontierSWE v2
Mayor es mejorOtra evaluación de ingeniería de software. Puntuación, %.
- Gemini 4 Argon
- 55,0%
- GPT-6 AstraLidera
- 65,5%
- Claude Fable 5.1
- 56,3%
- Claude Opus 5.5
- 62,3%
Astra alcanza la mayor puntuación de este grupo. Este resultado ayuda a matizar el liderazgo de Argon en DeepSWE.
LVBench
Mayor es mejorComprensión de vídeos largos. Puntuación, %.
- Gemini 4 ArgonLidera
- 91,7%
- GPT-6 Astra
- 87,5%
- Claude Fable 5.1
- 79,7%
- Claude Opus 5.5
- 83,7%
Google usa 1 fotograma por segundo para Gemini, 800 fotogramas para Astra, 300 para Fable y 600 para Opus, por límites de sus API. Evalúa comprensión, no generación de vídeo.
CWE-bench v1
Mayor es mejorCorrección de vulnerabilidades de software. Puntuación, %.
- Gemini 4 ArgonLidera
- 68,0%
- GPT-6 AstraLidera
- 68,0%
- Claude Fable 5.1
- 58,0%
- Claude Opus 5.5
- 67,0%
Argon y Astra empatan al 68 %. Esta prueba mide reparación de vulnerabilidades; no todas las tareas de ciberseguridad.
La selección incluye victorias, empates y pruebas donde otro modelo queda primero. Esa diferencia te permite elegir qué evaluar con tus propios materiales. Una buena puntuación de programación aporta poca información sobre si un modelo respetará el tono de tu marca al redactar un carrusel.
Google publica el detalle de las configuraciones y metodología de evaluación. Cambiar las herramientas del agente, su presupuesto de razonamiento o el conjunto de tareas puede cambiar el resultado. Conservamos aquí las cifras de su tabla, sin mezclarlas con ejecuciones de otros proveedores.
Qué dice la evaluación independiente de Vals AI
La tabla de Vals Index sitúa a Argon en el primer puesto con 68,90 %, seguido de Sonnet 5.5 con 67,04 % y Opus 5.5 con 66,97 %. GPT-6 Astra alcanza 63,13 % y GPT-6.1 Sol, 61,15 % en esa misma tabla, consultada el 30 de septiembre.
Vals combina tareas de finanzas, código, derecho e impuestos con ponderaciones económicas. Su índice ayuda a comparar trabajo profesional; no evalúa campañas de marketing. Además, el texto de conclusiones de la página todavía describe a Sonnet y Opus como líderes. Para estas cifras usamos la tabla actual, que ya incluye Argon.
Un millón de tokens de salida: qué cambia
Google amplía el máximo de salida de 64K a un millón de tokens. Es el espacio disponible para una ejecución larga. Conviene distinguir ese límite de la ventana de contexto, que describe lo que un modelo puede recibir.
- Límite anterior
- 64K
- Gemini 4 Argon
- 1M
Es un máximo de salida. El consumo real y el coste dependen de cuántos tokens use la tarea.
Para un agente que investiga, escribe código y comprueba cambios, tener más margen puede permitir seguir trabajando sin cortar la ejecución por ese límite. A cambio, una tarea larga puede consumir muchos tokens. Recomendamos medir tokens y llamadas por entrega, junto con el tiempo de revisión humana, cuando el acceso permita probarlo.
Precio de Gemini 4 Argon: la tarifa introductoria cambia después
Google anunció estas tarifas para la API, en dólares estadounidenses por millón de tokens:
| Tokens | Introducción | Después |
|---|---|---|
| Entrada | US$2 | US$4 |
| Salida | US$10 | US$20 |
Google no ha anunciado la fecha de término del periodo introductorio.
El anuncio también indica un descuento del 95 % sobre la tarifa de entrada para tokens en caché. No especifica cuándo termina el periodo introductorio.
Un ejemplo calculado: 10.000 tokens de entrada y 2.000 de salida cuestan US$0,04 con la tarifa inicial o US$0,08 con la posterior. Excluye herramientas y caché; una investigación con varias llamadas consume más. El máximo de un millón de tokens de salida no significa que una respuesta vaya a usarlo completo.
Cuándo se podrá usar Gemini 4 Argon
Por ahora, Google empieza con defensores de ciberseguridad y evaluadores de confianza. Su anuncio señala que la expansión comenzará por clientes de API de pago y suscriptores de Google AI Ultra. No publica una fecha de apertura general.
La elección práctica depende del acceso: revisa tu cuenta y la documentación vigente antes de preparar una integración o cambiar el modelo de una automatización.
Qué probaría un equipo de marketing
Cuando llegue el acceso, proponemos una prueba breve con una entrega que puedas comprobar:
- Un informe: entregar las cifras de las publicaciones de una misma cuenta y pedir conclusiones con sus cálculos y fuentes.
- Una investigación: pedir un resumen de tendencias con enlaces, fechas y una separación clara entre anuncios disponibles y promesas futuras.
- Un borrador: dar el brief y ejemplos de tu marca; comprobar qué datos conserva y qué partes necesitas reescribir.
HeyMark permite trabajar con publicaciones y métricas de tus cuentas, y llevar esos datos a Claude o ChatGPT. Esos materiales sirven para evaluar una entrega con hechos de tu marca. No hemos probado Argon con HeyMark ni anunciamos una integración con Gemini.
Las cifras del lanzamiento dan motivos para probarlo. La decisión de usarlo en tu trabajo vendrá de las entregas que puedas revisar, su coste y el acceso efectivo.
Fuente
Planifica el próximo post en HeyMark.
Guarda la idea, revisa el texto con tu equipo y mira cómo le fue después en las cuentas que conectaste.