Gemini 4 Argon: benchmarks, precio y por qué no puedes usarlo todavía
El lunes OpenAI presentó GPT-6.1 Sol en el DevDay. Ayer, 30 de septiembre de 2026, Google contestó con Gemini 4 Argon, el primer modelo de la generación Gemini 4. Llevábamos meses leyendo filtraciones y retrasos, y por fin hay tabla oficial.
La tabla es buena: Argon gana en 12 de 18 benchmarks a GPT-6 Astra, Claude Opus 5.5 y Claude Fable 5.1, y marca récord en DeepSWE, la prueba de ingeniería de software en repositorios reales. Sale además con un precio de lanzamiento de 2/10 dólares, igualito al de GPT-6.1 Sol, y con algo que no tiene nadie más: hasta un millón de tokens de salida en una sola respuesta.
Ahora la mala noticia. No lo puedes usar. Ni en la app de Gemini, ni en AI Studio, ni en la API, ni en Vertex. De momento solo lo tienen los equipos internos de Google, el Gobierno de Estados Unidos y los defensores de ciberseguridad del programa Fairwind. Para el resto, “lo antes posible”. Sin fecha.
Lo que vas a encontrar aquí:
- Qué es Gemini 4 Argon, de dónde sale el nombre y qué hay detrás del lanzamiento a medias.
- Cuánto costará de verdad, con el precio de lanzamiento y el que viene después.
- Los 18 benchmarks oficiales, dónde gana, dónde pierde y qué dice Artificial Analysis.
- Para qué sirve (y para qué no) un millón de tokens de salida.
- Cómo queda frente a GPT-6.1 Sol, que cuesta lo mismo y sí puedes usar hoy, y frente a Astra, Opus 5.5 y Fable 5.1.
- Qué hacer mientras llega para no pillarte los dedos el día que abran la puerta.
¿Qué es Gemini 4 Argon y por qué se llama así? ¶
Gemini 4 Argon es el nuevo modelo de frontera de Google DeepMind, pensado para ingeniería de software de largo recorrido, trabajo profesional con agentes y defensa en ciberseguridad. Es el primero de la familia Gemini 4 y sustituye como buque insignia a Gemini 3.1 Pro, que llevaba en ese papel desde febrero.
Lo anunció Sundar Pichai con un tono poco habitual en él: “Hay mucha conversación sobre nuestro próximo modelo(!), así que quería enseñarlo cuanto antes”. Traducido: los rumores se estaban comiendo el relato y Google ha preferido enseñar la tabla antes de tener el producto listo para todo el mundo.
¿Y el nombre? “Argon” era el nombre en clave interno. A mediados de septiembre empezaron a circular salidas de un checkpoint de “Gemini 4 Pro, internamente argon”, y en esas mismas fechas apareció en Arena camuflado como gemini-3.8-flash. Todo el mundo esperaba un “Gemini 4 Pro” y al final el nombre en clave se ha quedado como nombre público. Google no ha explicado si habrá otros gases nobles detrás (el argón es el elemento 18), así que cualquier teoría sobre “Gemini 4 Neón” es pura especulación. Por ahora.
| Característica | Gemini 3.1 Pro | Gemini 4 Argon |
|---|---|---|
| Salida máxima | 64K | 1M tokens |
| Contexto de entrada | 1M | 1M (según Artificial Analysis; no oficial) |
| Entrada / salida (1M) | $2 / $12 | $2 / $10 de lanzamiento, luego $4 / $20 |
| Lectura de caché | Con descuento | 95 % de descuento ($0,10 con el precio de lanzamiento) |
| ID en la API | gemini-3.1-pro-preview |
Sin publicar |
| Corte de conocimiento | — | Sin publicar |
| Disponibilidad | General | Solo Fairwind, Google y Gobierno de EE. UU. |
Fuentes: blog de Google, publicaciones de Logan Kilpatrick y Sundar Pichai en X, Artificial Analysis y 9to5Google.
Un detalle curioso: con el precio de lanzamiento, Argon sale más barato en salida que Gemini 3.1 Pro ($10 frente a $12). Y otro menos curioso: fíjate en cuántas casillas dicen “sin publicar”. El ID del modelo, el corte de conocimiento, el recargo por contexto largo, los niveles de razonamiento y la fecha en que acaba el precio de lanzamiento: todo eso está por saber. Hay tabla de benchmarks, pero no hay ficha técnica para developers.
¿Cuánto cuesta Gemini 4 Argon? ¶
Durante el periodo de lanzamiento, 2 dólares por millón de tokens de entrada y 10 por millón de salida, con un 95 % de descuento en la entrada cacheada. Después, 4 y 20 dólares. Lo confirmó Logan Kilpatrick, responsable de producto de la API de Gemini, en X: “$2 de entrada y $10 de salida durante el precio de lanzamiento”.
Con esos números sobre la mesa:
- Con precio de lanzamiento, cuesta lo mismo que GPT-6.1 Sol y Claude Sonnet 5.5, y lee de caché al mismo precio que Sol (10 céntimos el millón), la mitad que Sonnet.
- Con el precio definitivo, cuesta lo mismo que Claude Opus 5.5 ($4/$20) y una quinta parte de GPT-6 Astra ($10/$50).
El precio de lanzamiento es un gancho, y Google no ha dicho cuánto dura. Como además solo lo pueden pagar unas cuantas organizaciones, es posible que cuando llegue a la API pública ya estemos en la tarifa de 4/20. Haz tus cuentas con el precio alto, y si te toca el bajo, mejor.
Queda otra incógnita: el recargo por contexto largo. Gemini 3.1 Pro cobraba el doble en entrada y 1,5 veces en salida por encima de 200.000 tokens. Para Argon no se ha publicado nada. Tampoco lo des por hecho ni por descartado.
Vamos con el mismo ejemplo de tarea de agente que usamos con Sol: 2 millones de tokens de entrada, el 90 % servidos desde caché, y 50.000 tokens de salida.
| Modelo | Entrada sin caché | Entrada cacheada | Salida | Total aprox. |
|---|---|---|---|---|
| GPT-6.1 Sol | $0,40 | $0,18 | $0,50 | ~$1,08 |
| Gemini 4 Argon (lanzamiento) | $0,40 | $0,18 | $0,50 | ~$1,08 |
| Gemini 4 Argon (lanzamiento, salida ×2) | $0,40 | $0,18 | $1,00 | ~$1,58 |
| Gemini 4 Argon (precio definitivo) | $0,80 | $0,36 | $1,00 | ~$2,16 |
| Claude Opus 5.5 | $0,80 | $0,36 | $1,00 | ~$2,16 |
Cálculo propio con precios anunciados, sin contar escrituras en caché. Es un ejemplo, no una medición.
¿Por qué una fila con “salida ×2”? Porque Argon es muy hablador. Artificial Analysis mide una media de 62.000 tokens de salida por tarea de su índice, frente a los 27.000 de GPT-6 Astra. Más del doble. Es más barato por token, pero no más eficiente: para llegar al mismo sitio escribe mucho más. En un agente con buena caché, la salida es la parte gorda de la factura, así que esto importa más que el precio de la tabla.
💡 Dos modelos con el mismo precio por token pueden tener facturas muy distintas. Lo que decide es cuántos tokens escriben para terminar la tarea, y ahí Argon gasta de más.
Herramienta gratis · Calculadora
¿Cuánto te costaría Argon con el precio de lanzamiento y con el definitivo?
La tabla de arriba es una tarea inventada. Mete el contexto que reenvía tu agente, los pasos que da y la salida que genera, y compara Gemini 4 Argon a 2/10 y a 4/20 con lo que pagas hoy por Sol, Sonnet u Opus.
Le das
Los pasos y el contexto de tu agente
Te devuelve
Lo que cuesta una ejecución y lo que cuesta el mes
¿Qué dicen los benchmarks oficiales de Gemini 4 Argon? ¶
Según Google DeepMind, Argon supera a GPT-6 Astra, Claude Opus 5.5 y Claude Fable 5.1 en 12 de 18 pruebas y empata en otra. Los resultados de Google son a pass@1 con el nivel de razonamiento más alto; los de los rivales son los que publicó cada laboratorio. Es la versión del fabricante, igual que las tablas de OpenAI y Anthropic.
| Área | Benchmark | Gemini 4 Argon | GPT-6 Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| Trabajo profesional | Vals Index | 68,9 | 63,1 | 65,8 | 67,0 |
| Trabajo profesional | AutomationBench | 51,3 | 41,4 | 31,4 | 42,5 |
| Trabajo profesional | Vals Finance Agent v2 | 65,4 | 53,5 | 58,9 | 58,6 |
| Trabajo profesional | Harvey Legal Agent Benchmark | 19,6 | 5,4 | 6,7 | 3,8 |
| Programación | DeepSWE v1.1 | 77,9 | 74,1 | 67,4 | 74,2 |
| Programación | FrontierSWE v2 | 55,0 | 65,5 | 56,3 | 62,3 |
| Programación | Vibe Code Bench | 91,9 | 89,6 | 90,3 | 90,3 |
| Programación | Terminal-Bench 4.0 | 57,4 | 58,2 | 57,9 | 66,4 |
| Ingeniería de ML | PostTrainBench | 45,3 | 44,3 | 40,2 | 49,3 |
| Ciencia | Terminal-Bench Science 0.1 | 57,6 | 68,1 | 52,6 | 63,3 |
| Ciencia | LABBench 2 | 88,8 | 85,4 | 68,6 | 73,1 |
| Matemáticas | RiemannBench | 76,0 | 72,0 | 65,6 | 69,6 |
| Contexto largo | GraphWalks hasta 128K | 99,7 | 98,7 | 91,4 | 90,6 |
| Contexto largo | GraphWalks 256K–1M | 84,2 | 71,8 | 65,0 | 66,8 |
| Computer use | Agent’s Last Exam | 39,5 | 34,2 | — | 38,2 |
| Computer use | OSWorld 2.0 (offline, parcial) | 69,2 | 72,6 | — | — |
| Multimodal | Chartography | 71,6 | 71,0 | 46,2 | 66,3 |
| Multimodal | LVBench (vídeo largo) | 91,7 | 87,5 | 79,7 | 83,7 |
| Ciberseguridad | CWE-bench v1 | 68,0 | 68,0 | 58,0 | 67,0 |
Fuente: documento de evaluación de Gemini 4 Argon publicado por Google DeepMind. Porcentajes, salvo donde se indica puntuación.
Esta tabla hay que leerla por partes, porque la media esconde cosas.
Donde Argon arrasa: trabajo profesional con agentes. En AutomationBench le saca casi 9 puntos a Opus 5.5 y 10 a Astra. En el benchmark legal de Harvey triplica a todos (aunque con notas tan bajas que la prueba todavía es durísima para cualquiera). En finanzas, 12 puntos sobre Astra. Si tu trabajo es montar agentes que rellenan hojas de cálculo, redactan documentos o automatizan procesos de oficina, esto es lo más llamativo del anuncio.
En programación, depende de la prueba. DeepSWE es el titular: 77,9 %, récord, casi 4 puntos por encima de Astra y Opus 5.5. Pero en FrontierSWE v2, otra prueba de ingeniería de software difícil, Argon queda último, a 10 puntos de Astra y 7 de Opus. Y en Terminal-Bench 4.0, la de trabajar en la terminal, Opus 5.5 le saca 9 puntos. Con un benchmark de programación ganado por goleada y dos perdidos con claridad, “el mejor modelo para programar” es mucho decir.
El contexto largo es su terreno. En GraphWalks entre 256.000 tokens y un millón, 84,2 frente a 71,8 de Astra y menos de 67 de los Claude. Google lleva años con ventanas de un millón y se nota: es el que mejor razona cuando le metes un repositorio entero.
En ciencia dura, Astra sigue arriba. Terminal-Bench Science: 68,1 Astra, 63,3 Opus, 57,6 Argon. Es la misma prueba donde GPT-6.1 Sol saca un 57,0, así que en investigación científica Argon y Sol están en la misma liga, un escalón por debajo.
🔑 Fable 5.1 no gana ninguna de las 18 pruebas de la tabla de Google. Cuidado con leer eso como “Fable ha quedado obsoleto”: cada laboratorio elige las pruebas que publica, y Google no ha incluido las que Anthropic suele usar para lucir a Fable en tareas de horas.
Un millón de tokens de salida no arregla una tarea mal definida
Cuanto más puede escribir un modelo del tirón, más importa decirle bien qué tiene que escribir. En el curso recorres el ciclo completo de SDD con OpenSpec, de la propuesta y la spec a las tareas y el apply, sobre un proyecto real y en modo asistido.
Entra en el curso gratis →¿Para qué sirve un millón de tokens de salida? ¶
Para resolver en una sola respuesta problemas que hoy obligan a partir el trabajo en muchos pasos. Es la novedad técnica más llamativa de Argon: pasa de 64.000 a 1.000.000 de tokens de salida. GPT-6.1 Sol y GPT-6 Astra se quedan en 128.000.
Para hacerte una idea, un millón de tokens es algo así como unas 750.000 palabras, o decenas de miles de líneas de código. En la práctica abre tres puertas:
- Generar o reescribir módulos enteros de una vez: una migración de framework, una capa de tests completa, la traducción de una base de código de un lenguaje a otro.
- Razonamiento muy largo sin cortes: problemas matemáticos o de planificación donde el modelo necesita pensar mucho antes de contestar.
- Documentos largos de verdad: informes, especificaciones o documentación técnica completa.
Ahora, echa cuentas. Una sola respuesta de un millón de tokens cuesta 10 dólares con el precio de lanzamiento y 20 con el definitivo, solo en salida. Y tarda: si el modelo sale a una velocidad normal de 60–100 tokens por segundo, un millón de tokens son entre tres y cinco horas de generación. Artificial Analysis todavía no ha podido medir la velocidad de Argon porque no hay API pública.
Y hay una pega de fondo. Los agentes funcionan bien precisamente porque parten el trabajo en pasos cortos y comprueban cada uno: ejecutan tests, leen errores, corrigen. Una respuesta gigante sin verificar entre medias es lo contrario de lo que recomendamos en harness engineering. El millón de salida es una herramienta estupenda para casos concretos, no un modo de trabajo por defecto.
💡 Que un modelo pueda escribir un millón de tokens del tirón no significa que debas dejarle. Cuanto más larga es la respuesta, más caro sale el error que se cuela en la línea 3.000.
¿Qué dicen las mediciones independientes? ¶
Artificial Analysis coloca a Gemini 4 Argon en 53 puntos de su Intelligence Index (52,6 sin redondear): empatado con GPT-6 Astra, por delante de GPT-6.1 Sol y por detrás de Claude Opus 5.5 y Sonnet 5.5. Su titular: Argon “iguala a GPT-6 Astra con un 60 % del coste por tarea” y devuelve a Google al grupo de los tres mejores laboratorios.
| Modelo | Intelligence Index (AA) | Coste por tarea del índice |
|---|---|---|
| Claude Opus 5.5 (max) | 58 | $5,98 |
| Claude Sonnet 5.5 | 56 | — |
| GPT-6 Astra (max) | 53 (52,7) | $3,26 |
| Gemini 4 Argon | 53 (52,6) | $1,99 |
| GPT-6.1 Sol (max) | 52 (51,8) | $0,72 |
Fuente: Artificial Analysis. El coste de Argon está calculado con el precio de lanzamiento.
Tres lecturas rápidas:
- Es un salto enorme para Google. Argon puntúa 23 puntos más que Gemini 3.1 Pro en el mismo índice. Durante meses, Google se había quedado fuera de la conversación sobre el mejor modelo para programar. Con esta cifra vuelve a entrar.
- Frente a Sol, la diferencia en inteligencia es de menos de un punto y la de coste es de casi tres veces. Con el mismo precio por token, Argon cuesta 1,99 dólares por tarea y Sol 0,72. Es la consecuencia directa de que Argon escriba más del doble que otros modelos.
- Opus 5.5 sigue arriba, con 5 puntos de ventaja. Pero cuesta tres veces más por tarea que Argon y ocho veces más que Sol.
Lo que falta: velocidad (no medible sin API pública), posición oficial en Arena y cualquier réplica independiente de DeepSWE. Los números de programación de la tabla anterior siguen siendo los de Google.
¿Por qué no puedes usar Gemini 4 Argon todavía? ¶
Porque Google lo ha entrenado para encontrar, validar y parchear vulnerabilidades críticas de forma autónoma, y antes de abrirlo al público quiere reforzar las salvaguardas contra el mal uso. Mientras tanto, lo reparte sin frenos de ciberseguridad a defensores verificados.
Quién lo tiene hoy:
- Los participantes del programa Fairwind, que Google lanzó el 2 de septiembre para dar a defensores de confianza acceso a modelos más permisivos en ciberseguridad. Son más de 650 organizaciones: gobiernos, operadores de infraestructura crítica (sanidad, telecomunicaciones, energía, finanzas), grandes plataformas tecnológicas, clientes de Google Cloud y mantenedores de software muy usado. Hasta ahora recibían Gemini 3.8 Flash Cyber y el agente de parches CodeMender. Ahora suman Argon.
- Los equipos de Google, donde según Pichai lo usan miles de personas.
- El Gobierno de Estados Unidos, dentro de su proceso voluntario de acceso previo a modelos.
Los siguientes en la cola serán los clientes de pago de la API y los suscriptores de Google AI Ultra. ¿Cuándo? “Lo antes posible y de la forma más segura posible”, en palabras de Pichai. No hay fecha.
Las cifras de ciberseguridad que acompañan el anuncio explican la cautela:
- En detección de vulnerabilidades reales recientes, en 20 lenguajes y usando Antigravity como harness, Argon encuentra el 85,8 %, frente al 71 % de Gemini 3.8 Flash Cyber.
- En pruebas de intrusión de caja negra con Wiz, 70,9 % frente a 58,2 %.
- En colaboración con Wiz, una instancia sin restricciones de Argon analizó software sanitario usado en hospitales de todo el mundo y encontró una exposición grave de historiales médicos que otros modelos de frontera no habían detectado.
Si esto te suena, es porque ya lo hemos vivido. Anthropic hizo algo parecido con Claude Mythos y OpenAI con GPT-5.4 Cyber: modelos que encuentran fallos de seguridad tan bien que primero se entregan a quien los va a parchear. La diferencia es que aquí no es un modelo especializado aparte: es el buque insignia de Google, y todos los demás esperan.
Para la versión general, Google dice que el modelo rechazará peticiones dañinas de ciberataque y armas químicas o biológicas, permitiendo la investigación de doble uso. Y añade una técnica que conviene seguir: vigilar las activaciones internas del modelo para detectar usos maliciosos, ya probada por equipos rojos internos y externos. No hemos encontrado todavía una model card completa ni el informe del Frontier Safety Framework.
Hay un dato de seguridad que sí te afecta directamente si montas agentes. En la prueba de inyección de prompts indirecta de Gray Swan, donde se mide cuántas veces un texto malicioso escondido en una web o documento consigue secuestrar al agente, Argon cae en la trampa el 0,7 % de las veces, frente al 1 % de Opus 5.5 y el 8,5 % de GPT-6 Astra. Es la métrica de seguridad que más importa cuando tu agente navega por internet o lee correos.
⚠️ Ese 0,7 % sigue siendo una de cada 140 veces. Que un modelo resista mejor la inyección de prompts no te exime de limitar lo que el agente puede tocar cuando lee contenido de fuera.
Un modelo que gana 12 de 18 benchmarks y que no puedes usar, otro que sale al mismo precio y sí puedes, y un tercero que se cancela la víspera. Todo en tres días. Cada domingo contamos a +7.200 developers qué cambia de verdad en su forma de programar y qué es ruido de lanzamiento, más 12 recursos elegidos a mano. Gratis, desde 2018.
Apúntate gratis →¿Qué dicen los developers en Hacker News y en la prensa? ¶
La reacción ha sido de interés por la tabla y bastante escepticismo por el formato del lanzamiento. Es difícil entusiasmarse con un modelo que no se puede probar.
En el hilo de Hacker News se repiten tres ideas:
- “Esto es marketing, no un producto.” Uno de los comentarios más votados lo resume: la noticia de verdad es que Gemini 4 “no está disponible y no tiene fecha prevista”. Otro, más escueto: “trust me bro”.
- El “demasiado peligroso para lanzarlo” ya es un clásico. Varios usuarios señalan que presentar un modelo como demasiado potente para el público se ha convertido en una táctica habitual de marketing en IA. Con Mythos pasó algo parecido.
- Hay quien ya lo ha probado, o dice haberlo hecho: un usuario cuenta que lo usó para descompilar el ejecutable de un juego hecho con Godot y extraer sus scripts cifrados. No lo podemos verificar, pero encaja con el perfil de ciberseguridad del modelo.
La prensa va en la misma línea. The New Stack titula “Es genial y no puedes tenerlo todavía”; XDA, “Google presenta Gemini 4 Argon, pero no te dejan usarlo”; VentureBeat habla de que Google “recupera el liderazgo en benchmarks”, con la coletilla de “en lanzamiento limitado”.
Y el mismo día llegó el contrapunto que Google no quería. Bloomberg publicó que parte de la plantilla de Google tiene dudas sobre Gemini 4: según algunos empleados, rinde muy bien en benchmarks pero le cuesta con algunas tareas de programación del mundo real, y creen que Fable (Anthropic) y Astra (OpenAI) están mejorando más rápido. Google lo niega y habla de un “amplio consenso” interno en que el modelo está en la frontera. Las acciones de Alphabet bajaron tras la noticia.
Esto cuadra con el contexto de los últimos meses: retrasos de modelos, un Gemini 3.5 Pro del que no se volvió a saber, cambios en la dirección de DeepMind y un nuevo jefe, Koray Kavukcuoglu, que la semana pasada decía que Gemini 4 estaba “en las primeras fases del post-entrenamiento” y que saldría “lo antes posible”. Siete días después, hay anuncio. Pero no hay producto.
💡 La distancia entre “gana en benchmarks” y “me resuelve el ticket de hoy” es la que separa un buen anuncio de un buen modelo. Hasta que no lo puedas probar con tu repositorio, Argon solo ha demostrado lo primero.
Gemini 4 Argon vs GPT-6.1 Sol: ¿cuál conviene? ¶
Hoy, GPT-6.1 Sol, porque se puede usar. Cuando Argon llegue a la API, la comparación estará muy ajustada: el mismo precio de lanzamiento, un punto de diferencia en el índice de Artificial Analysis a favor de Argon y casi tres veces menos coste por tarea a favor de Sol.
Es la comparación que todo el mundo quiere hacer, y Google no la ha hecho: su tabla compara con Astra, Opus 5.5 y Fable 5.1, pero no con Sol ni con Sonnet 5.5, que salieron después de cerrar sus pruebas. Así que toca cruzar datos de fuentes distintas.
| Dimensión | Gemini 4 Argon | GPT-6.1 Sol |
|---|---|---|
| Precio entrada / salida | $2 / $10 (lanzamiento), luego $4 / $20 | $2 / $10 |
| Lectura de caché (1M) | $0,10 (lanzamiento) | $0,10 |
| Salida máxima | 1M | 128K |
| Intelligence Index (AA) | 53 | 52 |
| Coste por tarea del índice (AA) | $1,99 | $0,72 |
| DeepSWE v1.1 | 77,9 % | 75,2 % (high) |
| Terminal-Bench Science 0.1 | 57,6 % | 57,0 % |
| AutomationBench | 51,3 % | 36,1 % (max) |
| Disponible hoy | No | Sí |
Fuentes: Google DeepMind, OpenAI y Artificial Analysis. Las cifras de benchmarks vienen de cada fabricante y no siempre usan el mismo harness.
Un aviso sobre OSWorld 2.0: Google da a Argon un 69,2 % y OpenAI da a Sol un 71,4 %, pero no se pueden comparar directamente. La prueba del algodón es Astra: Google le asigna un 72,6 % en su configuración y OpenAI un 73,5 % en la suya. Cada uno mide a su manera.
Cómo lo leo yo:
- En programación agéntica pura están parejos. Argon gana en DeepSWE por 2,7 puntos, pero ha perdido con claridad en FrontierSWE y Terminal-Bench 4.0, pruebas en las que OpenAI no ha publicado cifras de Sol. Empate técnico hasta que haya mediciones independientes.
- En automatización de trabajo de oficina, Argon va claramente por delante: 51,3 frente a 36,1 en AutomationBench es mucha distancia, incluso con las dudas de comparar configuraciones distintas.
- En la factura, Sol gana. Mismo precio por token, pero Argon escribe mucho más para cada tarea. Y cuando termine el precio de lanzamiento, Argon costará el doble por token.
- En contexto largo y salidas enormes, Argon no tiene rival. Si tu caso de uso es razonar sobre un millón de tokens o generar documentos enormes, es otra categoría.
Gemini 4 Argon vs GPT-6 Astra, Opus 5.5 y Fable 5.1 ¶
Argon iguala a Astra en inteligencia general a menos de la mitad del precio definitivo por token, y a Opus 5.5 se le acerca en precio pero no en el índice. Así queda el mapa de la gama alta con la información de hoy:
| Dimensión | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 |
|---|---|---|---|---|
| Precio entrada / salida | $2/$10 → $4/$20 | $10 / $50 | $4 / $20 | — |
| Intelligence Index (AA) | 53 | 53 | 58 | — |
| Coste por tarea (AA) | $1,99 | $3,26 | $5,98 | — |
| Benchmarks ganados (tabla Google) | 12 + 1 empate | 3 + 1 empate | 2 | 0 |
| Dónde brilla | Agentes de oficina, contexto largo, ciber | Ciencia, FrontierSWE | Terminal, construcciones largas | Tareas de horas |
Fuentes: Google DeepMind, Artificial Analysis, OpenAI y Anthropic.
Contra GPT-6 Astra, Argon es la mala noticia que le faltaba. Esta semana GPT-6.1 Sol ya le había quitado casi todos los argumentos de precio en programación; ahora Argon le empata en el índice de AA a un 60 % del coste por tarea y le gana en 12 pruebas. A Astra le quedan la ciencia dura y FrontierSWE.
Contra Opus 5.5 la cosa está más equilibrada. Con el precio definitivo, cuestan lo mismo por token. Opus lidera el índice con 5 puntos de ventaja y gana en Terminal-Bench 4.0 por 9 puntos, que es justo la prueba más parecida a lo que hace un agente de programación en tu terminal. Argon gana en DeepSWE, en automatización y en contexto largo, y sale más barato por tarea. Si vives en Claude Code, no hay motivo para moverte hoy.
Contra Fable 5.1 la tabla de Google es demoledora, cero de dieciocho. Pero ojo con el sesgo de selección: Fable destaca en tareas autónomas de horas con subagentes, y eso no aparece en ninguna prueba de la tabla.
Arquitectura de agentes
El modelo cambia cada semana; la arquitectura de tu agente no debería
Sol el lunes, Argon el miércoles y lo que venga el viernes. Si tu agente está bien construido, cambiar de modelo es tocar una línea. En esta masterclass montas los seis niveles de arquitectura de un agente: roles, guardarraíles, memoria, skills, MCP y orquestación, con evals para comparar modelos con tus propias tareas.
Ver la masterclass →Masterclass en directo · 6 niveles de arquitectura
¿Qué puedes hacer mientras llega Gemini 4 Argon? ¶
Preparar tu código para cambiar de modelo con una línea y montar tus propias pruebas, para que el día que abran la API sepas en una tarde si te compensa. No tiene sentido tomar decisiones con una tabla de benchmarks que no puedes comprobar.
Tres cosas concretas:
1. Saca el nombre del modelo del código. El ID de Argon en la API todavía no es oficial, así que no lo escribas a mano en veinte sitios. Con el SDK de Google, por ejemplo:
import os
from google import genai
client = genai.Client()
# El ID de Gemini 4 Argon aún no es público:
# cuando salga, solo cambias la variable de entorno.
MODEL = os.environ.get("WR_MODEL", "gemini-3.1-pro-preview")
response = client.models.generate_content(
model=MODEL,
contents="Revisa este diff y dime qué tests faltan.",
)
print(response.text)
Si usas varios proveedores, un router como OpenRouter o una pasarela tipo Vercel AI Gateway te deja cambiar entre Sol, Sonnet, Opus y Argon sin tocar tu lógica.
2. Prepara un banco de pruebas con tus tareas reales. Diez o quince tareas de tu día a día, con la solución conocida: un bug que ya arreglaste, una refactorización, un test que falta. El día que Argon esté disponible, las pasas con él y con lo que usas hoy, y comparas dos cosas: cuántas resuelve y cuánto has pagado. Eso vale más que cualquier tabla de este post.
3. Si ya trabajas con herramientas de Google, tenlas al día. Google ha probado Argon internamente en Antigravity y lo ha usado como harness en sus pruebas de ciberseguridad. Es muy probable que llegue ahí, y a la CLI de Gemini, en cuanto se abra. Ni Antigravity, ni la CLI de Gemini, ni GitHub Copilot, ni OpenRouter han anunciado soporte todavía.
Mientras Google decide cuándo abre la puerta, nosotros seguimos probando lo que sí se puede usar. Cada domingo, junto a +7.200 developers, contamos qué modelos y harnesses nos funcionan en proyectos de verdad y te pasamos 12 recursos elegidos para no ahogarte en lanzamientos. Gratis, desde 2018.
Quiero esa dinamita 🧨¿Qué modelo usar para cada tarea hoy? ¶
Con Argon anunciado pero cerrado, el reparto práctico no cambia todavía; lo que cambia es qué vigilar. Así queda la tabla a 1 de octubre, marcando dónde podría entrar Argon cuando esté disponible:
| Tarea | Modelo recomendado hoy | Cuando Argon esté disponible |
|---|---|---|
| Implementar, refactorizar, depurar en Codex | GPT-6.1 Sol | Probar Argon: mejor DeepSWE, peor coste por tarea |
| Ejecutar dentro de Claude Code | Sonnet 5.5 | Sin cambios |
| Planificar arquitectura o migraciones grandes | Opus 5.5 o GPT-6 Astra | Candidato, sobre todo con contexto enorme |
| Agentes de trabajo de oficina (hojas, documentos) | GPT-6.1 Sol u Opus 5.5 | Argon, si se confirma AutomationBench |
| Razonar sobre repositorios o documentos de 500K+ | Gemini 3.1 Pro u Opus 5.5 | Argon: el mejor en GraphWalks 256K–1M |
| Generar salidas enormes (módulos, docs, migraciones) | Partir en pasos con Sol u Opus | Argon, con verificación entre medias |
| Investigación científica, razonamiento muy profundo | GPT-6 Astra | Astra sigue por delante |
| Análisis de seguridad y búsqueda de vulnerabilidades | Opus 5.5 o GPT-6.1 Sol | Argon, si tu organización entra en Fairwind |
Es un punto de partida, no una verdad absoluta. La columna de la derecha es una hipótesis hasta que alguien, tú incluido, pueda probar el modelo.
Lo que todavía no sabemos ¶
Hay más preguntas abiertas que en cualquier lanzamiento reciente, precisamente porque no hay producto:
- ¿Cuándo llega a la API y a la app de Gemini? “Lo antes posible” no es una fecha.
- ¿Cuánto dura el precio de 2/10? Si acaba antes de que el modelo esté disponible para todos, en la práctica Argon costará lo mismo que Opus 5.5.
- ¿Se sostiene fuera de los benchmarks? Las dudas internas que publicó Bloomberg apuntan justo ahí: buenos números, peor rendimiento en tareas reales de programación.
- ¿Cuánto tarda? Sin API no hay medición de velocidad, y un modelo que escribe el doble que Astra puede ser lento de narices.
- ¿Habrá recargo por contexto largo? Con un millón de tokens de entrada y otro de salida, esta línea de la tarifa puede cambiar mucho la factura.
- ¿Qué versión llegará al público? La que usan los defensores de Fairwind va sin frenos de ciberseguridad. La general llevará salvaguardas extra, y ya vimos con Fable 5.1 que los frenos pueden costar varios puntos en tareas agénticas.
Gemini 4 Argon en una frase ¶
Es el mejor modelo que ha presentado Google y, sobre el papel, uno de los tres mejores del mundo, pero hoy es una tabla de benchmarks, no una herramienta. Cuando llegue a la API, merecerá una tarde de pruebas con tus tareas reales, sobre todo si trabajas con contextos enormes o agentes de oficina. Hasta entonces, GPT-6.1 Sol, Sonnet 5.5 y Opus 5.5 siguen siendo lo que puedes usar.
TL;DR ¶
- 🚀 Gemini 4 Argon es el nuevo modelo de frontera de Google DeepMind, presentado el 30 de septiembre de 2026.
- 📊 Según Google, gana en 12 de 18 benchmarks a GPT-6 Astra, Opus 5.5 y Fable 5.1, con récord en DeepSWE (77,9 %), pero pierde en FrontierSWE, Terminal-Bench 4.0 y Terminal-Bench Science.
- 🧮 Artificial Analysis lo sitúa en 53 puntos, empatado con Astra y uno por encima de GPT-6.1 Sol, con un coste por tarea de 1,99 dólares (Sol: 0,72) porque escribe más del doble de tokens.
- 💰 Cuesta $2/$10 de lanzamiento (igual que Sol) y $4/$20 después (igual que Opus 5.5), con un 95 % de descuento en caché.
- 📝 Genera hasta un millón de tokens de salida, frente a 64K de Gemini 3.1 Pro y 128K de Sol y Astra.
- 🔒 Solo está disponible para defensores de ciberseguridad del programa Fairwind, equipos de Google y el Gobierno de EE. UU. Sin fecha para la API ni la app.
Preguntas frecuentes ¶
¿Qué es Gemini 4 Argon? ¶
Gemini 4 Argon es el modelo de frontera de Google DeepMind presentado el 30 de septiembre de 2026, el primero de la generación Gemini 4. Está pensado para ingeniería de software de largo recorrido, trabajo profesional con agentes y defensa en ciberseguridad, y puede generar hasta un millón de tokens de salida en una sola respuesta.
¿Cuánto cuesta Gemini 4 Argon? ¶
Con el precio de lanzamiento, 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida, con un 95 % de descuento en la entrada cacheada. Después pasará a 4 y 20 dólares. Google no ha dicho cuándo termina el precio de lanzamiento ni si habrá recargo por contexto largo.
¿Puedo usar Gemini 4 Argon ya? ¶
No, salvo que tu organización participe en el programa Fairwind de Google para defensores de ciberseguridad. De momento solo lo usan esos participantes, los equipos internos de Google y el Gobierno de Estados Unidos. Los siguientes serán los clientes de pago de la API y los suscriptores de Google AI Ultra, sin fecha anunciada.
¿Por qué se llama Argon? ¶
“Argon” era el nombre en clave interno del modelo, que se filtró a mediados de septiembre cuando se esperaba un “Gemini 4 Pro”. Google ha mantenido el nombre en clave como nombre público y no ha explicado si seguirá una nomenclatura de gases nobles.
¿Gemini 4 Argon es mejor que GPT-6.1 Sol? ¶
En el índice de Artificial Analysis puntúa un punto más (53 frente a 52) y, según Google, supera a Sol en DeepSWE y en AutomationBench. Pero Sol cuesta casi tres veces menos por tarea, se puede usar hoy y, al mismo precio por token, escribe muchos menos tokens para terminar cada tarea.
¿Gemini 4 Argon es mejor que Claude Opus 5.5? ¶
Depende de la tarea. Según Google, Argon gana a Opus 5.5 en DeepSWE, AutomationBench y contexto largo, mientras que Opus gana en Terminal-Bench 4.0, PostTrainBench y Terminal-Bench Science. En el índice de Artificial Analysis, Opus 5.5 va 5 puntos por delante (58 frente a 53), aunque cuesta tres veces más por tarea.
¿Qué es el programa Fairwind de Google? ¶
Es un programa lanzado el 2 de septiembre de 2026 que da a defensores de ciberseguridad verificados acceso a modelos de Google con menos restricciones en tareas de seguridad. Participan más de 650 organizaciones, entre gobiernos, operadores de infraestructura crítica, plataformas tecnológicas y mantenedores de software. Incluye Gemini 3.8 Flash Cyber, el agente CodeMender y ahora Gemini 4 Argon.
¿Cuántos tokens de salida admite Gemini 4 Argon? ¶
Hasta un millón de tokens de salida en una sola respuesta, frente a los 64.000 de Gemini 3.1 Pro y los 128.000 de GPT-6.1 Sol y GPT-6 Astra. Con el precio de lanzamiento, una respuesta de un millón de tokens costaría 10 dólares solo en salida.
¿Cuál es el ID de Gemini 4 Argon en la API? ¶
Google todavía no lo ha publicado, porque el modelo no está disponible en la API pública. Conviene no escribir el nombre del modelo a mano en el código y leerlo de una variable de entorno o de la configuración, para cambiarlo con una línea cuando salga.
Fuentes ¶
- Gemini 4 Argon: our next era of frontier intelligence — Google
- Gemini 4 Argon model evaluation — Google DeepMind (PDF)
- Anuncio de Sundar Pichai en X
- Precio de lanzamiento, Logan Kilpatrick en X
- Gemini 4 Argon — Artificial Analysis
- Resumen de Artificial Analysis en X
- Fairwind Program — Google
- Google unveils Gemini 4 Argon, retaking benchmark lead — VentureBeat
- Gemini 4 Argon announcement — 9to5Google
- Google Gemini 4 Argon — CNBC
- Google Gemini 4 — Axios
- Google reveals Gemini 4 Argon, but you’re not allowed to use it — XDA
- Google announces Gemini 4 Argon for coding and cyber defense — Unite.AI
- Google DeepMind unveils Gemini 4 Argon with 1M output tokens — MarkTechPost
- Google Finally Brings Gemini 4 Into the Fight — Trending Topics
- Gemini 4 Argon en Artificial Analysis — Trending Topics
- Google Grapples With Employee Skepticism About New Gemini 4 — Bloomberg
- Gemini 4 Argon — Hacker News
- Gemini 4 Pro leaks on Arena disguised as Gemini 3.8 Flash — Pasquale Pillitteri
- Gemini 4 release and post-training — The Next Web
🧨 Última oportunidad para recibir la dinamita que mereces sobre programación con IA el próximo domingo: Suscríbete gratis a Web Reactiva en https://webreactiva.com/newsletter
12 recursos para developers cada domingo en tu bandeja de entrada
Además de una skill práctica bien explicada, trucos para mejorar tu futuro profesional y una pizquita de humor útil para el resto de la semana. Gratis.