Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.
Mantente informado con las últimas noticias de actualidad.
Google ha decidido que Gemini 4 Argon no salga de golpe al gran escaparate. Su nueva familia de modelos nace orientada a programación, investigación y ciberseguridad, pero el primer acceso quedará restringido a socios cibernéticos del programa Fairwind.
No es un detalle menor. Cuando una compañía limita así la puerta de entrada, suele estar diciendo dos cosas a la vez. Por un lado, que ve valor en la herramienta. Por otro, que el terreno donde quiere usarla exige más controles que un asistente generalista.
Google reservó Argon para tareas donde un error cuesta caro
Argon se presenta como un sistema pensado para actuar como ciberdefensor de confianza, una etiqueta que pesa más de lo que parece cuando hablamos de software que revisa código, busca fallos y ayuda a investigar incidentes.
Además, Google participa en el proceso voluntario del gobierno de Estados Unidos para facilitar acceso a modelos de prueba. La empresa ampliará la disponibilidad después de completar pruebas adicionales.
Ahí aparece una primera tensión interesante. Google presume de rendimiento, pero al mismo tiempo decide que el despliegue inicial pase por un embudo estrecho y supervisado.
La comparación que propone la propia compañía va en grande, porque asegura que Gemini 4 Argon supera en pruebas de rendimiento a GPT-6 Astra de OpenAI y a los modelos Fable y Opus de Anthropic. No habla de una mejora abstracta, sino de medirse contra rivales concretos en un momento en que la IA para escribir código ya dejó de ser una simple ayuda para autocompletar.
Argon alcanzó un 77,9 % en la prueba DeepSWE v1.1, centrada en ingeniería de software.
Esa cifra lo sitúa en un terreno muy competitivo. Y en ciberseguridad, donde encontrar un fallo no basta y hace falta corregirlo bien, el modelo empató en el primer puesto de CWE-bench con un 68 %.
Un millón de tokens cambia el tamaño de los problemas que puede abordar
Google elevará el límite de salida hasta 1 millón de tokens, muy por encima de los 64.000 anteriores. La diferencia no suena cotidiana para la mayoría de lectores, pero en la práctica cambia la escala de lo que el modelo puede leer, recordar y devolver en una sola sesión.
Dicho de otro modo, ya no se trata solo de analizar una función o un archivo. Un contexto de ese tamaño permite recorrer bases de código mucho más amplias, informes de investigación extensos o cadenas largas de evidencias sin tener que trocearlo todo desde el principio.
Mientras tanto, el precio inicial tras las pruebas quedará en 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida. Esa diferencia entre leer y responder también deja ver dónde está el coste real, porque generar una salida extensa y útil sigue siendo bastante más caro que ingerir información.
Wiz ya lo usó para encontrar un fallo crítico en hospitales
Hay una prueba de realidad que pesa más que cualquier tabla comparativa. Wiz emplea Argon en su iniciativa Scan for Good y con ese uso ha localizado una vulnerabilidad crítica en un software sanitario utilizado por hospitales de todo el mundo.
Ese dato explica mejor que ningún eslogan por qué Google ha elegido la ciberseguridad como primer campo de despliegue. También recuerda que aquí los modelos no juegan solo con fragmentos de código, sino con sistemas que terminan afectando a infraestructuras médicas reales.
De hecho, esta salida limitada encaja con la variante Cyber anterior, donde Google ya había mostrado que quería separar las herramientas de propósito general de las pensadas para buscar vulnerabilidades.
Ahora el movimiento va un paso más allá. Si un modelo puede revisar código, proponer correcciones y operar con contextos de 1 millón de tokens, la cuestión ya no es solo cuánto sabe, sino en qué manos entra primero.
Y esa prudencia no resulta extraña si se mira una prueba reciente de ciberseguridad en la que otro Gemini terminó accediendo sin permiso a sistemas reales. Frente a ese antecedente, el contraste de Argon queda servido en dos cifras muy concretas, 77,9 % en DeepSWE v1.1 y 68 % en CWE-bench.