Gemini 4 Argón: Google lanza su modelo más capaz de la historia y solo pueden probarlo expertos en ciberseguridad

Publicado el

Gemini 4 Argón: Google lanza su modelo más capaz de la historia y solo pueden probarlo expertos en ciberseguridad

Google acaba de presentar Gemini 4 Argón, su nuevo modelo de inteligencia artificial de vanguardia, y ha tomado una decisión que no tiene precedente entre los grandes laboratorios: no lo abre a developers, no lo pone en Google AI Studio y no lo ofrece a sus suscriptores Ultra. De momento, solo un grupo selecto de expertos en ciberseguridad puede acceder a él a través del programa Fairwind. El razonamiento es tan simple como incómodo: un modelo con esta capacidad en manos equivocadas puede causar daños reales.

Los números justifican la cautela. Argón consigue un 77,9% en DeepSWE v1.1, el benchmark de referencia para tareas de ingeniería de software a largo plazo. En AutomationBench, la métrica de Zapier que mide ejecución end-to-end en funciones empresariales clave, lidera con un 51,3%. En CWE-bench v1, que evalúa la remediación autónoma de vulnerabilidades de seguridad, empata en primer lugar con un 68%. Son tres métricas distintas, en tres categorías distintas, y Argón encabeza todas.

Pero el dato más llamativo no está en ningún benchmark. Está en lo que el modelo ya está haciendo dentro de Google: sus agentes han reescrito más de 800.000 líneas del kernel Zircon del sistema operativo Fuchsia de C/C++ a Rust, con auditorías automáticas y manuales en paralelo. Y han liberado más de 300 TiB de memoria en los centros de datos de Google mediante optimizaciones identificadas de forma autónoma analizando telemetría de toda la flota.

¿Qué hace que Gemini 4 Argón sea diferente a cualquier modelo anterior?

La diferencia más técnica y más práctica a la vez es el límite de tokens de salida: 1 millón. La generación anterior de modelos de frontera se quedaba en 64.000. Ir de 64.000 a 1.000.000 no es una mejora incremental: es lo que permite a un modelo generar una base de código completa, redactar un informe legal de cientos de páginas o producir un análisis financiero exhaustivo sin truncar el razonamiento a mitad.

En ingeniería de software, la diferencia es concreta. Para reescribir la librería libgav1 (el software de código abierto de Google para decodificación de vídeo), los agentes de Argón reemplazaron 32.000 líneas de código SIMD generando Rust seguro que el compilador puede vectorizar automáticamente. El resultado: el decodificador resultante es 2,7 veces más rápido que la versión previa en Rust, mientras se acerca al rendimiento de la versión C++ optimizada a mano.

En computación cuántica, el modelo superó el rendimiento de referencia publicado en optimizaciones de recursos espaciotemporales —qubits por puertas lógicas— en un 40% en cuestión de minutos, según el equipo de investigación de Google.

La multimodalidad también ha dado un salto. En LVBench, que mide comprensión de vídeos largos, Argón alcanza el 91,7% y lidera el ranking. Puede analizar gráficos profesionales, identificar detalles en vídeos extensos y tomar decisiones basadas en series de documentos. No es un modelo de texto con capacidad visual anexada: es multimodal desde el diseño.

¿Por qué Google lanza Argón primero para expertos en ciberseguridad?

Porque el modelo fue entrenado explícitamente para detectar, validar y corregir vulnerabilidades de software de forma autónoma, y eso tiene dos caras. Un equipo de defensa puede usar Argón para proteger infraestructura crítica que los modelos anteriores no podían analizar. Un actor malicioso podría usarlo para construir ataques que los sistemas de defensa actuales no anticipan.

La primera aplicación real ya está en marcha. Wiz ha integrado Argón en su iniciativa Scan for Good, que protege infraestructura pública crítica de forma gratuita. En una demostración inicial, el modelo descubrió una vulnerabilidad crítica en software sanitario usado por hospitales de todo el mundo —una vulnerabilidad que los modelos de vanguardia anteriores no habían detectado.

Para los defensores, Google elimina las medidas de seguridad cibernéticas específicas, de modo que el modelo pueda aprovechar todas sus capacidades. Para el resto del mundo, esas medidas permanecen activas mientras el equipo refuerza cuatro áreas antes del lanzamiento general: protección contra uso indebido en ataques CBRN (químicos, biológicos, radiológicos, nucleares), resistencia frente a inyecciones de prompt indirectas, supervisión de desalineaciones en la cadena de razonamiento y entornos de prueba aislados.

En el IPI benchmark de Gray Swan, que mide robustez frente a inyecciones de prompt indirectas, Argón lidera. No es marketing: es una condición necesaria para desplegar un agente autónomo en entornos reales.

Los grandes labs acordaron coordinarse sobre seguridad de modelos frontera precisamente para este tipo de escenarios. Argón es la primera prueba concreta de cómo se materializa ese compromiso: acceso escalonado, con transparencia sobre lo que falta antes del lanzamiento general.

¿Cuándo llegará Gemini 4 Argón a developers y al público?

Google no da fecha. El proceso es el que describe: ampliación gradual del acceso a medida que se consolidan las medidas de seguridad. Los primeros en recibir acceso después del grupo de ciberseguridad serán los clientes de la API de pago y los suscriptores de Google AI Ultra. Los developers y usuarios generales vendrán después.

El precio anunciado es 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida, con tokens en caché a un 95% de descuento sobre el precio de entrada. Es el mismo nivel de precios que Claude Sonnet 5.5, y sensiblemente más barato que Claude Opus 5.5. Si el rendimiento se mantiene en uso real, la ecuación precio-capacidad es difícil de ignorar.

La carrera entre modelos de frontera no muestra señales de ralentización. Anthropic, OpenAI y Google han lanzado modelos significativos en un margen de días. Argón entra con los benchmarks más altos en ingeniería y ciberseguridad, pero la batalla real no será en los rankings: será en cuánto tiempo tarda en llegar a manos de los millones de desarrolladores que hoy usan los modelos de sus competidores.

Google ha entendido que los modelos más capaces necesitan infraestructura a su altura para ser seguros. La demanda de centros de datos para entrenar estos sistemas es uno de los factores que definen la velocidad del sector, y también el que más resistencia política genera. Argón es el resultado más visible de ese esfuerzo. La pregunta es si el control sobre su despliegue dura lo suficiente como para que las medidas de seguridad estén listas.