
Google ha levantado el telón sobre Gemini 4 Argon, un nuevo modelo insignia de IA que, según la empresa, supera a sus predecesores en ingeniería de software, trabajo empresarial orientado al conocimiento y defensa en ciberseguridad. Alphabet desplegó el sistema el miércoles 30 de septiembre de 2026, empezando con un grupo limitado de socios de ciberseguridad de confianza en lugar de un lanzamiento público completo. El movimiento marca el mayor paso de la compañía hasta ahora hacia lo que llama inteligencia de nivel fronterizo, y llega en un momento en el que Google está bajo presión para demostrar que sus modelos pueden igualar a los competidores en tareas reales, de alto riesgo.
Conclusiones clave
Gemini 4 Argon amplía su límite de tokens de salida a 1 millón de tokens, frente a 64,000, lo que permite cadenas de razonamiento mucho más largas.
El modelo establece un nuevo estado del arte en DeepSWE v1.1 con una puntuación del 77.9% para tareas de ingeniería de software a largo horizonte.
Argon empata por el primer lugar en CWE-bench v1 con una puntuación del 68%, construyendo sobre la base en ciberseguridad establecida por el modelo Google 3.8 Flash Cyber.
Los despliegues internos ya han liberado más de 300 TiB de memoria de centros de datos, con ahorros estimados totales entre 500 TiB y 1 PiB.
Google lanzará Argon por fases, comenzando con socios de ciberseguridad.
Desempeño de frontera de Gemini 4 Argon en ingeniería de software y trabajo empresarial
Gemini 4 Argon ofrece lo que Google describe como desempeño de frontera en flujos de trabajo complejos del mundo real, que abarcan programación, investigación legal y financiera, y defensa en seguridad. La empresa afirma que el modelo ya está funcionando dentro de sus propios equipos de ingeniería, con personal que cita mejoras en tareas especializadas de codificación, mayor capacidad de investigación y calidad de redacción.
Puntuaciones de referencia que establecen nuevos estándares
En DeepSWE v1.1, un benchmark que mide el desempeño de ingeniería de software en el mundo real a largo horizonte, Argon publicó una puntuación del 77.9%, un nuevo estado del arte según Google. Más allá de programar, el modelo encabeza el Vals Index, que rastrea el impacto económico en finanzas, codificación, trabajo legal y fiscal, ponderando cada sector por su contribución al PIB de EE. UU. CNBC informó que Argon llega por delante de GPT-6 Astra de OpenAI y Fable 5.1 de Anthropic en ese mismo índice. El modelo también ocupa el primer lugar en AutomationBench de Zapier, que mide la ejecución de extremo a extremo en funciones centrales de negocio, con una puntuación del 51.3%, y alcanza el 91.7% en LVBench, una prueba de comprensión de video largo, que Google llama estado del arte. La fortaleza de Argon en razonamiento visual también se extiende al análisis profesional de gráficos y a la toma de decisiones basada en documentos, útil para trabajadores del conocimiento que manejan informes densos y expedientes de múltiples páginas.
Esta distribución de resultados importa porque muestra que el modelo no es solo un especialista en programación. Un sistema que funciona bien en redacción legal, investigación financiera y comprensión de video a la vez sugiere que Google está apuntando Argon a clientes empresariales que necesitan un solo modelo para múltiples departamentos, en lugar de un conjunto de herramientas pequeñas y específicas.
Defensa en ciberseguridad y la colaboración con Wiz
Argon fue entrenado específicamente para fortalecer la defensa cibernética, y Google dice que puede encontrar, validar y corregir de forma autónoma vulnerabilidades críticas de software. En CWE-bench v1, que evalúa la capacidad de un modelo para remediar fallos de seguridad, Argon empata por el primer lugar con una puntuación top del 68%, construyendo sobre el desempeño del modelo Google 3.8 Flash Cyber, que se lanzó antes en septiembre de 2026 y lideró CWE-bench v0. CNBC informó que Argon también empata con OpenAI’s GPT-6 Astra y Grok 4.7 en benchmarks de evaluación de ciberseguridad, posicionándolo como un competidor directo en una esquina de la carrera de IA que avanza rápidamente.
Para defensores confiables y los equipos internos de Google, la empresa planea lanzar Argon sin barreras de ciberseguridad, dándoles acceso a las capacidades defensivas completas de nivel de frontera del modelo.
Descubrimiento autónomo de vulnerabilidades en acción
La empresa de seguridad Wiz ya está poniendo a trabajar a Argon a través de su iniciativa Scan for Good, un programa gratuito orientado a proteger infraestructura pública crítica encontrando y corrigiendo exposiciones de alto riesgo. En una prueba temprana, el modelo descubrió una vulnerabilidad crítica que expone información personal sensible en software de atención médica utilizado por hospitales de todo el mundo: un riesgo que Google dice que los modelos de frontera anteriores habían pasado por alto por completo. En el benchmark interno de vulnerabilidades de Google, Argon detectó exposiciones a través de bases de código que abarcan 20 lenguajes de programación, y en el benchmark de pruebas de penetración de caja negra de Wiz, superó a 3.8 Flash Cyber al identificar superficies de ataque y producir evidencia de prueba de concepto.
Innovaciones técnicas: de salidas de hasta un millón de tokens a la optimización cuántica
Para respaldar tareas más largas y complejas, Google amplió significativamente el límite de tokens de salida de Argon hasta 1 millón de tokens, líder en la industria, frente a los 64,000 anteriores. Ese espacio extra permite que el modelo genere cientos de miles de tokens en una sola pasada de razonamiento, aportando profundidad a problemas que antes requerían múltiples sesiones de idas y vueltas.
El modelo ya está produciendo resultados medibles dentro de la propia infraestructura de Google. En investigación de computación cuántica, Argon ayudó a optimizar los recursos del espacio-tiempo — qubits multiplicados por compuertas — de subrutinas que son cuellos de botella en aplicaciones clave, superando un punto de referencia publicado en un 40% en cuestión de minutos. Por separado, un equipo de agentes de Argon analizó telemetría en toda la flota en los centros de datos de Google para identificar y aplicar de forma autónoma optimizaciones de memoria, liberando más de 300 TiB de memoria una vez desplegado por completo; con ahorros estimados totales entre 500 TiB y 1 PiB. CNBC señaló que esas mejoras se lograron sin que la empresa comprara hardware adicional.
Los agentes de Argon también están abordando uno de los trabajos más tediosos de la ingeniería de software: migrar bases de código en C/C++ a Rust. El esfuerzo abarca decenas de miles de líneas en bibliotecas centrales como re2 y libgav1, escalando hasta más de 800,000 líneas para el kernel Zircon del sistema operativo Fuchsia. Dado lo críticos que son estos sistemas, Google dice que las reescrituras pasan por auditorías rigurosas, automatizadas y manuales, pruebas de emulación y revisión antes de llegar a producción. Para libgav1, la biblioteca de decodificación de video de código abierto de Google, los agentes de Argon tomaron un puerto existente en Rust y reemplazaron 32,000 líneas de código SIMD mediante experimentos repetidos guiados por perfiles, produciendo un decodificador seguro para la memoria que corre 2.7 veces más rápido que la versión anterior en Rust, mientras iguala la salida de video idéntica.
Salvaguardas de frontera antes de una disponibilidad más amplia
Antes de que Argon llegue a una audiencia más amplia, Google dice que está reforzando las salvaguardas. El modelo está diseñado para rechazar solicitudes dañinas vinculadas a ciberataques o a un mal uso de CBRN (químico, biológico, radiológico, nuclear), mientras aún apoya la investigación científica legítima de doble uso, bajo el Frontier Safety Framework de la empresa. Google dice que ha mejorado las técnicas para monitorear las activaciones internas del modelo con el fin de detectar el mal uso, y que las salvaguardas se probaron con red teams internos y externos usando métodos de ataque manuales y automatizados.
También se describe a Argon como el modelo más resistente de Google hasta ahora contra ataques de inyección indirecta de prompts, donde instrucciones ocultas intentan secuestrar el comportamiento de un modelo. Mediante entrenamiento adversarial y red teaming automatizado, la empresa afirma que Argon lidera en el benchmark de Gray Swan de Inyección Indirecta de Prompts.
Este enfoque por capas refleja una tensión más amplia en el desarrollo de IA en la frontera: las mismas capacidades que hacen que un modelo sea útil para encontrar y corregir vulnerabilidades podrían, en manos equivocadas, utilizarse para descubrir nuevas. La decisión de Google de lanzar Argon primero a un grupo reducido de socios de ciberseguridad de confianza, en lugar de hacerlo al público, indica cuán en serio está tomando ese riesgo de doble uso.
Estrategia de despliegue y qué viene después
Google no está activando Argon de una sola vez. La empresa dice que planea lanzar el modelo por fases, comenzando con un primer grupo de defensores cibernéticos y probadores de confianza, cuyas aportaciones del mundo real ayudarán a refinar el sistema antes de que llegue a desarrolladores, empresas y consumidores.
CNBC también informó que Google está realizando una evaluación previa de seguridad con el gobierno de EE. UU. como parte del despliegue. El momento es notable: el lanzamiento llegó un día después de que el CEO de Google, Sundar Pichai, firmara un acuerdo voluntario de seguridad de la IA con el presidente Donald Trump, tras una reunión con importantes ejecutivos de tecnología en la Casa Blanca, centrada en crecientes preocupaciones por la seguridad de la IA.
El lanzamiento también marca un cambio de estrategia. Según CNBC, Google pasó gran parte del año anterior escalando modelos “flash” más rápidos y de menor costo, mientras que Gemini 4 Argon representa un nuevo impulso en la frontera: llega casi un año después de que Gemini 3 colocara a la empresa nuevamente al frente de la carrera de modelos de IA. Que Argon pueda sostener esa posición dependerá menos de las puntuaciones de referencia y más de cómo se desempeña cuando está en manos de desarrolladores externos y clientes empresariales que no formaron parte de las pruebas internas de Google.
Artículo producido con la asistencia de inteligencia artificial y revisado por el equipo editorial.
