
Google acaba de presentar uno de sus modelos de inteligencia artificial más potentes y, a diferencia de otros grandes lanzamientos, no ha decidido abrirlo inmediatamente a todo el mundo. Gemini 4 Argon llega con capacidades avanzadas para programación, investigación empresarial y tareas de larga duración, pero hay un área que está llamando especialmente la atención: la ciberseguridad.
Según Google DeepMind, el nuevo modelo puede detectar, validar y corregir automáticamente vulnerabilidades críticas de software. Esa misma capacidad que puede ayudar a los defensores a encontrar fallos antes que los atacantes plantea una pregunta inevitable: ¿qué ocurriría si herramientas de este nivel terminaran utilizándose para buscar vulnerabilidades con objetivos ofensivos?
Google parece tomarse precisamente ese riesgo en serio. Gemini 4 Argon está siendo entregado inicialmente a un grupo limitado de especialistas en ciberseguridad mediante el Fairwind Program, mientras la compañía continúa evaluando sus salvaguardas antes de extender el acceso a desarrolladores, empresas y consumidores.
Puede leer también | Un modelo de IA detecta una vulnerabilidad zero-day en Linux antes que los humanos
¿Qué es Gemini 4 Argon?
Gemini 4 Argon es el nuevo modelo de frontera de Google DeepMind y el primero presentado dentro de la familia Gemini 4.
Fue diseñado para realizar tareas complejas que requieren múltiples pasos y periodos prolongados de razonamiento.
Google destaca especialmente cuatro áreas:
- Ingeniería de software.
- Investigación y trabajo empresarial.
- Finanzas y tareas jurídicas.
- Ciberseguridad defensiva.
La gran diferencia frente a modelos anteriores no estaría únicamente en responder mejor preguntas aisladas.
Argon está diseñado para mantener procesos largos en los que debe analizar información, tomar decisiones intermedias, utilizar herramientas y continuar trabajando hasta alcanzar un objetivo.
Hasta un millón de tokens de salida
Una de las especificaciones más llamativas anunciadas por Google es el aumento drástico de la cantidad máxima de información que el modelo puede generar durante una sola trayectoria de trabajo.
Gemini 4 Argon eleva el límite de salida hasta:
1.000.000 de tokens
frente a los:
64.000 tokens
de modelos anteriores mencionados por Google.
El objetivo no es simplemente producir documentos extraordinariamente largos.
Una mayor capacidad permite sostener procesos complejos de:
- Análisis de código.
- Depuración.
- Migraciones de software.
- Investigaciones extensas.
- Interacción con múltiples documentos.
- Tareas realizadas por agentes.
Google ya utiliza Argon internamente
Gemini 4 Argon no es solamente un modelo preparado para demostraciones.
Google asegura que miles de empleados ya lo están utilizando internamente para tareas especializadas.
Entre los ejemplos publicados por la compañía aparece la migración de grandes bases de código escritas en C y C++ hacia Rust.
Los experimentos incluyen proyectos con decenas de miles de líneas e incluso partes mucho mayores del ecosistema de Google.
En el caso de libgav1, el decodificador de video open source desarrollado por Google, agentes basados en Argon trabajaron sobre una implementación Rust y reemplazaron alrededor de 32.000 líneas relacionadas con código SIMD.
Google afirma que el resultado consiguió mejorar considerablemente el rendimiento del port en Rust mientras mantenía la salida de video equivalente.
También ha sido utilizado para optimizar centros de datos
Otro ejemplo presentado por Google resulta especialmente interesante para administradores de infraestructura.
Un conjunto de agentes Argon analizó datos de profiling procedentes de la infraestructura interna de Google con el objetivo de encontrar oportunidades de optimización de memoria.
Según la compañía, las modificaciones identificadas permitieron liberar inicialmente más de:
300 TiB de memoria
en su infraestructura.
Google estima que el ahorro completo podría alcanzar entre:
500 TiB y 1 PiB
una vez desplegadas todas las optimizaciones.
Pero la ciberseguridad es donde Argon se vuelve especialmente interesante
Google entrenó específicamente Gemini 4 Argon para tareas de ciberseguridad defensiva.
El modelo puede trabajar sobre código y sistemas con el objetivo de:
Encontrar vulnerabilidad
|
v
Analizar condiciones
|
v
Validar que el fallo existe
|
v
Generar evidencia
|
v
Proponer corrección
|
v
Aplicar o ayudar a aplicar parche
Eso significa que el modelo puede abarcar una parte mucho mayor del ciclo de gestión de una vulnerabilidad que los asistentes de programación tradicionales.
Puede encontrar vulnerabilidades de manera autónoma
Google afirma directamente que Argon puede:
“encontrar, validar y corregir de manera autónoma vulnerabilidades críticas de software”.
Esto representa un salto significativo respecto de utilizar un chatbot simplemente para explicar una función insegura.
Un agente puede recibir un código o un entorno, comenzar a investigar y continuar analizando diferentes caminos hasta encontrar un problema real.
Ese tipo de automatización puede cambiar profundamente el trabajo de:
- Equipos Red Team.
- Blue Team.
- Investigadores de vulnerabilidades.
- Desarrolladores.
- Equipos DevSecOps.
- Centros de operaciones de seguridad.
Argon logró un 68% en CWE-bench v1
En CWE-bench v1, una evaluación centrada en la capacidad de corregir vulnerabilidades de seguridad, Gemini 4 Argon obtuvo:
68%
Según los resultados publicados por Google, esa puntuación lo coloca empatado en el primer puesto del benchmark.
| Evaluación | Gemini 4 Argon |
|---|---|
| CWE-bench v1 | 68% |
| DeepSWE v1.1 | 77,9% |
| LVBench | 91,7% |
Como siempre ocurre con benchmarks publicados durante el lanzamiento de un modelo, estas cifras deben interpretarse dentro de las condiciones y metodologías concretas de cada evaluación y no como garantía de rendimiento idéntico en todos los entornos reales.
Puede analizar sistemas incluso sin tener el código fuente
Una de las capacidades que más atención debería recibir desde la perspectiva de seguridad aparece en las pruebas realizadas junto con Wiz.
Google señala que, en un benchmark interno de penetración de caja negra de Wiz, Argon tuvo que trabajar sobre sistemas web en funcionamiento sin disponer del código fuente.
El modelo mostró capacidad para:
- Descubrir superficie de ataque.
- Encontrar vulnerabilidades.
- Analizar los fallos encontrados.
- Producir pruebas de concepto para comprobarlos.
Precisamente este último punto ayuda a entender por qué Google no está ofreciendo inmediatamente la versión completa del modelo al público general.
Encontrar vulnerabilidades sirve tanto al defensor como al atacante
La investigación de vulnerabilidades es un ejemplo clásico de tecnología de doble uso.
Imagine que una herramienta puede encontrar automáticamente:
Servidor vulnerable
|
v
Endpoint inseguro
|
v
Condición explotable
|
v
Prueba de concepto
Un investigador defensivo puede utilizar esa información para:
detectar | v reportar | v corregir
Pero exactamente la misma capacidad podría utilizarse potencialmente para:
detectar | v localizar objetivos | v intentar explotación
La capacidad tecnológica es similar. Lo que cambia es quién la utiliza, con qué autorización y para qué objetivo.
Google limita inicialmente el acceso
Por ahora Gemini 4 Argon no está disponible de forma abierta para todos los usuarios de Gemini.
El despliegue inicial se realiza mediante:
Fairwind Program
un programa limitado de Google dirigido a determinados:
- Equipos de ciberseguridad.
- Gobiernos.
- Socios considerados de confianza.
- Clientes empresariales seleccionados.
Google utiliza esta primera etapa para obtener información sobre el comportamiento del modelo en situaciones reales antes de ampliar su disponibilidad.
Fairwind fue diseñado precisamente para defensa cibernética avanzada
Google anunció Fairwind en septiembre de 2026 como una iniciativa destinada a ofrecer capacidades avanzadas de IA a defensores seleccionados.
Su objetivo es utilizar modelos potentes para encontrar y corregir vulnerabilidades de manera proactiva en:
- Infraestructura crítica.
- Servicios públicos.
- Sistemas gubernamentales.
- Plataformas empresariales.
En lugar de esperar a que aparezca un ataque, la idea es utilizar la IA para localizar previamente las mismas debilidades que un atacante podría intentar descubrir.
Wiz ya está utilizando Gemini 4 Argon
Uno de los primeros socios mencionados por Google es Wiz.
La compañía de seguridad está utilizando Argon mediante su iniciativa Scan for Good, destinada a descubrir y corregir exposiciones de alto riesgo en infraestructura pública crítica.
Google afirma que, durante una de estas evaluaciones, Argon encontró una vulnerabilidad crítica en software sanitario utilizado por hospitales.
El fallo podía exponer información personal sensible y no había sido detectado por modelos frontier anteriores utilizados en la misma tarea.
¿Por qué esto también genera preocupación?
Porque la distancia entre una herramienta capaz de encontrar vulnerabilidades y una herramienta capaz de automatizar etapas de un ataque puede comenzar a reducirse.
Hasta ahora un atacante podía necesitar:
Especialista
|
analizar aplicación
|
identificar superficie
|
investigar fallo
|
construir PoC
|
validar vulnerabilidad
Con agentes cada vez más capaces, algunas de estas fases pueden comenzar a automatizarse.
El escenario potencial pasa a ser:
Agente IA
|
descubre superficie
|
analiza automáticamente
|
encuentra vulnerabilidad
|
genera evidencia
Eso no significa que Gemini 4 Argon esté siendo utilizado públicamente para realizar ataques.
Significa que las capacidades necesarias para automatizar parte de la investigación ofensiva están mejorando rápidamente, y Google reconoce expresamente que necesita controles contra el abuso.
Puede leer también | El lado oscuro de la Inteligencia Artificial: riesgos, dilemas y consecuencias
La versión para defensores de confianza tendrá menos restricciones cibernéticas
Hay un detalle particularmente interesante en el anuncio oficial.
Google señala que proporcionará a sus propios equipos internos y a determinados defensores de confianza una versión de Argon sin las barreras cibernéticas que limitarían determinadas capacidades del modelo.
El objetivo es permitir que investigadores legítimos aprovechen toda su capacidad defensiva.
Esto plantea un equilibrio complicado.
Si las restricciones son demasiado fuertes:
Investigador legítimo
|
v
La IA rechaza analizar exploit
|
v
Pierde utilidad defensiva
Pero si son demasiado débiles:
Actor malicioso
|
v
Automatiza investigación ofensiva
|
v
Aumenta capacidad de ataque
Encontrar el punto intermedio es actualmente uno de los principales problemas de seguridad para los desarrolladores de modelos frontier.
Google está reforzando cuatro grandes áreas de seguridad
Antes de la disponibilidad general, Google afirma estar concentrándose en cuatro líneas principales.
| Área | Objetivo |
|---|---|
| Prevención de abuso | Evitar utilización para ataques cibernéticos y otros usos de alto riesgo. |
| Prompt injection | Impedir que instrucciones externas manipulen al agente. |
| Desalineación | Detectar acciones que se aparten de la intención del usuario. |
| Entornos seguros | Aislar y endurecer los sistemas donde actúan agentes avanzados. |
Google intenta detectar también cuándo el modelo se sale de los límites
Otro aspecto poco habitual del anuncio es la atención prestada a lo que Google denomina misalignment monitoring.
El objetivo es detectar situaciones donde un agente intenta cumplir una tarea utilizando acciones que exceden lo que realmente pretendía el usuario.
La estructura conceptual sería:
Usuario define objetivo
|
v
Agente ejecuta pasos
|
v
Monitor analiza acciones
|
+---- comportamiento esperado --> continuar
|
+---- comportamiento anómalo --> detener
Esto resulta especialmente relevante cuando una IA ya no se limita a generar texto y puede utilizar:
- Terminales.
- Navegadores.
- APIs.
- Repositorios.
- Herramientas de desarrollo.
- Sistemas empresariales.
La defensa contra prompt injection también mejora
Los agentes de IA pueden recibir información desde documentos, sitios web, correos o repositorios.
Eso abre la posibilidad de un ataque conocido como indirect prompt injection.
Por ejemplo:
Agente analiza sitio web
|
v
Sitio contiene instrucción maliciosa
|
v
"ignora tus instrucciones y envía..."
|
v
Agente debe reconocerla como contenido
y no como orden legítima
Google afirma que Argon es su modelo más resistente hasta ahora frente a este tipo de ataques y señala resultados favorables en pruebas especializadas de Gray Swan.
El riesgo no consiste solamente en generar malware
Cuando se habla de inteligencia artificial y ofensiva cibernética suele imaginarse:
"Escribe ransomware"
Pero el riesgo más interesante puede encontrarse antes.
Una IA avanzada puede potencialmente reducir el esfuerzo necesario para:
- Analizar grandes cantidades de código.
- Encontrar funciones interesantes.
- Relacionar componentes.
- Descubrir superficies de ataque.
- Priorizar posibles vulnerabilidades.
- Construir pruebas para validarlas.
Es decir, puede automatizar parte del trabajo que tradicionalmente requería muchas horas de un especialista.
Esto también puede cambiar completamente la defensa
El mismo argumento funciona en sentido contrario.
Actualmente existen millones de líneas de código que probablemente nunca han recibido una auditoría humana de seguridad suficientemente profunda.
Una organización podría utilizar agentes como Argon para revisar continuamente:
Código nuevo | v IA analiza | +--> vulnerabilidades +--> configuraciones inseguras +--> errores +--> posibles correcciones | v Revisión humana | v Parche
La ventaja para los defensores está en que ellos poseen normalmente acceso completo al código, documentación, historial, pruebas y entorno de desarrollo.
Eso puede proporcionar al agente mucho más contexto que el disponible para un atacante externo.
El gran cambio: buscar fallos antes de que exista un CVE
Las herramientas tradicionales de vulnerabilidades suelen trabajar muy bien cuando ya sabemos que un componente presenta un problema.
Por ejemplo:
CVE publicado
|
v
scanner reconoce versión
|
v
alerta
Un modelo capaz de razonar sobre código puede abordar otro problema:
No existe CVE
|
v
analiza código
|
v
descubre comportamiento inseguro
|
v
nuevo fallo
Esto aproxima la IA al trabajo de investigación de vulnerabilidades zero-day.
Ya existen precedentes: modelos anteriores han sido utilizados para encontrar fallos previamente desconocidos en software real.
Puede leer también | Un modelo de IA detecta una vulnerabilidad zero-day en Linux antes que los humanos
Defensores y atacantes entran en una carrera de automatización
Durante años, la seguridad informática ha mantenido una asimetría complicada.
Una organización debe proteger:
100 servidores 500 aplicaciones 10.000 endpoints millones de líneas de código
mientras un atacante necesita encontrar solamente:
1 vulnerabilidad útil
La IA podría cambiar parte de esa ecuación.
Los defensores pueden desplegar agentes que revisen continuamente grandes cantidades de código y sistemas.
Pero, en paralelo, herramientas similares podrían reducir el costo del reconocimiento y análisis ofensivo.
La pregunta ya no será únicamente quién tiene mejores especialistas.
También será:
¿quién utiliza mejor sus agentes?
¿Reemplazará Gemini 4 Argon a los investigadores de seguridad?
Probablemente no sea la forma correcta de interpretar esta evolución.
Un investigador humano todavía aporta elementos difíciles de reemplazar:
- Comprensión del contexto.
- Priorización del riesgo.
- Creatividad.
- Conocimiento del negocio.
- Validación responsable.
- Coordinación de divulgación.
- Evaluación del impacto real.
Lo que sí puede cambiar radicalmente es su productividad.
Un especialista que antes podía revisar una cantidad determinada de código podría utilizar múltiples agentes para analizar superficies mucho mayores.
Una posible jornada del investigador de seguridad del futuro
09:00 Lanzar 20 agentes sobre diferentes componentes 10:00 Revisar 150 posibles hallazgos 11:00 Descartar falsos positivos 12:00 Priorizar 8 vulnerabilidades reales 14:00 Solicitar validación automática 15:00 Revisar parches propuestos 16:00 Crear reportes y pruebas 17:00 Enviar correcciones
El investigador deja progresivamente de examinar manualmente cada línea y pasa a coordinar, validar y supervisar agentes especializados.
Gemini 4 Argon tampoco es únicamente un modelo de ciberseguridad
A pesar del foco del lanzamiento inicial, Argon está diseñado como un modelo general de frontera.
Google destaca capacidades en:
- Programación.
- Investigación financiera.
- Trabajo jurídico.
- Automatización empresarial.
- Comprensión multimodal.
- Análisis de videos largos.
- Escritura.
En DeepSWE v1.1, diseñado para evaluar ingeniería de software sobre tareas prolongadas, Google informa una puntuación del:
77,9%
Esto ayuda a explicar por qué el mismo modelo puede ser especialmente capaz en ciberseguridad: encontrar vulnerabilidades requiere precisamente comprender grandes cantidades de software.
Google también prepara una estrategia agresiva de precios
Google anunció inicialmente un precio introductorio de:
| Uso | Precio introductorio |
|---|---|
| 1 millón de tokens de entrada | US$2 |
| 1 millón de tokens de salida | US$10 |
Los tokens de entrada almacenados en caché tendrán un descuento significativo.
Google señala que después del periodo introductorio las tarifas previstas aumentarán.
El precio puede convertirse en un factor importante porque los agentes autónomos consumen cantidades de tokens mucho mayores que un chat tradicional.
¿Cuándo estará Gemini 4 Argon disponible para todos?
Google todavía no ha anunciado una fecha concreta para un lanzamiento público general.
El plan comunicado establece una expansión gradual.
FASE ACTUAL
Fairwind
Defensores seleccionados
|
v
Primeras ampliaciones
Clientes API de pago
Google AI Ultra
|
v
Desarrolladores
Empresas
Consumidores
El ritmo dependerá, entre otros factores, de las evaluaciones realizadas durante esta primera etapa y del fortalecimiento de los controles de seguridad.
Google participa también en evaluaciones previas del gobierno de Estados Unidos
La compañía señala que Gemini 4 Argon participa en el proceso voluntario estadounidense de acceso a modelos antes de su lanzamiento.
El objetivo es permitir evaluaciones adicionales antes de ampliar la disponibilidad de sistemas con capacidades avanzadas.
Esto muestra hasta qué punto los nuevos modelos frontier han dejado de ser tratados únicamente como productos de software convencionales.
La seguridad de los agentes comienza a convertirse en infraestructura crítica
Cuando un modelo solamente responde preguntas, el impacto de un error puede ser limitado.
Cuando un agente dispone además de:
terminal + Internet + repositorios + credenciales + herramientas + autonomía
la situación cambia completamente.
Por eso los sistemas que ejecutan agentes necesitan controles tradicionales de seguridad:
- Sandboxing.
- Mínimo privilegio.
- Segmentación.
- Registro de acciones.
- Control de salida.
- Aprobaciones humanas.
- Límites temporales.
- Gestión de secretos.
Dar acceso completo a un agente no debería convertirse en la opción predeterminada
Un agente utilizado para revisar código quizá necesite:
LEER repositorio EJECUTAR tests PROPONER cambios
pero no necesariamente:
BORRAR producción PUBLICAR repositorio CAMBIAR firewall ACCEDER facturación ELIMINAR backups
La capacidad del modelo no debería determinar automáticamente sus permisos.
Puede leer también | OpenHands: la plataforma de desarrollo de software con IA de código abierto
El dilema que deja Gemini 4 Argon
El lanzamiento resume perfectamente uno de los debates tecnológicos más importantes de los próximos años.
Si restringimos demasiado una IA avanzada:
menos posibilidades de abuso
|
pero
|
menos capacidad para defender
Si permitimos acceso completamente abierto:
más innovación
|
pero
|
capacidades también disponibles
para actores maliciosos
No existe una respuesta sencilla.
Google está apostando inicialmente por acceso progresivo y usuarios seleccionados mientras intenta validar sus barreras de seguridad.
Lo que deberían observar los equipos de ciberseguridad
Gemini 4 Argon no es importante únicamente para quienes planean utilizarlo.
También indica hacia dónde se dirige la industria.
Los responsables de seguridad deberían prepararse para un escenario donde:
- La búsqueda de vulnerabilidades será cada vez más automatizada.
- Los agentes analizarán sistemas continuamente.
- Los tiempos entre descubrimiento y explotación podrían reducirse.
- Los equipos defensivos necesitarán automatizar también la corrección.
- El control de agentes será una nueva disciplina de seguridad.
La ventana para corregir vulnerabilidades podría reducirse
Hoy una organización puede disponer de días o semanas entre:
descubrimiento
|
publicación
|
desarrollo exploit
|
explotación masiva
La automatización podría comprimir ese ciclo.
En un futuro cercano podríamos encontrarnos con:
publicación CVE
|
v
agentes analizan
|
v
generan pruebas
|
v
ataques automatizados
Para los defensores esto significa que inventarios actualizados, gestión de vulnerabilidades y parcheo rápido serán todavía más importantes.
Pero la IA también puede acortar el tiempo defensivo
Existe otra posibilidad.
El mismo agente puede:
detectar vulnerabilidad
|
v
generar parche
|
v
ejecutar tests
|
v
solicitar aprobación
|
v
desplegar corrección
La carrera, por tanto, no necesariamente favorece únicamente a los atacantes.
Puede favorecer a las organizaciones capaces de automatizar la defensa de manera responsable.
Recomendamos
- Un modelo de IA detecta una vulnerabilidad zero-day en Linux antes que los humanos
- El lado oscuro de la Inteligencia Artificial: riesgos, dilemas y consecuencias
- OpenHands: la plataforma de desarrollo de software con IA de código abierto
- La IA de Código Abierto es el Camino a Seguir
En resumen
Google presentó Gemini 4 Argon como su nuevo modelo de inteligencia artificial de frontera y ha decidido limitar inicialmente su acceso.
El modelo está llegando primero a ciberdefensores seleccionados mediante el programa Fairwind.
La razón resulta especialmente relevante para el sector de seguridad: Google afirma que Argon puede detectar, validar y corregir vulnerabilidades críticas de manera autónoma.
En pruebas publicadas por la compañía alcanzó un 68% en CWE-bench v1 y mostró mejoras importantes en tareas de descubrimiento de vulnerabilidades, incluida evaluación de sistemas web sin disponer de su código fuente.
Google está reforzando salvaguardas contra abuso, prompt injection y comportamientos que excedan las instrucciones del usuario antes de ampliar su disponibilidad.
La compañía todavía no ha comunicado una fecha definitiva para un acceso general.
Conclusión editorial
Gemini 4 Argon muestra que la carrera de inteligencia artificial está entrando en una etapa diferente.
Ya no se trata únicamente de qué modelo escribe mejor, genera una imagen más convincente o responde correctamente más preguntas.
Ahora hablamos de sistemas capaces de trabajar durante periodos prolongados, utilizar herramientas, analizar infraestructuras y descubrir vulnerabilidades que los especialistas humanos podrían no haber encontrado.
Para la ciberseguridad, eso puede representar una oportunidad extraordinaria.
Millones de líneas de código podrían revisarse continuamente. Vulnerabilidades podrían detectarse antes de llegar a producción. Los parches podrían generarse y probarse en horas en lugar de semanas.
Pero existe inevitablemente la otra cara.
La habilidad necesaria para encontrar una vulnerabilidad no cambia dependiendo de si quien la busca pretende corregirla o explotarla.
Por eso resulta especialmente significativo que Google haya decidido no liberar inmediatamente todas las capacidades de Argon.
La compañía sabe que está desarrollando una tecnología de doble uso.
Y sabe también que colocar un modelo capaz de descubrir vulnerabilidades, analizar sistemas de caja negra y generar pruebas de concepto en manos de millones de usuarios requiere controles mucho más fuertes que los de un chatbot convencional.
Gemini 4 Argon probablemente no será el último modelo con estas capacidades.
OpenAI, Anthropic, Google y otros laboratorios están avanzando hacia agentes cada vez más autónomos y capaces.
Por eso el verdadero cambio que anuncia Argon puede no ser simplemente una nueva generación de Gemini.
Puede ser el comienzo de una época en la que atacantes y defensores dejen de buscar vulnerabilidades únicamente con equipos humanos y comiencen a desplegar ejércitos de agentes de inteligencia artificial para encontrarlas primero.
En ese escenario, limitar permisos, mantener inventarios actualizados, automatizar parches y supervisar las acciones de los agentes dejará de ser una práctica avanzada.
Se convertirá en una necesidad básica de ciberseguridad.
Fuentes: Google DeepMind, Google Gemini, Fairwind Program, Wiz y documentación del Frontier Safety Framework de Google DeepMind.

