Cuando GLM-5.2 ayudó a Hugging Face a investigar un incidente en el que una IA eludió de forma autónoma sus propias salvaguardas, se puso de manifiesto un cambio más amplio. La IA se está convirtiendo en parte tanto de la ciberofensiva como de la ciberdefensa.
A medida que las capacidades cibernéticas avanzadas se vuelven más accesibles, las capacidades defensivas sólidas no pueden seguir limitadas a un pequeño número de organizaciones con muchos recursos. Los mantenedores de código abierto, los investigadores independientes, los desarrolladores y los equipos de seguridad más pequeños también necesitan herramientas que les ayuden a encontrar y corregir vulnerabilidades antes de que sean explotadas.
Un mundo abierto no puede tener solo superficies de ataque abiertas. También debe tener un escudo abierto.
GLM-5.3 es nuestro modelo más capaz hasta la fecha para tareas de ciberseguridad. Ofrece mejoras sustanciales en la detección de vulnerabilidades, el análisis de exploits y las tareas de seguridad complejas de varios pasos. Estas capacidades pueden ayudar a los defensores a identificar debilidades antes, validar riesgos y acelerar la remediación.
También crean riesgos claros de doble uso. Por eso, estamos adoptando un enfoque por etapas para el lanzamiento. Socios de seguridad seleccionados evaluarán primero GLM-5.3 en entornos controlados. El acceso más amplio y la disponibilidad de la API llegarán después. Una vez que se completen las evaluaciones de seguridad necesarias y los preparativos del lanzamiento, publicaremos los pesos completos del modelo GLM-5.3.
La apertura responsable no significa tratar cada capacidad como inofensiva. Significa evaluar los riesgos de forma transparente, reforzar las salvaguardas antes del lanzamiento, coordinar la divulgación de vulnerabilidades validadas y ampliar el acceso a las capacidades defensivas avanzadas de manera proporcional a los riesgos.
De la detección de vulnerabilidades al análisis de seguridad de varios pasos
Como parte del post-entrenamiento, introdujimos datos de detección de vulnerabilidades y entornos de seguridad autorizados en la mezcla de entrenamiento. Esperábamos que esto mejorara la capacidad del modelo para encontrar y analizar vulnerabilidades.
A medida que el entrenamiento escalaba, la mejora se extendió más allá de los fallos aislados. GLM-5.3 se volvió más eficaz para conectar las condiciones de vulnerabilidad, el comportamiento del programa, las rutas de validación y el impacto potencial a lo largo de múltiples etapas de análisis.
Evaluamos estas capacidades en tres benchmarks:

- CyberGym comienza con código fuente de caja blanca y comprueba si un modelo puede identificar y validar vulnerabilidades provocando fallos. GLM-5.3 obtiene un 84,5%, frente al 77,2% de GLM-5.2.
- ExploitBench exige un razonamiento más profundo sobre vulnerabilidades reales y su explotación. GLM-5.3 alcanza el 54,4%, más del doble que el 24,4% de GLM-5.2.
- ExploitGym mide las tareas de explotación completadas bajo presupuestos de evaluación normalizados. GLM-5.3 completa 105 tareas en dos horas y 130 en seis horas, frente a 29 y 39 de GLM-5.2.
El patrón es consistente. La mejora de GLM-5.3 respecto a GLM-5.2 es mayor a medida que las tareas pasan de la detección aislada de vulnerabilidades a la explotación de varios pasos. Los resultados también muestran dónde se necesita avanzar más, particularmente en las tareas de extremo a extremo más complejas.
De los benchmarks al software real
También hemos trabajado con universidades y equipos de seguridad profesionales para evaluar los modelos GLM en bases de código reales dentro de entornos autorizados.
En este trabajo, la serie GLM ha producido 2.436 hallazgos de vulnerabilidades en 269 proyectos, incluidos 1.097 clasificados como de severidad media a alta. Estos hallazgos abarcan software de sistema, sistemas operativos, motores de navegador, infraestructura de código abierto, aplicaciones web, protocolos de red y dispositivos inteligentes. Algunos de los problemas subyacentes habían pasado desapercibidos durante décadas.
En estas evaluaciones, los expertos en seguridad establecen el alcance autorizado, revisan los resultados del modelo, investigan los riesgos potenciales y se coordinan con las partes correspondientes. Los modelos GLM pueden ayudar a los investigadores a reconstruir la lógica de programas complejos, reducir un gran número de rutas candidatas y conectar evidencia entre múltiples componentes.
El propósito no es simplemente generar más hallazgos. Es ayudar a los defensores a identificar riesgos significativos con antelación y reducir el tiempo entre la detección y la remediación.
La detección debe ir seguida de una divulgación responsable
Una vulnerabilidad no se gestiona de forma segura en el momento en que se descubre. Debe revisarse, reproducirse cuando corresponda, notificarse a través de los canales adecuados y coordinarse con los mantenedores afectados.
Los hallazgos de nuestro trabajo de seguridad se envían a través de procesos de divulgación establecidos. Solo publicamos detalles técnicos cuando hacerlo es coherente con el proceso de divulgación y remediación correspondiente. En el caso de los problemas que siguen en proceso de coordinación, no publicamos información que pueda aumentar innecesariamente el riesgo o identificar proyectos afectados.
Para que este trabajo sea más transparente, creamos el Registro de Divulgación de Seguridad de Z.ai.

El registro documenta los hallazgos a medida que avanzan en el proceso de divulgación. En el caso de problemas divulgados públicamente, puede incluir el proyecto afectado, la severidad, un CVE u otro identificador cuando esté disponible, e información sobre cuánto tiempo permaneció el problema en la base de código.
Para las vulnerabilidades que siguen bajo divulgación coordinada, el registro puede publicar un hash criptográfico. Esto permite que un hallazgo pueda verificarse más adelante sin revelar prematuramente detalles operativos.
Abrir un modelo y divulgar una vulnerabilidad son decisiones separadas. Poner un modelo a disposición de forma más amplia no exige publicar detalles de las vulnerabilidades antes de que los mantenedores hayan tenido la oportunidad adecuada de investigar y responder.
Seguridad y lanzamiento por etapas
La ciberseguridad es un ámbito particularmente difícil para la seguridad de la IA. Las tareas ofensivas y defensivas suelen implicar la misma terminología, el mismo código y los mismos métodos técnicos.
Una solicitud para analizar una vulnerabilidad puede provenir de un mantenedor que prepara un parche, de un estudiante que resuelve un desafío CTF, de un investigador que realiza una evaluación autorizada o de un atacante que apunta a un sistema real. Las palabras clave por sí solas no pueden distinguir estos casos de manera fiable. La intención, la autorización, el contexto, el objetivo y el impacto potencial: todos importan.
Para GLM-5.3, utilizamos un enfoque de defensa en profundidad con tres capas complementarias.
Clasificador externo
En nuestros servicios alojados, un clasificador externo identifica solicitudes de alto riesgo y ayuda a prevenir actividades claramente dañinas.
Monitor de razonamiento
Un monitor de razonamiento evalúa el riesgo durante la ejecución de la tarea. Está diseñado para detectar objetivos dañinos que pueden surgir a lo largo de múltiples pasos, en lugar de depender únicamente del texto de la solicitud inicial.
Alineación profunda de seguridad
El propio modelo está entrenado para distinguir el trabajo de seguridad legítimo de la actividad ofensiva de alto riesgo y para rechazar las solicitudes que cruzan ese límite.
La alineación profunda de seguridad es especialmente importante para un lanzamiento de pesos abiertos. Los clasificadores y monitores alojados se aplican a nuestros servicios, pero no acompañan automáticamente al modelo en cada despliegue local. La alineación a nivel de modelo es la capa de seguridad incluida en el checkpoint publicado.
Para desarrollar estos sistemas, creamos datos de entrenamiento diferenciales que reflejan tanto las similitudes como las diferencias entre la investigación de seguridad autorizada y la actividad maliciosa. También construimos datos adversariales que cubren variantes de jailbreak, intención disfrazada y otros intentos de evadir la revisión de seguridad.
Nuestras evaluaciones cubren una variedad de tareas de ciberseguridad, entre las que se incluyen:
- educación y conocimiento en seguridad;
- defensa de blue team;
- desafíos CTF;
- detección y remediación de vulnerabilidades;
- pruebas de penetración autorizadas;
- desarrollo de exploits;
- intrusión no autorizada y otras actividades claramente maliciosas.
El objetivo es reducir el abuso de alto riesgo sin rechazar de forma generalizada las tareas legítimas de defensa, educación e investigación.
Antes del lanzamiento más amplio, equipos de seguridad profesionales llevarán a cabo evaluaciones de seguridad y pruebas de red team. Estas evaluaciones examinan tanto si el modelo puede ser manipulado para respaldar actividades dañinas como si sus salvaguardas interfieren con el trabajo de seguridad legítimo.
Ningún sistema de seguridad puede eliminar todos los riesgos de doble uso. Una vez que los pesos del modelo son públicos, ningún desarrollador puede garantizar el control sobre cada modificación o uso posterior. Las salvaguardas a nivel de modelo pueden elevar la barrera contra el abuso, pero no pueden proporcionar un control absoluto.
Por lo tanto, nuestro proceso de lanzamiento se centra en las etapas donde es posible una reducción significativa de riesgos: el entrenamiento, la evaluación previa al lanzamiento, las pruebas controladas con socios, las salvaguardas en los servicios alojados, la divulgación responsable y las pruebas adversariales continuas.
Lanzamiento de la iniciativa OpenVuln
Gran parte de la infraestructura digital mundial depende del software de código abierto. Muchos proyectos críticos son mantenidos por equipos pequeños o por colaboradores individuales sin recursos de seguridad dedicados.
Al mismo tiempo, la IA está facilitando la automatización de tareas cibernéticas complejas. Si las capacidades defensivas avanzadas permanecen concentradas en un pequeño número de organizaciones, los proyectos con menos recursos pueden quedar a cargo de proteger algunas de las partes más importantes de la cadena de suministro de software.
Para ayudar a abordar este desequilibrio, lanzamos la iniciativa OpenVuln junto con GLM-5.3.
Apoyo continuo a la seguridad del código abierto
Trabajaremos con los mantenedores para auditar proyectos de código abierto importantes, identificar vulnerabilidades potenciales y apoyar la divulgación responsable y la remediación.
Los mantenedores pueden usar OpenVuln para enviar proyectos a revisión de seguridad y obtener más información sobre el proceso.

Un escudo para el mundo abierto
GLM-5.3 demuestra que los modelos abiertos pueden volverse significativamente más fuertes en la detección de vulnerabilidades, el análisis de exploits y el razonamiento de seguridad complejo. Ese progreso conlleva un valor defensivo real y un riesgo real de doble uso.
Nuestra responsabilidad es dirigir estas capacidades hacia la detección temprana de vulnerabilidades, apoyar la remediación responsable y fortalecer los sistemas de código abierto de los que todos dependen.
Tras la evaluación por etapas y el acceso más amplio a la API, tenemos la intención de lanzar GLM-5.3 como un modelo de pesos abiertos. Seguiremos mejorando las salvaguardas a nivel de modelo, probando el uso adversarial y apoyando la divulgación coordinada durante todo el proceso.
El mundo abierto debe tener su propio escudo. A través de GLM-5.3 y de la iniciativa OpenVuln, tenemos la intención de hacer que ese escudo esté más ampliamente disponible y lanzarlo con cuidado.





