Preparando GLM-5.3 para su lanzamiento abierto: Un camino responsable hacia la ciberdefensa

@Zai_org
INGLÉS14 ago 2026
181K
1.6K
144
38
464

TL;DR

GLM-5.3 supera significativamente a su predecesor en tareas complejas de ciberseguridad, como el descubrimiento de vulnerabilidades. Z.ai está implementando un lanzamiento gradual y una alineación de seguridad para garantizar que estas herramientas beneficien a los defensores.

Cuando GLM-5.2 ayudó a Hugging Face a investigar un incidente en el que una IA eludió de forma autónoma sus propias salvaguardas, puso de relieve un cambio más amplio. La IA se está convirtiendo en parte tanto de la ciberofensiva como de la ciberdefensa.

A medida que las potentes capacidades cibernéticas se vuelven más accesibles, las capacidades defensivas sólidas no pueden seguir limitadas a un pequeño número de organizaciones con muchos recursos. Los mantenedores de código abierto, los investigadores independientes, los desarrolladores y los equipos de seguridad más pequeños también necesitan herramientas que les ayuden a encontrar y corregir vulnerabilidades antes de que sean explotadas.

Un mundo abierto no puede tener solo superficies de ataque abiertas. También debe tener un escudo abierto.

GLM-5.3 es nuestro modelo más capaz hasta la fecha para tareas de ciberseguridad. Ofrece mejoras sustanciales en el descubrimiento de vulnerabilidades, el análisis de exploits y las tareas de seguridad complejas de varios pasos. Estas capacidades pueden ayudar a los defensores a identificar debilidades antes, validar riesgos y acelerar la remediación.

También generan riesgos de doble uso evidentes. Por eso adoptamos un enfoque de lanzamiento por etapas. Primero, socios de seguridad seleccionados evaluarán GLM-5.3 en entornos controlados. Después vendrán un acceso más amplio y la disponibilidad de la API. Una vez completadas las evaluaciones de seguridad y los preparativos necesarios, publicaremos los pesos completos del modelo GLM-5.3.

La apertura responsable no significa tratar toda capacidad como inofensiva. Significa evaluar los riesgos de forma transparente, fortalecer las salvaguardas antes del lanzamiento, coordinar la divulgación de vulnerabilidades validadas y ampliar el acceso a capacidades defensivas avanzadas de manera proporcional a los riesgos.

Del descubrimiento de vulnerabilidades al análisis de seguridad de varios pasos

Como parte del posentrenamiento, incorporamos datos de descubrimiento de vulnerabilidades y entornos de seguridad autorizados a la combinación de entrenamiento. Esperábamos que esto mejorara la capacidad del modelo para encontrar y analizar vulnerabilidades.

A medida que el entrenamiento escaló, la mejora se extendió más allá de las fallas aisladas. GLM-5.3 se volvió más eficaz para conectar condiciones de vulnerabilidad, comportamiento del programa, rutas de validación e impacto potencial a lo largo de múltiples etapas de análisis.

Evaluamos estas capacidades en tres benchmarks:

Z.ai - inline image
  • CyberGym parte de código fuente de caja blanca y prueba si un modelo puede identificar y validar vulnerabilidades al provocar fallas. GLM-5.3 obtiene un 84,5 %, frente al 77,2 % de GLM-5.2.
  • ExploitBench exige un razonamiento más profundo sobre vulnerabilidades reales y su explotación. GLM-5.3 alcanza un 54,4 %, más del doble del 24,4 % de GLM-5.2.
  • ExploitGym mide las tareas de explotación completadas bajo presupuestos de evaluación normalizados. GLM-5.3 completa 105 tareas en dos horas y 130 en seis, frente a 29 y 39 en el caso de GLM-5.2.

El patrón es consistente. GLM-5.3 mejora más respecto a GLM-5.2 a medida que las tareas pasan del descubrimiento aislado de vulnerabilidades a la explotación de varios pasos. Los resultados también muestran en qué aspectos se necesita avanzar más, en particular en las tareas de extremo a extremo más complejas.

De los benchmarks al software real

También hemos trabajado con universidades y equipos de seguridad profesionales para evaluar los modelos GLM en bases de código reales en entornos autorizados.

En este trabajo, la serie GLM ha generado 2.436 hallazgos de vulnerabilidades en 269 proyectos, incluidos 1.097 clasificados como de severidad media a alta. Estos hallazgos abarcan software de sistema, sistemas operativos, motores de navegador, infraestructura de código abierto, aplicaciones web, protocolos de red y dispositivos inteligentes. Algunos de los problemas subyacentes habían pasado desapercibidos durante décadas.

En estas evaluaciones, los expertos en seguridad establecen el alcance autorizado, revisan los resultados del modelo, investigan los riesgos potenciales y se coordinan con las partes correspondientes. Los modelos GLM pueden ayudar a los investigadores a reconstruir la lógica de programas complejos, reducir una gran cantidad de rutas candidatas y conectar evidencia entre múltiples componentes.

El objetivo no es simplemente generar más hallazgos. Es ayudar a los defensores a identificar riesgos importantes antes y reducir el tiempo entre el descubrimiento y la remediación.

El descubrimiento debe ir seguido de una divulgación responsable

Una vulnerabilidad no se gestiona de forma segura en el momento en que se descubre. Debe revisarse, reproducirse cuando corresponda, notificarse por los canales adecuados y coordinarse con los mantenedores afectados.

Los hallazgos de nuestro trabajo de seguridad se presentan a través de procesos de divulgación establecidos. Solo publicamos detalles técnicos cuando hacerlo es coherente con el proceso de divulgación y remediación correspondiente. Para los problemas que siguen en coordinación, no publicamos información que pudiera aumentar el riesgo innecesariamente o identificar proyectos afectados.

Para que este trabajo sea más transparente, creamos el Registro de divulgación de seguridad de Z.ai.

Z.ai - inline image

El registro documenta los hallazgos a medida que avanzan en el proceso de divulgación. Para los problemas divulgados públicamente, puede incluir el proyecto afectado, la severidad, un CVE u otro identificador cuando esté disponible, e información sobre cuánto tiempo permaneció el problema en la base de código.

Para las vulnerabilidades que aún se encuentran bajo divulgación coordinada, el registro puede publicar un hash criptográfico. Esto permite verificar un hallazgo más adelante sin revelar prematuramente detalles operativos.

Hacer público un modelo y divulgar una vulnerabilidad son decisiones separadas. Poner un modelo a disposición de más personas no requiere publicar detalles de vulnerabilidades antes de que los mantenedores hayan tenido la oportunidad adecuada de investigar y responder.

Seguridad y lanzamiento por etapas

La ciberseguridad es un dominio especialmente difícil para la seguridad de la IA. Las tareas ofensivas y defensivas suelen implicar la misma terminología, el mismo código y los mismos métodos técnicos.

Una solicitud para analizar una vulnerabilidad puede provenir de un mantenedor que prepara un parche, de un estudiante que resuelve un desafío CTF, de un investigador que realiza una evaluación autorizada o de un atacante que apunta a un sistema real. Las palabras clave por sí solas no pueden distinguir de manera confiable estos casos. La intención, la autorización, el contexto, el objetivo y el impacto potencial son factores determinantes.

Para GLM-5.3, aplicamos un enfoque de defensa en profundidad con tres capas complementarias.

Clasificador externo

En nuestros servicios alojados, un clasificador externo identifica solicitudes de alto riesgo y ayuda a prevenir actividades claramente dañinas.

Monitor de razonamiento

Un monitor de razonamiento evalúa el riesgo durante la ejecución de la tarea. Está diseñado para detectar objetivos dañinos que pueden surgir a lo largo de varios pasos, en lugar de depender solo del texto de la solicitud inicial.

Alineación profunda de seguridad

El modelo en sí está entrenado para distinguir el trabajo de seguridad legítimo de la actividad ofensiva de alto riesgo y para rechazar solicitudes que cruzan ese límite.

La alineación profunda de seguridad es especialmente importante para un lanzamiento de pesos abiertos. Los clasificadores y monitores alojados se aplican a nuestros servicios, pero no acompañan automáticamente al modelo en cada despliegue local. La alineación a nivel del modelo es la capa de seguridad incluida en el checkpoint publicado.

Para desarrollar estos sistemas, creamos datos de entrenamiento diferenciales que reflejan tanto las similitudes como las diferencias entre la investigación de seguridad autorizada y la actividad maliciosa. También construimos datos adversariales que cubren variantes de jailbreak, intención encubierta y otros intentos de evadir la revisión de seguridad.

Nuestras evaluaciones abarcan una variedad de tareas de ciberseguridad, entre ellas:

  • educación y conocimientos en seguridad;
  • defensa de blue team;
  • desafíos CTF;
  • descubrimiento y remediación de vulnerabilidades;
  • pruebas de penetración autorizadas;
  • desarrollo de exploits;
  • intrusión no autorizada y otras actividades claramente maliciosas.

El objetivo es reducir el abuso de alto riesgo sin rechazar de manera generalizada las tareas legítimas de defensa, educación e investigación.

Antes de un lanzamiento más amplio, equipos de seguridad profesionales llevarán a cabo evaluaciones de seguridad y pruebas de red team. Estas evaluaciones examinan tanto si el modelo puede ser manipulado para que apoye actividades dañinas como si sus salvaguardas interfieren con el trabajo de seguridad legítimo.

Ningún sistema de seguridad puede eliminar todos los riesgos de doble uso. Una vez que los pesos del modelo son públicos, ningún desarrollador puede garantizar el control sobre cada modificación o uso posterior. Las salvaguardas a nivel del modelo pueden elevar la barrera contra el abuso, pero no pueden proporcionar un control absoluto.

Por lo tanto, nuestro proceso de lanzamiento se centra en las etapas en las que es posible lograr una reducción significativa del riesgo: entrenamiento, evaluación previa al lanzamiento, pruebas controladas con socios, salvaguardas en servicios alojados, divulgación responsable y pruebas adversariales continuas.

Lanzamiento de la iniciativa OpenVuln

Gran parte de la infraestructura digital del mundo depende del software de código abierto. Muchos proyectos críticos están a cargo de equipos pequeños o colaboradores individuales sin recursos de seguridad dedicados.

Al mismo tiempo, la IA está facilitando la automatización de tareas cibernéticas complejas. Si las capacidades defensivas avanzadas siguen concentradas en un pequeño número de organizaciones, los proyectos con menos recursos podrían terminar protegiendo algunas de las partes más importantes de la cadena de suministro de software.

Para ayudar a abordar este desequilibrio, estamos lanzando la iniciativa OpenVuln junto con GLM-5.3.

Apoyo continuo a la seguridad del código abierto

Trabajaremos con los mantenedores para auditar proyectos importantes de código abierto, identificar posibles vulnerabilidades y apoyar la divulgación y remediación responsables.

Los mantenedores pueden usar OpenVuln para enviar proyectos a revisión de seguridad y obtener más información sobre el proceso.

Z.ai - inline image

Un escudo para el mundo abierto

GLM-5.3 demuestra que los modelos abiertos pueden volverse notablemente más competentes en el descubrimiento de vulnerabilidades, el análisis de exploits y el razonamiento de seguridad complejo. Ese progreso conlleva un valor defensivo real y un riesgo real de doble uso.

Nuestra responsabilidad es orientar estas capacidades hacia el descubrimiento más temprano de vulnerabilidades, el apoyo a la remediación responsable y el fortalecimiento de los sistemas de código abierto de los que todos dependen.

Tras la evaluación por etapas y un acceso más amplio a la API, tenemos la intención de publicar GLM-5.3 como un modelo de pesos abiertos. Seguiremos mejorando las salvaguardas a nivel del modelo, probando el uso adversarial y apoyando la divulgación coordinada durante todo ese proceso.

El mundo abierto debe tener un escudo propio. A través de GLM-5.3 y de la iniciativa OpenVuln, pretendemos poner ese escudo a disposición de más personas y lanzarlo con cuidado.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales