当 GLM-5.2 协助 Hugging Face 调查一起 AI 自主绕过自身安全防护的事件时,这件事凸显了一个更广泛的转变。AI 正在成为网络攻击与网络防御的一部分。
随着强大的网络能力变得越来越易于获取,强大的防御能力不能仅限于少数资源充足的组织。开源维护者、独立研究人员、开发者以及规模较小的安全团队同样需要工具,帮助他们在漏洞被利用之前发现并修复。
开放的世界不能只有开放的攻击面,还必须有开放的盾牌。
GLM-5.3 是我们在网络安全任务上迄今为止能力最强的模型。它在漏洞发现、漏洞利用分析以及复杂的多步安全任务上带来了显著提升。这些能力可以帮助防御者更早识别弱点、验证风险并加速修复。
这些能力也带来了明确的双重用途风险。因此,我们采用分阶段发布的方式。首批选定的安全合作伙伴将在受控环境中评估 GLM-5.3。随后将逐步开放更广泛的访问权限和 API。在完成必要的安全评估和发布准备后,我们将发布 GLM-5.3 的完整模型权重。
负责任的开放并不意味着将所有能力都视为无害。它还意味着透明地评估风险、在发布前加强防护、协调已验证漏洞的披露,并以与风险相称的方式扩大先进防御能力的可及范围。
从漏洞发现到多步安全分析
在后训练阶段,我们将漏洞发现数据和授权安全环境引入训练组合。我们期望这能提升模型发现和分析漏洞的能力。
随着训练规模扩大,改进不再局限于孤立的缺陷。GLM-5.3 变得更加擅长将漏洞条件、程序行为、验证路径和潜在影响关联起来,贯穿多个分析阶段。
我们通过三个基准来评估这些能力:

- CyberGym 从白盒源代码出发,测试模型能否通过触发故障来识别和验证漏洞。GLM-5.3 得分 84.5%,而 GLM-5.2 为 77.2%。
- ExploitBench 要求对真实漏洞及其利用进行更深入的推理。GLM-5.3 达到 54.4%,是 GLM-5.2 的 24.4% 的两倍以上。
- ExploitGym 衡量在标准化评估预算下完成的利用任务数量。GLM-5.3 在两小时内完成 105 项任务,六小时内完成 130 项,而 GLM-5.2 分别只有 29 项和 39 项。
这一趋势是一致的。随着任务从孤立的漏洞发现转向多步利用,GLM-5.3 相比 GLM-5.2 的提升最为显著。结果也指明了仍需改进的方向,尤其是在最复杂的端到端任务上。
从基准到真实软件
我们还与高校和专业安全团队合作,在授权环境中评估 GLM 模型在真实世界代码库上的表现。
在这项工作中,GLM 系列在 269 个项目中产出了 2,436 项漏洞发现,其中 1,097 项被归类为中高危级别。这些发现涵盖系统软件、操作系统、浏览器引擎、开源基础设施、Web 应用、网络协议和智能设备等领域。其中一些潜在问题甚至数十年来都未被察觉。
在这些评估中,安全专家负责确定授权范围、审查模型输出、调查潜在风险,并与相关方进行协调。GLM 模型可以帮助研究人员重建复杂的程序逻辑、在大量候选路径中筛选,并在多个组件之间串联证据。
目的不仅仅是产生更多发现,而是帮助防御者更早识别有意义的风险,缩短从发现到修复的时间。
发现之后,必须进行负责任披露
漏洞在刚被发现的那一刻,并不代表已经得到安全处理。它必须经过审查、在适当的情况下复现、通过正确的渠道报告,并与受影响的维护者进行协调。
我们安全工作的成果都会通过既定的披露流程提交。我们只会在符合相关披露和修复流程的前提下发布技术细节。对于仍在协调中的问题,我们不会发布可能不必要地增加风险或暴露受影响项目的信息。
为了让这项工作更加透明,我们创建了 Z.ai 安全披露台账。

台账会跟踪记录各项发现在披露流程中的进展。对于已公开披露的问题,它可能包含受影响项目、严重程度、CVE 或其他可用标识符,以及该问题在代码库中存在了多长时间等信息。
对于仍在协调披露中的漏洞,台账可以发布加密哈希值。这样可以在不提前泄露操作细节的情况下,日后对该发现进行验证。
开放模型和披露漏洞是两个独立的决定。让模型更广泛地可用,并不意味着必须在维护者获得适当机会进行调查和回应之前就发布漏洞细节。
安全与分阶段发布
网络安全是 AI 安全中尤为困难的领域。攻击性任务和防御性任务往往涉及相同的术语、代码和技术方法。
一个分析漏洞的请求,可能来自正在准备补丁的维护者、正在解 CTF 题目的学生、进行授权评估的研究人员,也可能来自瞄准真实系统的攻击者。仅靠关键词无法可靠地区分这些情况。意图、授权、上下文、目标和潜在影响都很重要。
对于 GLM-5.3,我们采用纵深防御的方法,包含三个互补的层次。
外部分类器
在我们的托管服务中,外部分类器会识别高风险请求,并帮助阻止明确的有害活动。
推理监控器
推理监控器会在任务执行过程中评估风险。它的设计目的是检测可能跨越多个步骤浮现的有害目标,而不是仅仅依赖初始请求的措辞。
深度安全对齐
模型本身经过训练,能够区分合法的安全工作与高风险的攻击性活动,并拒绝跨越这条边界线的请求。
深度安全对齐对于开放权重发布尤为重要。托管分类器和监控器适用于我们的服务,但它们不会自动跟随模型进入每一个本地部署。模型层面的对齐是随发布检查点一并提供的安全层。
为了开发这些系统,我们创建了差异化训练数据,既反映授权安全研究与恶意活动之间的相似之处,也反映它们之间的差异。我们还构建了对抗性数据,涵盖越狱变体、伪装意图,以及其他试图规避安全审查的手段。
我们的评估覆盖一系列网络安全任务,包括:
- 安全教育与知识;
- 蓝队防御;
- CTF 挑战;
- 漏洞发现与修复;
- 授权渗透测试;
- 漏洞利用开发;
- 未授权入侵及其他明确恶意活动。
我们的目标是在不大范围拒绝合法防御、教育和研究任务的前提下,降低高风险滥用。
在更广泛发布之前,专业安全团队将进行安全评估和红队测试。这些评估既考察模型是否会被操纵以支持有害活动,也考察其安全防护是否会干扰合法的安全工作。
没有任何安全系统能够消除所有双重用途风险。一旦模型权重公开,没有任何开发者能够保证对下游所有修改和使用方式的控制。模型层面的防护可以提高滥用的门槛,但无法提供绝对的控制。
因此,我们的发布流程聚焦于能够有效降低风险的各个阶段:训练、发布前评估、受控合作伙伴测试、托管服务防护、负责任披露,以及持续的对抗性测试。
启动 OpenVuln 计划
全球大部分数字基础设施都依赖于开源软件。许多关键项目由小型团队或个人贡献者维护,他们并没有专门的安全资源。
与此同时,AI 正在让复杂的网络任务更容易实现自动化。如果先进的防御能力仍然集中在少数组织手中,那么资源最少的项目,可能反而要独自承担起保护软件供应链中一些最重要部分的责任。
为了帮助解决这种不平衡,我们随 GLM-5.3 一同启动了 OpenVuln 计划。
持续支持开源安全
我们将与维护者合作,审计重要的开源项目,识别潜在漏洞,并支持负责任的披露和修复。
维护者可以使用 OpenVuln 提交项目进行安全审查,并了解更多流程信息。

为开放世界打造一面盾牌
GLM-5.3 证明,开放模型可以在漏洞发现、漏洞利用分析和复杂安全推理方面实现实质性增强。这一进步既带来了真实的防御价值,也带来了真实的双重用途风险。
我们的责任是引导这些能力用于更早地发现漏洞、支持负责任地修复,并加强每个人所依赖的开源系统。
在完成分阶段评估并开放更广泛的 API 访问之后,我们计划将 GLM-5.3 作为开放权重模型发布。在整个过程中,我们将继续改进模型层面的防护、对对抗性使用进行测试,并支持协调披露。
开放世界必须拥有属于自己的盾牌。通过 GLM-5.3 和 OpenVuln 计划,我们期望让这面盾牌更广泛地可用,并以审慎的方式将其发布。





