智谱发布GLM-5.3:会找漏洞,完整权重两周后开放

栏目:互联网/干货 | 来源:网易智能 | 2026-08-14 14:38

8月14日,智谱今日发布GLM-5.3。它沿用GLM-5.2的基座模型,主要变化发生在后训练阶段:长程任务环境扩到原来的数十倍,任务类型更多,训练时间也更长。

模型当天进入ZCode、AutoClaw和GLM Coding Plan,API即将上线,完整权重定在发布两周后开源。智谱称,这段时间将用于安全评估和模型加固,尽量限制潜在攻击能力,同时保留漏洞发现和修复的价值。

同一个基座,又往前练了一段

智谱没有用更大的参数量解释这次升级。它把提升归到更长、更复杂的后训练上:让模型反复处理需要规划、工具调用和结果检查的任务。

按智谱公布的数据,GLM-5.3在Terminal-Bench 3.0上的得分由前代的4.6升至28.3;DeepSWE v1.1从46.2升至66.9;Agents' Last Exam从23.8升至28.5。智谱自建的Z.ai Code Bench在High档位下GLM-5.3达到31.4% 的准确率,每项任务平均输出约5万tokens,作为对照,智谱称Claude Opus 4.8最高档位的准确率为29.5%,但每项任务约需12万tokens。智谱的内部体感评测给出的增幅是50%。

会找漏洞,不等于会打穿系统

GLM-5.3最醒目的新增能力是网络安全。智谱公布的对比对象包括Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol。

在CyberGym上,GLM-5.3的成功率为84.5%,高于GLM-5.2的77.2%,也略高于Mythos 5的83.8% 和GPT-5.6 Sol的83.6%。按照智谱的测试说明,这一环节从白盒源代码出发,通过触发程序故障来识别和验证漏洞。

在ExploitBench上,GLM-5.3得分54.4%,是GLM-5.2(24.4%)的两倍多,但仍低于Mythos 5的78.0% 和GPT-5.6 Sol的76.5%。按预算归一化的ExploitGym吞吐量口径,GLM-5.3两小时完成105项任务、六小时完成130项,相较GLM-5.2的29项和39项提升明显,但Mythos 5在同样时段分别完成181项和247项,仍然领先。

GLM-5.3在安全任务上比前代进步明显,但复杂利用能力仍落后于Mythos 5。

2436个漏洞,账本可查

智谱称,自GLM-5.2发布以来,公司联合清华大学、南开大学,以及云起无垠、绿盟科技、赛博昆仑、DARKNAVY、腾讯玄武等多家安全团队,开展了密集的红队测试与安全评估。经过初筛、去重后,累计发现漏洞2436个,其中1097个为中高危,涉及系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与互联网协议等269个项目。

相关漏洞已陆续提交CNNVD/CNVD等国家漏洞库。智谱还建立了"Z.ai安全披露账本",已修复的漏洞公开细节,仍在协调披露阶段的漏洞则先公开哈希值供后续核验。

智谱在发布材料中也列举了几个已披露的具体案例,包括在Cursor、微软邮件与办公系统、某国民级通信App、DNS协议(追溯至1983年)以及一家人形机器人厂商产品中发现的漏洞,均已进入CNNVD/CNVD披露与修复流程。

权重开放后,服务端防线管不到本地副本

智谱为GLM-5.3设计了三层安全措施:外层是一个轻量分类器,标记并拦截大规模滥用请求;中间是推理监控器,在模型推理过程中实时审查任务意图;最里层是模型自身的安全对齐,让模型自主识别并拒绝恶意请求。

前两层依赖服务端。如果开发者下载权重并在本地部署,它们不会随着模型一起交付。智谱在发布材料中也写得很清楚:深度安全对齐,是开放权重场景下唯一仍然有效的一层防线。

漏洞防御和漏洞利用共用一段能力链。模型读懂大型代码库、安排长程任务、调用工具并验证结果,可以帮维护者补洞,也可能把一次攻击继续往前推。所以GLM-5.3新增的安全能力,既是智谱要宣传的卖点,也是它推迟开放权重的原因。

智谱也留了几手。最敏感的能力通过"网络安全受信访问"计划限制,只向经过验证的用户开放,不随开源权重一起放出;同步启动的"开源的盾"计划将对重点开源项目开展持续安全审计、向开源社区免费提供模型额度,并在ZCode中提供代码审计功能。(易句)

(本文由AI撰写,网易编辑负责校对)

了解更多

猜你想看

← 返回首页