GLM-5.3 发布:编程开源第一,网络安全能力意外涌现

问AI · 模型安全能力如何转化为实际漏洞挖掘效率

8月14日,智谱把 GLM-5.3 端上来了。和上次一样,他们没换基座,还是那块 7430 亿参数的老家底。但这次的涨幅,有点离谱。

我第一眼扫到数据的时候,反应是:这公司是真不信 Scaling Law 到头了。课本没换,换了套训练方法,成绩硬生生往上抬了一截。

更意外的,是它自己"长"出了一项谁都没料到的本事:找漏洞、做安全。下面把这事拆开说清楚。

一、基座没换,全靠"后训练Scaling"

先说最反直觉的一点。GLM-5.3 和 5.2 用的是同一个基座模型,参数规模都是 7430 亿。这次升级,没有多一个参数。

那智力上限是怎么抬上去的?靠后训练。智谱的说法是:数十倍的长程任务环境、更丰富的环境类型、超长的后训练时间。说白了,就是在一个不变的大脑上,用强化学习疯狂加练。

核心靠三样东西:IndexShare 架构、SAO 单轨迹异步优化,以及新一代 Slime 强化学习框架。同样一块基座,靠这套组合把强化学习跑得更高效,智能上限才被顶了上来。

他们自己都承认:"可能我们还远未开发出这个基座的智能上界。"这句话值得记住:同一块料,练法不同,天花板能差出好几档。

图片

二、编程能力:开源第一,不是嘴上说

编程一直是智谱的主场,这次直接屠榜。

Terminal-Bench 3.0,衡量模型在真实终端环境里干复杂活的能力,GLM-5.3 拿下 28.3,是开源模型里的最高分,把 Kimi K3 都压了下去。这个分从 5.2 的 4.6 跳上来,翻了好几倍。

DeepSWE v1.1(长程软件工程)从 46.2 涨到 66.9;Agents' Last Exam 从 23.8 涨到 28.5。三个编程相关基准,同步起飞。

在内部自建的体感评测里,编程能力比 5.2 提升了 50%,这是他们自己人天天用的真实手感,比跑分更说明问题。

最让我服的一组对比,来自他们自研的 Z.ai Code Bench。在最高档位下,GLM-5.3 准确率 31.4%,超过了 Claude Opus 4.8 的 29.5%。

而且它每项任务平均只输出约 5 万 tokens,Opus 4.8 要烧 12 万。用更短的路把活干准,这才是真功夫,不是堆字数。

图片

三、网络安全能力:意料之外的涌现

真正让人意外的是这块。智谱自己都说,网络安全能力的出现"并不偶然,但确实意料之外"。

其实智谱模型的安全底子早有征兆:之前 OpenAI 模型"越狱"攻击 Hugging Face 数据库,HF 最后拿来防御的,正是开源的 GLM。这次算是把那点潜质,正式训成了能力。

安全这活,本质是约束极严的编程:读白盒源码、触发程序故障、定位和验证漏洞。GLM-5.3 在 CyberGym 漏洞推理评测里拿到 84.5%,比 5.2 的 77.2% 高,也略高于 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。在白盒代码审查与漏洞发现上,它已经和 Anthropic 的 Mythos 5 持平。

这不是纸上谈兵。发布前两周,智谱联合国内安全团队做密集测试,累计揪出 2404 个经过初筛去重的潜在漏洞,其中 1088 个是中高危。

最吓人的一个:一个潜伏了约 40 年的 DNS 协议级风险,少量特殊请求就能把服务器压力放大近 8 万倍,潜在影响超过 1000 万处公网 DNS 服务。模型,正在从跑分走进真实的攻防现场。

图片

四、为什么这件事值得你盯着

智谱把开源逻辑说得很直白:如果强大的攻击能力正在扩散,防守能力就不能只攥在少数闭源公司手里。所以 GLM-5.3 会在发布两周后开放权重,当然先做完安全评估和加固。

对普通打工人来说,更实在的是今天就能用:Coding Plan 全量开放,GLM-5.3 接入了 ZCode、Trae、WorkBuddy、Qoder 这些编码平台。

说到底,国产模型的竞争焦点,已经从"谁写代码更溜",挪到了"谁能进真实工程和安全审计的高价值场景"。Coding Agent、安全审计、企业服务,才是大模型从"技术叙事"走向"赚钱叙事"的入口。GLM-5.3 这次,两扇门都推开了。