把权重推迟两周,挡不住一件事——它自己就是靠 post-train 变危险的
先说结论
8 月 14 日,Z.ai(智谱)发布 GLM-5.3,同时做了一件此前开源权重阵营没人做过的事:因为模型的网络攻防能力涨得超出预期,主动把权重发布推迟约两周,并说最敏感的安全能力只对经过验证的用户开放。截至今天(8 月 17 日),Hugging Face 上 GLM-5.3 的仓库仍未公开。
这个动作值得记住,但不是因为它有效。它真正的意义在于:一家把「权重就该发出去」写在身份里的实验室,第一次公开承认某个能力烫手到不能按原节奏发。而它给出的缓解措施,恰好被它自己的技术事实拆掉了。
事情是怎么发生的
Z.ai 自己的说法是:GLM-5.3 没有重训基座,跑的还是 GLM-5.2 那个 743B 的底模,全部提升来自后训练的规模扩展——官方博客的开场白就是「Scaling post-training is all we did for GLM-5.3」。
他们在后训练里加了漏洞发现类的数据,原本的预期只是「单个 bug 的推理更准一点」。结果能力没有停在那儿,而是随训练规模持续复利,模型开始能对完整的利用链条做出连贯的多步规划,而不只是指出某处孤立的缺陷。用他们自己的描述,这不是计划中的目标。
数字上能看出这条曲线的形状。CyberGym(审代码、找漏洞、确认漏洞真实存在)从 77.2% 涨到 84.5%,越过了 Anthropic 那个受限访问模型报出的 83.8%;ExploitBench(把漏洞写成能跑的利用)从 24.4% 涨到 54.4%,但对面是 78.0%,差距仍然明显;ExploitGym 在两小时预算内完成 105 个任务、六小时 130 个,上一代只有 29 和 39。
配套的还有一个开源项目审计计划,以及一份战绩清单:GLM-5.2 以来,他们的模型在 269 个开源项目里找出 2,436 个漏洞,其中 1,097 个被评为高危或严重,发布时 53 个已分配 CVE,2,383 个仍在补丁禁运期内。
需要说清楚的是,这些数字全部自报,尚无第三方复测;CyberGym 那 0.7 个百分点的领先,换套评测脚手架就可能翻转。
为什么重要
开源权重这场架,过去两年一直卡在「谁能拿到」上:闭源阵营说权重一放就不可撤回,开源阵营说防守方需要同等的能力。GLM-5.3 把靶子换了——不是谁拿到,而是攻和防这两条能力曲线,哪条先起飞。
Z.ai 的数据恰好给出了一个可以长期跟踪的答案雏形:找漏洞这一端已经贴着前沿模型,写利用那一端还差一大截。如果这个错位是稳定的,开源阵营的论证就成立——扩散出去的主要是防守方用得上的那半截能力,那些没有专职安全人员维护、却撑着大半个软件供应链的开源项目,第一次有机会用得起这种审计。如果这个错位在下一代就抹平,同样的论证会当场作废。
这也是第一次由一家中国实验室,主动把「分级发布 + 受信访问」这套原本属于前沿闭源实验室的话术,套在自己的开源模型上。治理规范在跨生态传染,这比某个具体分数更值得盯。
站得住与站不住的地方
站得住的部分:两周不是被当成永久屏障来卖的。2,383 个漏洞还在禁运期里,这个窗口买的是补丁时间——先让维护者把洞堵上,再让那个会找洞的东西公开。这是个连贯的、有实际收益的理由。
站不住的部分要命得多。GLM-5.3 是它自己论证的反例:能力完全由后训练造出来,基座一行没动。那么权重一旦公开,任何有算力的人都可以在同一个基座上重跑一遍相似的后训练——Z.ai 已经把配方的存在性证明公开了,甚至连「加漏洞发现数据、把后训练规模拉上去、能力会自己复利」这个关键提示都说了。两周的推迟和受信访问,管的是 Z.ai 自己托管的那个入口;管不了别人在下载下来的权重上做什么。
而且模型此刻已经在收费 API 后面跑着。正在被「安全评估」的那套能力,付费的人现在就能用。
补丁禁运争到的时间是一次性的,后训练的可复现性是永久的。诚实的说法应该是:这不是风险控制,是一次有序的移交——用两周换补丁窗口,然后承认接下来控不住。把它当成前者来叙述,才是这次发布最需要被质疑的地方。
接下来该盯什么
一,8 月底权重是否如期公开,许可证是否照旧宽松,「受信访问」在权重公开之后还剩什么可执行的内容。
二,找漏洞与写利用之间那道差距的走向。这是整场开源攻防辩论目前唯一有数字的支点,值得每一代模型都记一次。
三,那 2,383 个禁运漏洞的补丁落地速度。补得上,「先扫再发」就有了可复制的模板;补不上,那就是把一份高危清单和找洞的工具一起交了出去。
四,会不会有第二家开源权重实验室跟进。一家做叫特例,三家做才叫规范。