智谱发布GLM-5.3:编程能力接近Claude Fable 5,安全测试发现40年前漏洞
智谱今日发布GLM-5.3,在编程和智能体能力上接近Claude Fable 5,并在安全测试中成为最强开源安全模型。发布前联合清华、南开等机构进行红队测试,发现2404个漏洞,最早可追溯至40年前。
智谱今日发布GLM-5.3,在编程和智能体能力上接近Claude Fable 5,并在安全测试中成为最强开源安全模型。发布前联合清华、南开等机构进行红队测试,发现2404个漏洞,最早可追溯至40年前。
SynthePulse Insight · AI 深度解读
版本 3 · 4 个来源
智谱发布 GLM-5.3,仅靠后训练将编程能力提升 50%,并在网络安全上发现 2436 个漏洞。但基准测试未经独立验证,生态兼容性仍存疑,模型保质期缩短至 20 天。
GLM-5.3 的发布最引人注目之处在于,它没有更换基座模型,而是通过极致的后训练 Scaling 将编程能力提升了 50%。智谱官方技术博客指出,此次升级的主要原因是后训练 Scaling,并称在 GLM-5.2 完全相同基座上高效推进强化学习,可能远未开发出该基座的智能上界。
参数量方面,GLM-5.3 与 GLM-5.2 相当,约为 7000 亿,而同期 Kimi K3 和 Qwen3.8-Max 已迈向万亿参数。APPSO 的报道强调,GLM-5.3 用不到一半的参数实现了与 Kimi K3 2.8T 级别大模型相当的智能,这被视为后训练 Scaling 的胜利。
然而,这些提升数据均来自智谱自身体感评测或内部基准,未经独立验证。极客公园的报道也仅转述了智谱的说法,未提供第三方测试结果。因此,50% 的提升幅度和基准排名应视为智谱的单方面宣称。
GLM-5.3 的另一个重点是网络安全。智谱联合清华、南开等机构进行了红队测试,累计发现漏洞 2404 个(初筛去重后),其中 1088 个为中高危,覆盖 220 个项目。The Decoder 的报道则称,GLM-5.3 帮助安全团队在 269 个项目中找到 2436 个漏洞,最古老的可追溯到约 40 年前。
在 ExploitGym 测试中,GLM-5.3 在 6 小时内完成了 130 道题(共 898 道),表现与 Claude Mythos 5 持平。量子位的实测显示,GLM-5.3 在 AegisDesk 项目中找出了全部 12 类漏洞,并自行修复,最终 54 项回归测试全部通过。
值得注意的是,漏洞发现的具体方法和验证过程并未完全披露,例如 2404 与 2436 两个数字的差异可能源于统计口径不同。此外,量子位的实测属于媒体测试,并非独立第三方评估,其结论应谨慎对待。
APPSO 的实测发现,在 Claude Code 中使用 GLM-5.3 时,若开启自动审批命令,会频繁遇到错误提示「auto mode cannot determine the safety of Bash right now.」,即自动模式无法判断 Bash 命令的安全性。这可能是 Claude Code 自身的机制,但第三方模型尚未适配。
相比之下,在智谱自家的 ZCode 中,GLM-5.3 能像 Codex 一样使用工具、截图识屏并持续优化,但运行时间更长。例如,一个行星撞地球的模拟在 Claude Code 中不超过 1 小时,而在 ZCode 中超过 1 小时仍在测试。
生态兼容性问题可能影响用户体验,但智谱已上线 Zcode 和 AutoClaw,并开放给 GLM Coding Plan 用户。第三方平台如 WorkBuddy、QwenWork、TraeWork 也已开放抢先体验,但 API 要等到下周二才开放。
智谱宣布 GLM-5.3 的权重将在两周内开源,并同步开源了后训练框架 Slime,支持 GLM、Qwen、DeepSeek 部分模型及 Llama 3。Slime 从 GLM 4.5 开始就被智谱用于后训练,此次开源有望降低后训练门槛。
然而,模型竞争已进入白热化。APPSO 指出,GLM-5.3 发布仅 20 天,就有更强的 Kimi K3 出现,而 Kimi 又 20 天后被 DeepSeek 超越,模型「保质期」被压缩至约 20 天。这种快速迭代对用户和开发者都构成挑战。
尽管 GLM-5.3 在编程和网络安全上表现突出,但面对 Kimi K3、DeepSeek V4、Grok 4.6 等竞品,其优势能维持多久仍是未知数。智谱的 API 定价尚未更新,仍显示 GLM-5.2 版本,但预计不会有太大变化。
量子位的实测展示了 GLM-5.3 在复杂任务上的能力:28 分钟完成《指环王》基准,40 分钟交付一个带后端、数据库和权限的模拟游戏,并在无 GPU 环境下主动区分 VERIFIED、INFERRED 和 UNVERIFIED。这些表现体现了模型在工程交付和风险认知上的进步。
但 APPSO 的实测则显示,GLM-5.3 在 3D 生成任务中表现不一。例如,人体血液循环仿真系统被做成了粗糙的「火柴人」,内部器官堆在一起;而水母湖场景则效果惊艳,但提示词相当长。这说明模型的表现高度依赖提示词质量。
综合来看,GLM-5.3 在编程和安全上确实有显著提升,但实际效果受工具、提示词和场景影响较大。用户需根据具体需求评估其适用性,而非盲目相信基准测试。
本报道基于智谱官方声明、量子位和 APPSO 的实测,以及 The Decoder 和极客公园的转述。所有性能数据(如 50% 提升、漏洞数量)均来自智谱或媒体测试,未经独立第三方验证,应视为 source_claim。部分数字(如 2404 与 2436)存在差异,可能源于统计口径不同。
GLM-5.3 证明了后训练 Scaling 的潜力,在编程和安全上达到新高度,但基准测试未经独立验证,生态兼容性有待改善。在模型保质期缩短至 20 天的竞争环境下,其长期优势尚不确定。