❯ 智谱 GLM-5.3 上线 API,独立评测得 60 分与 Kimi K3 持平
发布与定价智谱的 GLM-5.3 正式上线官方 API 与合作网关,定价与 GLM-5.2 持平,主打编码、防御性网络安全和长程智能体任务。这一代没换基座,全部提升来自后训练扩展——更长的训练时长、比上代大数十倍的训练环境、更杂的环境类型。开源权重要等安全评估和加固走完才放。
跑分位置独立评测机构 Artificial Analysis 给出的智能指数是 60 分,与 Kimi K3 持平,比此前的 GLM-5.2 涨了 7 分,但仍落后 Opus 5 的 63 分和 Fable 5 的 62 分。权重一旦开放,它将并列开源模型第一。据智谱自己公布的数据,Terminal-Bench 3.0 从 4.6 冲到 28.3,DeepSWE 从 46.2 到 66.9,CyberGym 漏洞发现率 84.5%。
一处异议研究者 teortaxesTex 提出不同看法,认为这一代过度偏向软件工程,CritPt 上出现小幅回退,综合来看 Kimi K3 仍是中国模型里最全面的。这个分歧点得留意:靠后训练在特定环境里堆出来的分数,迁移到别的任务上未必守得住。同一个 60 分,落在编码流水线上和落在科研推理上,含金量不是一回事——选型时值得先拿自家任务与评测环境比一比重合度。
▪ SIGNAL同基座、纯后训练就涨 7 分,说明这一轮竞争的胜负手已经从预训练规模挪到了训练环境的构造能力。