2026-08-27-星期四 · 英伟达 · 智谱 · DeepSeek

收录于 第 74 期(2026-08-27) · 本期共 15 条

❯ 智谱开源 GLM-5.3-Flash,公测流量全部跑在国产芯片集群上

身份揭盲智谱 8 月 26 日开源 GLM-5.3-Flash,并确认它就是此前在 OpenRouter 上匿名跑了一周的神秘模型 Ox Alpha。总参数 320B、激活 18B,采用 MIT 许可证,上下文 100 万 token,是 GLM-5 系列第一个原生多模态模型。独立测评机构 Artificial Analysis 给出智能指数 57 分,与 Claude Opus 4.8 持平,每任务成本约 0.045 美元。

真正的看点在硬件官方称匿名公测期间的流量全部跑在国产芯片集群上,团队在 SGLang 之上自建推理引擎,同硬件端到端性能提升三倍,达到「与主流英伟达 GPU 相当的硬件效率与单 token 成本」。铺垫此前就已埋下:今年 7 月智谱收购了源自中科院计算所的中科加禾,主业正是异构计算软件与推理引擎,目标是把多厂商 AI 芯片的利用率提上去。官方没有点名芯片厂商。

架构与定价模型首次在 GLM 主系列用上线性注意力与稀疏注意力的混合结构,叠加 IndexPool 压缩,注意力计算量降到三分之一、键值缓存降到约四分之一,预训练吃了约 30 万亿 token 的多模态数据。编程评测 DeepSWE v1.1 从上一代的 46.2 提到 63.4。API 定价是 GLM-5.3 的十分之一,限时折扣期内相当于 Opus 4.8 的四十分之一。

分发口径也变了匿名测试期该模型一度成为 OpenRouter 上调用量最大的模型,一周内超过 DeepSeek 两倍——用免费额度换真实分布式流量,是国产模型第一次把这套打法跑通。要重新算账的是海外开发者的模型选型成本:一个开源权重、编程能力对标顶级闭源、价格差四十倍的选项摆在那儿,闭源厂商的定价空间会被直接压缩。

▪ SIGNAL这次的分水岭不在跑分,在于一个前沿量级的模型第一次证明自己能脱离英伟达供货节奏活着。