2026-08-05-星期三 · DeepSeek

收录于 第 53 期(2026-08-05) · 本期共 9 条

❯ DeepSeek 新版 V4-Flash 跑分追平 GLM-5.2,价格只有对方十分之一

价格差十倍DeepSeek 更新的 V4-Flash 把开源模型的价格性能曲线又压低一档:研究者 Nathan Lambert 称新版跑分已追平 GLM-5.2,而据报道,OpenRouter 页面列出的价格是 V4-Flash 每百万 token 输入 0.14 美元、输出 0.28 美元,GLM-5.2 为 1.40 与 4.40 美元。换算下来,输入差十倍、输出差十五倍。目前它是 OpenRouter 上调用量第一的模型。

被低估的采用量Lambert 的另一句话点出容易被漏掉的部分:初版 V4-Flash 的采用数据在讨论里被严重低估,真实用量远高于外界印象,HuggingFace 上的相关活跃度同样居高。生态跟进得很快——已有第三方放出 14 个量化版本,从无损的 BF16 一路压到 1-bit,全部提供 GGUF 格式供本地推理运行时直接加载。值得单独提一句的是这批量化的评估方式:不用跑分对比,而是用 KL 散度衡量压缩后的输出分布偏离原始权重多远,问的是”这个模型还是不是原来那个模型”,而不是”它还能考多少分”。

预算表被改写对做产品的团队,token 成本已经不再是应用侧的主要预算项,按上述公开报价推算,这一档价位下真正吃钱的是上下文管理和调用次数。受挤压的是定位在中间档的闭源 API:上有前沿模型的能力溢价,下有追平跑分却只要十分之一价钱的开源权重,中间这层很难解释自己贵在哪。1-bit 量化加 GGUF 还把另一批人拉了进来——能在个人机器上跑起接近前沿的模型,这批用户以前根本不在定价表的考虑范围里。

▪ SIGNAL当追平跑分只要十分之一的价钱,中间档 API 就没有故事可讲了。