❯ DeepSeek V4-Flash 0731 第三方评测出炉:激活参数仅 13B,智能体成绩反超自家 Pro 版
评测全景DeepSeek 上月末放出的 V4-Flash 0731 过去一天被第三方评测集中验证:官方自报的 TerminalBench 2.1 得分 82.7,与独立评测机构 Ante harness 跑出的数字完全一致,后者还把它排在 xAI 的 Grok-4.5 之上。半导体研究机构 SemiAnalysis 公开祝贺,称它在智能体任务上大幅超过英伟达 Nemotron3 Ultra,而激活参数少 4.2 倍、总参数少近一半。
参数与架构这个成绩是用一个”小”模型打出来的:总参数 284B、激活仅 13B 的混合专家架构,带 100 万 token 上下文。模型结构与此前的 Flash-Preview 完全相同,只重做了后训练,TerminalBench 就从 Pro-Preview 的 72.1 拉到 82.7——便宜版反超了自家高价版 14.7%。
九个月跨越纵向对比更扎眼。研究员 Teortaxes 整理的数据显示,九个月前的 V3.2 在同类智能体基准上只有 4.0%,0731 做到 61.4%,成本还降到三分之一。多家评测方给出的性价比结论一致:Vals 测得它比 Grok 便宜 28 倍,分数却相当。
竞争压力压力最先传导到闭源实验室的定价表上。当一个开放权重、激活 13B 的模型能跑进第一梯队智能体榜单,企业客户在采购编码和智能体方案时,为闭源 API 付的溢价就需要拿出新的理由。开发者社区已经在预判:照这个后训练迭代速度,DeepSeek 年内摸到闭源旗舰的分数段并非玩笑。
▪ SIGNAL后训练重做一遍就反超高价版,说明智能体能力的门槛正在从”堆参数”移向”炼配方”——这恰恰是开源阵营追赶最快的一段。