❯ DeepSeek 发布 V4-Flash 正式版:权重当天开源,智能体测评反超自家 Pro 预览版
当天开源DeepSeek 于 7 月 31 日放出 V4-Flash-0731 正式版,架构一个字没改,权重当天就以 MIT 协议挂上 Hugging Face 公开仓库,同日 API 进入公测。官方公布的九项智能体与编程测评里,这个 284B 总参、13B 激活的小模型全部反超自家更大的 V4-Pro 预览版;技术报告直接沿用 4 月那篇 V4 论文,等于挑明——模型没换,换的是训练。
提升从哪来涨幅集中在智能体活上。此前 4 月发布的预览版在这一类任务上一直被诟病,官方数据显示,DeepSWE 从 7.3 跳到 54.4,接近七倍;Terminal Bench 2.1 从 61.8 升到 82.7,把 V4-Pro 预览版的 72.1 甩在身后。第三方口径也对得上:Artificial Analysis 给出的智能指数为 50 分,追平谷歌 Gemini 3.6 Flash,比 4 月的预览版整整高出 10 分。而这 10 分全部来自后训练——总参数、激活参数、100 万上下文窗口三项一个没动,价格也没变。DeepSeek 同时说明,这次升级只作用于 V4-Flash 接口,V4-Pro 的 API 与网页端暂时不变,Pro 正式版”尽快”发布。新接口已原生支持 Responses 格式并适配了 Codex。
便宜到不必计价这一手最难受的是卡在中间那一档的闭源模型。上游刚经历 OpenAI 把 GPT-5.6 Luna 的输入价砍掉八成,下游又冒出一个同等智能、权重白送的开源模型,中间价位被两头挤。对国内做智能体产品的团队来说,推理成本这项预算基本可以从关键决策里划掉,卡人的换成了评测体系和工程可靠性。海外闭源厂商则要回答一个更硬的问题:当同一套架构靠后训练就能涨 10 分,模型代际这件事还值多少溢价。
▪ SIGNAL同一个模型跑两遍,第二遍多值 10 分——后训练正在变成比参数量更值钱的资产。