❯ DeepSeek发布V4.1 Flash,5520亿参数新架构瞄准更低推理成本
新架构DeepSeek发布DeepSeek-V4.1-Flash,模型拥有5520亿个主干参数和100万令牌上下文窗口,并被公司称为新架构家族中最小的型号,后续仍有更大的Pro版本。
推理设计公司技术材料显示,新模型采用因果编码器—解码器架构,预填充与解码阶段激活的参数规模不同,设计重点指向推理效率和缓存占用。相比此前V4系列,公司公布的智能体、编程及网络安全跑分领先多款更大的模型,但这些数字仍属于厂商口径,需要第三方在统一提示词、输出预算和真实任务上复测。
产品位置Flash并非只拼榜单,它用更小的激活规模承接长上下文和智能体工作负载。开发者真正要比较的是任务完成率、输出长度和每次任务成本;价格便宜但反复重试,同样会吃掉架构节省下来的预算。更大的Pro版本发布后,Flash能否保留性价比优势也要重新验证。
▪ SIGNALDeepSeek把新架构先落在低价Flash型号上,市场会用真实任务成本检验这次效率升级。