06 MODEL
❯ 小米公开 MiMo-V3 核心架构,称读入百万 Token 所需计算量降至约五分之一
小米 MiMo 负责人罗福莉在 X 公布了下一代 MiMo-V3 将采用的核心架构 HySparse 2。团队称,与 MiMo-V2.6 的架构相比,处理 100 万 Token 输入时,读入内容所需的计算量降至原来的约 1/5.02,生成回答时占用的 KV 缓存缩小 4.5 倍,长文本检索测试成绩也更高。这些是团队公布的测试结果,MiMo-V3 模型本身尚未发布。
这套架构主要针对长对话和智能体任务。智能体处理复杂工作时,会不断积累文件、对话和工具结果;模型每次继续工作,都可能需要读取这些历史内容。把长内容读进去的计算叫“预填充”,生成答案时保留的中间信息则放在 KV 缓存中。两者分别影响等待时间和显存占用,也是百万 Token 长任务容易变贵的原因。
HySparse 2 尝试更细致地选择和复用信息。按团队介绍,它把选择单位从一整块内容细化到单个 Token,并调整近期内容的保留方式,让局部与全局信息共享缓存;还使用 KV 桥接和重用等机制。直观地说,模型希望少做重复计算,同时保住完成任务需要的信息。具体效果目前来自团队测试,不能直接推算成所有用户的费用都降低相同比例。
如果这些改进能在真实任务中成立,长文档分析和需要反复调用工具的智能体,就可能用更少显存、更短等待时间完成工作。但省下资源的同时,也要确认模型没有漏掉关键细节。因此后续应一起比较完成任务的准确性、耗时与成本,才能判断架构变化对用户是否有用。
▪ SIGNAL长上下文竞争正在延伸到“读得起、用得稳”:能装下更多信息,还要能以合理成本找到其中真正有用的部分。