08 RESEARCH
❯ 字节 Seed 团队发现分块 KV 缓存压缩带来“相位敏感性”,长上下文检索准确率最多相差 40.2 个百分点
换个位置,准确率就变了字节跳动 Seed 团队 9 月底在预印本平台 arXiv 提交了一篇论文,研究一种长上下文优化技术带来的副作用。据投资界报道,研究人员在 128K 长上下文检索测试中发现,同一条信息只是换了位置,DeepSeek-V4 系列模型的检索准确率最多相差 40.2 个百分点,而且随位置每 4 个 Token 周期性起伏。
压缩窗口里的位置有讲究原因指向分块 KV 缓存压缩。据 IT之家介绍,模型处理长文本时要保存大量历史信息,这项技术按固定步幅把连续几个 Token 压成更少的缓存条目,以节省内存和计算。副作用是每个 Token 多了一个属性:它落在压缩窗口的第几个位置。团队把同样的信息在不同位置上检索难度不同的现象称为“相位敏感性”。
新版本差距已明显缩小论文评估了多个版本。差距最大的是 DeepSeek-V4-Flash 的基础版,后续版本 V4-Flash-0731 缩小到 19.1 个百分点,V4-Pro-0813 为 14.8 个百分点,更新的 V4.1-Flash-0910 降到 6.1 个百分点,波动周期也从 4 个 Token 变为 2 个。团队还用 Qwen3-0.6B 架构搭了多种压缩方案做对照,现象同样出现,说明它来自分块压缩这种设计本身。
平均分看不出来常规评测把大量测试结果汇总成一个平均分,周期性的高低会互相抵消。论文的建议是,评估采用这类压缩的模型时,把信息放在不同相位上分别测试。对开发者而言,这给长文档问答里“同一个问题时好时坏”提供了一个可检验的解释。
▮ SIGNAL为了省内存而做的工程优化会在模型里留下有规律的弱点,长上下文能力的比较需要比平均分更细的测法。