字节跳动Seed团队研究揭示大模型长文本检索性能波动机制
字节跳动旗下Seed团队9月底在arXiv平台发表一篇论文,指出分块KV缓存压缩可能导致大语言模型在长上下文推理中出现周期性性能波动。研究发现,采用该技术的部分开放权重模型,长文本检索准确率在不同位置相位之间最高可相差40个百分点,为理解大模型回答不稳定现象提供了新的技术解释。
分块KV缓存压缩通过减少缓存条目降低长上下文推理的内存开销,但也会使Token相对于压缩窗口边界的位置影响信息检索能力。这种现象被称为相位敏感性,意味着相同信息放在不同位置,模型可能表现出明显不同的检索准确率。
研究结果提示,传统基准测试的平均分数可能掩盖模型在特定位置的性能弱点。不过,这并不意味着DeepSeek用户遇到的所有异常都源于该机制,服务器负载、模型版本及其他系统因素也可能影响实际体验。
此外,DeepSeek曾于2026年5月回应网页版特殊字符触发异常输出的问题,称其与模型幻觉有关。