产业观察

字节 Seed 团队发现 DeepSeek“抽风”原因,长上下文可能性能漂移

IT之家·2026/10/9 00:49:58🔗 原文

📋总体概括

字节跳动 Seed 团队于今年9月底在 arXiv 提交论文,揭示 DeepSeek 长上下文「抽风」的深层原因:分块 KV 缓存压缩引入了「Token 相位」这一新位置坐标,导致模型检索性能出现周期性漂移——相同信息在压缩窗口的不同位置,检索难度截然不同。研究评估了 DeepSeek-V4-Flash、DeepSeek-V4-Pro 及 DeepSeek-V4.1-Flash 等基础版和后训练版模型。KV 缓存压缩本是降低长上下文推理内存与注意力成本的常用手段,而相位敏感性的发现为业界优化长上下文推理稳定性敲响警钟。

⚡关键信息

  • ▸字节 Seed 团队9月底在 arXiv 发文,直指 DeepSeek 长上下文「抽风」与分块 KV 缓存压缩的相位敏感性有关
  • ▸KV 缓存压缩将连续标记窗口按固定步幅压缩,可降低长上下文推理的内存和注意力成本
  • ▸压缩引入新坐标「Token 相位」,即 Token 相对压缩窗口边界的位置
  • ▸模型存在系统性不对称:相同信息在某些相位易检索,在另一些相位难检索
  • ▸研究覆盖基础版和后训练版的 DeepSeek-V4-Flash、V4-Pro 及后训练版 V4.1-Flash

🔥犀利点评

这论文的价值在于点破了一个行业普遍忽视的问题:大家只盯着 KV 压缩省了多少显存,却没人追问压缩窗口的边界效应会系统性扭曲注意力。所谓「抽风」不是玄学,是工程优化埋下的周期性 bug。字节拿 DeepSeek 开刀做研究,既是学术贡献,也难免被解读为竞争叙事——但结论本身值得所有做大上下文的厂商自查。

本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文 →