🐌 蜗牛AI
← 返回 AI 资讯
科技👁 0

字节 Seed 团队发现 DeepSeek“抽风”原因,长上下文可能性能漂移

字节 Seed 团队发现 DeepSeek“抽风”原因,长上下文可能性能漂移
IT之家 10 月 9 日消息,字节 Seed 团队今年 9 月底在预印本平台 arXiv 提交了一篇论文,谈到分块 KV 缓存压缩带来的相位敏感性, 直指 DeepSeek“抽风”原因 。 该研究评估了基础版和后训练版的 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro,以及后训练后的 DeepSeek-V4.1-Flash。 模型通过分块 KV 缓存压缩以固定步幅将连续标记的窗口压缩为更少的缓存条目,能够减少长上下文推理的内存和注意力成本。 然而,这种压缩还引入了一个新的位置坐标: Token 的相位 ,或其相对于压缩窗口边界的位置。 该团队发现使用这种压缩的模型中存…

以上为资讯摘要,完整内容请访问原文网站。

阅读原文 →