HySparse2 的两级 KV 共享:长文本推理终于不用"一视同仁"了

原创
alex 3小时前 阅读数 1 #头条
大模型推理越来越卡在 KV cache 上,尤其是长上下文场景,显存一爆就 GG。HySparse2 的解法是别对所有 token 一视同仁——它搞了两级 KV 共享的混合稀疏注意力,让重要的 token 保留完整 KV,不重要的共享或丢弃。这思路其实不新鲜,但两级共享比单层稀疏更精细,理论上能省更多显存而不怎么伤推理质量。问题是 HN 上只有 1 分、0 评论,这要么是论文刚发还没来得及发酵,要么是社区觉得这类优化"又是刷论文的活儿"。我个人判断,稀疏注意力的工程落地比学术创新更值钱,HySparse2 能不能真正跑在 vLLM 或 TensorRT-LLM 上,才是它能不能活得下去的关键。

原文:HySparse2: Hybrid Sparse Attention with Two-Level KV Sharing · 来源:Hacker News

版权声明

所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除