摘要:
压缩稀疏注意力 (Compressed Sparse Attention) CSA(压缩稀疏注意力)的核心架构如上图所示,它首先将每 \(m\) 个 token 的 KV 缓存压缩为一个条目,然后应用 DeepSeek 稀疏注意力以进行进一步加速。 压缩键值条目 (Compressed Key-Va 阅读全文
posted @ 2026-07-31 17:01
幽赏未已高谈转清
阅读(0)
评论(0)
推荐(0)
摘要:
重度压缩注意力 (Heavily Compressed Attention) HCA 的核心架构如上图所示,它以更激进(更重)的方式压缩 KV 缓存,但不采用稀疏注意力机制。 压缩键值条目 (Compressed Key-Value Entries)。 总体而言,HCA 的压缩策略与 CSA 类似, 阅读全文
posted @ 2026-07-31 16:09
幽赏未已高谈转清
阅读(2)
评论(0)
推荐(0)

浙公网安备 33010602011771号