回收·再入(QEvict)

回收·再入(QEvict)

QEvict 把长上下文 KV cache 从一次性删除改成可恢复的三层管理,在有限内存下让历史窗口有机会重新回到全精度。

0:00 / 3:54
QEvict 把 KV cache 的「删或留」改成三层路由:高重要性窗口保留全精度,中间窗口进入可恢复的低比特层,只有最低分窗口才永久移除。它针对的是一个常被忽略的事实:解码过程中,历史 token 的重要性会随 query 漂移,今天被判定无关的片段,明天可能重新获得注意力。1
这篇论文属于 arXiv cs.LG,并交叉列入 cs.CL;arXiv 的 2026 年 8 月 7 日新列表收录了它,摘要页显示 v1 于 2026 年 8 月 5 日提交。第一作者是 Ayushman Garg,作者单位包括印度理工学院鲁尔基分校的 Mehta Family School of Data Science and Artificial Intelligence,以及印度理工学院德里的 Yardi School of Artificial Intelligence 和电气工程系;论文首页没有单独标出通讯作者。23
歌里把核心数字压进了鼓点:在 32K RULER、Llama-3.1-8B-Instruct、20% KV 预算下,QEvict 的宏平均为 87.6,高于同内存的 Layer-DefensiveKV 86.4,也高于可比量化基线 79.0;它距离 Full-KV 只有 2.4 分。LongBench 的 20% 预算下,Llama / Mistral 分别为 46.4 / 37.8,对应最强同内存 eviction 基线的 44.0 / 37.4;预算压到 5% 时,论文报告的增益扩大到 +9.7 / +4.7。4
听的时候抓住最后一个反转:QEvict 不是免费魔法。当前实现要在路由时重建低比特窗口,并回退到 SDPA 取得注意力分数;用 FlashAttention-2 时,峰值显存从 29.54 GB 降到 20.78 GB,但重建与解量化开销会拖慢吞吐。论文只评估 decoder-only 模型、固定大小连续窗口,尚未覆盖自适应窗口边界。适合早高峰通勤时听:一刀删除的 cache,能不能给旧证据留一条回来的路。4

Fuentes de referencia

  1. 1
  2. 2
  3. 3
  4. 4

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado