
Memory 技术日报 2026-07-09:TF-Engram、SDM 与会拒绝的 mRAG
本期收录 4 条 memory/context 论文信号:TF-Engram 把短语记忆放进 SSD-backed 推理层级,Sparse Delta Memory 扩大线性 RNN 的显式状态,Transformer 线性化论文拆解固定缓存预算边界,MMAgent-R2 则把 mRAG 推向 rerank/reject 闭环。
7 月 8 日新提交的 memory/context 论文有一个共同变化:研究重点继续从「把更多 token 塞进上下文」转向「把可读写、可路由、可拒绝的记忆机制接进推理路径」。今天最值得看的四条,分别落在外部短语记忆、线性 RNN 显式状态、Transformer 线性化和多模态 RAG 验证上。
速览
| 方向 | 进展 | 时间窗依据 | 可复现状态 | 读者先看什么 |
|---|---|---|---|---|
| 外部短语记忆 | TF-Engram 把短语级语义记忆离线构建后放进 GPU、DRAM、SSD 分层存储,并用 early-exit 预取隐藏外部访问延迟。论文在 Qwen3-0.6B 上报告平均分从 57.6 提到 59.4。arXiv 原文 | arXiv v1 于 2026-07-08 21:19:52(北京时间)提交。arXiv 原文 | 未看到公开代码入口。 | 关注 SSD-backed memory 是否真的能在延迟可控的情况下扩大模型外部知识表。 |
| 线性 RNN 显式记忆 | Sparse Delta Memory 用稀疏读写替换 Gated DeltaNet 的 dense key-value outer product,在相同参数量和 isoFLOP 约束下扩大状态容量;8B 模型 RULER 平均分从 GDN 的 34.2 提到 50.2。arXiv 原文 | arXiv v1 于 2026-07-08 21:17:19(北京时间)提交。arXiv 原文 | 论文 HTML 指向 GitHub,但该仓库当前抓取为 404,暂不可验证。论文 HTML | 关注大状态容量能否补上线性注意力在长上下文召回上的短板。 |
| Transformer 线性化 | Analysis-Driven Transformer Linearization 在冻结 backbone 下分析 softmax attention 的 key-dependent rank-1 正交投影,并用 GDN、SWA、sink tokens、short convolutions 与固定预算 cache routing 逼近长上下文能力。arXiv 原文 | arXiv v1 于 2026-07-09 01:59:09(北京时间)提交。arXiv 原文 | 未看到公开代码入口。 | 关注「固定缓存预算」在多项检索任务上的边界,不要只看 common reasoning 指标。 |
| 多模态 RAG 验证 | MMAgent-R2 在 mRAG 中加入 visual reranking 和 active rejection;在 MMhops 上,8B 版本报告 Bridging 67.2、Comparison 39.8,并称相对基线分别提升 13.2 和 10.4。arXiv 原文 | arXiv v1 于 2026-07-08 21:15:39(北京时间)提交。arXiv 原文 | 未看到公开代码入口。 | 关注 RAG 系统是否有「拒绝当前候选并继续检索」的闭环,而不是只做一次 top-k。 |
1. TF-Engram:把短语记忆放到 SSD 层级里
TF-Engram 的出发点很工程化:如果模型参数、LoRA、RAG 和长上下文都不是低成本扩知识的唯一答案,能不能把短语级记忆做成一个推理时可查的外部表?论文的做法是离线从语料里挖短语,用 Qwen3-Embedding 生成语义向量,再把大表放进 GPU cache、DRAM cache 和 NVMe SSD 三层。1
关键机制是 early-exit guided predictive prefetching:模型在靠近末层的位置提前预测后续 token 分布,据此把可能要访问的短语记忆从 SSD/DRAM 预取到 GPU。这样做的目标不是让外部记忆零成本,而是把访问延迟藏进自回归解码流程里。1
论文报告了几个值得记住的数字:在 Qwen3-0.6B 上,10 个 benchmark 的平均分从 baseline 的 57.6 提到 59.4,参数量匹配的 LoRA 是 58.7;100M-entry 表约 215.86 GB,SSD-backed 100M 表把 GPU memory 从 GPU-resident 10M 表的 24.03 GB 降到 3.06 GB;Top-128 prefetch 下吞吐为 462.4 tokens/s,baseline 是 481.2 tokens/s。1
工程判断:这篇值得做小规模复现,但不要只看平均分。它在 HellaSwag 和 WinoGrande 上不如 LoRA,说明静态 phrase memory 对需要句级语境消歧的任务未必稳定。真正有价值的验证点是:当外部知识表从 1M 扩到 100M entries 时,命中率、预取准确度、SSD I/O 和尾延迟如何一起变化。
2. Sparse Delta Memory:给线性 RNN 更大的显式状态
Sparse Delta Memory 处理的是线性注意力/线性 RNN 的老问题:每 token 计算量固定,但状态太小,长上下文召回会掉。SDM 扩展 Gated DeltaNet,把 dense key-value outer product 换成对大型显式 memory table 的稀疏读写。论文强调,在相同参数和 isoFLOP 条件下,状态容量可以提升多个数量级,而每 token 计算量不随记忆规模线性增长。2
它的机制可以粗略理解为三步:先用 product-key 风格检索选出少量 memory slots,再对这些 slots 做 gated delta write,最后从少量读槽加权汇总。SDM 还使用 learned initial state,把初始记忆本身变成一种参数化记忆。2
论文给出的长上下文结果很直接:RULER 平均分在 1.4B 模型上从 GDN 的 20.0 到 SDM 的 31.2,在 8B 模型上从 GDN 的 34.2 到 SDM 的 50.2;8B 短上下文 average accuracy 从 GDN 的 55.70 到 SDM 的 56.84。代价也写得比较清楚:8B 规模下训练吞吐约比 GDN 慢 1.49x,推理 decode 约慢 10%,但比 Full Attention 快 6x。2
工程判断:这条线索比单纯 KV cache 压缩更像「改模型状态结构」。如果读者做的是长上下文模型架构或自研 serving,这篇值得跟;如果只是在现有 API/RAG 栈上做应用,短期可操作性较弱。需要注意的是,论文 HTML 给出的 GitHub 地址当前抓取为 404,今天不能把它当作已开放代码。
3. Analysis-Driven Linearization:固定缓存预算不是银弹
这篇论文试图回答一个更基础的问题:为什么某些 post hoc linearization 能保住模型质量,某些不行?作者在冻结 backbone 的设置下分析 softmax attention,认为 softmax 中有 key-dependent 的 rank-1 正交投影特征,因此 delta-style 更新比纯 gated accumulation 更接近原始注意力。3
方法组合包括 GDN、Sliding Window Attention、sink tokens、short convolutions 和 fixed-budget cache routing。论文里一个代表性配置是 64-token cache,其中包含 56 个滑窗 token 和 8 个 sink tokens;更大的 128-token cache 能继续改善 MMLU。3
定量上,纯线性替换会严重掉分。加入 SWA 和 sink tokens 后,LLaMA3.1-8B 上 GDN 的 MMLU 到 58.88,Qwen3-8B 到 70.97;再加入 short convolution 后,分别到 59.17 和 71.10。LLaMA3.1-8B 的 128-token cache 版本 MMLU 到 63.22。3
工程判断:这篇的价值不是「线性注意力已经追平 full attention」,而是把常见补丁的作用拆开了。固定预算 cache routing 对 common reasoning 有帮助,但论文也承认它在需要多个独立记忆项并行检索的 RULER/S-NIAH 类任务上仍有限。对 memory 系统来说,这正是风险点:缓存预算如果不能根据内容自适应,长上下文检索会先撞到多值召回问题。
4. MMAgent-R2:RAG 需要会拒绝的检索循环
MMAgent-R2 面向知识库视觉问答里的多模态 RAG。普通 mRAG 常先取一个固定候选池,再让后续模块在这个池子里过滤;如果第一轮检索把相似但事实不匹配的实体放进来,错误会一路传到答案。MMAgent-R2 加了两件事:visual reranking 直接比较查询图像和候选图像,active rejection 在候选不可信时拒绝当前结果并继续检索。4
训练上,论文用 GRPO 联合优化外部检索、内部验证和答案生成,并设计 outcome reward、format reward、verification reward。实现细节里,图像检索用 EVA-CLIP-8B 和 Faiss-GPU,默认 Top-K=5;文本检索用 E5,Wikipedia 被切成 800 字符 chunks。4
结果上,MMAgent-R2-7B 在 InfoSeek overall 报告 50.2%,MMAgent-R2-8B 在 E-VQA Single-Hop/All 报告 55.9%/54.2%;MMhops 上,8B 版本 Bridging 67.2、Comparison 39.8,论文称相对基线分别提升 13.2 和 10.4。消融结果显示,只加 rerank 会提升实体识别和 VQA 准确率,再加 reject 继续提升。4
工程判断:这篇对普通文本 RAG 也有启发。很多线上 RAG 失败不是生成器不够强,而是系统没有「候选全错时重新找」的动作。把 reject 作为可训练、可计费、可观测的步骤,比继续堆更大的 top-k 更接近生产系统需要的闭环。
工程判断
今天四条线索指向同一个结论:memory 系统正在分层。模型内部有 SDM 这类显式状态,模型外部有 TF-Engram 这类短语记忆表,注意力替代方案开始关心固定预算 cache routing,RAG 则从一次性检索走向 rerank/reject 循环。
如果只选一条跟进,工程团队可以先看 TF-Engram 和 MMAgent-R2。前者给了外部大表接入推理路径的系统账,后者给了 RAG 候选验证失败后的动作设计。Sparse Delta Memory 和 Transformer linearization 更偏模型结构,需要等代码、训练配方和更完整复现出来再判断投入。
Related content
- Sign in to comment.
More from this channel›
- Memory 技术日报 2026-07-15:LMCache 回收 IPC KV、vLLM 拆分读写监控
- Memory 技术日报 2026-07-14:KVeXpress、Oracle LangGraph 与 Rapid-MLX
- Memory 技术日报 2026-07-13:SGLang Omni、Triton Kernel Lab 与 RISWIS
- Memory 技术日报 2026-07-12:PKAS、Graphify 与 LiteLLM 网关压缩
- Memory 技术日报 2026-07-08:CompactionRL、KVpop 与记忆注入防线
- Memory 技术日报 2026-07-07:DPD、RAG 验证与 LLM Wiki
- Memory 技术日报 2026-07-06:可编程 KV、legal-kb 与代码图谱 MCP
- Memory 技术日报 2026-07-05:MemMachine、ReContext 与 CheckRLM
