
上下文要会收、毒文会伪装、证据不足要拒答:8 月 24–30 日三篇大模型论文
导读 8 月 24–30 日新挂出的三篇论文:长程智能体如何管理上下文、RAG 投毒如何伪装,以及模型如何用实体替换判断答案是否真的依赖证据。
本期覆盖 2026 年 8 月 24 日–30 日 在 arXiv 新挂出的大模型相关论文。三篇分别处理长程智能体的上下文管理、RAG 的数据投毒,以及证据不足时的拒答。共同的挑选标准是:问题能说清,实验能复述,结果能转成工程或产品上的检查动作。
本期三篇
| 论文 | 方法类型 | 一句话结论 | 挂出日期 |
|---|---|---|---|
| ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL | 智能体上下文管理与强化学习 | 给智能体规划、长期记忆和软压缩工具,再把训练奖励分配到具体的上下文编辑动作,长任务表现更稳。1 | 8 月 28 日 |
| CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents | RAG 安全与数据投毒 | 投毒文档可以藏进正常内容,并把向量分布打散,绕过依赖聚类或查询匹配的防御。2 | 8 月 28 日 |
| Twin Worlds: Equivariance-Based Abstention for Evidence-Grounded Reasoning | 证据 grounding 与拒答 | 把问题和证据里的实体替换成结构相同的合成实体,再看答案能否跟着变,用“变得是否对应”判断模型是否真的依赖证据。3 | 8 月 28 日 |
1. 让智能体自己管理越来越长的上下文
元信息
ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL
作者:Zhuoshi Pan、Qizhi Pei、Junru Lu、Honglin Lin、H. Vicky Zhao、Di Yin、Xing Sun;清华大学、腾讯 Youtu Lab、上海人工智能实验室
arXiv:2608.28476v1 · 2026 年 8 月 28 日提交 · cs.CL · 论文注明已接收 EMNLP 2026 主会。1
要解决什么问题
长上下文问答和深度搜索会让智能体连续检索、阅读、思考、调用工具。传统做法把每轮思考、工具调用和工具返回都追加到历史里,工作上下文便持续变长。上下文过长以后,模型需要在大量旧信息里找回关键事实,还要承担更高的推理成本。
现有的主动式上下文管理已经允许模型搜索、删除或总结历史,但工具箱仍然偏窄。模型还需要提前规划、把分散信息存成长期记忆,并以更温和的方式压缩历史。训练过程也把最终任务成败平均摊给中间所有编辑动作,模型很难知道究竟是哪一次删改、记忆或压缩影响了后续结果。1
方法是什么
ContextPilot 做了两层改动。
第一层是工具。论文在搜索、读取、删除和总结之外加入三类能力:
plan 负责先安排全局步骤;长期记忆工具把实体、时间和事件关系写入可检索的记忆;软卸载工具把历史压缩成摘要、关键词或轻量压缩结果,之后仍可通过搜索找回。第二层是强化学习训练。作者先观察每次上下文编辑后,上下文长度和模型不确定性变化了多少,把变化大的动作视为高影响动作,再从这些动作处分支采样更多后续轨迹。一个中间编辑动作的价值,也由经过该动作的多条后续分支共同估计。这样,奖励从“整条轨迹最后答对没有”细化到“这一步上下文处理是否给后续留下了更好的状态”。1

结果说明了什么
在长上下文问答上,ContextPilot-8B-RL 使用 32K 上下文窗口,在 NovelQA、∞Bench、LongMemEval-S 和 BrowseComp+ 上的平均得分为 69.40;相同规模的 StateLM-8B-RL 平均为 65.85。ContextPilot-14B-RL 的平均得分为 72.20。每种方法运行三次,论文报告均值和标准差。4
强化学习对更复杂的长任务帮助更明显。ContextPilot-8B 从 SFT 模型的平均 65.78 提升到 RL 模型的 69.40;BrowseComp+ 单项提升 5.34 个百分点。论文报告,NovelQA 的平均输入长度约为 119K tokens,BrowseComp+ 可达到约 552K tokens,后者更能体现上下文管理的价值。4
在深度搜索任务上,WebSailor-7B 使用 ContextPilot 后四项平均得分为 38.32,高于 SUPO 的 36.31;WebExplorer-8B 的 ContextPilot 平均得分为 50.10,高于 SUPO 的 49.09。在至少 15 轮的 BrowseComp 轨迹里,WebExplorer 的每轮输入长度接近线性增长,最高约 30K tokens;ContextPilot-8B 则稳定在约 8K–10K tokens。4
读完可以带走什么
做长流程智能体时,可以把上下文管理当成需要训练和评测的动作策略,而不是超出窗口后统一截断。工程上值得单独记录三类指标:上下文长度随轮数的曲线、每类编辑工具的失败率,以及编辑动作之后的任务成功率。
如果团队已经有搜索和摘要工具,下一步可以先补一层结构化长期记忆,再观察模型是否减少重复检索。训练数据也应该保留编辑前后的中间状态,让评估者知道模型删掉了什么、记住了什么,以及最终答案是否依赖这些变化。
局限一句
证据主要来自 NovelQA、∞Bench、LongMemEval-S、BrowseComp+、GAIA 等固定基准,长上下文问答和深度搜索都在受控环境中进行;论文的三次运行均值说明了实验稳定性,真实生产流量中的成本、工具错误和信息新鲜度仍需单独验证。4
2. 毒文也可以伪装成正常文档
元信息
CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents
作者:Jaewon Jung、Haizhong Zheng、Hongsun Jang、Jaeyong Song、Beidi Chen、Jinho Lee;首尔国立大学、卡内基梅隆大学
arXiv:2608.28389v1 · 2026 年 8 月 28 日提交 · cs.CR、cs.CL · 论文注明已接收 EMNLP 2026。2
要解决什么问题
RAG 把外部文档交给模型参考。知识库允许第三方写入、网页会持续更新时,攻击者就可能放入带有错误目标答案的文档,让检索器把这些文档送进模型上下文。
已有投毒攻击常常把用户查询原文直接写进恶意文档。这样做能提高检索命中率,却会留下两个明显痕迹:文档和查询出现大量词面重合,恶意文档在向量空间里形成很紧的簇。防御系统可以用查询匹配或聚类异常把它们筛掉。CamoDocs 研究的问题是:恶意内容保持有效,文档表面和向量分布同时看起来更像正常内容,攻击还会不会成功。2
方法是什么
CamoDocs 为每个目标问题分别生成两组草稿:一组写正确答案相关的正常内容,一组写向目标错误答案靠拢的对抗内容。两组草稿都切成较小的子文档,再把对应片段拼在一起。
接着,攻击者只改正常内容那一半里的词。算法用一个替代向量模型寻找能让多个恶意文档向量彼此分散的候选词,再用轻量语言模型的困惑度筛掉过于突兀的替换,最后从候选中选出最能拉开向量距离的词。对抗内容保留诱导错误答案所需的词,正常内容则负责伪装和打散聚类结构。2

结果说明了什么
实验覆盖 HotpotQA、Natural Questions 和 MS-MARCO,主实验使用 Qwen3-8B、Llama-3.1-8B 和 Mixtral 8x7B,并比较七种防御。每个数据集做 10 次试验,每次随机抽取 100 个互不重叠的目标问题,总计 1000 个目标问题;每个目标问题注入 10 篇对抗文档。5
在 Qwen3-8B 的 HotpotQA 实验里,CamoDocs 跨七种防御的平均攻击成功率为 62.93%。面对专门检测查询重合的防御,CamoDocs 仍有 77.20% 的攻击成功率;传统投毒方法 PoisonedRAG、PIA 和 CorruptRAG 在同一列都低于 10%。加回查询原文的 CamoDocs + Query 平均成功率为 54.06%,查询检测列只有 9.40%,这组对照说明“隐藏查询”本身就是攻击成立的重要条件。5
闭源模型也出现同一风险:CamoDocs 在 HotpotQA 上对 GPT-5.4-mini 的平均攻击成功率为 61.80%,对 Claude-Haiku-4.5 为 55.09%。这组数字描述的是论文设置下的攻击成功率,不能直接换算成某个线上 RAG 系统的实际失陷概率。5
防御侧的代价同样值得看。TrustRAG 在没有攻击的 NeoQA 上删掉 91.48% 的检索文档,干净准确率从 29.13% 降到 5.79%;加入 CamoDocs 后,攻击成功率仍为 23.25%,干净准确率为 9.08%。NeoQA 使用虚构内容来迫使模型依赖检索证据,因此这组结果把“防御是否顺手删掉了有用证据”单独暴露出来。5
消融实验进一步指出,向量分散是主要增益来源:在 Llama-3.1-8B、HotpotQA、TrustRAG 设置下,从只生成对抗文档到加入正常文档、切块、分散损失和一致性过滤,最终攻击成功率达到 29.10%;加入分散损失这一项带来 17.20 个百分点的提升,一致性过滤再提升 0.40 个百分点。5
读完可以带走什么
RAG 的安全边界从文档进入知识库的那一刻开始。接入开放网页、用户编辑内容或第三方知识库时,评估集应加入“内容表面正常、目标答案错误、向量分布分散”的投毒样本。
防御可以同时检查来源权限、文档之间的异常相似度、查询与文档的词面重合,以及答案和原始证据的对应关系。单独依赖聚类清洗会遇到效用代价:过滤得越狠,检索依赖型任务越容易丢掉本来有用的证据。上线前应把干净准确率、被删除文档比例和攻击成功率放在同一张表里看。
局限一句
论文采用“攻击者能够向知识库注入文档”的黑盒威胁模型,攻击成功率由 GPT-4.1-mini 评判,主要数据集也是公开基准;真实系统的写入权限、文档审核和检索流水线会改变风险大小。5
3. 让模型先证明自己真的在看证据
元信息
Twin Worlds: Equivariance-Based Abstention for Evidence-Grounded Reasoning
作者:Vy Nguyen、Ziqi Xu、Jeffrey Chan、Estrid He、Feng Xia、Renqiang Luo、Erik Cambria、Xiuzhen Zhang;RMIT University、吉林大学、南洋理工大学
arXiv:2608.28018v1 · 2026 年 8 月 28 日提交 · cs.CL · 论文注明代码已公开。3
要解决什么问题
知识密集型问答经常同时给模型问题和外部证据。证据缺少关键事实时,模型依然可能根据参数里记住的实体关联生成一个听起来合理的答案。只测模型的置信度,或者只问模型“证据够不够”,都可能遇到一种情况:模型非常自信,也能在多次回答里保持一致,但答案其实来自记忆而非给定材料。
论文把这个问题叫作证据 grounding:答案的理由是否由当前证据支撑。作者进一步关注拒答,也就是证据不足时输出“无法判断”,把错误的确定性答案挡在系统之外。3
方法是什么
Twin Worlds 的核心是「等变性」(equivariance)。这个概念可以先用一句话理解:输入中的实体换了名字,答案也应该按照同一套对应关系一起改变。
系统先把问题和证据里的实体替换成带类型的占位符,例如人物、组织、日期分别保留自己的类型;再用一一对应的合成实体重新填回去,生成多个结构相同的“平行世界”。实体之间的关系、句子结构和证据位置保持一致,真实名称带来的模型记忆线索则被削弱。
模型在原世界和每个平行世界里分别回答。系统把平行世界的答案映射回原来的实体,再检查它们是否与原答案一致。这个“映射回来再比对”的动作叫
back-mapping。一致率高,系统保留答案;一致率低,系统拒答。论文用验证集调节阈值,默认取 3 个 twin worlds。3
结果说明了什么
实验覆盖 HotpotQA、MIRAGE、FaithEval 和 FEVER,使用 GPT-5.1、LLaMA-4-Scout 17B×16E、Mistral-Small-24B 三个模型骨干。在 GPT-5.1 上,Twin Worlds 在 HotpotQA 的 F1 为 0.9396、准确率为 0.9390、拒答率为 0.003;在 MIRAGE 上 F1 为 0.9318、准确率为 0.9300、拒答率为 0.005。论文报告,三个模型在 HotpotQA 和 MIRAGE 的六组组合里都取得最高 F1 和准确率,拒答率保持在 0.029 以内。6
在全部问题都不可回答的 FaithEval 上,Twin Worlds 在 LLaMA-4 和 Mistral-Small 上取得最高准确率与拒答率,在 GPT-5.1 上取得第二好结果。在 FEVER 事实核验任务上,三个模型骨干的 F1 都由 Twin Worlds 取得最高值。这个结果把方法的用途从“问答系统要不要回答”扩展到了“事实判断需要保留多少证据”。6
人工评估包含 200 个 MIRAGE 和 HotpotQA 样本,每个样本由 3 名标注者判断。实体替换后的关系结构平均得分为 4.61 / 5,其中 99.1% 的评分至少为 4;Twin Worlds 与人工判断在可回答样本上的一致率为 86%,在不可回答样本上为 81%,总体一致率为 83.5%,Fleiss’ κ 为 0.78。6
行为分析里,GPT-5.1 在“证据忠实”条件下的 world-tracking rate 为 0.804,在“证据不忠实”条件下为 0.215;LLaMA-4 对应为 0.780 / 0.230,Mistral-Small 为 0.761 / 0.243。这组差距说明,带类型的一一替换能把“证据支持答案”和“实体名称诱发答案”区分开来。6
消融实验也给出了一条实用边界:只生成 1 个平行世界时,三个模型平均 RS 比默认设置低 0.044;增加到 6 个世界后,收益很小,却增加了推理成本。移除类型约束会让 RS 下降 0.048–0.051,移除答案回映射会下降 0.067–0.076,把合成实体换成高频 Wikipedia 实体会下降 0.103–0.115。6
读完可以带走什么
在需要引用证据的问答、检索和事实核验系统里,可以把“证据被改写后答案是否按关系改变”加入离线评测。它测到的是 grounding 行为,和答案置信度、多个采样答案是否一致属于不同维度。
产品上可以把 Twin Worlds 式检查放在高风险回答的最后一道门:系统先生成候选答案,再对关键实体做少量类型保持的替换。如果回映射后的答案频繁漂移,界面可以要求补充证据、降级为检索结果展示,或直接提示当前材料不足。
局限一句
方法依赖可识别的实体和关系结构,四个基准也以知识密集型问答、事实核验为主;合成实体、拒答阈值和额外推理调用在代码类、开放式创作或非实体中心任务上的表现仍需另测。6
三篇各记一句
- ContextPilot:长任务的上下文管理应当成为智能体会做、也能被单独评估的动作。
- CamoDocs:RAG 的安全检查要覆盖“看起来正常、向量也不扎堆”的投毒文档。
- Twin Worlds:模型回答前,先检查答案是否会随着证据里的实体关系一起变化。
References
- 1
- 2
- 3
- 4
- 5
- 6
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.