修过就放水,毒文仍会信,缺事实就编:8 月 11–17 日三篇大模型论文

修过就放水,毒文仍会信,缺事实就编:8 月 11–17 日三篇大模型论文

覆盖 8 月 11–17 日 arXiv:检查—修复会话如何让检查器变松、推理模型能否扛住毒文 RAG,以及编码智能体缺事实时为何硬编。

本期覆盖 2026 年 8 月 11 日–17 日 在 arXiv 新挂出的大模型相关论文。从中挑了三篇:一篇看「检查—修复」流水线会不会让检查模型越查越松,一篇看推理型模型能不能扛住被投毒的检索文档,一篇看编码智能体缺了关键事实时会不会硬编。
挑选标准只有三条:问题能说清楚、实验设计能复述、结论对工程师或产品决策有直接含义。

本期三篇

论文一句话挂出日期
Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency上下文里刚经历过一次「查错—修好」,同一条检查请求上的误报会系统性下降8 月 17 日
Towards Safer RAG: Only Agents Capable of System 2 Thinking may Access Untrusted Documents普通聊天模型会「看出毒文却仍受影响」;带深思的推理模型更扛得住8 月 17 日
The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks仓库级改码成败,取决于编辑当下能不能拿到耦合事实;缺了就编,而不是停8 月 17 日

1. 刚查过并修好,检查模型会变松

Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency Parsa Mazaheri、Kasra Mazaheri arXiv: 2608.16003 · 2026-08-17 提交 · cs.AI / cs.CL

要解决什么问题

很多自动流水线会让一个语言模型当检查器(verifier),再让同一个或另一个模型当修复器。对话历史里往往已经躺着上一轮的「指出错误 → 给出修正」。作者问:这种接线本身,会不会改变检查器对当前这条请求的判定?
他们只测误报(false alarm):把人标为「全程正确」的解题轨迹再拿给模型查,只要模型还报错,就是误报。

方法是什么

  • 数据来自 ProcessBench:主实验用 929 条「全步骤正确」轨迹测误报,另有 929 条带标注错误的轨迹测检出能力;来源包括 GSM8K、MATH、OlympiadBench、OmniMath。
  • 当前待查题目字节级完全相同;差别只在上下文里是否先放一段已完成的「审计 → 修复」片段。
  • 对照是等长、非审计的填充文本,避免「多塞了字」本身造成差异。
  • 主结果保留通过灵敏度筛选的三款开源模型:Qwen3.6-27B、Qwen3.6-35B-A3B、Ministral-3-14B-Instruct-2512;每条样本采 8 次(温度 0.7)。
  • 用信号检测论拆开:是更会区分对错(d′),还是更不愿举手报错(判定阈值 c)。1

结果说明了什么

方向很稳:在 15 / 15 组「模型 × 措辞」组合里,先验的审计—修复片段都让误报下降,相对等长对照少 2.8–11.5 个百分点,约合 9%–25% 的相对降幅。
主措辞 F1 上的绝对变化:
模型误报变化
Qwen3.6-27B−4.00 pp
Qwen3.6-35B-A3B−3.59 pp
Ministral-3-14B−8.83 pp
更反直觉的是:若那段先验片段里审计判错了(标了不存在的错误,再「修好」),在 Ministral-3-14B 上误报会再降一截(F1 上相对正确审计再降 5.62 pp),五个措辞全为负。这和「上下文越负面,模型越爱挑刺」的常见预期相反。1
信号检测侧:判定阈值 c 在 15/15 组合里都往「少报错」挪,家族校正后仍有 13/15 存活;d′ 的变化无一过校正关(d′ 检验本身灵敏度约为 c 的一半,作者也写明了)。人工抽查 50 条基线误报,约 82% 属于明显判错,所以在这个工作点上,变松未必有害。
开推理模式后,相对降幅仍在(两款 Qwen 约 −17.5% / −19.7%),阈值解读也还成立。

读完可以带走什么

如果你在做「LLM 查、LLM 修」的代码审查、数学批改、内容质检:
  1. 不要默认检查器对当前样本独立。 同一会话里刚修过一轮,阈值会系统性变松。
  2. 评测要把会话状态算进去。 只测冷启动单条,会高估上线后的严格度。
  3. 需要稳定严格度时,换干净上下文或固定判定规则,别指望模型自己保持同一条线。
局限:主结论针对「会对措辞起反应」的开源检查器;Gemma-4-31B 上方向甚至反号。错误审计再降误报的效应,主要在 Ministral 上五个措辞都站住。任务家族是数学过程检查,闭源大模型未测。

2. 只有会「慢想」的代理,才该读不可信文档

Towards Safer RAG: Only Agents Capable of System 2 Thinking may Access Untrusted Documents Mehrdad Ghassabi arXiv: 2608.17153 · 2026-08-17 提交 · cs.CL

要解决什么问题

检索增强生成(RAG)会把外部文档塞进上下文。文档一旦被投毒,模型答案就可能跟着偏。更麻烦的是:模型有时已经标出文档有问题,最终答案仍被带偏——监控到了,控制没跟上。
已有工作提出 Cordon 原则:负责最终作答的模型干脆不看原始证据,只看受控摘要。有效,但隔离成本高。本文改提一条更可落地的原则:只有具备审慎「系统 2」推理能力的代理,才允许直接接触不可信文档;只会联想匹配的「系统 1」代理继续隔离。
这里的系统 1 / 系统 2借用认知科学习惯说法:前者偏快速联想,后者偏逐步核查。

方法是什么

作者故意用朴素投毒,而不是优化攻击:
  1. 先生成正确答案;
  2. 写一句与之矛盾的话;
  3. 扩成约 500 词连贯假文档;
  4. 用评判模型确认文档确实在传错误信息。
两个核心指标:
  • Cordon Rate(C):在有效样本上,模型既检出了误导信息、最终答案又仍被影响的联合比例。
  • Contamination Rate(T):明确要求「忽略全部检索文档、只靠参数知识」时仍被毒文带偏,而「不给检索」时又没被带偏——用来剥离模型本来就有的错误先验。2
对比 DeepSeek-Chat(标准对话)与 DeepSeek-Reasoner(推理增强)。检索题来自 BEIR 子集 SciFact、FiQA、MS-MARCO,各取初始 40 条查询。评判用 Gemini 2.5 Pro,且全部人工复核。温度 0.1。

结果说明了什么

指标 / 数据DeepSeek-ChatDeepSeek-Reasoner
Cordon Rate · SciFact0.1750.000
Cordon Rate · FiQA0.0250.000
Cordon Rate · MS-MARCO0.0000.000
Contamination Rate · SciFact0.2500.100
Contamination Rate · FiQA0.1000.000
攻击成功率 · SciFact0.2650.154
知识密集的科学事实验证(SciFact)上差距最大:普通对话模型会「看出毒仍受影响」;推理模型把这条 Cordon Rate 压到 0,Contamination Rate 也从 0.25 降到 0.10。开放域问答(MS-MARCO)上两者都接近 0——监控—控制缝隙主要出现在难、靠知识的题上。2

读完可以带走什么

做企业知识库、客服 RAG、内部文档问答时:
  1. 别默认「模型会标出不可信 → 就不会用它」。 标出和采纳是两回事。
  2. 不可信或外网检索,优先交给会逐步核查的推理模型;便宜的快速模型继续只看受控摘要。
  3. 评测要拆开「检出」和「是否仍被影响」,只报准确率会漏掉监控—控制缝隙。
局限:每数据集约 40 查询、两款 DeepSeek 对照、投毒故意朴素;复杂优化攻击、多代理协作下的缝隙是否同形,原文没有证明。作者也把「真正获得系统 2」写成仍待解决的方向。

3. 编码智能体的工作集:缺的不是记忆力,是事实是否在场

The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks Bardia Mohammadi、Lars Klein、Aman Chadha、Akhil Arora、Laurent Bindschaedler arXiv: 2608.16630 · 2026-08-17 提交 · cs.SE / cs.AI / cs.LG

要解决什么问题

仓库级改码要求测试、import、配置、迁移规则在有限上下文里保持一致。作者把任务看成一张耦合事实图:改一处时,需要的原子事实要么来自近期上下文,要么来自模型参数记忆;两边都没有的,就是一致性债务(coherence debt)。
核心问题:成败到底看「事实离编辑有多近」,还是看「编辑当下事实在不在」?

方法是什么

  • 虚构 API 迁移:4 套手写迁移(Rust / Go / Python / JavaScript),各 12 条机械可检要求;闭卷时隐藏工作区与工具。
  • 真实库对照:Pydantic v1→v2(79 测),再做改名孪生版,专门打掉模型背过的 API 记忆。
  • 工具智能体语料:Claude Code、Codex CLI、Aider、OpenHands 等,122 次配对试验。
  • 合成耦合任务:多文件共享随机字面量;按 motif 扣掉秘密文件,精确控制「缺几个事实」。
  • 外部效度:SWE-bench Verified 上 100 实例、多模型/脚手架,共 397 次可计分轨迹。3

结果说明了什么

通道可以互换,空两边就不行。
  • 闭卷、未见过的 API:0 / 154 次完成迁移(Wilson 95% 上界约 2.4%)。
  • 把变更说明与源码前置进提示:匹配试验 299 / 300 达到 ≥9/12 要求,213 / 300 全过 12 条。
  • 真实 Pydantic 闭卷:多数试验卡在同一批 53 / 79 测(Jaccard = 1.000);改名后七个家族 66 / 70 次又齐刷刷卡在同一批 24 / 79 测——记不住新名字时,失败位置高度一致。
扣掉事实的代价是相加的,距离几乎无关。
  • 8 个 motif 扣掉 m 个,通过测数贴近线性:32 → 24 → 16.7 → 8.0 → 0.0。
  • 把事实放到离编辑点 12.8 万 字符(工具场景)或 20 万 字符(闭卷)处,成功率仍平;同一事实不给,任务直接塌。机制是在场,不是邻近
脚手架烧 token 差一个数量级,也救不回被扣的事实。
  • 六种配置、三种任务规模下,144 次试验全过测时,累计输入 token 从约 29.4 万375 万(约 12.8×),单轮峰值上下文只差约 1.8×
  • 故意扣 0 / 4 / 8 个事实:各配置都从约 100% → 50% → 0%;Haiku 花约 573 万 token 也只到 Opus 约 46 万 token 就能到的 100%,事实被扣时多烧也补不回来。3
缺事实产生的是错误劳动,不是空白。
  • 文件被删后,智能体常自建文件、编造取值继续干。
  • 会不会主动说「卡住」取决于模型:同一 Claude Code 脚手架上,Opus 8 / 8 报告阻塞,GPT-5 / Codex CLI 0 / 8
  • 规范与代码冲突时,两脚手架 39 / 39 次跟规范走——哪怕规范规定的是更差写法。过期规范比没有规范更糟:正确规范 → 100% 选更好写法;无规范 → 33%;过期规范 → 0%(3,385 次判定)。
在 SWE-bench 上,用「最近读过邻域」估工作集几乎等于瞎猜(AUC ≈ 0.49):热门仓库里参数记忆能顶读文件,读操作不再预测成败。

读完可以带走什么

做编码智能体、迁移助手、多文件重构时:
  1. 写代码的那一刻,把本编辑依赖的事实塞进有效上下文(提示、工具返回、摘要都行);别假设「刚才读过」就还在。
  2. 用产物对账,而不是用读文件次数。 智能体会编文件把「缺口」填上,读操作仪表会失明。
  3. 过期规范文件比没有更危险——会压过现场代码。
  4. 别指望加预算、换更贵脚手架自动补回缺失事实;先保证事实在场。
局限:主负载偏迁移型;虚构任务去掉直接 API 暴露,仍可能留下通用编程先验。SWE-bench 上作者明确不宣称一致性债务能预测解题率。冲突来源试验 n=39,置信区间下界仍宽。

三篇放在一起看

三篇分别落在检查流水线行为、检索安全、编码系统三条线上,没有共同的「这一周统一结论」。若你只记三句话:
  1. 检查—修复会话会让检查器阈值变松——严格度要按会话状态评,不能只测冷启动。
  2. 标出毒文 ≠ 不被毒文带偏——不可信文档优先给会逐步核查的推理模型。
  3. 编码智能体缺的是编辑当下的耦合事实——缺了就编;多烧 token 也换不回被扣掉的事实。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content