1/4

本周 AI 论文速览:推理编辑、文档视觉、证据约束与智能体持续学习

本期精选 2026 年 7 月 13 日至 19 日提交的 4 篇 AI 论文,沿着推理可编辑、文档原生视觉、证据约束和智能体持续学习四条研究线,快速看懂它们把问题往前推进了哪一步。

本期按 2026-07-13 至 2026-07-19 的固定周窗口筛选 4 篇新提交论文。它们都在处理同一个实际问题:怎样让模型的中间过程更能被人改、被证据约束,或者跨阶段继续变好。

01 推理过程,也能直接改

Deep Interaction 把用户反馈放进已经展开的 Chain-of-Thought,而不是只在最终答案后补一句评价。用户可以直接编辑原始 CoT,系统用文本差异检测识别改动,再把编辑结果整理成 Feedback-CoT;论文还比较了强调编辑、删减冗余、移除后续错误传播内容和数字去词汇化等处理方式。1
在 ScienceQA、STEM20K、Gaokao-MM 和 LogicQA 等任务上,论文报告校正成功率相对基线提升超过 25%,Token 使用量约减少 40%。1
它把「人怎么纠正模型」从对话末端移到了推理中间:反馈不再只是下一轮提示词里的意见,而是直接修改一条可见的推理轨迹。

02 文档不是普通图像

文档 AI 的难点不止是认出字,还包括字形、笔画、公式和版式。MonkeyOCRv2 用 1.13 亿张、覆盖 17 种语言的 MonkeyDoc v2 语料训练视觉基础模型,同时做图像到文本生成和像素级文档重建,让视觉表示保留文档自身的细节。2
在 CRNN 文字识别实验中,总体准确率从 58.7% 提升到 67.3%;在 MDPBench 上,MonkeyOCRv2-Parsing 达到 83.3%,比此前最佳开源模型高 2.8%,视觉编码器规模约小 11 倍。2
这条研究线的切入点很明确:不再把文档当成自然图像的一个子集,而是把字符和版式细节写进预训练目标。

03 让模型少背一点事实

Knowledgeless Language Models 选择改造预训练信号,而不是改模型架构。训练时先把语料里的命名实体替换成占位符,推理时对输入和上下文做同样的匿名化,生成后再恢复实体名,借此削弱模型对实体事实的参数化回忆,让它更依赖当前上下文和检索证据。3
在 2.5B tokens 的设置下,SmolLM-1.7B 的 FEVER 从 86.9 提升到 94.7,HaluBench 从 64.3 提升到 74.7;在检索增强问答中,10B tokens 设置下的 TriviaQA 从 52.8 提升到 63.4。3
它把「减少幻觉」的着力点从输出过滤前移到训练阶段:模型不必先把所有实体事实背进参数,才能学会根据证据作答。

04 优化收益,会不会复利?

Do Agent Optimizers Compound? 没有只看一次 benchmark 的最终分数,而是在 Terminal-Bench 2.0 上分成 Phase 1 优化、未见任务迁移和 Phase 2 再优化,比较 GEPA、Meta Harness 与 RELAI-VCL 的长期表现。4
结果说明,优化器的收益并不自动延续:GEPA 的 Phase 1 达到 70.8%,但迁移到未见任务时降到 54.5%,低于基线的 56.8%;Meta Harness 的迁移分数是 68.2%,第二阶段再优化后却降到 59.1%。RELAI-VCL 同时拿到 72.7% 的迁移分数和 77.3% 的最终分数,终身平均为 76.4%,基线为 58.7%。4
贡献位置在评测口径:Agent harness 不该只回答「这次能拿多少分」,还要回答「换任务后能否迁移,继续优化会不会忘掉已经学会的东西」。
四篇论文放在一起看,研究对象都从最终答案往中间过程移动:推理轨迹可以被编辑,文档视觉可以保留细节,事实记忆可以让位给证据,Agent 优化也要经得起跨阶段检验。

相似内容

评论

登录后可发表评论。