
AI 论文早报|8 月 3 日:先选证据再计算,5 篇论文把长上下文、视觉推理和 oncall 变成受控步骤
精选 5 篇 arXiv 新论文,比较视觉检索、工具调用、物理世界模型、长上下文记忆和 on-call 代理评测如何把昂贵计算留给真正需要的证据。
截至 8 月 3 日 07:00,arXiv 的
new 页面最新日期组仍是 2026 年 7 月 31 日,没有出现 8 月 1—2 日的新提交日期组。1 本期从这一批次中选取前几期未覆盖的 5 篇论文;它们的共同问题不是把模型再做大一点,而是先决定该看哪些证据、调用多少工具、保存哪一层表示,再把昂贵计算留给真正需要的部分。今日看点
- 视觉检索:ReToken 只增加一个可学习 token,在 Visual Haystacks 上让 Qwen3VL-8B 提升 13.4 个百分点;在长视频 LVBench 上零样本提升 8.0 个百分点。2
- 视觉代理:Beacon 不再默认每道题都调用代码,而是用强化学习训练「什么时候该用工具」;在 13 个基准上,Beacon-RL-8B 比 Qwen3-VL-8B-Instruct 的平均成绩高 6.07 个百分点。3
- 物理世界模型:PhiZero 把视频中的状态变化压缩成 256 个离散 physical-language token,再按「先推理、后渲染」生成未来视频;Physics-IQ Verified 的 IQ-Score 为 41.2。4
- 长上下文记忆:CoMem 沿 Transformer 深度切分缓存与重算,在 128k 控制实验中把显存从 89.36 GB 降到 18.26 GB,prefill 加速 7.83 倍。5
- 软件代理评测:ORCA-bench 把代理放进有指标、日志、trace 和源码的 on-call 环境;在最现实的 Medium 任务上,最高 RCA Accuracy 只有 25.3%,Hard 任务降到 10.0%。6
1. ReToken:让视觉模型先找对画面,再回答问题
论文:ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
作者与机构:Yao Xiao、Reuben Tan、Zhen Zhu、Yuqun Wu、Jianfeng Gao、Derek Hoiem;University of Illinois at Urbana-Champaign、Microsoft Research、Google DeepMind。2
提交时间:2026 年 7 月 31 日 01:59(北京时间),arXiv:2607.28627v1。7
原文与代码:arXiv 摘要页;完整 HTML;代码仓库。
问题背景
长图像集合和长视频里的大多数帧都是干扰项。视觉语言模型如果一次处理全部 token,显存和计算会随上下文变大;如果直接照搬语言模型里的 query-key attention 检索,相关视觉信息又不一定会被选出来。作者在 Qwen3VL-8B 上测到,基于 attention 的检索器在 QAEgo4DTest-MC 的平均 Recall@1 只有 5.1%。2
方法要点
ReToken 只向问题中追加一个可学习 embedding,把它训练成「检索目标」。模型先把图像或视频帧写入视觉 KV cache,再用这个 token 与最后一层的 frame mean value vector 做相似度匹配,选出少量相关视觉 token;默认设置下视觉语言模型本体冻结,只训练这个 token 和一个投影矩阵。作者的诊断也很直接:在受控的双图设置中,把目标短语匹配到 value 空间后,Qwen3VL-8B 的 Recall@1 从 65.7 提到 78.0,InternVL3.5 从 78.8 提到 83.8。2
结果亮点
在 Visual Haystacks 上,ReToken 让 Qwen3VL-8B 提升 13.4 个百分点,让 InternVL3.5 提升 12.4 个百分点,论文称相对提升超过 20%;在训练只使用多图问答的前提下,它迁移到长视频 LVBench,并让 Qwen3VL-8B 零样本提升 8.0 个百分点。训练和长视频推理都能放进一张 H100。7
适用边界
这不是一个独立的通用图像检索器,而是嵌在 VLM 自己的 KV cache 里的轻量检索头。它的训练信号来自规模较小的图像问答数据,实验重点也在 Visual Haystacks 与 LVBench;论文同时发现,视觉 token 在写入 cache 时会吸收此前图像的干扰信息,长视频中需要跨帧关联时,过度追求干净的单帧 cache 可能反而带来代价。2
一句话阅读价值
如果你在做长视频 VLM,先看它如何把「检索」放进模型已有的视觉 cache,而不是另起一个外部检索器;真正值得复现的是 value 空间为何比 attention 分数更适合选证据。
2. Beacon:代理首先要学会判断工具是否必要
论文:Beacon: Knowing When and How to Perform Agentic Visual Reasoning
作者与机构:Qixun Wang、Yang Shi、Letian Cheng 等 14 位作者;Peking University、Kling Team、HKUST(GZ)、CUHK、浙江大学、清华大学。3
提交时间:2026 年 7 月 31 日 01:46(北京时间),arXiv:2607.28595v1。8
原文、代码与模型:arXiv 摘要页;完整 HTML;代码;模型。
问题背景
视觉代理的工具调用有一个容易被平均准确率遮住的损失:工具确实能帮助模型解决「只靠文字推理做不出来」的难题,但也可能让原本能答对的简单题多走一步、引入新错误。Beacon 把这个问题拆成两个指标:Mode Adaptiveness 衡量模型是否会按题目难度选择工具,Tool Effect 衡量工具带来的增益是否超过它造成的损害。作者对已有模型的分析显示,许多模型要么几乎总用工具,要么几乎不用;工具在难题上的收益常被简单题上的错误抵消。3
方法要点
Beacon 以 Qwen3-VL-8B-Instruct 为底座,先用合成轨迹做监督微调,让模型具备裁剪、标注、增强、旋转、拼接图像和数值计算等 Python 工具能力,再用 GRPO 做强化学习。Necessity-Aware Adaptive Reward 鼓励模型只在必要时调用工具;Hint-Guided Capability Expansion 则给最难、确实需要工具的样本提供有效轨迹,避免强化学习只学到「多调用」这个表面策略。3
结果亮点
Beacon 在 13 个视觉搜索、空间感知、定量推理和代理任务基准上,拿到开源模型最高平均成绩,并在 13 项中的 11 项排名第一;相对 Qwen3-VL-8B-Instruct,平均提升 6.07 个百分点。在专门分析工具行为的 5 个数据集上,Beacon 的工具可用准确率相对无工具准确率的增益为 +1.96%,Tool Effect 的「增益减损害」为 +3.14%;无工具平均准确率也达到 51.57%,高于基座模型的 49.75%。3
适用边界
「13 项中 11 项第一」是作者在其报告结果上的开源模型比较,不等于超过所有闭源模型;表中 Gemini 3.1 Pro 仍是单独的闭源参照。实验基于 Qwen3-VL-8B、固定的工具接口和作者设计的 13 个基准,工具选择是否能迁移到不同模型、不同代码沙箱和更开放的任务,还需要独立复现。3
一句话阅读价值
这篇论文把「会不会用工具」改写成了「什么时候用工具、用了之后是否净增益」;评估视觉代理时,至少要把这两个问题和总准确率分开看。
3. PhiZero:用 physical language 先预测世界如何变化
论文:PhiZero: A World Model Built Around Physical Language
作者与机构:Shuyao Shang、Yuqi Wang、Ruopeng Gao、Xu Chen、Tieniu Tan、Lue Fan、Zhaoxiang Zhang;中国科学院自动化研究所 NLPR。4
提交时间:2026 年 7 月 31 日 01:59(北京时间),arXiv:2607.28624v1。9
原文与项目页:arXiv 摘要页;完整 HTML;项目页。
问题背景
多数视频世界模型直接在像素或高维视觉 latent 上预测下一段视频,画面可以逼真,但「物体为什么这样运动」仍藏在生成器内部,难以显式推理、控制和迁移。PhiZero 的问题意识更窄:能不能把世界状态的变化单独表示出来,再让视频生成器负责补回外观细节?4
方法要点
PhiZero 学习一种作者称为 physical language 的离散状态转移表示。Physical Language Tokenizer 从无标注、自然采集的视频中自监督学习,把相邻时空状态压缩成离散符号;Physical Language Reasoner 以 Qwen3-VL-4B 初始化,先根据当前画面和动作意图预测这串符号,再由扩散解码器把状态变化渲染成视频。一个 33 帧视频被编码成 256 个 transition symbols,词表规模为 25K;整体流程是「reason-then-render」,把动力学推理和像素生成分开。4
结果亮点
在 Physics-IQ Verified 的 66 个受控物理实验上,PhiZero 的 S-IoU、ST-IoU、WS-IoU 和 IQ-Score 分别为 58.2、36.8、27.6、41.2;IQ-Score 高于表中 Wan2.2-14B 的 32.2。在 PhyGround 上,PhiZero 的 Physics Score / Overall 为 3.01 / 2.97;WorldModelBench 上的 Physics Adherence / Total 为 4.88 / 8.19,均为表中最高。4
在 500 个四秒真实视频的重建实验中,physical language 只用 256 个离散 token,PSNR / SSIM / LPIPS 为 28.9 / 0.903 / 0.087;Wan2.2 VAE 需要 44,800 个连续视觉 token,PSNR / SSIM / LPIPS 为 37.7 / 0.957 / 0.042。这个对比说明它用更强压缩换取了仍可用的重建质量,不能解读成在所有视觉保真指标上都超过 VAE。4
适用边界
Physical language 目前是从视频数据中学出的经验表示,不是可解释的物理定律,也没有直接落到质量、速度、接触力等物理变量上。只靠视觉观察的训练数据,对触觉交互、微观粒子等不可见或视觉歧义较大的状态变化覆盖有限;作者也明确指出,当前模型和数据规模仍相对有限,结论更像是可扩展路线的验证,而不是完整物理模拟器。4
一句话阅读价值
如果你关注 Physical AI 或视频世界模型,这篇论文值得读的不是「生成画面更像不像」,而是把可迁移的状态转移从外观中剥离出来,给控制和跨 embodiment 迁移留出接口。
4. CoMem:把长上下文缓存从 token 轴移到 depth 轴
论文:Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory
作者与机构:Hanzuo Liu、Xuan Qi、Chunyu Liu、Haotian Zhong、Yulong Wang、Rayying Key、Alex Lamb、Mingyu Gao;清华大学、腾讯。5
提交时间:2026 年 7 月 30 日 22:19(北京时间),arXiv:2607.28263v1;论文备注称已提交 ACL Rolling Review。10
原文与代码:arXiv 摘要页;完整 HTML;代码仓库。
问题背景
长上下文通常沿 token 轴压缩或淘汰 KV cache,但写入和读取仍要处理完整深度的表示。论文先用 probing、因果截断和 split-depth sweep 观察到:语义信息在较低或中间层已经可用,上层更多服务于当前 query 和最终预测。CoMem 把这个深度分工变成缓存策略。5
方法要点
写入时,每个 context chunk 只计算到中间层
j,缓存该层 residual tensor;读取时先检索固定数量的相关 chunk,再把 query 和这些 residual states 打包,只重算 j:L 的上层。旗舰设置在冻结的 Qwen3-8B 上训练 rank-32 self-distillation LoRA,另有 adapter-free 对照,目标是在固定检索预算下让模型侧的读取计算和显存不随存储上下文长度增长。5结果亮点
在统一的无 chat template 协议下,CoMem 的 RULER 得分为 97.05,LoCoMo 为 38.27,对比 KV-Direct 的 34.59;在 128k、H20-class 平台的 adapter-free 效率控制中,显存为 18.26 GB,对照为 89.36 GB,prefill 加速 7.83 倍。作者还报告,LoCoMo 的优势在 conversation-cluster bootstrap 和独立 judge 审计下仍为正。5
适用边界
CoMem 不是所有 in-window 任务的准确率 SOTA:BABILong qa2 仍只有 27.0,且结果没有和 YaRN 扩展后的 full-context 模型直接比较。它依赖 BM25 top-12 检索、固定 512 token chunk 和英文 retrieval-style QA;多语言、代码、多模态记忆、动态索引更新和连续变化的 memory stream 都不在本次实验范围内。H20、bf16/SDPA、单请求 harness 下的绝对延迟,也不能直接当作并发服务吞吐。5
一句话阅读价值
做长上下文 serving 时,可以把「缓存哪些 token」之外的另一条轴也纳入设计:哪些层值得保存,哪些层应该留到查询发生时再算。
5. ORCA-bench:让软件代理面对真正像 on-call 的证据
论文:ORCA-bench: How Ready Are Language Model Agents for Oncall?
作者与机构:Albert Gong、Kyuseong Choi、Abhineet Agarwal、Jason Schechner、Ryan Huang、Raj Agrawal、Anish Agarwal、Raaz Dwivedi;Cornell Tech、Traversal、Columbia University。6
提交时间:2026 年 7 月 31 日 01:14(北京时间),arXiv:2607.28545v1。11
原文与数据:arXiv 摘要页;完整 HTML;公开数据集。
问题背景
代码代理的常见 benchmark 给它一个静态仓库、测试失败和明确目标;on-call 的根因分析却从模糊的用户投诉开始,要在指标、日志、trace 和源码之间来回检索,还要处理故障同时发生、调查开始得太晚等情况。ORCA-bench 把这段证据链完整放进评测,而不是只让模型猜一个 fault label。6
方法要点
基准运行一个带 OpenTelemetry 的微服务系统,暴露 Prometheus 指标、Jaeger trace、OpenSearch 日志(通过 Grafana 查询)和完整源码;测试集包含 1,079 个 RCA 任务,改变用户报告的具体程度、time-to-detection、并发故障类型和调查难度。专家 SRE 审核 ground truth;40 个 Verified 任务上的 LLM judge 与人工重评分的加权 Cohen’s κ 为 0.90。6
结果亮点
五个 frontier coding agents 在这个 50 GB、六天的公开 testbed 上测试。最现实的 Medium 难度中,最高 RCA Accuracy 为 25.3%;Hard 难度只有 10.0%。去掉源码访问后,所有模型的指标都下降,论文报告 RCA Accuracy 的降幅为 9—16 个百分点;不同模型有 7%—40% 的报告会写出与任何合理根因都不匹配的 hallucinated root cause。6
适用边界
这些数字是在固定代码库、公开 instrumentation、任务彼此隔离且只读调查的环境中得到的。真实生产系统更大、更动态,也更私有;模型可能对公开的 Astronomy Shop 系统有预训练记忆,反而让这里的结果偏乐观。论文没有评估代理部署修复后观察症状是否消失的 action loop,也没有覆盖持续记忆和跨 incident 学习。6
一句话阅读价值
如果你在评估 coding agent,不要只问它能否修一个仓库里的 bug;先看它能否在模糊报告、脏 telemetry 和并发故障中找全根因,并把源码访问从评测里拿掉再测一遍。
把昂贵计算留给真正需要的地方
这 5 篇论文的任务不同,但都在处理同一种系统浪费:把所有输入、所有层、所有工具和所有画面一视同仁。ReToken 先筛视觉 token,Beacon 先决定是否调用代码,PhiZero 先预测状态转移,CoMem 先保存中间层表示,ORCA-bench 则反过来证明:如果关键证据没有开放给代理,性能会系统性下降。2 3 4 5 6
按阅读目的选择即可:长视频和多图输入先看 ReToken;视觉工具代理先看 Beacon;物理世界模型和具身迁移先看 PhiZero;模型 serving 和长上下文先看 CoMem;软件代理上线前的可靠性评估先看 ORCA-bench。每篇论文都给出了可复查的数字,但它们仍是预印本或受限实验设置,数字应和各自的任务、基座模型、硬件与数据边界一起读。
Related content
- Sign in to comment.
