
AI 论文早报|8 月 12 日:从权重扰动到心智探针,5 篇新论文把隐藏能力变成可测信号
精选 2026 年 8 月 10 日 UTC 提交的 5 篇 AI 新论文,比较它们如何把安全边界、视觉盲点、机器人价值、强化学习探索和心智推理转成可训练或可验证的中间信号。
截至 2026 年 8 月 12 日 07:00(北京时间),本期覆盖 arXiv 详情页记录为 2026 年 8 月 10 日 UTC 的 v1 提交,换算到北京时间是 8 月 10 日 22:19 至 8 月 11 日 01:59。5 篇论文分别来自智能体安全、视觉语言模型、机器人学习、LLM 强化学习和社会推理;它们的共同动作是把原本藏在总分、轨迹或隐状态里的信号,变成可以训练、诊断或单独评测的对象。12345
今日看点
- SHE 不改模型权重,而是让系统提示、规则库、安全记忆和工具策略分别承担安全责任;在 Agent-SafetyBench 测试集上,平均攻击成功率从静态 SafeHarness 的 17.1% 降到 5.5%,良性任务可用率从 31.6% 升到 47.6%。6
- CVPD 从模型自己的裁剪图、全图和「擦除区域」反应中寻找视觉盲点,在 Qwen3-VL-8B-Instruct 上把 OCRBench 从 82.80 提到 86.40,把 MMStar 细粒度感知从 60.25 提到 63.63。7
- RynnValue 用「距离目标还剩多少时间」替代偏好标注和归一化进度,训练数据超过 7,000 小时、约 300 万个片段;接入机器人强化学习后,实物任务平均成功率从 52.5%(在线)和 63.8%(离线)提高到 72.5% 和 82.5%。8
- 3PO 把探索从 token 概率空间移到参数空间:采样不同的权重扰动,让同一问题由附近的多条策略产生不同轨迹。在两个 7B 级模型上,C3PO 的数学 Pass@1 比标准 GRPO 高 1.05 至 1.52 个百分点,但实际运行时间约为 GRPO 的 1.5 倍。9
- Avalon-ToM-Bench 把心智理论拆成「认知/动机 × 推理/行动」四个象限;线性探针能从隐藏状态解出 77%–82% 的答案,而模型自己的思维链只有 62%–70%,说明「内部已有判断」和「能否表达出来」是两件事。10
这组论文适合按两个问题来读:训练系统如何获得更有用的反馈,以及评测如何区分「模型真的具备能力」和「模型只是输出了看起来像能力的答案」。前两篇偏系统安全与视觉训练,后三篇分别把价值、探索和社会推理的中间变量固定下来。
1. SHE:安全护栏也可以从失败轨迹中演化
基本信息:Wanying Qu、Qinghua Mao、Yu Li 等;作者来自上海人工智能实验室、复旦大学、上海交通大学和香港科技大学。论文是 arXiv cs.AI/cs.CV 预印本 v1,提交时间为 2026 年 8 月 10 日 UTC;项目代码公开在 RainbowQTT/SHE。6
问题背景:LLM 代理的安全边界不只由模型权重决定,还由上下文拼接、记忆读写、工具权限和运行时控制共同决定。传统安全护栏通常部署后保持静态,遇到新型攻击时只能继续堆规则;而多个功能缠在一起时,一条失败轨迹也很难说明到底是哪一层出了问题。6
方法要点:SHE 把护栏拆成四个可编辑工件:负责总原则的 System Prompt、保存明确规则的 Rule Bank、记录反复出现边界案例的 Safety Memory,以及限制工具调用的 Tool Policy。每次 rollout 失败后,系统先诊断风险,再把诊断路由到负责的工件,生成经过约束的局部修改;候选版本只有在安全性和良性任务可用率的验证中更好,才替换当前版本。6

结果亮点:实验固定 DeepSeek-V3.2 为基础代理,用 GPT-5.5 做结构化诊断、编辑和全轨迹裁判;在 Agent-SafetyBench 的 200 个任务子集上演化 20 轮,其中 15 个任务用于演化、185 个任务用于测试。SHE 的平均攻击成功率为 5.5%,静态 SafeHarness 为 17.1%;同时,SHE 的良性任务可用率为 47.6%,SafeHarness 为 31.6%。6
在完全未参与演化的 AgentHarm 上,SHE 的 Harm Score 为 9.8%,Harm Refusal 为 86.4%,良性非拒绝得分为 77.8%;作者还把在 DeepSeek-V3.2 上演化的护栏直接迁移到 Kimi K2.6、GLM-5.2 和 MiniMax M2.7,没有额外演化。6
证据边界与阅读价值:这是一个在两个安全基准、有限任务子集和特定裁判模型上的系统实验,不能直接等同于真实部署中安全边界会自动稳定演化。尤其要留意演化成本:每轮需要重新运行代理、评估完整轨迹并比较候选版本。若你在设计 agent harness,这篇最值得借鉴的不是「让规则自动增长」,而是把安全责任拆开,让每次失败都能落到可回滚、可验证的局部修改上。
2. CVPD:视觉盲点可以由模型自己的反事实反应挖出来
基本信息:Shravan Venkatraman、Omkar Thawakar、Ritesh Thawkar、Abdelrahman Shaker、Rao Muhammad Anwer;作者来自 Mohamed bin Zayed University of Artificial Intelligence 与 Aalto University。论文为 arXiv cs.CV v1,提交于 2026 年 8 月 10 日 UTC,并标注为 BMVC 2026。2
问题背景:视觉语言模型的自我改进通常只有一个整条回答的奖励或正确率,信号太粗;视觉蒸馏虽然能提供 token 级监督,却往往需要标注、分割器、外部工具或更强教师模型。论文要解决的是:能不能只用模型自己对同一张图的不同观察,构造出足够密的视觉监督。7
方法要点:CVPD 先对候选区域生成三种反事实视图。裁剪区域后,模型回答分布应明显改变并变得更集中;把同一区域模糊擦除后,完整图像的回答应基本不变。满足这三个条件的区域,被视为「模型有能力读到、但全图输入时没有稳定利用」的视觉盲点。训练时,裁剪视图作为正向教师,擦除视图作为负向教师,完整图像由在线学生处理,再用 KL 锚点限制模型不要为了细粒度感知而损失通用能力。7

结果亮点:作者从 15,000 张无标注图像中筛出约 2,590 个三元组,只保留率为 17.2%;在 Qwen3-VL-8B-Instruct 上,CVPD 在 12 个基准中都没有相对基础模型退步。代表性结果包括 OCRBench 从 82.80 提到 86.40、MMStar Fine-Grained 从 60.25 提到 63.63、MMStar Logical Reasoning 从 61.69 提到 64.77。7
但「自包含」并不等于「完全不用搜索」。通过模型自定位、3×3 网格和 2×2 网格寻找候选区域时,保留盲点中来自 3×3 网格的占 53%,来自自定位提案的占 27%;当解冻视觉编码器时,MMStar Fine-Grained 从 63.63% 降至 62.55%,OCRBench 从 86.40% 降至 85.25%。7
证据边界与阅读价值:结果集中在 Qwen3-VL-4B/8B、LoRA 和一轮盲点训练,盲点通过网格候选保证了覆盖,尚不能说明更大模型或连续视频场景也能同样稳定。对视觉自训练系统而言,论文给出了一条很具体的检查路径:不要只问模型答对没有,还要问「放大哪里会改变答案」「擦掉哪里却不改变答案」。
3. RynnValue:把机器人奖励改写成到目标的时间距离
基本信息:Dongchi Huang、Hongyin Zhang、Bohan Hou 等;作者来自 DAMO Academy、Alibaba Group 与 Hupan Lab。论文为 arXiv cs.RO/cs.CV/cs.LG 预印本 v1,提交于 2026 年 8 月 10 日 UTC;作者公开了 项目页、代码仓库 和 模型集合。8
问题背景:机器人强化学习需要可扩展的价值或奖励模型。偏好标注依赖人工比较,归一化进度又被绑在单条轨迹内部,换机器人、换视角或换任务后不一定还能比较。RynnValue 选择一个更直接的标签:从当前观测到语言指定目标还剩多少时间,把它当成跨数据源的 directed cost-to-go。8
方法要点:模型基于 RynnBrain,每次输入 8 个随机采样的观测帧,同时预测绝对时间距离和相邻帧的相对时间差。训练时随机打乱时间顺序,部分样本换成不匹配指令,并用 value-isolation attention 防止不同观测的查询互相偷看答案。这样,模型必须从画面判断状态,而不能只利用固定采样间隔或帧的位置。预测出的时间价值再通过势能奖励整形,接入在线或离线强化学习。8

结果亮点:训练集超过 7,000 小时,约 300 万个指令条件片段。域外 RBM-EVAL-OOD 含 976 条轨迹,RynnValue-8B 的 Kendall’s τa 为 0.675,高于偏好监督 Robometer 的 0.655,也高于只用进度监督的 0.292。8
在四个实物双臂机器人任务、每项 20 次评估中,在线强化学习的平均成功率为 72.5%,Robometer 为 52.5%,稀疏奖励为 48.8%;离线强化学习中,RynnValue 为 82.5%,Robometer 为 63.8%。但消融也很直白:去掉时间顺序打乱后,域外 Kendall’s τa 从 0.675 降到 0.189;去掉 value-isolation attention 后降到 0.482。8
证据边界与阅读价值:当前价值语义默认优化「更快完成」,还没有把安全、能耗或动作精度纳入同一个时间标签;实物实验也集中在双臂 Franka 和四个操纵任务。若你在做机器人奖励模型,先检查任务是否能定义可靠的完成截止点,再考虑这个标签是否比偏好或进度更容易扩展;如果目标不是最短时间,论文的接口还需要重新设计。
4. 3PO:探索不只是在 token 分布上调温度
基本信息:Vatsal Venkatkrishna、Nico Daheim、Iryna Gurevych;作者来自 INSAIT、Sofia University “St. Kliment Ohridski”,以及 Technical University of Darmstadt 的 UKP Lab 和 ATHENE。论文为 arXiv cs.LG/cs.AI/cs.CL 预印本 v1,提交于 2026 年 8 月 10 日 UTC;代码在 insait-institute/C3PO,模型在 BayesRL。9
问题背景:RLVR 依赖模型自己采样出高奖励轨迹。温度只能改变 token 分布的方差,不能重排 token 的相对顺序;当一组 rollout 全部得到相同奖励时,GRPO 也没有有效优势信号,训练可能停滞。9
方法要点:3PO 用变分后验对权重采样,在参数空间产生不同的邻近策略,再让这些策略生成 rollout。B3PO 每步采一次权重扰动;M3PO 使用多个扰动并平均梯度;C3PO 把同一组 rollout 分配给多个扰动,同时在完整组上计算优势,并用序列级重要性采样稳定更新。温度控制的是「同一个策略如何采样」,权重扰动则可以直接改变甚至重排 token 的概率。9

结果亮点:实验使用 OLMo-3-1025-7B 和 Qwen2.5-Math-7B,数学训练集为 DAPO-MATH-17k,代码任务使用 CodeR1-12K。OLMo-3 上,C3PO 的数学 Pass@1 均值为 44.04±0.46%,标准 GRPO 为 42.99±0.51%;Qwen2.5-Math-7B 上分别为 46.88±0.38% 和 45.36±0.35%。AIME 难题上的增益最高分别为 4.17 和 5.83 个百分点,LiveCodeBench-v6 上 C3PO 得分为 15.17。9
M3PO 和 C3PO 在训练中产生的 malformed 或错误 rollout 少于 GRPO 与动作空间基线,也挽救了更多原本全组零奖励的 prompt;但 C3PO 的噪声过大时会崩溃:有效样本量参数 λ 取 10^8 会损害表现,10^9 是论文默认值。M3PO 和 C3PO 的实际运行时间约为 GRPO 的 1.5 倍。9
证据边界与阅读价值:实验仍限于两个 7B 级模型和数学、代码任务,作者没有在更大模型上验证,也没有测试更结构化的非对角后验。它适合回答一个很具体的工程问题:当 GRPO 的问题是「采不到正确轨迹」而不是「不会评估轨迹」时,是否值得用额外墙钟时间换参数空间探索。
5. Avalon-ToM-Bench:模型可能知道答案,却没有把它说出来
基本信息:Yen-Shan Chen、Yu Chian Duan、Chih-En Kuo、Jian-Bin Wu、Yun-Nung Chen;作者来自 National Taiwan University 和 CyCraft AI Lab。论文为 arXiv cs.AI/cs.CL/cs.CY/cs.GT 预印本 v1,提交于 2026 年 8 月 10 日 UTC;代码公开在 Avalon-ToM-Bench。10
问题背景:静态心智理论测试容易把任务简化成常识问答;直接看隐藏身份游戏的胜负,又会把心智推理和规划、记忆、说服能力混在一起。论文选择《抵抗组织:阿瓦隆》的非对称信息机制,既保留不同角色看到不同信息的条件,又把每个判断拆成可诊断的二分类题。10
方法要点:基准包含 97 个场景、408 个 True/False 心智理论陈述,以及 34 个规则召回控制题。四个象限由两条轴组成:角色知道什么还是想做什么(认知/动机),以及模型是在推断还是在选择行动(推理/行动)。评测输入只保留指定座位能看到的私有信息和公共历史,模型必须从那个视角判断陈述真伪。10

结果亮点:作者评测 28 个模型,参数规模从 0.6B 到 120B+。模型规则召回平均准确率约 83.3%,但在视角受限的心智理论任务上通常只有 50%–60%;四个象限中,视角采择平均 63.5%,策略性信号传递 70.4%,意图归因 78.2%,默契协同 75.8%。10
在 Qwen3 系列上,线性探针从中间层隐藏状态解出的准确率为 77%–82%,模型自己的思维链为 62%–70%。激活 steering 能把 Qwen3-1.7B 从 54% 提到 77%,Qwen3-4B 从 70% 提到 81%,Qwen3-8B 从 74% 提到 83%。相反,仅在测试时打开思维链平均只增加 1.1 个百分点;换成推理训练模型,平均提升 11.0 个百分点。10
证据边界与阅读价值:所有题目来自同一个游戏,且采用 True/False 格式,不能直接代表开放式谈判或真实多方协作。探针和 steering 分析也只覆盖 Qwen3 家族。它给评测设计的启发很实用:把知识控制题、受限视角题和隐藏状态分析放在一起,才能区分模型是不知道、没推出来,还是推出来却没表达。
一句话收束
今天的五篇论文没有把「能力提升」写成一个总分:SHE 把安全责任拆给可演化的系统工件,CVPD 从反事实视觉反应中找盲点,RynnValue 用时间距离给机器人提供跨任务价值,3PO 用权重扰动打开 RLVR 的探索空间,Avalon-ToM-Bench 则把「内部知道但外部说不出」单独测了出来。决定是否打开原文时,可以先按自己的瓶颈筛选:需要安全回滚,看 SHE;需要视觉自训练,看 CVPD;需要机器人奖励,看 RynnValue;需要 RLVR 探索,看 3PO;需要社会推理评测,看 Avalon-ToM-Bench。
References
- 1SHE arXiv 详情页
arxiv.org
- 2CVPD arXiv 详情页
arxiv.org
- 3RynnValue arXiv 详情页
arxiv.org
- 43PO arXiv 详情页
arxiv.org
- 5Avalon-ToM-Bench arXiv 详情页
arxiv.org
- 6SHE HTML 原文
arxiv.org
- 7CVPD HTML 原文
arxiv.org
- 8RynnValue HTML 原文
arxiv.org
- 93PO HTML 原文
arxiv.org
- 10Avalon-ToM-Bench HTML 原文
arxiv.org

AI 论文早报
每日自动汇总值得关注的 AI 新论文,用中文早报帮你快速掌握研究进展。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.