
奇绩信号Alpha Sight 2026年7月27日【文字版】
本期精选 7 月 24 日 arXiv 当日提交区的十二篇 AI 论文,拆解跨模态推理、深度研究 Agent、机器人数据、长上下文系统、具身记忆与交互式编码评测的最新方法和证据边界。
本期判断
按 arXiv recent 列表的分组日期,本期覆盖 2026 年 7 月 24 日 当日提交区的十二篇 AI 论文。由于 7 月 25—26 日为周末,详情页的版本时间在部分论文中显示为 7 月 23 日 UTC;本文以 arXiv 列表日期作为本期收录边界,并用详情页核对标题、作者、摘要和版本信息。
这批论文有三个共同信号。第一,模型能力正在从「更大的模型」转向「更有结构的过程」:MIRROR 把视图差异变成跨模态监督,AREX 把验证拆成递归改进,TTEL 则把推理错误定位到 token 级别。第二,Agent 的瓶颈越来越像系统工程问题:上下文生命周期、训练脚手架、长上下文 KV 访问和交互式需求澄清,都直接决定最终能力。第三,具身和科学任务都在提醒研究者,记忆或表征只有绑定到空间、构象或可验证约束,才会从「存过」变成「能用」。
头条
1. MIRROR:让强视图教弱视图,跨模态推理不再只是混合采样(原文)
信号源:南加州大学、卡内基梅隆大学
认知提取
同一道几何题,图像、文字和图文联合输入可能各自暴露不同的推理短板。MIRROR 的关键判断是:不要把三种视图简单混在同一个 RL batch 里,而要在每道题上找到当前最强视图,再把它的偏好定向传给较弱视图。它把模态不一致从鲁棒性问题改造成了一种自监督信号。
论文摘要
- 作者构造 ODA-Data,把同一几何问题改写为 text-dominant、image-dominant 和 combined 三种配对视图,并筛选出只在某个视图下可解的样本。
- MIRROR 对每道题分别进行十六次 rollout,按当前成功率自适应选择 teacher view,再用 on-policy distillation 和 reverse-KL 监督 student view。
- 在 ODA-Val 上,image pass@16 从四十二点五七提升到五十七点零六,text pass@16 从八十点二二提升到八十六点一零;GeoInt pass@16 提升七点五九个百分点,MathVerse mean judge score 提升五点二二个百分点。

核心方法
- 数据构造分为过滤 easy problems、生成并验证 TikZ 图、重写 image-dominant prompt 和模态特定评估四步,最终得到约两千个配对样本,训练集占百分之八十五,验证集占百分之十五。
- student 只在自己的 restricted view 上采样,teacher 不直接提供另一条生成轨迹,而是对 student 自己的轨迹重新评分,减少 teacher 轨迹分布带来的偏差。
- 总目标为 outcome-reward RL 加 reverse-KL 正则。teacher 使用 policy 的 EMA,衰减系数为零点九九,防止当前策略在长程训练中自我强化错误。
- 训练以 Qwen3-VL-4B-Instruct 为底座,使用 verl、GRPO 和 vLLM;prompt 上限四千零九十六 token,response 上限一万六千三百八十四 token,每个 prompt 十六次 rollout。

实验成果
- 在 FLOPs 对齐的比较中,MIRROR step 一百五十的 image reward 为零点二六二五,GRPO step 二百为零点二三六八;text reward 分别为零点四五八一和零点四三八七。
- MIRROR 的最大净可解性增益为正百分之八点九五;ODA-Train 中 image-dominant 与 text-dominant 两种视图都能解出的比例从百分之四十二点五升到百分之六十点七。
- teacher 选择消融表明,固定使用文本、图像或联合视图都不如按问题选择 teacher。reverse-KL 系数零点零一在整体排序中最好,系数零点一会造成训练崩溃。



| 设置 | ODA-Val Image pass@16 | ODA-Val Text pass@16 | GeoInt pass@16 | MathVerse mean |
|---|---|---|---|---|
| Base model | 42.57 | 80.22 | 70.79 | 41.31 |
| Strongest single-view GRPO | 48.78 | 83.16 | 未报告 | 未报告 |
| MIRROR | 57.06 | 86.10 | 78.38 | 46.53 |
总结与反思
- 结果总结:强视图不是固定的全局 teacher,而是随问题变化;MIRROR 把跨模态 transfer 方向显式化,四个主要指标均超过 base model。
- 局限性:验证集中在几何问题,teacher 选择仍主要依赖 rollout reward;当前策略 teacher 的长程稳定性不足。
- 前沿见解:多模态后训练的下一步不只是增加输入模态,而是建立「同一潜在问题的多视图」和「视图间定向监督」机制。
2. AREX:深度研究 Agent 用递归验证改进答案,而不是只把搜索轨迹拉长(原文)
信号源:北京智源人工智能研究院
认知提取
深度研究任务的难点并不只是找到一个候选答案,而是逐条确认它满足所有约束。AREX 利用发现和验证之间的不对称,把研究代理拆成内层搜索和外层改进:内层找证据,外层审查未解决断言,再决定精炼还是重启。真正的增益来自把长历史压缩成一个可继续行动的状态。
论文摘要
- AREX 提出 Recursive Self-Improving agent,在每轮研究中维护 provisional answer、supporting evidence 和零到一百的 confidence score。
- Autonomous Context Updating 会保留 verified findings、source identifiers、current candidates、unresolved constraints、validity concerns、rejected candidates 和 next-step plan。
- 评测覆盖 BrowseComp、GAIA、xbench-2510、DeepSearchQA、WideSearch 和 HLE with tools;AREX-Base 在 WideSearch-en 得分八十二点零,在 HLE tool 得分五十二点四。

核心方法
- 内层循环通过 search、visit、python 等工具收集证据,生成临时答案;外层根据置信度检查轨迹是否可恢复,再选择 Refine 或 Restart。
- ACU 将不断膨胀的交互历史压缩为 improvement state,避免下一轮研究被无关的工具输出和旧假设干扰。
- 训练分为 recursive task synthesis、teacher trajectory quality control、multi-stage agentic mid-training 和 step-aware RL;关键步骤包括首次获得证据、推翻旧假设、调用 context update。
- 每个 episode 最多三百个 inner research turns、五个 outer self-improvement operations;WideSearch 使用 Item-F1,DeepSearchQA 使用 F1,其余任务报告 accuracy。

实验成果
- 在 BrowseComp 上,没有 ACU 且没有外层循环的配置准确率为五十九点六;加入 ACU 后为七十一点四;ACU 与外层循环同时启用时为八十二点五,完整配置较最弱设置高二十二点九个百分点。
- AREX-Turbo 在 BrowseComp、GAIA、xbench-2510、DeepSearchQA、WideSearch-en 和 HLE tool 上分别达到七十点七、八十一点六、五十七点零、七十八点五、六十八点五和四十点六。
- 正确输出落在九十到一百置信度区间的比例从无 ACU 时的百分之八十九点三提升到有 ACU 时的百分之九十五点九;错误输出中低于六十置信度的比例从百分之六十一点零降到百分之五十五点二。
- 关键步骤的平均 loss 高于普通步骤:evidence discovery 为零点二七七,path rejection and redirection 为零点二九八,key context-update 为零点三零零,说明稀疏奖励确实集中在过程节点。


| BrowseComp 配置 | Accuracy |
|---|---|
| 无 ACU、无外层循环 | 59.6 |
| 无 ACU、有外层循环 | 69.8 |
| 有 ACU、无外层循环 | 71.4 |
| 有 ACU、有外层循环 | 82.5 |
总结与反思
- 结果总结:AREX 的关键增益来自 ACU、外层递归和关键步骤监督的叠加,而不是单纯增加搜索轮数。
- 局限性:自蒸馏实验只在没有 ACU、外层循环和 key-step supervision 的简化配置上进行,不能直接归因到完整 AREX 配方。
- 前沿见解:深度研究 Agent 的训练目标正在从最终答案 reward 走向「哪个中间状态值得保留、哪个假设应该被推翻」的状态价值学习。
3. AXIS:把机器人数据采集变成可增长的社区基础设施(原文)
信号源:Axis Robotics、加州大学伯克利分校、佐治亚理工学院、德州农工大学、约翰斯·霍普金斯大学、宾夕法尼亚大学、密歇根大学、新加坡国立大学、南洋理工大学
认知提取
机器人学习缺的往往不是又一个模型,而是能持续产生、清洗、验证和扩增演示数据的管线。AXIS 把网页遥操作、任务生成、成功检查、轨迹精炼和仿真增强串成一条可持续数据引擎。它给出的信号是,数据多样性和验证机制比单纯复制同分布轨迹更能决定 VLA 的鲁棒性。
论文摘要
- AXIS 当前包含二百零七个操作任务、五万条以上人类演示轨迹和六万多个任务或场景变体。
- 数据引擎支持浏览器 MuJoCo-WASM 遥操作、自动任务生成、成功验证、质量过滤、静态片段移除、轨迹平滑与重采样。
- 以 π0.5 为起点,在 LIBERO-Plus robustness suite 上,AXIS-100% 的 overall success rate 为八十八点八,较 vanilla π0.5 的八十三点九高四点九个百分点;RoboCasa matched control 为五十七点五。

核心方法
- Infrastructure layer 负责任务生成和浏览器遥操作;Dataset layer 统一轨迹表示、成功验证和清洗;Model layer 对接 visuomotor imitation policy 与 VLA。
- 轨迹处理先由 task-specific success checker 重新验证,再移除静态片段、平滑、重采样到固定控制频率,最后在 IsaacSim 中随机化物体姿态、光照、材质、相机和摩擦。
- 训练从 released π0.5 checkpoint 开始,可先在 AXIS 或 RoboCasa corpus 上 continual pretraining,再按默认 LIBERO recipe fine-tune。
- 评测对 Camera、Light、Sensor Noise、Background、Layout、Language 和 Robot 七个扰动轴固定 rollout budget,并额外在 AXIS-100% held-out task split 检查分布偏移。

实验成果
- 数据精炼后,平滑加重采样相对 raw teleoperation 将 mean acceleration 降低六十三点九个百分点,将 mean jerk 降低八十点八个百分点;replay success 从百分之百降到百分之八十六点二。
- AXIS-100% 相比 vanilla π0.5 的最大增益出现在 sensor noise,达到正十三点七个百分点;camera 为正十一点三个百分点,background 为正三点七个百分点,layout 为正二点六个百分点。
- 同等轨迹数量下,RoboCasa matched control overall 只有五十七点五,说明提升不只是数据量效应。

| 训练条件 | Overall | Camera | Sensor Noise | Layout | Robot |
|---|---|---|---|---|---|
| π0.5 vanilla | 83.9 | 72.5 | 82.5 | 82.9 | 74.4 |
| AXIS-25% | 84.7 | 77.5 | 86.2 | 85.5 | 76.9 |
| AXIS-50% | 85.7 | 68.8 | 91.2 | 88.2 | 79.5 |
| AXIS-100% | 88.8 | 83.8 | 96.2 | 85.5 | 78.2 |
| RoboCasa matched | 57.5 | 35.2 | 63.2 | 68.0 | 39.4 |
总结与反思
- 结果总结:AXIS 的主要价值在数据闭环,规模增长和扰动多样性共同提升了视觉、噪声与场景变化下的鲁棒性。
- 局限性:真实世界验证的任务和机器人覆盖仍有限,且语言与 robot-pose 轴的增益不如视觉扰动稳定。
- 前沿见解:VLA 的数据基础设施可能会像开源软件一样增长,但前提是任务定义、成功检查和数据质量都可被社区复用。
4. TTEL:测试时扩展把错误定位到 token,推理成本可以少一半(原文)
信号源:Google DeepMind
认知提取
独立采样的问题是每次都从头写一条完整思路,顺序 refinement 的问题是整条轨迹结束后才知道哪里错。TTEL 用反馈前后的 token 概率差,找出最可能的错误位置,再从有效前缀分支。它把 test-time scaling 从「再试几次」改成了「保留已经正确的部分,再把预算花在错误局部」。
论文摘要
- TTEL 计算原始 student probability、真实反馈下的 teacher probability 和 null-context baseline,利用 filtered spike 抵消一般性上下文扰动。
- 若存在可行动 spike,就在最大 filtered spike 之前截断并重生成;没有可定位错误时才从 root prompt restart。
- 在 Qwen3-8B 和 LiveCodeBench 上,TTEL pass@64 为七十一点零,generated tokens 为三十六万零四百,独立采样为六十四点六和七十三万五千;AIME-25 上 TTEL pass@16 为五十四点二,独立采样为四十五点零。

核心方法
- 对轨迹每个 token 计算 student probability 和反馈后的 teacher probability,定义 raw feedback-conditioned spike,再减去 null feedback spike 得到 filtered score。
- 分支点由阈值集合确定:真实反馈造成的概率下降必须超过零点零六,null baseline 的扰动不能超过零点零六。
- TTEL-GenFB 使用上一轮答案、完整 reasoning trace 和静态失败消息;TTEL-EnvFB 在 LiveCodeBench 中使用 runtime error 或失败 public test cases。
- 评测采用 temperature 一、top-p 一、最大生成长度一万六千三百八十四 token;模型为 Qwen3-8B 与 Qwen3-4B-Thinking-2507。

实验成果
- LiveCodeBench 上,TTEL pass@64 为七十一点零正负一点六,token 成本为三十六万零四百正负七百;独立采样分别为六十四点六正负一点零和七十三万五千正负一千一百。
- HMMT 上,TTEL pass@64 为六十九点五正负零点六,token 成本为三十一万二千八百正负一万零七百;独立采样 pass@64 为六十七点四。
- 去掉完整 thought trace 后,TTEL-GenFB pass@k 从零点六三零降到零点五九七;使用更丰富 environment feedback 的 TTEL-EnvFB 为零点六五八。
- 去掉 null-baseline filter 后,平均 spike 数量从十九点三暴增到四百八十六点零,downstream pass@k 降到零点五九二。





| 任务 | TTEL pass@k | TTEL tokens | Independent Sampling pass@k | Independent Sampling tokens |
|---|---|---|---|---|
| LiveCodeBench, k=64 | 71.0 ± 1.6 | 360.4k ± 0.7k | 64.6 ± 1.0 | 735.0k ± 1.1k |
| AIME-25, k=16 | 54.2 ± 3.6 | 146.6k ± 4.5k | 45.0 ± 3.7 | 228.8k ± 1.0k |
| HMMT-25, k=64 | 69.5 ± 0.6 | 312.8k ± 10.7k | 67.4 ± 1.4 | 749.9k ± 0.1k |
总结与反思
- 结果总结:TTEL 在代码和数学任务上同时提高 pass@k、降低生成 token,主要收益来自有效前缀复用。
- 局限性:方法依赖有信息量的反馈和完整 reasoning trace;数学任务缺少 execution feedback,只能使用 generic feedback。
- 前沿见解:如果 token-level credit assignment 能被推广到更丰富的交互环境,推理预算将从全轨迹搜索转向局部错误修复。
认知模型
5. Agentic Context Management:Agent 记忆首先是生命周期和架构问题(原文)
信号源:Maximem
认知提取
把历史存进向量库不等于 Agent 获得了记忆。论文把 context 当成一种要被设计、摄取、隔离、预取、压缩和合并的生命周期资产,并指出最危险的不是「没有检索到」,而是「检索到了但仍不够支撑推理」。这是一篇偏系统论的论文,强项是把成本、隔离和信息完整性放进同一个问题里。
论文摘要
- Agentic Context Management 包含 architecting、ingesting、scoping、anticipating、compacting & consolidation 五个原语。
- 全量追加历史的 token 成本为 O(n²);粗糙摘要可降为 O(n),但会出现 accuracy cliff;validated compaction 试图在线性成本下保持关键事实可恢复。
- 论文在 LongMemEval 五百题上报告九十二点零,即四百六十题正确;在 LoCoMo categories 1 到 4 上报告九十三点二。

核心方法
- Architecting 决定记忆类别、抽取方式、存储位置和保留时间;ingesting 将对话、文档和工具调用转成结构化 memory;scoping 负责 user、customer、client 层级隔离。
- Anticipating 将可能需要的 context 提前移出关键路径;compacting & consolidation 在超出预算时压缩上下文,并要求压缩后关键事实仍可恢复。
- 参考实现 Synap 采用 async-first SDK、scope-aware retrieval、conversation compaction 和 streaming channel;集成模式为 FETCH、COMPACT、MODEL、INGEST。
- 评测使用 gpt-5-mini 作为答案模型和 judge;LoCoMo 只报告 categories 1 到 4,排除 adversarial abstention category 5。


实验成果
- 一个 memory library 在三十二天积累一万零一百三十四条 entries,其中只有三十八条可用,junk rate 为百分之九十九点六。
- 一个压缩案例把一万八千二百八十二 token 压到一百二十二,任务准确率从百分之六十六点七降到百分之五十七点一,说明「压得更短」不能代替「保留足够信息」。
- LongMemEval 的自报结果为九十二点零,优于论文列出的 SuperMemory 八十五点二、八十四点六和八十一点六,以及 Zep 七十一点二;作者明确声明这不是 controlled comparison。
- retrieval study 中,CodeXGLUE 的 keyword MRR@10 为零点二九零,vector 为零点九一四,但 vector indexing time 为 keyword 的九十七倍;SciQ 则是 keyword 零点八一五、vector 零点六一四。



| 数据集 | 配置 | 结果 |
|---|---|---|
| LongMemEval | 500 questions | 92.0%(460/500) |
| LoCoMo | categories 1-4 | 93.2% |
总结与反思
- 结果总结:ACM 把 memory 从存储组件提升为 context lifecycle,核心指标同时涉及准确率、token 成本、租户隔离和检索延迟。
- 局限性:benchmark 不测生产负载下的 latency、每任务 token cost 和 context rot;系统中的 anticipatory prediction、图遍历和验证机制有 proprietary 部分。
- 前沿见解:Agent infrastructure 的下一层竞争点不只是 recall,而是 decision-level context 和 organization-scale context 的完整性。
多模态
6. VLM-IE3D:用隐式和显式几何 token 让 VLM 真正进入三维空间(原文)
信号源:南洋理工大学、阿里巴巴达摩院、胡潘实验室
认知提取
只从 RGB 学隐式 3D 表示,模型可以知道大概的空间布局,却未必能回答「这个物体离墙多远」或「哪个框更紧」。VLM-IE3D 的做法是同时保留全局隐式几何和可解释的显式几何属性,再用 cross-attention 融合。它没有宣称取代真实 3D 输入,而是证明视频 RGB 可以被组织成更接近 3D reasoning 的中间表示。
论文摘要
- 输入为 RGB 视频和自然语言问题,模型通过 AnySplat 生成 Implicit Geometry Tokens 与显式 depth、camera pose、3D Gaussian splats 或 point maps。
- 3D-aware adapter 先压缩空间相邻 token,再用 implicit-explicit attention 以 IGTs 为 query、EGTs 为 key/value,最后与 2D visual tokens 相加。
- VLM-IE3D 使用 Qwen2.5-VL-3B,冻结 2D visual encoder 和 3D geometry encoder,在 3D video detection、visual grounding、dense captioning 和 spatial reasoning 上评测。

核心方法
- 2D visual encoder 提取 2D tokens;AnySplat 产生 IGTs;explicit embedding module 把 depth maps 等 3D attributes 转成 EGTs。
- 2×2 spatial merging 后,IEA 对 IGTs 和 EGTs 做 multi-head cross-attention,再把融合后的 3D tokens 与 2D tokens 做 element-wise addition。
- 训练一 epoch,Adam 学习率从一乘十的负五次方衰减至零,使用八张 H100 80G,输入分辨率三百九十二乘五百一十八,压缩后 token 数为二百五十二。
- 3D grounding 使用 ScanRefer 的三万六千六百六十五条 object descriptions 和五百六十二个 indoor scans;3D detection 使用四帧、一 FPS 的视频片段。


实验成果
- Scan2Cap 上,VLM-IE3D 的 C@0.5 为八十点四,M@0.5 为二十八点八;Qwen2.5-VL-3B 为五十八点零和二十六点九。
- ScanRefer 上,VLM-IE3D 的 Acc@0.25 为四十三点二,使用 proposal refinement 后为五十五点四;Acc@0.50 为十六点九,refinement 后为四十八点九。
- 3D video detection 上,VLM-IE3D 的 P25、R25、F1 分别为四十四点二、四十一点九、四十二点八,VG LLM 为四十一点七、三十五点七、三十八点二;VLM-IE3D 速度为六 FPS,参数三点二三 B。
- VSI-Bench 的正文报告平均表现为百分之四十七点六,并指出超过 Gemini-1.5-Pro 的百分之四十五点四;原表中 Avg. 列另列三十一点九,本文保留两处原文口径,不做合并推断。
- ablation 显示,baseline 的 P25/R25/F1 为三十二点一、三十点一、三十点九;加入 IGTs 和 EGTs 后为四十四点二、四十一点九、四十二点八。




| 模型 | Scan2Cap C@0.5 | Scan2Cap M@0.5 | Detection P25 | Detection R25 | Detection F1 |
|---|---|---|---|---|---|
| Qwen2.5-VL-3B | 58.0 | 26.9 | 32.1 | 30.1 | 30.9 |
| VG LLM | 78.6 | 28.6 | 41.7 | 35.7 | 38.2 |
| VLM-IE3D | 80.4 | 28.8 | 44.2 | 41.9 | 42.8 |
总结与反思
- 结果总结:显式和隐式几何互补,轻量 IEA 在检测和 captioning 上均超过纯 2D baseline。
- 局限性:显式 3D 输入在精确 grounding 上仍有优势;模型依赖 3D geometry encoder 和 RGB 重建质量。
- 前沿见解:多模态模型的空间能力可能不需要把完整 3D 场景直接塞进上下文,而是需要可解释、可压缩的几何 token 接口。
具身智能
7. Beyond Episodic Evaluation:连续 EQA 中,记住不等于积累(原文)
信号源:马里兰大学帕克分校、德州大学奥斯汀分校、伊利诺伊大学厄巴纳-香槟分校
认知提取
传统 EQA 每问一题就重置环境,容易掩盖记忆架构的真实瓶颈。Sequential-EQA 把同一场景的多个问题连续交给 Agent,结果显示,保留 memory 并不会自动形成可复用知识。只有把视觉证据绑定到 metric 3D 结构的记忆,Agent 才能在减少导航的同时持续提高回答质量。
论文摘要
- 作者从 OpenEQA 重新组织 scene-level question sequences,固定模型和权重,只改变 episodic 到 sequential 的评测协议。
- 对比 ExploreEQA、MemoryEQA、3D-Mem 和 UniNavid 四种记忆范式,指标包括 SR、SR_mem、MA、PL、PL_mem 和 SA。
- 超过百分之六十的 scenes 至少包含十个 query;3D-Mem 在 sequential setting 中把 answer success rate 从二十五点五提高到五十八点八,导航效率提升五十三点三个百分点。


核心方法
- Episodic 形式从空记忆 m0 开始,sequential 形式将上一题结束时的 mi 传给下一题;所有网络权重冻结,不做 sequential training。
- ExploreEQA 存储 occupancy 和 frontier scores;MemoryEQA 存储 RGB、pose、language description 和 embedding;3D-Mem 存储 3D point cloud 与 visual embeddings;UniNavid 依赖 transformer hidden state。
- 3D-Mem 采用 spatially indexed 3D lookup;评测指标中 MA = SR_mem - SR,SA =(PL - PL_mem)/PL 乘百分之百。

实验成果
- ExploreEQA 的 SR/SR_mem/MA/PL/PL_mem/SA 为四十三点八、四十六点五、二点七、八十四点三、八十四点三、零;MemoryEQA 为六十一点零、六十二点四、一点四、四十三点六、四十三点九、负零点五。
- 3D-Mem 为二十五点五、五十八点八、三十三点三、五点六、二点六、五十三点三;UniNavid 为三十六点四、三十七点三、零点九、十二点二、十二点四、负一点五。
- 在连续三个问题的定性样例中,3D-Mem 从 episodic 下答对三题中的一题,变为 sequential 下三题全对;对应路径长度明显下降。
- Unitree Go2 真实部署中,UniNavid 在室内和室外均为百分之十五;3D-Mem 从百分之二十升到百分之四十;MemoryEQA 从百分之四十升到百分之四十七。






| Agent | SR | SR_mem | MA | PL | PL_mem | SA |
|---|---|---|---|---|---|---|
| ExploreEQA | 43.8 | 46.5 | 2.7 | 84.3 | 84.3 | 0.0 |
| MemoryEQA | 61.0 | 62.4 | 1.4 | 43.6 | 43.9 | -0.5 |
| 3D-Mem | 25.5 | 58.8 | 33.3 | 5.6 | 2.6 | 53.3 |
| UniNavid | 36.4 | 37.3 | 0.9 | 12.2 | 12.4 | -1.5 |
总结与反思
- 结果总结:Sequential-EQA 把 memory architecture 的差异放大,3D spatial memory 是唯一同时改善准确率与导航效率的方案。
- 局限性:这是诊断性评测,不是顺序训练后的最优 agent;真实机器人样本规模较小,噪声和执行误差可能放大差异。
- 前沿见解:具身记忆的核心不是容量,而是把视觉语义证据绑定到可检索、可度量的空间坐标。
AI4Science
8. EnsembleEGNN:环肽不应只用一个代表构象来表示(原文)
信号源:原文未明确列出作者机构
认知提取
环肽在溶液中不是一个静止结构,而是一组带有不同热力学权重的构象。EnsembleEGNN 先分别理解每个 conformer 的局部几何,再用 Boltzmann-informed attention 把它们合成为一个分子表示。结果说明,分子性质预测的误差有一部分来自「只看代表构象」,而不是来自模型容量不足。
论文摘要
- 每个分子保留五个 conformers,按 Boltzmann weight 排序并归一化;每个 conformer 由 EGNN 独立编码。
- 预训练目标包括 masked token recovery、noisy-coordinate reconstruction 和 pairwise distance reconstruction,总损失权重为零点三、零点五、零点二。
- 在 CREMP-CycPeptMPDB 的二千九百七十九个样本上,预训练 EnsembleEGNN 的 R² 为零点四七七、Pearson r 为零点六九九;Hybrid 与 BERT 联合后达到零点五三八和零点七三七。

核心方法
- 每个 conformer 的 atom tokens 和三维坐标输入六层 EGNN,仅在各自 k-nearest-neighbor graph 中传递消息,保持旋转和平移等变性。
- 通过两层 MLP 计算 conformer score,并与 log Boltzmann weight 相加得到聚合权重;per-atom embedding 用加权和,global embedding 用带 inducing points 的 Set Attention Block。
- 预训练在 CREMP 上进行八十个 epoch,batch size 八,学习率二乘十的负四次方;下游目标是 log(P_app),使用五折交叉验证。

实验成果
- Random-init 基本失败,R² 只有零点零零五正负零点零零四,Pearson r 为零点一一三;BERT-only 为零点四三九和零点六六七。
- EnsembleEGNN 的 MAE/RMSE 为零点三一九/零点四三六,Hybrid 进一步降到零点三零四/零点四零九。
- 五折结果中,Hybrid 的 R² 分别为零点五六五、零点四九四、零点五五三、零点五二六和零点五五二,跨切分整体保持优势。
- Hybrid 相对 sequence-only baseline 的 R² 增加零点零九九,Pearson r 增加零点零七零。


| 模型 | R² | Pearson r | MAE | RMSE |
|---|---|---|---|---|
| Random-init | 0.005 ± 0.004 | 0.113 ± 0.016 | 0.457 ± 0.003 | 0.601 ± 0.001 |
| BERT-only | 0.439 ± 0.053 | 0.667 ± 0.035 | 0.334 ± 0.014 | 0.451 ± 0.022 |
| EnsembleEGNN | 0.477 ± 0.009 | 0.699 ± 0.009 | 0.319 ± 0.002 | 0.436 ± 0.004 |
| Hybrid | 0.538 ± 0.029 | 0.737 ± 0.016 | 0.304 ± 0.008 | 0.409 ± 0.013 |
总结与反思
- 结果总结:构象 ensemble 的显式建模和自监督预训练都必要,Hybrid 进一步说明几何与序列信息互补。
- 局限性:当前模型只在 conformer 内消息传递,跨构象交互在 pooling 阶段才发生;数据覆盖和样本规模仍有限。
- 前沿见解:AI4Science 的表征学习需要把状态分布和热力学权重一起建模,而不是把复杂对象压成一个静态快照。
Infra
9. Windowed-MTP:百万 token 上,draft head 不必读取完整 KV cache(原文)
信号源:英伟达
认知提取
Speculative decoding 的 verifier 可以很快,但如果 draft head 每一步都扫描一百万 token 的 KV cache,速度优势会被长上下文成本吃掉。Windowed-MTP 只限制 draft attention 的可见范围,保留 sink tokens 和最近窗口,target verifier 仍然全上下文验证。它是一个不改模型、不训练、不改变接受判定的 serving 级优化。
论文摘要
- Windowed-MTP 使用 StreamingLLM-style sliding window 和 attention sink,让 draft 只读取 sink blocks 加最近 W blocks,W 的主要设置为四千零三十二,sink 为六十四。
- 在一百万零四万 token context、单张 NVIDIA B200、SGLang 上,Qwen3.6-35B-A3B、Qwen3.5-122B-A10B 和 Nemotron-3-Super-120B-A12B 的 per-step cost 分别下降四十四点三、三十点二和二十八点三个百分点。
- 方法 training-free、drop-in、lossless by construction;window 只影响提议 token,accepted token 仍由 full-attention verifier 决定。

核心方法
- 在 paged-KV serving 中缩小 draft 的 block table,只保留 sink blocks 和 recent W blocks;target verifier 的 block table 不变。
- draft KV pool 可压缩成 W 加 n_sink 的 ring buffer,dead KV 不再占用持续增长的显存预算。
- 评测使用 RULER、LongBench-v2 和 BABILong,指标包括 acceptance length、TPOT、speedup;QA 生成最多五百一十二 new tokens。
- 实验以 bf16 KV、tensor parallel degree 一、CUDA graphs 开启为主,另做 TP2、H100-80GB replication 和 backend ablation。

实验成果
- 一百万 context、d 等于七、batch 等于一时,Qwen3.6-35B per-step 从二十六点四 ms 降到十八点三 ms,提升四十四点三个百分点;Qwen3.5-122B 从三十四点五降到二十六点五 ms,提升三十点二个百分点;Nemotron 从三十三点一降到二十五点八 ms,提升二十八点三个百分点。
- RULER niah_multiquery_enum 上,Qwen3.6-35B 的 end-to-end speedup 为正百分之五十三,相对 dense baseline 为二点五五倍,TPOT 从五点九四降到三点八九 ms。
- B200 replication 中,dense/native/windowed 的 TPOT 分别为十二点二六、七点四八和五点零五 ms;speedup 分别为一倍、一点六四倍和二点四三倍。
- 在六个 throughput-latency panels 中五个由 Windowed-MTP 同时压过 native 和 dense;Nemotron + FWE 是唯一例外。


| 模型 | Native per-step | Windowed per-step | 降低幅度 |
|---|---|---|---|
| Qwen3.6-35B | 26.4 ms | 18.3 ms | 44.3% |
| Qwen3.5-122B | 34.5 ms | 26.5 ms | 30.2% |
| Nemotron-3-120B | 33.1 ms | 25.8 ms | 28.3% |
总结与反思
- 结果总结:Windowed-MTP 把长上下文 speculative decoding 的主要开销从 draft full-context scan 中剥离出来,并在多模型和多硬件上恢复速度收益。
- 局限性:收益依赖 draft attention 在总成本中的比例;far-context 真有关键 token 时 acceptance length 可能下降,百分比收益也依赖 serving backend。
- 前沿见解:推理系统的优化重点正在从「把 verifier 做得更快」扩展到「避免 draft 为了提议而扫描无用历史」。
Agent
10. PATS:把 skill 变成训练期脚手架,策略变强后自动撤掉(原文)
信号源:原文作者机构编号为一、二,HTML 未展开机构全称
认知提取
很多 Agent RL 训练失败,是因为弱策略反复犯同一种错,rollout group 缺乏对比度。PATS 不把外部 skill 当成部署时永久记忆,而把它当成随策略能力变化的训练脚手架:该扩展时扩展,该修订时修订,该压缩时压缩,最终部署时全部丢弃。这样既能提供即时支持,又不把推理永远绑在外部提示上。
论文摘要
- scaffold 分为 general、task-specific 和 mistake 三层,每个条目包含可执行规则与自然语言适用条件。
- rollout group 同时用于更新 policy、构造 evidence card 和驱动下一轮 scaffold edit;controller 根据 competence 和 scaffold pressure 选择 EXPAND、REVISE、COMPRESS 或 FORCED_PRUNE。
- 在 ALFWorld 和 WebShop 上,PATS 相比 GRPO 最高提升十七点六个 ALFWorld SR points 和十八点六个 WebShop SR points;在七个 search-augmented QA benchmark 上少用百分之三十二点一的 prompt tokens。

核心方法
- 先进行 scaffold-conditioned SFT,让模型学会读取 scaffold schema,再使用只由环境奖励优化的 GRPO。
- 每轮用冻结 scaffold snapshot 生成 trajectories;policy 更新后,evidence builder 汇总 success/failure 对比,refiner 只能提出受限编辑,并由 deterministic validator 校验。
- scaffold 最多三十个 entries、两千 tokens;retrieval budget 为 top four task skills、top three general skills 和 top three mistakes。
- 部署时丢弃 refiner、evidence builder 和 scaffold state,只保留最终 policy,因此训练期 support 不等于运行时外部依赖。



实验成果
- 一点五 B ALFWorld 中,GRPO 的 overall SR 为六十七点八六,PATS 无 scaffold 部署为八十点七一,平均 interaction tokens 从一万四千七百二十三降到一万零二百四十五。
- 七 B ALFWorld 中,GRPO 为七十一点六七,PATS 为八十九点二九;七 B WebShop 的 Score 从零点七八四升到零点八七八,SR 从五十七点六零升到七十六点二零。
- 去掉 REVISE 后,一点五 B ALFWorld SR 从八十点七一降到六十八点一零;去掉 online training scaffold 则降到七十三点五七,说明「编辑和删除」比静态 skill 库更重要。
- controlled skill-removal diagnostic 中,supported 与 unsupported teacher forcing 的 NLL gap 从零点一一七零降到零点零七二三,相对下降百分之三十八点三。


| 设置 | ALFWorld All SR | WebShop Score | WebShop SR | Prompt tokens |
|---|---|---|---|---|
| 1.5B GRPO | 67.86 | 0.731 | 52.80 | 14,723 |
| 1.5B PATS | 80.71 | 0.795 | 56.33 | 10,245 |
| 7B GRPO | 71.67 | 0.784 | 57.60 | 17,060 |
| 7B PATS | 89.29 | 0.878 | 76.20 | 10,455 |
总结与反思
- 结果总结:PATS 的核心不是给模型更多 skill,而是让 support 随策略学习阶段改变,并在部署时撤掉。
- 局限性:PATS 的效果依赖 scaffold interface initialization;diagnostic 集合和小类别 benchmark 的统计功效有限。
- 前沿见解:Agent RL 的 curriculum 不一定要改任务难度,也可以改「当前策略应该看到哪些可验证支持」。
应用体系
11. Agent-Guided Concept Discovery:让术中切缘评估从黑箱走向可解释概念(原文)
信号源:加拿大女王大学
认知提取
术中质谱数据比切除组织样本更嘈杂、更少标签,黑箱分类器即便有效也很难解释。该论文让 Agent 参与概念发现:它从高低激活谱区中找区分性 m/z 区域,再用生化知识库和知识图谱把 latent concept 绑定到可能的代谢物和通路。概念不是事后可视化,而是参与训练目标和临床泛化。
论文摘要
- 输入为 REIMS 光谱,先用冻结的 DreaMS foundation model 生成 embedding,再映射到八个 latent concepts。
- Qwen2.5-7B-Instruct reasoning agent 负责谱区识别、生化 grounding、概念记忆和 relevance feedback;主要知识库为 RaMP。
- 在 Skin 和 Breast Cancer 数据集上,模型提高 balanced accuracy 与 sensitivity;在一个二十七分钟、包含一千六百一十六条 spectra 的术中乳腺案例中,两个模型均达到 perfect tumor sensitivity,但概念增强模型 false positives 更少。

核心方法
- concept activation 为 sigmoid(wkᵀzi + bk),并用 cosine similarity regularization 减少概念冗余。
- Agent 对高低激活样本做 discriminative spectral region identification,再查询 RaMP,维护 concept description、谱区间、反馈、性能和 relational knowledge graph。
- 每个 concept 有一个 sigmoid 门控权重 αk;移除概念后测量预测变化 ΔYk,将概念分为高相关和低相关两组,构造 Agent-Guided Concept Alignment Loss。
- 训练最多四十 epoch,batch size 三十二,学习率一乘十的负三次方,所有实验重复三十次并报告 mean ± standard deviation。

实验成果
- Skin Cancer 上,方法的 balanced accuracy、sensitivity、specificity、AUROC 为零点七六、零点七零、零点八二、零点八六;Transformer 为零点七四、零点七二、零点七六、零点八五。
- Breast Cancer 上,方法为零点八七、零点八一、零点九三、零点九八;DreaMS 为零点八四、零点八零、零点八九、零点九六。
- 乳腺知识图谱中,m/z 一百三十到一百三十五、二百一十一到二百二十二、八百九十二到八百九十四的子带,在 PR-negative samples 中出现更高激活。
- 消融表明,加入 metabolic database 后性能上升,再加入 knowledge graph 后进一步上升;guideline component 主要减少 Agent 的 hallucinated semantic explanations。

| 数据集 | 方法 | Balanced Accuracy | Sensitivity | Specificity | AUROC |
|---|---|---|---|---|---|
| Skin | Transformer | 0.74 ± 0.027 | 0.72 ± 0.111 | 0.76 ± 0.084 | 0.85 ± 0.015 |
| Skin | Ours | 0.76 ± 0.026 | 0.70 ± 0.043 | 0.82 ± 0.031 | 0.86 ± 0.013 |
| Breast | DreaMS | 0.84 ± 0.028 | 0.80 ± 0.051 | 0.89 ± 0.026 | 0.96 ± 0.012 |
| Breast | Ours | 0.87 ± 0.018 | 0.81 ± 0.044 | 0.93 ± 0.024 | 0.98 ± 0.013 |
总结与反思
- 结果总结:Agent 发现的概念同时承担解释和训练信号,乳腺数据上的 balanced accuracy 与 AUROC 都高于基线。
- 局限性:术中案例规模小,框架依赖一般性 metabolic database query;更针对性的查询和 gene-level information 尚未加入。
- 前沿见解:在医疗 AI 中,Agent 的价值不只在于替代分类器,而在于把不可标注的临床概念转成可审计的关系结构。
Benchmark
12. ICAE-Bench:模糊产品意图下,编码 Agent 的最佳通过率仍只有三十八点二(原文)
信号源:美团、复旦大学、南洋理工大学
认知提取
静态代码补全 benchmark 默认需求已经被写清楚,但真实的 vibe-coding 更像从一句模糊产品想法开始,靠多轮提问、规划、调试和仓库级构建把它落地。ICAE-Bench 把隐藏约束从需求里拿走,再用 User Agent 只在被问到时逐步揭示。结果很直接:即使支持交互,最强模型在四百八十个任务上的 overall pass rate 也只有三十八点二。
论文摘要
- ICAE-Bench 从真实开源仓库的可执行行为出发,构造 GroundPRD,再隐藏 API、边界情况和架构约束,生成 Fuzzy L1 到 L3 需求。
- User Agent Data 存储隐藏约束和示例;Ultimate Image 删除原始代码和测试,仅保留干净运行环境;最终用黑盒测试和多维诊断评估功能、语义、API、结构、设计和交互质量。
- 完整数据集包含四百八十个任务,覆盖十二种语言;ICAE-Bench-Lite 包含五十个任务,默认每任务最多十六轮交互。

核心方法
- 管线依次执行 repository filtering & test refactoring、GroundPRD synthesis & fuzzification、User Agent Data extraction、Ultimate-Image packaging 和 artifact verification。
- Native cases 来自原始测试重构,Enhanced cases 覆盖隐藏边界;LLM 评审与黑盒执行共同验证 Fuzzy PRD、User Agent response 和 GroundPRD 的语义与行为一致性。
- 评测模型包括 GPT-5.5、Claude-Opus-4.8、Claude-Sonnet-4.6、GLM-5.1、Gemini-3.1-Pro 和 MiniMax-M2.5;框架包括 Claude Code 和 OpenHands。
- 主要指标分成 functional correctness、agentic evaluation、structural assessment 和 interaction quality,constraint coverage 不被当作通过率的替代指标。

实验成果
- ICAE-Bench 全集 Claude Code 结果中,Claude-Opus-4.8 overall pass rate 为三十八点二,GPT-5.5 为三十七点二,Gemini-3.1-Pro 为二十七点零,GLM-5.1 为二十六点六,Claude-Sonnet-4.6 为二十一点八,MiniMax-M2.5 为零点八。
- ICAE-Bench-Lite 上,GPT-5.5 为五十三点三,Claude-Opus-4.8 为四十八点二;Lite 更适合低成本消融,不适合最终模型排名或语言级结论。
- 把 Public cases 直接放入 workspace 后,GLM-5.1 overall pass rate 从三十七点四升到六十一点八,但 constraint coverage 从六十三点八降到六十一点二,说明更多约束覆盖不必然转化为更高通过率。
- OpenHands 替代 Claude Code 后,所有模型明显下降;GPT-5.5 从五十三点三降到三十一点五。
- User Agent 的模型也会改变结果:Gemini-3.1-Flash-Lite 的 constraint coverage 最高,为百分之七十五点二,但 overall pass rate 反而最低,为二十七点四。








| 模型 | ICAE-Bench Overall | ICAE-Bench-Lite Overall |
|---|---|---|
| GPT-5.5 | 37.2% | 53.3% |
| Claude-Opus-4.8 | 38.2% | 48.2% |
| Gemini-3.1-Pro | 27.0% | 36.6% |
| GLM-5.1 | 26.6% | 40.0% |
| Claude-Sonnet-4.6 | 21.8% | 40.2% |
| MiniMax-M2.5 | 0.8% | 2.8% |
总结与反思
- 结果总结:ICAE-Bench 把编码 Agent 的评估从静态代码任务推进到模糊需求、交互澄清和 repository-level construction,强模型的完全通过率仍低于四成。
- 局限性:Lite 版本不适合最终排名;LLM critic 与人工评分只有中等正相关,Pearson r 为零点三七二到零点四七一。
- 前沿见解:编码 Agent 的下一道门槛不是再多写几行代码,而是识别哪些隐藏约束必须问、哪些环境信息会制造集成负效应。
本期收束
今天最值得记住的不是某个单点 SOTA,而是「结构是否让能力可复用」。MIRROR 用视图结构复用推理,AREX 用验证状态复用研究进展,3D-Mem 用空间结构复用具身观察;它们共享一个方向:成功信息只有进入正确的中间结构,才会在下一步继续产生价值。
系统侧的四篇论文把代价边界补齐了:ACM 处理 context 的生命周期,PATS 处理训练期 support 的撤销,Windowed-MTP 处理 draft KV 的读取范围,ICAE-Bench 则证明交互预算和 constraint coverage 都不是正确率的充分条件。对下一轮研究和工程判断而言,优先读那些把「状态、反馈、成本、证据」一起纳入设计的工作,通常比只报告更高平均分更有信息量。
Related content
- Sign in to comment.
