奇绩信号Alpha Sight 2026年7月27日【文字版】

奇绩信号Alpha Sight 2026年7月27日【文字版】

本期精选 7 月 24 日 arXiv 当日提交区的十二篇 AI 论文,拆解跨模态推理、深度研究 Agent、机器人数据、长上下文系统、具身记忆与交互式编码评测的最新方法和证据边界。

本期判断

按 arXiv recent 列表的分组日期,本期覆盖 2026 年 7 月 24 日 当日提交区的十二篇 AI 论文。由于 7 月 25—26 日为周末,详情页的版本时间在部分论文中显示为 7 月 23 日 UTC;本文以 arXiv 列表日期作为本期收录边界,并用详情页核对标题、作者、摘要和版本信息。
这批论文有三个共同信号。第一,模型能力正在从「更大的模型」转向「更有结构的过程」:MIRROR 把视图差异变成跨模态监督,AREX 把验证拆成递归改进,TTEL 则把推理错误定位到 token 级别。第二,Agent 的瓶颈越来越像系统工程问题:上下文生命周期、训练脚手架、长上下文 KV 访问和交互式需求澄清,都直接决定最终能力。第三,具身和科学任务都在提醒研究者,记忆或表征只有绑定到空间、构象或可验证约束,才会从「存过」变成「能用」。

头条

1. MIRROR:让强视图教弱视图,跨模态推理不再只是混合采样(原文

信号源:南加州大学、卡内基梅隆大学

认知提取

同一道几何题,图像、文字和图文联合输入可能各自暴露不同的推理短板。MIRROR 的关键判断是:不要把三种视图简单混在同一个 RL batch 里,而要在每道题上找到当前最强视图,再把它的偏好定向传给较弱视图。它把模态不一致从鲁棒性问题改造成了一种自监督信号。

论文摘要

  • 作者构造 ODA-Data,把同一几何问题改写为 text-dominant、image-dominant 和 combined 三种配对视图,并筛选出只在某个视图下可解的样本。
  • MIRROR 对每道题分别进行十六次 rollout,按当前成功率自适应选择 teacher view,再用 on-policy distillation 和 reverse-KL 监督 student view。
  • 在 ODA-Val 上,image pass@16 从四十二点五七提升到五十七点零六,text pass@16 从八十点二二提升到八十六点一零;GeoInt pass@16 提升七点五九个百分点,MathVerse mean judge score 提升五点二二个百分点。
MIRROR 通过强视图向弱视图迁移推理的整体框架
▲ 图一:MIRROR 先比较同一问题的多种视图,再以当前最强视图作为 teacher 监督较弱视图,原图见论文原文

核心方法

  • 数据构造分为过滤 easy problems、生成并验证 TikZ 图、重写 image-dominant prompt 和模态特定评估四步,最终得到约两千个配对样本,训练集占百分之八十五,验证集占百分之十五。
  • student 只在自己的 restricted view 上采样,teacher 不直接提供另一条生成轨迹,而是对 student 自己的轨迹重新评分,减少 teacher 轨迹分布带来的偏差。
  • 总目标为 outcome-reward RL 加 reverse-KL 正则。teacher 使用 policy 的 EMA,衰减系数为零点九九,防止当前策略在长程训练中自我强化错误。
  • 训练以 Qwen3-VL-4B-Instruct 为底座,使用 verl、GRPO 和 vLLM;prompt 上限四千零九十六 token,response 上限一万六千三百八十四 token,每个 prompt 十六次 rollout。
MIRROR 单题训练 reward 对比
▲ 图二:单题训练中,MIRROR 的 reward 高于单模态 GRPO 和 naive mixed-modality GRPO,原图见论文原文

实验成果

  • 在 FLOPs 对齐的比较中,MIRROR step 一百五十的 image reward 为零点二六二五,GRPO step 二百为零点二三六八;text reward 分别为零点四五八一和零点四三八七。
  • MIRROR 的最大净可解性增益为正百分之八点九五;ODA-Train 中 image-dominant 与 text-dominant 两种视图都能解出的比例从百分之四十二点五升到百分之六十点七。
  • teacher 选择消融表明,固定使用文本、图像或联合视图都不如按问题选择 teacher。reverse-KL 系数零点零一在整体排序中最好,系数零点一会造成训练崩溃。
MIRROR 训练 reward 曲线
▲ 图三:不同训练策略的 reward 曲线,显式的定向迁移比简单混合视图更有效,原图见论文原文
MIRROR 带来的净可解性增益
▲ 图四:相对于 base model 的净 solvability 变化,MIRROR 的增益最大,原图见论文原文
MIRROR 中 EMA teacher 与当前策略 teacher 的稳定性对比
▲ 图五:当前策略 teacher 约在九十步后不稳定并在约一百七十步崩溃,EMA teacher 则保持较低 entropy 和 reference KL,原图见论文原文
设置ODA-Val Image pass@16ODA-Val Text pass@16GeoInt pass@16MathVerse mean
Base model42.5780.2270.7941.31
Strongest single-view GRPO48.7883.16未报告未报告
MIRROR57.0686.1078.3846.53

总结与反思

  • 结果总结:强视图不是固定的全局 teacher,而是随问题变化;MIRROR 把跨模态 transfer 方向显式化,四个主要指标均超过 base model。
  • 局限性:验证集中在几何问题,teacher 选择仍主要依赖 rollout reward;当前策略 teacher 的长程稳定性不足。
  • 前沿见解:多模态后训练的下一步不只是增加输入模态,而是建立「同一潜在问题的多视图」和「视图间定向监督」机制。

2. AREX:深度研究 Agent 用递归验证改进答案,而不是只把搜索轨迹拉长(原文

信号源:北京智源人工智能研究院

认知提取

深度研究任务的难点并不只是找到一个候选答案,而是逐条确认它满足所有约束。AREX 利用发现和验证之间的不对称,把研究代理拆成内层搜索和外层改进:内层找证据,外层审查未解决断言,再决定精炼还是重启。真正的增益来自把长历史压缩成一个可继续行动的状态。

论文摘要

  • AREX 提出 Recursive Self-Improving agent,在每轮研究中维护 provisional answer、supporting evidence 和零到一百的 confidence score。
  • Autonomous Context Updating 会保留 verified findings、source identifiers、current candidates、unresolved constraints、validity concerns、rejected candidates 和 next-step plan。
  • 评测覆盖 BrowseComp、GAIA、xbench-2510、DeepSearchQA、WideSearch 和 HLE with tools;AREX-Base 在 WideSearch-en 得分八十二点零,在 HLE tool 得分五十二点四。
AREX 的基准表现
▲ 图六:AREX 与闭源、开源及专用研究代理的基准比较,原图见论文原文

核心方法

  • 内层循环通过 search、visit、python 等工具收集证据,生成临时答案;外层根据置信度检查轨迹是否可恢复,再选择 Refine 或 Restart。
  • ACU 将不断膨胀的交互历史压缩为 improvement state,避免下一轮研究被无关的工具输出和旧假设干扰。
  • 训练分为 recursive task synthesis、teacher trajectory quality control、multi-stage agentic mid-training 和 step-aware RL;关键步骤包括首次获得证据、推翻旧假设、调用 context update。
  • 每个 episode 最多三百个 inner research turns、五个 outer self-improvement operations;WideSearch 使用 Item-F1,DeepSearchQA 使用 F1,其余任务报告 accuracy。
AREX 的递归自我改进框架
▲ 图七:内层研究循环维护答案和证据,外层循环根据置信度选择接受、精炼或重启,原图见论文原文

实验成果

  • 在 BrowseComp 上,没有 ACU 且没有外层循环的配置准确率为五十九点六;加入 ACU 后为七十一点四;ACU 与外层循环同时启用时为八十二点五,完整配置较最弱设置高二十二点九个百分点。
  • AREX-Turbo 在 BrowseComp、GAIA、xbench-2510、DeepSearchQA、WideSearch-en 和 HLE tool 上分别达到七十点七、八十一点六、五十七点零、七十八点五、六十八点五和四十点六。
  • 正确输出落在九十到一百置信度区间的比例从无 ACU 时的百分之八十九点三提升到有 ACU 时的百分之九十五点九;错误输出中低于六十置信度的比例从百分之六十一点零降到百分之五十五点二。
  • 关键步骤的平均 loss 高于普通步骤:evidence discovery 为零点二七七,path rejection and redirection 为零点二九八,key context-update 为零点三零零,说明稀疏奖励确实集中在过程节点。
AREX 正确与错误输出的 confidence 分布
▲ 图八:ACU 使正确答案更多集中到高置信度区间,也让错误答案更容易暴露为低置信度,原图见论文原文
AREX 关键步骤的平均 loss
▲ 图九:证据发现、路径拒绝与 context update 的训练 loss 高于普通步骤,原图见论文原文
BrowseComp 配置Accuracy
无 ACU、无外层循环59.6
无 ACU、有外层循环69.8
有 ACU、无外层循环71.4
有 ACU、有外层循环82.5

总结与反思

  • 结果总结:AREX 的关键增益来自 ACU、外层递归和关键步骤监督的叠加,而不是单纯增加搜索轮数。
  • 局限性:自蒸馏实验只在没有 ACU、外层循环和 key-step supervision 的简化配置上进行,不能直接归因到完整 AREX 配方。
  • 前沿见解:深度研究 Agent 的训练目标正在从最终答案 reward 走向「哪个中间状态值得保留、哪个假设应该被推翻」的状态价值学习。

3. AXIS:把机器人数据采集变成可增长的社区基础设施(原文

信号源:Axis Robotics、加州大学伯克利分校、佐治亚理工学院、德州农工大学、约翰斯·霍普金斯大学、宾夕法尼亚大学、密歇根大学、新加坡国立大学、南洋理工大学

认知提取

机器人学习缺的往往不是又一个模型,而是能持续产生、清洗、验证和扩增演示数据的管线。AXIS 把网页遥操作、任务生成、成功检查、轨迹精炼和仿真增强串成一条可持续数据引擎。它给出的信号是,数据多样性和验证机制比单纯复制同分布轨迹更能决定 VLA 的鲁棒性。

论文摘要

  • AXIS 当前包含二百零七个操作任务、五万条以上人类演示轨迹和六万多个任务或场景变体。
  • 数据引擎支持浏览器 MuJoCo-WASM 遥操作、自动任务生成、成功验证、质量过滤、静态片段移除、轨迹平滑与重采样。
  • 以 π0.5 为起点,在 LIBERO-Plus robustness suite 上,AXIS-100% 的 overall success rate 为八十八点八,较 vanilla π0.5 的八十三点九高四点九个百分点;RoboCasa matched control 为五十七点五。
AXIS 从任务生成到真实世界验证的整体数据引擎
▲ 图十:AXIS 把任务生成、网页遥操作、数据精炼、真实感增强、策略学习和真实验证统一在一条管线中,原图见论文原文

核心方法

  • Infrastructure layer 负责任务生成和浏览器遥操作;Dataset layer 统一轨迹表示、成功验证和清洗;Model layer 对接 visuomotor imitation policy 与 VLA。
  • 轨迹处理先由 task-specific success checker 重新验证,再移除静态片段、平滑、重采样到固定控制频率,最后在 IsaacSim 中随机化物体姿态、光照、材质、相机和摩擦。
  • 训练从 released π0.5 checkpoint 开始,可先在 AXIS 或 RoboCasa corpus 上 continual pretraining,再按默认 LIBERO recipe fine-tune。
  • 评测对 Camera、Light、Sensor Noise、Background、Layout、Language 和 Robot 七个扰动轴固定 rollout budget,并额外在 AXIS-100% held-out task split 检查分布偏移。
AXIS 的仿真增强多样性
▲ 图十一:同一任务通过材质、光照、背景、场景布局和初始状态随机化生成多种变体,原图见论文原文

实验成果

  • 数据精炼后,平滑加重采样相对 raw teleoperation 将 mean acceleration 降低六十三点九个百分点,将 mean jerk 降低八十点八个百分点;replay success 从百分之百降到百分之八十六点二。
  • AXIS-100% 相比 vanilla π0.5 的最大增益出现在 sensor noise,达到正十三点七个百分点;camera 为正十一点三个百分点,background 为正三点七个百分点,layout 为正二点六个百分点。
  • 同等轨迹数量下,RoboCasa matched control overall 只有五十七点五,说明提升不只是数据量效应。
AXIS 数据集规模与覆盖
▲ 图十二:AXIS 数据集由二百零七个任务、五万零一百二十九个 episode 和五万以上人工演示构成,原图见论文原文
训练条件OverallCameraSensor NoiseLayoutRobot
π0.5 vanilla83.972.582.582.974.4
AXIS-25%84.777.586.285.576.9
AXIS-50%85.768.891.288.279.5
AXIS-100%88.883.896.285.578.2
RoboCasa matched57.535.263.268.039.4

总结与反思

  • 结果总结:AXIS 的主要价值在数据闭环,规模增长和扰动多样性共同提升了视觉、噪声与场景变化下的鲁棒性。
  • 局限性:真实世界验证的任务和机器人覆盖仍有限,且语言与 robot-pose 轴的增益不如视觉扰动稳定。
  • 前沿见解:VLA 的数据基础设施可能会像开源软件一样增长,但前提是任务定义、成功检查和数据质量都可被社区复用。

4. TTEL:测试时扩展把错误定位到 token,推理成本可以少一半(原文

信号源:Google DeepMind

认知提取

独立采样的问题是每次都从头写一条完整思路,顺序 refinement 的问题是整条轨迹结束后才知道哪里错。TTEL 用反馈前后的 token 概率差,找出最可能的错误位置,再从有效前缀分支。它把 test-time scaling 从「再试几次」改成了「保留已经正确的部分,再把预算花在错误局部」。

论文摘要

  • TTEL 计算原始 student probability、真实反馈下的 teacher probability 和 null-context baseline,利用 filtered spike 抵消一般性上下文扰动。
  • 若存在可行动 spike,就在最大 filtered spike 之前截断并重生成;没有可定位错误时才从 root prompt restart。
  • 在 Qwen3-8B 和 LiveCodeBench 上,TTEL pass@64 为七十一点零,generated tokens 为三十六万零四百,独立采样为六十四点六和七十三万五千;AIME-25 上 TTEL pass@16 为五十四点二,独立采样为四十五点零。
TTEL 的 pass@k 与生成 token 成本 Pareto 前沿
▲ 图十三:LiveCodeBench 上 TTEL 在 pass@k 与平均 generated tokens 之间形成更优的 Pareto 前沿,原图见论文原文

核心方法

  • 对轨迹每个 token 计算 student probability 和反馈后的 teacher probability,定义 raw feedback-conditioned spike,再减去 null feedback spike 得到 filtered score。
  • 分支点由阈值集合确定:真实反馈造成的概率下降必须超过零点零六,null baseline 的扰动不能超过零点零六。
  • TTEL-GenFB 使用上一轮答案、完整 reasoning trace 和静态失败消息;TTEL-EnvFB 在 LiveCodeBench 中使用 runtime error 或失败 public test cases。
  • 评测采用 temperature 一、top-p 一、最大生成长度一万六千三百八十四 token;模型为 Qwen3-8B 与 Qwen3-4B-Thinking-2507。
TTEL 在 AIME-25 上的 Pareto 前沿
▲ 图十四:AIME-25 上 TTEL 的推理成本与 pass@k 对比,原图见论文原文

实验成果

  • LiveCodeBench 上,TTEL pass@64 为七十一点零正负一点六,token 成本为三十六万零四百正负七百;独立采样分别为六十四点六正负一点零和七十三万五千正负一千一百。
  • HMMT 上,TTEL pass@64 为六十九点五正负零点六,token 成本为三十一万二千八百正负一万零七百;独立采样 pass@64 为六十七点四。
  • 去掉完整 thought trace 后,TTEL-GenFB pass@k 从零点六三零降到零点五九七;使用更丰富 environment feedback 的 TTEL-EnvFB 为零点六五八。
  • 去掉 null-baseline filter 后,平均 spike 数量从十九点三暴增到四百八十六点零,downstream pass@k 降到零点五九二。
TTEL 在 HMMT-25 上的 Pareto 前沿
▲ 图十五:HMMT-25 上 TTEL、独立采样和多轮 refinement 的成本与准确率关系,原图见论文原文
TTEL 的反馈类型消融
▲ 图十六:完整 reasoning trace 和 environment feedback 都会影响错误定位质量,原图见论文原文
TTEL 去掉 null-baseline 后的错误 spike
▲ 图十七:不做 null-baseline subtraction 会制造大量 false-positive spike,原图见论文原文
TTEL 的额外模型实验
▲ 图十八:附加模型和任务上的 test-time scaling 对比,原图见论文原文
TTEL 的附加消融结果
▲ 图十九:附加上下文和分支策略消融,原图见论文原文
任务TTEL pass@kTTEL tokensIndependent Sampling pass@kIndependent Sampling tokens
LiveCodeBench, k=6471.0 ± 1.6360.4k ± 0.7k64.6 ± 1.0735.0k ± 1.1k
AIME-25, k=1654.2 ± 3.6146.6k ± 4.5k45.0 ± 3.7228.8k ± 1.0k
HMMT-25, k=6469.5 ± 0.6312.8k ± 10.7k67.4 ± 1.4749.9k ± 0.1k

总结与反思

  • 结果总结:TTEL 在代码和数学任务上同时提高 pass@k、降低生成 token,主要收益来自有效前缀复用。
  • 局限性:方法依赖有信息量的反馈和完整 reasoning trace;数学任务缺少 execution feedback,只能使用 generic feedback。
  • 前沿见解:如果 token-level credit assignment 能被推广到更丰富的交互环境,推理预算将从全轨迹搜索转向局部错误修复。

认知模型

5. Agentic Context Management:Agent 记忆首先是生命周期和架构问题(原文

信号源:Maximem

认知提取

把历史存进向量库不等于 Agent 获得了记忆。论文把 context 当成一种要被设计、摄取、隔离、预取、压缩和合并的生命周期资产,并指出最危险的不是「没有检索到」,而是「检索到了但仍不够支撑推理」。这是一篇偏系统论的论文,强项是把成本、隔离和信息完整性放进同一个问题里。

论文摘要

  • Agentic Context Management 包含 architecting、ingesting、scoping、anticipating、compacting & consolidation 五个原语。
  • 全量追加历史的 token 成本为 O(n²);粗糙摘要可降为 O(n),但会出现 accuracy cliff;validated compaction 试图在线性成本下保持关键事实可恢复。
  • 论文在 LongMemEval 五百题上报告九十二点零,即四百六十题正确;在 LoCoMo categories 1 到 4 上报告九十三点二。
Agentic Context Management 的五原语生命周期
▲ 图二十:从 architecting 到 ingesting、scoping、anticipating、compacting 的 context 生命周期,原图见论文原文

核心方法

  • Architecting 决定记忆类别、抽取方式、存储位置和保留时间;ingesting 将对话、文档和工具调用转成结构化 memory;scoping 负责 user、customer、client 层级隔离。
  • Anticipating 将可能需要的 context 提前移出关键路径;compacting & consolidation 在超出预算时压缩上下文,并要求压缩后关键事实仍可恢复。
  • 参考实现 Synap 采用 async-first SDK、scope-aware retrieval、conversation compaction 和 streaming channel;集成模式为 FETCH、COMPACT、MODEL、INGEST。
  • 评测使用 gpt-5-mini 作为答案模型和 judge;LoCoMo 只报告 categories 1 到 4,排除 adversarial abstention category 5。
全量追加、粗摘要和 validated compaction 的成本关系
▲ 图二十一:全量追加的输入 token 随轮次呈二次增长,bounded context 把增长压为近似线性,原图见论文原文
ACM 的 accuracy-cost frontier
▲ 图二十二:full-append 保持 fidelity 但成本高,粗摘要成本低但有损,validated compaction 试图兼顾二者,原图见论文原文

实验成果

  • 一个 memory library 在三十二天积累一万零一百三十四条 entries,其中只有三十八条可用,junk rate 为百分之九十九点六。
  • 一个压缩案例把一万八千二百八十二 token 压到一百二十二,任务准确率从百分之六十六点七降到百分之五十七点一,说明「压得更短」不能代替「保留足够信息」。
  • LongMemEval 的自报结果为九十二点零,优于论文列出的 SuperMemory 八十五点二、八十四点六和八十一点六,以及 Zep 七十一点二;作者明确声明这不是 controlled comparison。
  • retrieval study 中,CodeXGLUE 的 keyword MRR@10 为零点二九零,vector 为零点九一四,但 vector indexing time 为 keyword 的九十七倍;SciQ 则是 keyword 零点八一五、vector 零点六一四。
ACM 的 keyword 与 vector retrieval 对比
▲ 图二十三:不同数据集上的 keyword/vector MRR 与 embedding-generation latency,原图见论文原文
ACM 的系统参考架构
▲ 图二十四:SDK、API、manager/pipeline 与多类型存储组成参考架构,原图见论文原文
ACM 在 LongMemEval 与 LoCoMo 上的结果
▲ 图二十五:LongMemEval 报告九十二点零,LoCoMo categories 1 到 4 报告九十三点二,原图见论文原文
数据集配置结果
LongMemEval500 questions92.0%(460/500)
LoCoMocategories 1-493.2%

总结与反思

  • 结果总结:ACM 把 memory 从存储组件提升为 context lifecycle,核心指标同时涉及准确率、token 成本、租户隔离和检索延迟。
  • 局限性:benchmark 不测生产负载下的 latency、每任务 token cost 和 context rot;系统中的 anticipatory prediction、图遍历和验证机制有 proprietary 部分。
  • 前沿见解:Agent infrastructure 的下一层竞争点不只是 recall,而是 decision-level context 和 organization-scale context 的完整性。

多模态

6. VLM-IE3D:用隐式和显式几何 token 让 VLM 真正进入三维空间(原文

信号源:南洋理工大学、阿里巴巴达摩院、胡潘实验室

认知提取

只从 RGB 学隐式 3D 表示,模型可以知道大概的空间布局,却未必能回答「这个物体离墙多远」或「哪个框更紧」。VLM-IE3D 的做法是同时保留全局隐式几何和可解释的显式几何属性,再用 cross-attention 融合。它没有宣称取代真实 3D 输入,而是证明视频 RGB 可以被组织成更接近 3D reasoning 的中间表示。

论文摘要

  • 输入为 RGB 视频和自然语言问题,模型通过 AnySplat 生成 Implicit Geometry Tokens 与显式 depth、camera pose、3D Gaussian splats 或 point maps。
  • 3D-aware adapter 先压缩空间相邻 token,再用 implicit-explicit attention 以 IGTs 为 query、EGTs 为 key/value,最后与 2D visual tokens 相加。
  • VLM-IE3D 使用 Qwen2.5-VL-3B,冻结 2D visual encoder 和 3D geometry encoder,在 3D video detection、visual grounding、dense captioning 和 spatial reasoning 上评测。
VLM-IE3D 的隐式与显式几何表示
▲ 图二十六:仅隐式几何形成粗粒度 cognitive map,显式几何补充局部细节,两者与 2D cues 联合建模,原图见论文原文

核心方法

  • 2D visual encoder 提取 2D tokens;AnySplat 产生 IGTs;explicit embedding module 把 depth maps 等 3D attributes 转成 EGTs。
  • 2×2 spatial merging 后,IEA 对 IGTs 和 EGTs 做 multi-head cross-attention,再把融合后的 3D tokens 与 2D tokens 做 element-wise addition。
  • 训练一 epoch,Adam 学习率从一乘十的负五次方衰减至零,使用八张 H100 80G,输入分辨率三百九十二乘五百一十八,压缩后 token 数为二百五十二。
  • 3D grounding 使用 ScanRefer 的三万六千六百六十五条 object descriptions 和五百六十二个 indoor scans;3D detection 使用四帧、一 FPS 的视频片段。
VLM-IE3D 的整体框架
▲ 图二十七:2D encoder、3D geometry encoder 和 explicit embedding 三路信息经 adapter 汇合,再交给 Qwen2.5-VL,原图见论文原文
VLM-IE3D 的 3D-aware adapter
▲ 图二十八:IEA 通过隐式 token 查询显式 token,将全局空间先验和可解释局部几何结合,原图见论文原文

实验成果

  • Scan2Cap 上,VLM-IE3D 的 C@0.5 为八十点四,M@0.5 为二十八点八;Qwen2.5-VL-3B 为五十八点零和二十六点九。
  • ScanRefer 上,VLM-IE3D 的 Acc@0.25 为四十三点二,使用 proposal refinement 后为五十五点四;Acc@0.50 为十六点九,refinement 后为四十八点九。
  • 3D video detection 上,VLM-IE3D 的 P25、R25、F1 分别为四十四点二、四十一点九、四十二点八,VG LLM 为四十一点七、三十五点七、三十八点二;VLM-IE3D 速度为六 FPS,参数三点二三 B。
  • VSI-Bench 的正文报告平均表现为百分之四十七点六,并指出超过 Gemini-1.5-Pro 的百分之四十五点四;原表中 Avg. 列另列三十一点九,本文保留两处原文口径,不做合并推断。
  • ablation 显示,baseline 的 P25/R25/F1 为三十二点一、三十点一、三十点九;加入 IGTs 和 EGTs 后为四十四点二、四十一点九、四十二点八。
VLM-IE3D 的 3D visual grounding 定性结果
▲ 图二十九:VLM-IE3D 在目标首次出现的帧和 3D box 定位上更贴近标注,原图见论文原文
VLM-IE3D 的 3D video detection 定性结果
▲ 图三十:VLM-IE3D 对物体形状和空间位置的 3D box 对齐更好,原图见论文原文
VLM-IE3D 的补充 3D detection 对比
▲ 图三十一:补充样例中的 3D video detection 比较,原图见论文原文
VLM-IE3D 的补充 visual grounding 对比
▲ 图三十二:补充样例中的 visual grounding 比较,原图见论文原文
模型Scan2Cap C@0.5Scan2Cap M@0.5Detection P25Detection R25Detection F1
Qwen2.5-VL-3B58.026.932.130.130.9
VG LLM78.628.641.735.738.2
VLM-IE3D80.428.844.241.942.8

总结与反思

  • 结果总结:显式和隐式几何互补,轻量 IEA 在检测和 captioning 上均超过纯 2D baseline。
  • 局限性:显式 3D 输入在精确 grounding 上仍有优势;模型依赖 3D geometry encoder 和 RGB 重建质量。
  • 前沿见解:多模态模型的空间能力可能不需要把完整 3D 场景直接塞进上下文,而是需要可解释、可压缩的几何 token 接口。

具身智能

7. Beyond Episodic Evaluation:连续 EQA 中,记住不等于积累(原文

信号源:马里兰大学帕克分校、德州大学奥斯汀分校、伊利诺伊大学厄巴纳-香槟分校

认知提取

传统 EQA 每问一题就重置环境,容易掩盖记忆架构的真实瓶颈。Sequential-EQA 把同一场景的多个问题连续交给 Agent,结果显示,保留 memory 并不会自动形成可复用知识。只有把视觉证据绑定到 metric 3D 结构的记忆,Agent 才能在减少导航的同时持续提高回答质量。

论文摘要

  • 作者从 OpenEQA 重新组织 scene-level question sequences,固定模型和权重,只改变 episodic 到 sequential 的评测协议。
  • 对比 ExploreEQA、MemoryEQA、3D-Mem 和 UniNavid 四种记忆范式,指标包括 SR、SR_mem、MA、PL、PL_mem 和 SA。
  • 超过百分之六十的 scenes 至少包含十个 query;3D-Mem 在 sequential setting 中把 answer success rate 从二十五点五提高到五十八点八,导航效率提升五十三点三个百分点。
Episodic 与 Sequential EQA 的评测差异
▲ 图三十三:Episodic 评测在每题后清空 memory,下一题必须重新探索,原图见论文原文
Sequential EQA 的跨问题记忆复用
▲ 图三十四:Sequential 评测保留上一题终态记忆,下一题可直接利用先前场景知识,原图见论文原文

核心方法

  • Episodic 形式从空记忆 m0 开始,sequential 形式将上一题结束时的 mi 传给下一题;所有网络权重冻结,不做 sequential training。
  • ExploreEQA 存储 occupancy 和 frontier scores;MemoryEQA 存储 RGB、pose、language description 和 embedding;3D-Mem 存储 3D point cloud 与 visual embeddings;UniNavid 依赖 transformer hidden state。
  • 3D-Mem 采用 spatially indexed 3D lookup;评测指标中 MA = SR_mem - SR,SA =(PL - PL_mem)/PL 乘百分之百。
Sequentialized OpenEQA 的问题数量分布
▲ 图三十五:大多数 scene 有十到十三个问题,横线表示至少含有 Nk 个问题的 scene 累计比例,原图见论文原文

实验成果

  • ExploreEQA 的 SR/SR_mem/MA/PL/PL_mem/SA 为四十三点八、四十六点五、二点七、八十四点三、八十四点三、零;MemoryEQA 为六十一点零、六十二点四、一点四、四十三点六、四十三点九、负零点五。
  • 3D-Mem 为二十五点五、五十八点八、三十三点三、五点六、二点六、五十三点三;UniNavid 为三十六点四、三十七点三、零点九、十二点二、十二点四、负一点五。
  • 在连续三个问题的定性样例中,3D-Mem 从 episodic 下答对三题中的一题,变为 sequential 下三题全对;对应路径长度明显下降。
  • Unitree Go2 真实部署中,UniNavid 在室内和室外均为百分之十五;3D-Mem 从百分之二十升到百分之四十;MemoryEQA 从百分之四十升到百分之四十七。
Sequential memory reuse 下的 accuracy-efficiency tradeoff
▲ 图三十六:3D-Mem 同时提高平均答案分数并降低导航时间和距离,原图见论文原文
不同 query index 下的 accuracy 与 navigation time
▲ 图三十七:只有 3D-Mem 在多个 query position 上持续表现出正向 accuracy delta,原图见论文原文
3D-Mem 的 episodic 与 sequential 轨迹比较
▲ 图三十八:3D-Mem 在 sequential 设定下复用前一题空间信息,减少重复探索,原图见论文原文
UniNavid 的 episodic 与 sequential 轨迹比较
▲ 图三十九:UniNavid 的隐式 hidden-state memory 未能稳定转化为连续场景知识,原图见论文原文
Unitree Go2 真实部署
▲ 图四十:Unitree Go2 室内外部署中,sequential memory reuse 对不同架构的影响,原图见论文原文
Unitree Go2 连续问题示例
▲ 图四十一:真实部署补充样例,展示弱记忆架构的重复导航和错误回答,原图见论文原文
AgentSRSR_memMAPLPL_memSA
ExploreEQA43.846.52.784.384.30.0
MemoryEQA61.062.41.443.643.9-0.5
3D-Mem25.558.833.35.62.653.3
UniNavid36.437.30.912.212.4-1.5

总结与反思

  • 结果总结:Sequential-EQA 把 memory architecture 的差异放大,3D spatial memory 是唯一同时改善准确率与导航效率的方案。
  • 局限性:这是诊断性评测,不是顺序训练后的最优 agent;真实机器人样本规模较小,噪声和执行误差可能放大差异。
  • 前沿见解:具身记忆的核心不是容量,而是把视觉语义证据绑定到可检索、可度量的空间坐标。

AI4Science

8. EnsembleEGNN:环肽不应只用一个代表构象来表示(原文

信号源:原文未明确列出作者机构

认知提取

环肽在溶液中不是一个静止结构,而是一组带有不同热力学权重的构象。EnsembleEGNN 先分别理解每个 conformer 的局部几何,再用 Boltzmann-informed attention 把它们合成为一个分子表示。结果说明,分子性质预测的误差有一部分来自「只看代表构象」,而不是来自模型容量不足。

论文摘要

  • 每个分子保留五个 conformers,按 Boltzmann weight 排序并归一化;每个 conformer 由 EGNN 独立编码。
  • 预训练目标包括 masked token recovery、noisy-coordinate reconstruction 和 pairwise distance reconstruction,总损失权重为零点三、零点五、零点二。
  • 在 CREMP-CycPeptMPDB 的二千九百七十九个样本上,预训练 EnsembleEGNN 的 R² 为零点四七七、Pearson r 为零点六九九;Hybrid 与 BERT 联合后达到零点五三八和零点七三七。
EnsembleEGNN 的构象 ensemble 聚合框架
▲ 图四十二:每个 conformer 先经 EGNN 编码,再按构象权重聚合为 per-atom 和 global ensemble embedding,原图见论文原文

核心方法

  • 每个 conformer 的 atom tokens 和三维坐标输入六层 EGNN,仅在各自 k-nearest-neighbor graph 中传递消息,保持旋转和平移等变性。
  • 通过两层 MLP 计算 conformer score,并与 log Boltzmann weight 相加得到聚合权重;per-atom embedding 用加权和,global embedding 用带 inducing points 的 Set Attention Block。
  • 预训练在 CREMP 上进行八十个 epoch,batch size 八,学习率二乘十的负四次方;下游目标是 log(P_app),使用五折交叉验证。
EnsembleEGNN 的预训练 loss
▲ 图四十三:训练和验证 loss 在 CREMP 上稳定收敛,原图见论文原文

实验成果

  • Random-init 基本失败,R² 只有零点零零五正负零点零零四,Pearson r 为零点一一三;BERT-only 为零点四三九和零点六六七。
  • EnsembleEGNN 的 MAE/RMSE 为零点三一九/零点四三六,Hybrid 进一步降到零点三零四/零点四零九。
  • 五折结果中,Hybrid 的 R² 分别为零点五六五、零点四九四、零点五五三、零点五二六和零点五五二,跨切分整体保持优势。
  • Hybrid 相对 sequence-only baseline 的 R² 增加零点零九九,Pearson r 增加零点零七零。
不同模型的交叉验证指标
▲ 图四十四:预训练的 EnsembleEGNN 和 Hybrid 在 held-out PAMPA 测量上优于 random-init 与 BERT-only,原图见论文原文
预测 log(P_app) 与实验值的 parity plot
▲ 图四十五:Hybrid 的预测点更贴近实验值对角线,原图见论文原文
模型Pearson rMAERMSE
Random-init0.005 ± 0.0040.113 ± 0.0160.457 ± 0.0030.601 ± 0.001
BERT-only0.439 ± 0.0530.667 ± 0.0350.334 ± 0.0140.451 ± 0.022
EnsembleEGNN0.477 ± 0.0090.699 ± 0.0090.319 ± 0.0020.436 ± 0.004
Hybrid0.538 ± 0.0290.737 ± 0.0160.304 ± 0.0080.409 ± 0.013

总结与反思

  • 结果总结:构象 ensemble 的显式建模和自监督预训练都必要,Hybrid 进一步说明几何与序列信息互补。
  • 局限性:当前模型只在 conformer 内消息传递,跨构象交互在 pooling 阶段才发生;数据覆盖和样本规模仍有限。
  • 前沿见解:AI4Science 的表征学习需要把状态分布和热力学权重一起建模,而不是把复杂对象压成一个静态快照。

Infra

9. Windowed-MTP:百万 token 上,draft head 不必读取完整 KV cache(原文

信号源:英伟达

认知提取

Speculative decoding 的 verifier 可以很快,但如果 draft head 每一步都扫描一百万 token 的 KV cache,速度优势会被长上下文成本吃掉。Windowed-MTP 只限制 draft attention 的可见范围,保留 sink tokens 和最近窗口,target verifier 仍然全上下文验证。它是一个不改模型、不训练、不改变接受判定的 serving 级优化。

论文摘要

  • Windowed-MTP 使用 StreamingLLM-style sliding window 和 attention sink,让 draft 只读取 sink blocks 加最近 W blocks,W 的主要设置为四千零三十二,sink 为六十四。
  • 在一百万零四万 token context、单张 NVIDIA B200、SGLang 上,Qwen3.6-35B-A3B、Qwen3.5-122B-A10B 和 Nemotron-3-Super-120B-A12B 的 per-step cost 分别下降四十四点三、三十点二和二十八点三个百分点。
  • 方法 training-free、drop-in、lossless by construction;window 只影响提议 token,accepted token 仍由 full-attention verifier 决定。
Windowed-MTP 限制 draft attention 的 KV 范围
▲ 图四十六:native draft 读取完整增长 key set,Windowed-MTP 只读取 sink 和最近窗口,中间 KV 可回收,原图见论文原文

核心方法

  • 在 paged-KV serving 中缩小 draft 的 block table,只保留 sink blocks 和 recent W blocks;target verifier 的 block table 不变。
  • draft KV pool 可压缩成 W 加 n_sink 的 ring buffer,dead KV 不再占用持续增长的显存预算。
  • 评测使用 RULER、LongBench-v2 和 BABILong,指标包括 acceptance length、TPOT、speedup;QA 生成最多五百一十二 new tokens。
  • 实验以 bf16 KV、tensor parallel degree 一、CUDA graphs 开启为主,另做 TP2、H100-80GB replication 和 backend ablation。
Windowed-MTP 随 context length 增大的节省
▲ 图四十七:context 越长,Windowed-MTP 相对 native MTP 的节省越大,原图见论文原文

实验成果

  • 一百万 context、d 等于七、batch 等于一时,Qwen3.6-35B per-step 从二十六点四 ms 降到十八点三 ms,提升四十四点三个百分点;Qwen3.5-122B 从三十四点五降到二十六点五 ms,提升三十点二个百分点;Nemotron 从三十三点一降到二十五点八 ms,提升二十八点三个百分点。
  • RULER niah_multiquery_enum 上,Qwen3.6-35B 的 end-to-end speedup 为正百分之五十三,相对 dense baseline 为二点五五倍,TPOT 从五点九四降到三点八九 ms。
  • B200 replication 中,dense/native/windowed 的 TPOT 分别为十二点二六、七点四八和五点零五 ms;speedup 分别为一倍、一点六四倍和二点四三倍。
  • 在六个 throughput-latency panels 中五个由 Windowed-MTP 同时压过 native 和 dense;Nemotron + FWE 是唯一例外。
Windowed-MTP 的 batch sweep Pareto 前沿
▲ 图四十八:一百万 token、不同 batch 下的吞吐与延迟 Pareto,对大多数模型和任务均有支配关系,原图见论文原文
Windowed-MTP 的 TP2 并发 Pareto 前沿
▲ 图四十九:双 B200 并发实验显示 compact draft pool 能容纳更多长上下文请求,原图见论文原文
模型Native per-stepWindowed per-step降低幅度
Qwen3.6-35B26.4 ms18.3 ms44.3%
Qwen3.5-122B34.5 ms26.5 ms30.2%
Nemotron-3-120B33.1 ms25.8 ms28.3%

总结与反思

  • 结果总结:Windowed-MTP 把长上下文 speculative decoding 的主要开销从 draft full-context scan 中剥离出来,并在多模型和多硬件上恢复速度收益。
  • 局限性:收益依赖 draft attention 在总成本中的比例;far-context 真有关键 token 时 acceptance length 可能下降,百分比收益也依赖 serving backend。
  • 前沿见解:推理系统的优化重点正在从「把 verifier 做得更快」扩展到「避免 draft 为了提议而扫描无用历史」。

Agent

10. PATS:把 skill 变成训练期脚手架,策略变强后自动撤掉(原文

信号源:原文作者机构编号为一、二,HTML 未展开机构全称

认知提取

很多 Agent RL 训练失败,是因为弱策略反复犯同一种错,rollout group 缺乏对比度。PATS 不把外部 skill 当成部署时永久记忆,而把它当成随策略能力变化的训练脚手架:该扩展时扩展,该修订时修订,该压缩时压缩,最终部署时全部丢弃。这样既能提供即时支持,又不把推理永远绑在外部提示上。

论文摘要

  • scaffold 分为 general、task-specific 和 mistake 三层,每个条目包含可执行规则与自然语言适用条件。
  • rollout group 同时用于更新 policy、构造 evidence card 和驱动下一轮 scaffold edit;controller 根据 competence 和 scaffold pressure 选择 EXPAND、REVISE、COMPRESS 或 FORCED_PRUNE。
  • 在 ALFWorld 和 WebShop 上,PATS 相比 GRPO 最高提升十七点六个 ALFWorld SR points 和十八点六个 WebShop SR points;在七个 search-augmented QA benchmark 上少用百分之三十二点一的 prompt tokens。
PATS 的训练动态与 token 使用
▲ 图五十:PATS 早期扩展 context,策略变强后逐步收缩;SkillRL context 则持续增长,原图见论文原文

核心方法

  • 先进行 scaffold-conditioned SFT,让模型学会读取 scaffold schema,再使用只由环境奖励优化的 GRPO。
  • 每轮用冻结 scaffold snapshot 生成 trajectories;policy 更新后,evidence builder 汇总 success/failure 对比,refiner 只能提出受限编辑,并由 deterministic validator 校验。
  • scaffold 最多三十个 entries、两千 tokens;retrieval budget 为 top four task skills、top three general skills 和 top three mistakes。
  • 部署时丢弃 refiner、evidence builder 和 scaffold state,只保留最终 policy,因此训练期 support 不等于运行时外部依赖。
PATS 的 support accumulation 与 withdrawal
▲ 图五十一:PATS 同时支持扩展、语义修订、压缩和有界 pruning,而不是单调累积提示,原图见论文原文
PATS 的脚手架控制流程
▲ 图五十二:冻结 scaffold 先条件化 rollout group,轨迹更新 policy,再驱动下一轮 validated scaffold edit,原图见论文原文
PATS 的方法总览
▲ 图五十三:PATS 将 evidence aggregation、competence-conditioned scheduling 和 constrained semantic revision 分开,原图见论文原文

实验成果

  • 一点五 B ALFWorld 中,GRPO 的 overall SR 为六十七点八六,PATS 无 scaffold 部署为八十点七一,平均 interaction tokens 从一万四千七百二十三降到一万零二百四十五。
  • 七 B ALFWorld 中,GRPO 为七十一点六七,PATS 为八十九点二九;七 B WebShop 的 Score 从零点七八四升到零点八七八,SR 从五十七点六零升到七十六点二零。
  • 去掉 REVISE 后,一点五 B ALFWorld SR 从八十点七一降到六十八点一零;去掉 online training scaffold 则降到七十三点五七,说明「编辑和删除」比静态 skill 库更重要。
  • controlled skill-removal diagnostic 中,supported 与 unsupported teacher forcing 的 NLL gap 从零点一一七零降到零点零七二三,相对下降百分之三十八点三。
PATS 的 internalization diagnostic
▲ 图五十四:受支持与不受支持 teacher forcing 的 NLL gap 随训练缩小,但该诊断集合较小,不能证明普遍 internalization,原图见论文原文
PATS 的性能与 prompt token tradeoff
▲ 图五十五:PATS 在 ALFWorld/WebShop 中同时提高任务指标、减少部署 prompt tokens,原图见论文原文
设置ALFWorld All SRWebShop ScoreWebShop SRPrompt tokens
1.5B GRPO67.860.73152.8014,723
1.5B PATS80.710.79556.3310,245
7B GRPO71.670.78457.6017,060
7B PATS89.290.87876.2010,455

总结与反思

  • 结果总结:PATS 的核心不是给模型更多 skill,而是让 support 随策略学习阶段改变,并在部署时撤掉。
  • 局限性:PATS 的效果依赖 scaffold interface initialization;diagnostic 集合和小类别 benchmark 的统计功效有限。
  • 前沿见解:Agent RL 的 curriculum 不一定要改任务难度,也可以改「当前策略应该看到哪些可验证支持」。

应用体系

11. Agent-Guided Concept Discovery:让术中切缘评估从黑箱走向可解释概念(原文

信号源:加拿大女王大学

认知提取

术中质谱数据比切除组织样本更嘈杂、更少标签,黑箱分类器即便有效也很难解释。该论文让 Agent 参与概念发现:它从高低激活谱区中找区分性 m/z 区域,再用生化知识库和知识图谱把 latent concept 绑定到可能的代谢物和通路。概念不是事后可视化,而是参与训练目标和临床泛化。

论文摘要

  • 输入为 REIMS 光谱,先用冻结的 DreaMS foundation model 生成 embedding,再映射到八个 latent concepts。
  • Qwen2.5-7B-Instruct reasoning agent 负责谱区识别、生化 grounding、概念记忆和 relevance feedback;主要知识库为 RaMP。
  • 在 Skin 和 Breast Cancer 数据集上,模型提高 balanced accuracy 与 sensitivity;在一个二十七分钟、包含一千六百一十六条 spectra 的术中乳腺案例中,两个模型均达到 perfect tumor sensitivity,但概念增强模型 false positives 更少。
Agent-Guided Concept Discovery 的整体流程
▲ 图五十六:REIMS embedding 先映射为 concepts,再由 reasoning agent 连接谱区、代谢物和通路并反哺训练,原图见论文原文

核心方法

  • concept activation 为 sigmoid(wkᵀzi + bk),并用 cosine similarity regularization 减少概念冗余。
  • Agent 对高低激活样本做 discriminative spectral region identification,再查询 RaMP,维护 concept description、谱区间、反馈、性能和 relational knowledge graph。
  • 每个 concept 有一个 sigmoid 门控权重 αk;移除概念后测量预测变化 ΔYk,将概念分为高相关和低相关两组,构造 Agent-Guided Concept Alignment Loss。
  • 训练最多四十 epoch,batch size 三十二,学习率一乘十的负三次方,所有实验重复三十次并报告 mean ± standard deviation。
乳腺癌 m/z、代谢物与通路知识图谱
▲ 图五十七:知识图谱把 m/z 子带与代谢物、通路和 PR 状态联系起来,原图见论文原文

实验成果

  • Skin Cancer 上,方法的 balanced accuracy、sensitivity、specificity、AUROC 为零点七六、零点七零、零点八二、零点八六;Transformer 为零点七四、零点七二、零点七六、零点八五。
  • Breast Cancer 上,方法为零点八七、零点八一、零点九三、零点九八;DreaMS 为零点八四、零点八零、零点八九、零点九六。
  • 乳腺知识图谱中,m/z 一百三十到一百三十五、二百一十一到二百二十二、八百九十二到八百九十四的子带,在 PR-negative samples 中出现更高激活。
  • 消融表明,加入 metabolic database 后性能上升,再加入 knowledge graph 后进一步上升;guideline component 主要减少 Agent 的 hallucinated semantic explanations。
术中案例和知识组件消融
▲ 图五十八:术中案例中概念增强模型保持 tumor sensitivity 并减少 false positives,消融显示 database、knowledge graph 和 guideline 的作用不同,原图见论文原文
数据集方法Balanced AccuracySensitivitySpecificityAUROC
SkinTransformer0.74 ± 0.0270.72 ± 0.1110.76 ± 0.0840.85 ± 0.015
SkinOurs0.76 ± 0.0260.70 ± 0.0430.82 ± 0.0310.86 ± 0.013
BreastDreaMS0.84 ± 0.0280.80 ± 0.0510.89 ± 0.0260.96 ± 0.012
BreastOurs0.87 ± 0.0180.81 ± 0.0440.93 ± 0.0240.98 ± 0.013

总结与反思

  • 结果总结:Agent 发现的概念同时承担解释和训练信号,乳腺数据上的 balanced accuracy 与 AUROC 都高于基线。
  • 局限性:术中案例规模小,框架依赖一般性 metabolic database query;更针对性的查询和 gene-level information 尚未加入。
  • 前沿见解:在医疗 AI 中,Agent 的价值不只在于替代分类器,而在于把不可标注的临床概念转成可审计的关系结构。

Benchmark

12. ICAE-Bench:模糊产品意图下,编码 Agent 的最佳通过率仍只有三十八点二(原文

信号源:美团、复旦大学、南洋理工大学

认知提取

静态代码补全 benchmark 默认需求已经被写清楚,但真实的 vibe-coding 更像从一句模糊产品想法开始,靠多轮提问、规划、调试和仓库级构建把它落地。ICAE-Bench 把隐藏约束从需求里拿走,再用 User Agent 只在被问到时逐步揭示。结果很直接:即使支持交互,最强模型在四百八十个任务上的 overall pass rate 也只有三十八点二。

论文摘要

  • ICAE-Bench 从真实开源仓库的可执行行为出发,构造 GroundPRD,再隐藏 API、边界情况和架构约束,生成 Fuzzy L1 到 L3 需求。
  • User Agent Data 存储隐藏约束和示例;Ultimate Image 删除原始代码和测试,仅保留干净运行环境;最终用黑盒测试和多维诊断评估功能、语义、API、结构、设计和交互质量。
  • 完整数据集包含四百八十个任务,覆盖十二种语言;ICAE-Bench-Lite 包含五十个任务,默认每任务最多十六轮交互。
ICAE-Bench 的交互式需求澄清设置
▲ 图五十九:编码 Agent 先从模糊产品需求开始,通过向 User Agent 提问逐步重建隐藏约束,再生成完整仓库,原图见论文原文

核心方法

  • 管线依次执行 repository filtering & test refactoring、GroundPRD synthesis & fuzzification、User Agent Data extraction、Ultimate-Image packaging 和 artifact verification。
  • Native cases 来自原始测试重构,Enhanced cases 覆盖隐藏边界;LLM 评审与黑盒执行共同验证 Fuzzy PRD、User Agent response 和 GroundPRD 的语义与行为一致性。
  • 评测模型包括 GPT-5.5、Claude-Opus-4.8、Claude-Sonnet-4.6、GLM-5.1、Gemini-3.1-Pro 和 MiniMax-M2.5;框架包括 Claude Code 和 OpenHands。
  • 主要指标分成 functional correctness、agentic evaluation、structural assessment 和 interaction quality,constraint coverage 不被当作通过率的替代指标。
ICAE-Bench 的五阶段构建框架
▲ 图六十:过滤、重构、模糊化、打包和验证五个阶段保证 benchmark 既保留模糊性,又能执行和复核,原图见论文原文

实验成果

  • ICAE-Bench 全集 Claude Code 结果中,Claude-Opus-4.8 overall pass rate 为三十八点二,GPT-5.5 为三十七点二,Gemini-3.1-Pro 为二十七点零,GLM-5.1 为二十六点六,Claude-Sonnet-4.6 为二十一点八,MiniMax-M2.5 为零点八。
  • ICAE-Bench-Lite 上,GPT-5.5 为五十三点三,Claude-Opus-4.8 为四十八点二;Lite 更适合低成本消融,不适合最终模型排名或语言级结论。
  • 把 Public cases 直接放入 workspace 后,GLM-5.1 overall pass rate 从三十七点四升到六十一点八,但 constraint coverage 从六十三点八降到六十一点二,说明更多约束覆盖不必然转化为更高通过率。
  • OpenHands 替代 Claude Code 后,所有模型明显下降;GPT-5.5 从五十三点三降到三十一点五。
  • User Agent 的模型也会改变结果:Gemini-3.1-Flash-Lite 的 constraint coverage 最高,为百分之七十五点二,但 overall pass rate 反而最低,为二十七点四。
ICAE-Bench 的模糊度层级
▲ 图六十一:Fuzzy L1、L2、L3 到 GroundPRD 的信息量逐级增加,但行为评估目标保持一致,原图见论文原文
ICAE-Bench 任务类别分布
▲ 图六十二:四百八十个任务覆盖十二种编程语言和多个项目类别,原图见论文原文
ICAE-Bench-Lite 不同模糊度下的通过率
▲ 图六十三:GroundPRD 对大多数模型表现最好,RecoveredPRD 即便保留交互记录仍低于完整需求,原图见论文原文
ICAE-Bench 的需求 token 长度
▲ 图六十四:Fuzzy L1-L3 的初始需求 token 远短于 GroundPRD,但隐藏约束仍需通过交互发现,原图见论文原文
ICAE-Bench 的模糊属性分布
▲ 图六十五:不同模糊需求等级中隐藏约束类别的占比,原图见论文原文
ICAE-Bench 的失败模式分布
▲ 图六十六:强模型更常出现输出不匹配,弱模型更常出现编译运行错误或没有测试入口,原图见论文原文
ICAE-Bench 的交互预算消融
▲ 图六十七:GLM-5.1 think-8k 的 overall pass rate 在八、十六、二十四轮预算下分别为二十二点九、三十七点四和三十四点四,呈非单调变化,原图见论文原文
ICAE-Bench 的运行时间与 token 开销
▲ 图六十八:从 Lite 到 Full split,时间和 token 成本增加,但成本与正确率并不呈正相关,原图见论文原文
模型ICAE-Bench OverallICAE-Bench-Lite Overall
GPT-5.537.2%53.3%
Claude-Opus-4.838.2%48.2%
Gemini-3.1-Pro27.0%36.6%
GLM-5.126.6%40.0%
Claude-Sonnet-4.621.8%40.2%
MiniMax-M2.50.8%2.8%

总结与反思

  • 结果总结:ICAE-Bench 把编码 Agent 的评估从静态代码任务推进到模糊需求、交互澄清和 repository-level construction,强模型的完全通过率仍低于四成。
  • 局限性:Lite 版本不适合最终排名;LLM critic 与人工评分只有中等正相关,Pearson r 为零点三七二到零点四七一。
  • 前沿见解:编码 Agent 的下一道门槛不是再多写几行代码,而是识别哪些隐藏约束必须问、哪些环境信息会制造集成负效应。

本期收束

今天最值得记住的不是某个单点 SOTA,而是「结构是否让能力可复用」。MIRROR 用视图结构复用推理,AREX 用验证状态复用研究进展,3D-Mem 用空间结构复用具身观察;它们共享一个方向:成功信息只有进入正确的中间结构,才会在下一步继续产生价值。
系统侧的四篇论文把代价边界补齐了:ACM 处理 context 的生命周期,PATS 处理训练期 support 的撤销,Windowed-MTP 处理 draft KV 的读取范围,ICAE-Bench 则证明交互预算和 constraint coverage 都不是正确率的充分条件。对下一轮研究和工程判断而言,优先读那些把「状态、反馈、成本、证据」一起纳入设计的工作,通常比只报告更高平均分更有信息量。

Related content

  • Sign in to comment.
More from this channel