
奇绩信号Alpha Sight 2026年7月24日【文字版】
本期精选十二篇 7 月 23 日 arXiv 新提交 AI 论文,围绕机器人技能获取、长时记忆、推理预算、具身闭环与科学生成,帮助读者快速判断哪些方法值得深入阅读。
本期判断
本文按 arXiv recent 分类页的 2026 年 7 月 23 日新提交组收录十二篇论文,覆盖头条、认知模型、多模态、具身智能、AI4Science、Infra、Agent、应用体系和 Benchmark 九个板块。详情页版本日期多显示为 2026 年 7 月 22 日,以下保留两层时间口径,不用其中一层替代另一层。
今天最强的共同信号,是研究者开始把「能力」拆成更细的可调用部件:机器人把单个人类视频转成可执行技能,视频模型把历史上下文改写成可学习的 KV memory,多模态模型同时调度视觉 token 和语言模型算力。
另一条线索是证据边界。PRO-LONG 的收益来自完整日志和程序化检索,KineBench 则要求世界模型生成的视频真正通过几何与物理闭环;OLEDLM 的高有效性仍要经过 DFT,EvoDRC 的修复收益也依赖全设计连通性检查。
头条
1. HOST:机器人从一段人类视频里学会新操作(原文)
信号源:北京理工大学、X SQUARE ROBOT、清华大学
认知提取
HOST 把「看人做一次」变成机器人自己的技能获取过程,不更新参数,也不要求为每个任务重新采集大批机器人示范。它先定位演示进度,再预测机器人自身将看到的未来观测,最后从预测观测生成动作,解决的是跨 embodiment 的执行适配。
论文摘要
- HOST 的训练目标不是直接模仿人类视频中的动作,而是把人类演示和机器人轨迹映射到共享的任务进度流形,再为机器人重新定义未来观测目标。1
- 推理阶段输入一段人类视频,平均约二十九秒获取新技能,平均成功率为百分之六十二,并保留已经学会的任务。
- 实验使用两只 ARX R5 六轴机械臂、平行夹爪和三个 RGB 相机,双臂动作空间为二十维;每个任务进行二十次试验。

核心方法
- Stage 1 用同一 embodiment 的机器人轨迹预训练,Stage 2 再用五千八百四十七段人类视频与机器人轨迹配对的数据适配人类视频输入。
- HOST 采用三级自锚定预测:progress localization 估计当前任务进度,vision prediction 预测机器人未来观测,action prediction 把未来观测变成控制动作。
- 训练数据包括十九万三千四百六十二条机器人轨迹,覆盖二百二十九个任务;方法在推理时不做参数更新。

实验成果
- HOST 比最强的无参数更新基线高四十三个百分点,比零样本模仿学习基线高四十五个百分点;与每个任务使用五十段机器人示范的微调基线相比,示范数量少五十倍,技能获取速度快五百零七倍。
- 在五十个新操作任务上,HOST 的平均成功率为百分之六十二;已掌握任务上,HOST 基本保持原有表现,而监督微调基线下降到百分之四十左右。
- 论文还测试了光照变化、分布外物体、场景替换和人为干扰,说明方法的收益不只来自单一演示环境。






总结与反思
- 结果总结:HOST 把单视频示范、跨 embodiment 适配和旧技能保留组合成一次推理时技能获取流程。
- 局限性:训练仍需要大规模机器人轨迹和成对的人类视频,论文的真实任务覆盖也有限。
- 前沿见解:机器人学习的下一步可能不是把所有技能都写进一个静态策略,而是让策略具备快速读取新演示并保持旧能力的机制。
2. Self Gradient Forcing:给长视频模型补上「历史记忆写入」的梯度(原文)
信号源:Joy Future Academy、京东
认知提取
Self Forcing 让模型用自己生成的历史继续生成视频,但历史 KV cache 只是被冻结的状态,未来的损失无法告诉模型「过去应该怎样写,未来才更容易读」。SGF 用一次无梯度 rollout 记录上下文,再用并行重建让未来 latent 的损失反向训练 KV 写入,补的是训练目标里的记忆缺口。
论文摘要
- SGF 的问题定义是 historical context-gradient gap:未来损失不能监督早先生成 latent 如何写入更有效的 K/V memory。2
- Pass 1 与推理一致地进行串行自回归 rollout,不保留梯度;Pass 2 在采样的 denoising exit step 重建上下文、KV 表示和 future-to-context causal attention。
- 所有模型只用五秒训练窗口,评估五秒、六十秒和二百四十秒外推;论文报告在六十秒和二百四十秒上明显优于 Self Forcing。

核心方法
- Pass 1 记录自生成上下文、噪声 latent 和采样的退出步;Pass 2 将上下文作为 stop-gradient clean-latent input,重新计算 context hidden states、K/V 和未来到上下文的注意力。
- 梯度只经过 Pass 2 的 clean-context forward、K/V projection、future-to-context attention 和 target-side denoising,不回传到 Pass 1 的轨迹、噪声或 scheduler state。
- 训练采用 sink-plus-FIFO context policy;frame-wise 设置为四个 sink、总窗口二十一、FIFO 十六、当前 chunk 一,chunk-wise 设置为三个 sink、总窗口十二、FIFO 六、当前 chunk 三。

实验成果
- 五秒训练窗口下,SGF 在五秒评估上与 Self Forcing 大致相当,在六十秒和二百四十秒外推上更稳定。
- 长视频对比主要观察 subject identity、background/layout consistency 和 temporal stability;Self Forcing 出现 view jumps、scene breaks 与 identity drift,SGF 更好保持人物和场景连续性。
- 当前可读原文片段没有给出完整的定量表格,因此不把「明显更好」改写成未经核实的百分比提升。

总结与反思
- 结果总结:SGF 不对完整串行 rollout 反向传播,而是用一次并行重建恢复未来损失对历史 KV 写入的监督。
- 局限性:论文当前公开片段的定量表格不完整,方法对具体视频扩散架构和上下文策略仍有依赖。
- 前沿见解:长视频生成的上下文管理不只是在窗口里保留更多 token,也在于模型是否学会把早期 latent 写成未来可用的记忆。
3. SmartVL:视觉 token 和语言模型算力一起按预算调度(原文)
信号源:普渡大学、威斯康星大学麦迪逊分校、NVIDIA Corporation
认知提取
很多多模态加速方法只剪视觉 token,或只跳过语言模型层。SmartVL 把两件事放到同一张预算表里,让视觉侧决定保留多少信息,语言模型侧决定用多深、多宽的计算,并让两者围绕同一个运行预算协同学习。
论文摘要
- SmartVL 同时控制视觉 token 数量、Transformer 深度和 attention head / FFN 宽度,目标是在输入内容和运行预算变化时学习 accuracy-efficiency Pareto frontier。3
- 两个 controller 使用共享预算编码,通过 Gumbel-sigmoid、straight-through estimator 和可微 latency estimator 做端到端训练。
- 评测覆盖 VQAv2、GQA、TextVQA、ScienceQA、POPE、MMBench 和 VizWiz;摘要片段报告,在约百分之五十计算预算下,SmartVL 平均比 AdaLLaVA 高百分之七点八。

核心方法
- Vision-side token controller 用 Gumbel-sigmoid 选择信息量更高的视觉 token;LLM-side compute controller 根据图像、预算和保留 token 数决定执行哪些层、attention head group 和 FFN 宽度。
- 预算以 full-model prefill FLOPs 的比例表示;token survival rate 到 compute controller 的路径使用 stop-gradient,prefix layers 保持全量执行,训练初期通过 gating bias 接近 full capacity。
- 推理阶段去掉噪声,物理删除被判定丢弃的 token;这种联合调度保留了 attention 对序列长度的二次复杂度这一关键收益点。

实验成果
- 七个 benchmark 的约百分之五十计算预算下,SmartVL 相对 AdaLLaVA 平均提升百分之七点八;论文还比较了约二点五到八点五 TFLOPs 的预算范围。
- Figure 三到 Figure 五显示,联合控制在多任务、多 token-pruning 基线和不同模型变体上保持更强或相当的准确率与延迟权衡。
- Figure 六和 Figure 七说明最优 token-compute 配置依赖任务:POPE 更偏好较高 token 保留率,VQAv2 更需要保留较深的 LLM 处理。







总结与反思
- 结果总结:SmartVL 把视觉输入压缩和语言模型计算裁剪合并为一个预算控制问题,主要收益来自跨维度协作。
- 局限性:当前证据集中在给定 MLLM、benchmark 和 latency estimator,真实服务系统中的调度开销仍需单独测量。
- 前沿见解:多模态推理优化的核心变量,正在从单一 token 数量转向输入内容、模型深度和运行预算的联合分配。
认知模型
4. PRO-LONG:把完整交互日志变成可搜索的程序化记忆(原文)
信号源:杜克大学
认知提取
长程 agent 常在「保留更多历史」和「还能不能找回关键信息」之间摇摆。PRO-LONG 不做学习式摘要,也不把日志压成向量,而是保存完整结构化交互记录,再用代码、grep 和正则检索;它更像给 agent 一台可以查询的黑匣子。
论文摘要
- PRO-LONG 将每次 observation、action 和 outcome 追加到
logs.txt,读取时用程序化搜索定位相关历史,实际可处理十万行以上日志。4 - 评测使用 ARC-AGI-3 public game set,共二十五个公开游戏,每个游戏含六到十个 level;默认每局最多五百个动作,每 turn 最多二十个动作。
- 论文报告,相比 base coding agent,PRO-LONG 在全公开游戏集上平均提升十八个百分点,最多达到百分之七十六点一 pass@1,同时少用四点二到五点八倍 billed tokens。

核心方法
- write 阶段保存完整 interaction log,read 阶段通过 grep、regex、Python 等工具检索,不依赖 learned retrieval 或 vector database。
- 评测每次使用独立 fresh session 和 workspace,报告 pass@1、best@k 及百分之九十五 bootstrap confidence intervals。
- 工具能力本身是渐进变量:read only、加入 grep / regex、加入 Python,再加入 write / edit,分别观察程序化记忆能力的边际收益。

实验成果
- GPT-5.5 上 pass@1 为百分之四十一点二,best@5 为百分之六十点一;Opus 4.6 上 pass@1 为百分之四十二点四;Fable 5 上 best@2 为百分之九十七点四,总成本为一千七百五十美元。
- Claude Code 配置下,PRO-LONG best@2 为百分之八十二点一,接近 Schema 的百分之八十四点四;Codex 配置下 pass@1 为百分之四十一点二,低于 WorldModeler 的百分之四十五点一。
- 消融中,GPT-5.5 的工具梯度从 read only 的百分之二十三点一,提升到加入 grep / regex 后的百分之二十七点二,再到加入 Python 后的百分之三十八点三,全部 write / edit 后为百分之四十一点二。

总结与反思
- 结果总结:完整日志加程序化检索在长程探索任务上提高了 agent 找回历史信息的能力,并减少了 token 消耗。
- 局限性:ARC-AGI-3 是游戏环境,日志格式和工具权限能否迁移到真实工作流仍需验证。
- 前沿见解:长上下文管理可以先回到更朴素的工程问题,保存什么、如何查询、何时写回,未必都要交给一个学习式 retriever。
多模态
5. PercepCap:让视频 caption 先交出可核验的时空证据(原文)
信号源:南京大学软件新技术国家重点实验室、快手科技 Kling Team、上海人工智能实验室
认知提取
普通视频 caption 模型直接输出一句话,错了也不知道错在对象位置、事件时间还是语言组织。PercepCap 先生成结构化 perception trace,包括带身份的对象框和事件起止时间,再基于这份证据写 caption,把「看见什么」与「怎么描述」分开。
论文摘要
- perception trace 记录 object id、label、timestamp、二次元框,以及 event 的 start time、end time 和文本描述。5
- 训练分为 PD-SFT 和 PG-RL:前者把模型适配到 perceive-describe 链,后者用 GRPO 同时优化空间、时间、语义一致性、caption 和格式奖励。
- Caption-Anchored Perception Data Construction 先生成 caption,再抽取对象与事件,最后回到视频中补齐框和时间戳,保证 perception 与 caption 指向同一内容。

核心方法
- 总奖励由空间 IoU、时间 IoU、语义一致性、caption 和格式奖励组成,统一约束 perception trace 与最终文字。
- PD-SFT 使用串行化目标序列做 next-token cross-entropy;PG-RL 使用 GRPO 处理 perception 段和 caption 段的联合奖励。
- 数据构造四步为 caption anchor generation、object-event content extraction、video-grounded perception completion 和 structured data assembly。



实验成果
- 当前可读表格片段明确展示 Gemini 3 Flash 与 Gemini 3.1 Pro 在 DREAM-1K、CaReBench、ShortVidBench 和 MotionBench 上的部分结果;例如 Gemini 3 Flash 在 DREAM-1K 的三项分数为三十七点六、四十八点五和三十点七。
- 论文报告 PercepCap 在 direct caption 和 caption-to-QA 评测中持续优于 Qwen3-VL baseline,但完整模型对比表在当前可读片段中没有全部展开。
- 这里保留可核实的部分表格,不把「leading caption quality」改写成未读取到的具体排名。
总结与反思
- 结果总结:PercepCap 把视频描述拆成可检查的对象轨迹、事件时间和最终 caption。
- 局限性:感知 trace 的 grounding 数据仍由 caption 锚定,若初始 caption 漏掉事件,数据构造可能继承该偏差。
- 前沿见解:多模态模型的可解释性不只是在输出后写理由,也可以把中间的空间和时间证据做成训练目标。
具身智能
6. DEED:把人形机器人从实验室补货任务推进到真实货架(原文)
信号源:HIVE Robots、丹麦技术大学工程技术系
认知提取
DEED 处理的不是一个新模型,而是 VLA 部署时最容易被忽略的细节:控制频率、数据筛选、任务相关视觉高亮、失败恢复和状态分布偏移。它在 Unitree G1-Edu 的真实超市货架任务上,把「训练集里会做」和「店里能稳定做」之间的差距显式化。
论文摘要
- DEED 由 data-efficient post-training、experience-driven refinement 和 latent-space in/out-of-distribution analysis 三部分组成。6
- 数据阶段对控制频率和相机频率做对齐,筛选高效成功行为,保留偶发恢复动作,并用 IA-VLA 对放置区域做跨帧高亮。
- 经验阶段将 autonomous rollouts、teleoperation demonstrations 和 human recovery demonstrations 放进 RECAP 风格 refinement;部署阶段用 GMM 与 Mahalanobis distance 检查状态是否偏离训练分布。

核心方法
- 经验驱动 refinement 用 Advantage=True / False 文本前缀条件化策略,value function 使用冻结的 Eagle-3 vision-language encoder 和两层一千零二十四单元 MLP。
- value function 训练五千步,batch size 为十六,AdamW 学习率为一乘以十的负四次方,权重衰减同为一乘以十的负四次方,验证集占百分之十五。
- return value 被离散为一百零一个 bins,范围为负一到零;失败成本设为八十,优势估计的 N 为二十五,正样本目标比例为零点四。





实验成果
- 论文将实验放在 Unitree G1-Edu、Dex-3 hands 和真实超市货架环境中,主要任务是从货架抓取 chip bag、转向货架、放置,再转回重复。
- value function 的训练约一小时三十分钟,使用五千步和十六的 batch size;这些是方法可复现的工程约束,不是最终成功率。
- 当前可读原文片段主要给出训练配置,未提供完整成功率对比表,因此不把方法描述为已解决 lab-to-store gap。
总结与反思
- 结果总结:DEED 把真实部署中的频率、数据质量、失败恢复和分布偏移纳入同一套 VLA 后训练框架。
- 局限性:当前公开证据更偏系统配方与部署分析,完整的跨场景成功率和长期运行结果仍需更多数据。
- 前沿见解:具身模型的工程价值很大一部分来自数据筛选、恢复样本和 OOD 监控,而不是单纯扩大 backbone。
7. Extreme-RGMT:让人形机器人学高动态动作,同时保住通用能力(原文)
信号源:北京理工大学自动化学院、Humanoid Robotics(Shanghai)有限公司、山东大学机械工程学院
认知提取
Extreme-RGMT 不把高动态动作当成另一个专用策略,而是先用大规模多源动作数据训练通用基础策略,再按跟踪难度把动作分成 mastered 和 challenging 两组。巩固容易动作、强化困难动作,目的是让人形机器人做后空翻时不把已经学会的日常运动一起忘掉。
论文摘要
- PACE 负责 progressive acquisition and consolidation,STAR 负责按片段难度和优势重采样高价值轨迹。7
- 问题建模为 POMDP,actor 只使用可部署观测,critic 额外使用 privileged information;训练采用 PPO 和并行仿真。
- 控制输出为二十九维 residual joint-position command,使用十帧 proprioceptive / action history 和二十一个 token 的局部参考动作窗口。

核心方法
- Stage I 用大规模多源动作数据学习 π_base,并根据跟踪表现划分 mastered motions 与 challenging motions。
- Stage II 将 π_base 扩展为 π_aug,对 mastered motions 做能力巩固,对 challenging motions 做高动态技能获取。
- 策略编码器分别处理 proprioceptive history、action history 和 local reference-motion window,再通过 cross-attention 与 FSQ bottleneck 形成 actor 输入。


实验成果
- 可核实的关键控制设定包括二十九维动作、十帧历史、二十一个参考窗口 token 和 Unitree G1 平台。
- 真实世界结果覆盖 aerial cartwheel、standing backflip、kip-up 和 aerial twist,说明评测重点是高动态接触转换、空中调整和落地恢复。
- 当前可读片段未给出完整成功率、跟踪误差和消融表,因此保留动作与训练设定,不补写未读取到的百分比。
总结与反思
- 结果总结:Extreme-RGMT 通过难度分层与非对称优化,把通用运动跟踪和高动态技能持续学习放在同一策略里。
- 局限性:主要定量表格未在当前可读片段中展开,技能保留与高动态收益的幅度仍需回到完整论文核对。
- 前沿见解:持续学习的人形控制器需要区分「巩固」和「获取」两类梯度,统一训练信号可能会牺牲通用能力。
AI4Science
8. OLEDLM:让分子语言模型用 GRPO 对齐 OLED 属性(原文)
信号源:清华大学、北京数学科学和应用研究院、武汉大学、深圳北理莫斯科大学、MathonAI Team
认知提取
OLEDLM 把分子设计拆成「先学 SMILES,再用 DFT 标签预测属性,最后用强化学习调整生成」三步。关键不在于把化学分子写成语言,而在于把 validity、属性误差、novelty 和 DFT 验证放到同一条证据链里。
论文摘要
- 预训练使用九百万条 OLED 相关 SMILES,后续用一万条 DFT 标签数据训练 S1 predictor、f predictor 和条件生成模型。8
- 生成器以 LLaMA-style Transformer 为基础,预测器以 BERT 为基础;GRPO 阶段调用 S1 predictor、RDKit、f predictor 和 DFT-Verifier。
- DFT 数据按九千条训练、五百条验证和五百条测试划分;GRPO 使用二十的 group size、学习率一乘以十的负五次方和一千步训练。

核心方法
- 模型规模约一亿参数,LLaMA-style generator 使用十二层、十二个 attention heads、hidden dimension 七百六十八,最大序列长度五百一十二。
- GRPO 设置为 group size 二十、KL 系数零点五、validity soft penalty 为负一点零、temperature 一点零、top-k 五十、top-p 零点九五。
- 论文同时记录有效性、S1 MAE、f MAE、唯一性和新颖性,避免只用单个属性分数定义生成质量。

实验成果
- 主生成结果中,GRPO validity 为百分之九十八点三,f MAE 为零点一五,novelty 为百分之九十四点四;SFT validity 为百分之八十二点九。
- SFT-20x 的 S1 MAE 为零点一九 eV、f MAE 为零点一二,但 novelty 降到百分之五十八点零,显示更强监督可能换来记忆化。
- DFT 验证的二十个分子中,SFT-20x 的 S1 MAE 为零点一三八 eV、f MAE 为零点零七六;GRPO 分别为零点二六零和零点一三四;SFT 分别为零点三三九和零点一六六。
总结与反思
- 结果总结:GRPO 在主生成表上提高了有效性并保留较高 novelty,但 DFT 验证仍显示不同训练配方之间存在属性误差差异。
- 局限性:DFT 仍是计算 proxy,论文没有提供真实合成、实验光电性质或器件级闭环。
- 前沿见解:AI4Science 生成模型的关键评估对象不是单个 reward,而是预测器、化学有效性、独特性和外部验证能否互相制约。
Infra
9. PyroDash:让小模型只在需要时把推理接力给大模型(原文)
信号源:Pyromind Dynamics Inc.
认知提取
PyroDash 不在请求开始时就决定「全程小模型」或「全程大模型」,而是让小模型边生成边判断,在需要帮助时输出控制 token,再把已有推理轨迹一次性接力给冻结的大模型。它把 offloading 变成 token-level 的运行时动作,不需要单独 router 或大模型 logits。
论文摘要
- Collaborate Engine 检测
τ_off,打包 query 与 partial reasoning trace,最多调用一次冻结 LLM 完成后续推理。9 - 训练数据 EasyHard-24k 有二万四千零六十一条样本,三阶段训练分别学习控制 token、cold-start offload capability 和 accuracy-cost trade-off。
- 目标函数最大化答案准确率并惩罚归一化推理成本,λ 控制运行点;方法兼容商业 API,不需要访问 LLM logits。

核心方法
- Stage 1 只训练控制 token 的 embedding layer;Stage 2 用 Offload SFT 让 SLM 学会自己完成或请求帮助;Stage 3 冻结大模型,用 GRPO 优化准确率减成本奖励。
- 每个请求至多一次 SLM 到 LLM 的 handoff,避免多次路由和重复上下文传输。
- λ 为零点零五时关注准确率,λ 为零点六时主动压低 LLM 使用率,形成可切换的 accuracy-cost operating points。

实验成果
- λ 为零点零五时,平均准确率为百分之六十四点零四,比 LLM-only baseline 高六点三六个百分点,总成本降低百分之二十点四。
- λ 为零点六时,平均准确率为百分之五十四点五五,LLM token ratio 为百分之一点九零,每个样本平均零点零一二次 LLM 调用。
- 在该低成本运行点,总成本从四十九点三六美元降到一点七八美元,降幅为百分之九十六点四。

总结与反思
- 结果总结:PyroDash 把大模型调用变成小模型生成过程中的一次性接力,并用训练目标直接管理成本。
- 局限性:收益依赖小模型是否能识别困难样本,单次 handoff 也可能错过需要多轮澄清的任务。
- 前沿见解:推理服务的路由粒度正在从请求级模型选择,移动到生成过程中的 token 级预算决策。
Agent
10. EvoDRC:让芯片版图修复 agent 用历史经验不断更新技能(原文)
信号源:亚利桑那州立大学、NVIDIA Corporation
认知提取
EvoDRC 没有把大版图一次性丢给一个 agent,而是先按 DRC violation 分布切成 repair crops,再让 agent 用局部分析、连通性检查和影响预览工具修复。通过验证的 operation-result pair 会写回 Knowledge DB,技能文件再由 refiner、summarizer 和 judge 迭代更新。
论文摘要
- Stage 1 做 layout decomposition,Stage 2 运行 ReAct repair agent,Stage 3 只有通过 full-design connectivity check 的修复才会被记录。10
- 每个 agent 可调用 Local DRC Analysis、Connectivity Check 和 Impact Preview 三类工具,并按 metal layer 组织历史记录。
- 实验使用 Claude Sonnet 4.6,reasoning effort 为 medium,最多五轮迭代,crop size 为二乘二微米;达到 zero violations 时提前停止。

核心方法
- repair crop 附带 DRC images、KLayout Python script、DRV distribution 和对应层的 skill files,agent 按 ReAct 循环提出并检查编辑操作。
- Knowledge DB 保存 design rules、repair operation 历史、local DRV changes、skill files 和 crop geometry 历史。
- Skill Refiner 做增量更新,DB Summarizer 读完整历史重建技能,Skill Judge 依据 source、claim citation、ambiguity、reference、coverage 和 writing quality 选出候选技能。

实验成果
- 评测包含 DAC26-DRC-Benchmark 的七个 block-level test cases 和一个外部 CLA design,初始 DRV 数量从六十八到七百六十五。
- 论文报告 EvoDRC 相对已报告 baseline 的总体 DRV reduction 为百分之七十三点五。
- Table 1 和 Table 2 是 HTML 文本表,不存在独立图片 URL;已在方法段保留可编辑对象类别、可用操作和三类 preview tool,不用生成图替代原始数据。
总结与反思
- 结果总结:EvoDRC 把版图修复拆成局部 crop、工具调用、全局连通性验证和技能演化四个环节。
- 局限性:系统依赖特定 DRC deck、KLayout 操作接口和 Claude agent,外部版图分布变化时技能迁移仍未充分验证。
- 前沿见解:Agent 的「自我进化」如果没有可执行检查和历史结果约束,很容易变成文本层面的经验总结;EvoDRC 的价值正在于把技能更新绑到可验证的版图结果上。
应用体系
11. User-Centric Mamba:把用户级先验注入交易序列状态空间模型(原文)
信号源:HSE University
认知提取
交易序列里的同一事件,对不同用户未必有同样含义。该工作把 CoLES 学到的用户 embedding 注入 Mamba 的初始 hidden state,或拼成 prefix token,让状态空间模型在读取序列前先拿到用户级先验,同时保留线性复杂度。
论文摘要
- 论文比较 hidden-state initialization 与 prefix concatenation 两种 CoLES-Mamba 融合方式,并用 discretization-step maps 和 Integrated Gradients 做解释。11
- 评测覆盖 Age、MBD 和 Taobao 三个交易数据集,任务分别为 multiclass、multi-label 和 binary。
- 数据规模从二万四千客户、二千一百万事件到七十八万一千客户、一亿五千六百万事件,报告 Accuracy、Mean ROC-AUC 或 ROC-AUC。

核心方法
- hidden-state initialization 使用
h₀ = W₂σ(W₁e_CoLES),prefix concatenation 使用X̃ = [Pe_CoLES; X]。 - CoLES 预训练一十万步,用户 embedding 缓存后用于下游;下游训练使用 AdamW、最多一百个 epoch,早停 patience 为三。
- 超参搜索使用 Optuna 与 TPE,每个 architecture-dataset 组合五十次 trial;搜索 Mamba 层数、state-space dimension、时间编码和特征 embedding 维度。
实验成果
- Age 上,plain Mamba 为零点三五四,hidden-state initialization 为零点三八六;MBD 从零点七一一提升到零点七三七;Taobao 从零点六九二提升到零点六九五。
- 相对 plain Mamba,hidden-state initialization 在 Age、MBD 和 Taobao 上分别提高三点二、二点六和零点七个百分点。
- Hybrid models 在第二到第三个 epoch 达到峰值验证性能,plain Mamba 约到第六个 epoch 才收敛。

总结与反思
- 结果总结:用户 embedding 注入 Mamba 后,三个数据集都获得小幅提升,hidden-state initialization 整体优于 prefix concatenation。
- 局限性:CoLES 在 train 和 test 联合数据上预训练,可能带来数据划分与部署时信息可得性的讨论;论文也没有证明所有交易序列都需要用户级先验。
- 前沿见解:状态空间模型的长期记忆不只来自时间序列本身,也可以由用户级状态在序列开始前设定。
Benchmark
12. KineBench:让具身世界模型生成的动作通过几何闭环(原文)
信号源:中国电信 TeleAI 人工智能研究院、新加坡国立大学、复旦大学、清华大学、西北工业大学深圳研究院
认知提取
很多 embodied world model 评测停留在视频像不像,或依赖另一个 inverse dynamics model 把视频翻译成动作。KineBench 直接从生成视频逐帧提取六维末端位姿,再送进物理仿真器执行闭环,测的是生成结果能不能真的支撑一段运动。
论文摘要
- KineBench 用二次元 instance segmentation、单目深度和六维 pose tracking 进行显式三维 grounding,组件包括 YOLOv11、MoGeV2 和 FoundationPose。12
- 评测包含二十个 manipulation tasks、ManiSkill3 physics simulator 和四个 suite:Basic Execution、Task Transfer、Visual OOD Generalization、Complexity Scaling。
- 训练只使用随机资产库的百分之五十,Visual OOD suite 在剩余百分之五十视觉条件上测试;对比模型包括 Wan 2.1、Wan 2.2、CogVideoX 和 LoRA 变体。

核心方法
- 每帧先做 2D instance segmentation,再用 MoGeV2 估计 metric depth,最后由 FoundationPose 跟踪六维末端位姿。
- 恢复的位姿序列送进物理仿真器,下一观测再进入闭环;除轨迹误差外,KineBench 还报告 SPARC smoothness 和 Maruyama Manipulability Index。
- 实验使用四张 NVIDIA A100;IDM baseline 使用十个 training tasks,每个任务一百条轨迹,未见任务随机采样五条轨迹。


实验成果
- 七个未见测试任务上的轨迹误差对比显示,KineBench 的几何 grounding 能把生成视频的运动结果落到可执行位姿上。
- 使用 simulator ground-truth depth 时,translation error 约为厘米级;换成 MoGeV2 depth 后约为一点五到三厘米,rotation error 约为十度;IDM baseline 在未见轨迹上的误差达到十厘米量级。
- 在复杂度扩展实验中,论文观察到 complexity-conditioned nonlinear scaling,随着任务复杂度上升,数据和 compute 的边际收益递减。



总结与反思
- 结果总结:KineBench 把 embodied world model 的评测从视觉相似度推进到 3D kinematic grounding 和物理闭环。
- 局限性:grounding 链条本身引入了分割、深度和 pose tracking 误差,闭环成功也不等于真实机器人成功。
- 前沿见解:具身世界模型真正需要回答的问题,不是「生成的视频像不像」,而是「从视频恢复的状态能否支撑下一步动作」。
本期收束
十二篇论文连起来看,研究重点正在从单点能力转向可验证的系统环节:HOST 和 Extreme-RGMT 处理技能获取与持续保留,SGF 和 PRO-LONG 处理长时记忆,SmartVL 和 PyroDash 处理计算预算,DEED、EvoDRC 与 KineBench 则把部署、修复和物理执行拉回闭环。
读者如果只挑三篇深入阅读,可以先看 HOST 的跨 embodiment 技能获取、SmartVL 的联合预算调度和 KineBench 的物理可执行性评测。OLEDLM、EvoDRC 与 User-Centric Mamba 更适合用来判断特定领域系统是否把外部验证、历史状态和任务约束纳入主流程。
来源均为本期收录论文的 arXiv 原始详情页与论文图表;预印本尚未经过同行评审。
相似内容
- 登录后可发表评论。
