奇绩信号Alpha Sight 2026年8月4日【文字版】

奇绩信号Alpha Sight 2026年8月4日【文字版】

本期从 arXiv 8月3日 recent 分组精选11篇 AI 论文,拆解世界模型 critic、动态推理、精确分词、KV 重建、Agent 安全与多模态评测如何把中间过程变成可复核接口。

本期判断:模型正在把隐含状态变成可检查的接口。 这批论文一端在改造 VLA critic、机器翻译推理和科学方程搜索,另一端在修补 tokenization、KV cache、Agent 安全与企业文档 grounding。共同信号不是再堆一个更大的黑盒,而是把中间过程留下来:状态要能预测,检索要能闭合,工具要能被审计,成本也要能被量出来。
本期时间边界为 arXiv recent 列表的 2026 年 8 月 3 日分组;所选论文详情页版本日期均为 2026 年 7 月 31 日。共 11 篇,覆盖头条、认知模型、多模态、具身智能、AI4Science、Infra、Agent、应用体系和 Benchmark 九个板块。列表分组日期用于批次边界,版本日期用于核对原文;以下数字和结论均以论文预印本为准,不等同于独立复现后的普遍结论。

头条

1. 把 VLA 的 critic 变成会预测世界的模型 原文

信号源:同济大学、上海人工智能实验室、复旦大学
🧭

认知提取

机器人做强化学习时,critic 只看当前一帧,就像只看监控截图判断一段录像的价值。WCM 给 critic 加了一条辅助任务:不仅估计回报,还要预测下一步 latent state。
这让「价值估计」从静态打分变成对隐藏状态的建模;但收益高度依赖仿真任务、历史长度和 λ 的平衡,不能直接等同于真实机器人已解决。

论文摘要

• 论文把 VLA-RL 的瓶颈定位为 state approximation:单帧或单个 VLM latent 与机器人控制的部分可观测性不匹配,简单堆历史帧又会带来高维复杂度。
• WCM 采用轻量 LeJEPA 架构,在价值回归之外预测未来 latent state,并兼容 π0、π0.5 和 OpenVLA-OFT。
• 论文在 ManiSkill、MetaWorld、CALVIN 和 LIBERO-Plus 的 149 个任务上评估,并在 WidowX-250S 的 7 个真实操作任务上验证。
原论文图表
▲ 图 1:WCM 将单帧 critic 与联合世界预测—价值估计并置;右侧结果显示它在仿真、OOD 和真实机器人训练中都获得较高分数。 论文原文
原论文图表
▲ 图 3:VLA-RL 的 POMDP 图示;实心节点是可观测量,空心节点是控制过程中隐藏的状态。 论文原文

核心方法

• 观察编码器逐帧映射历史图像,语言适配器把 CLIP 指令映射到 WCM latent space,causal Transformer history trunk 建模带语言条件的时序。
• World decoder 在动作条件下预测下一 latent state,使用 action encoder 与 gated FiLM residual blocks;value decoder 同时输出价值。
• 总损失为 value loss、下一状态 prediction loss 与 SIGReg 正则的加权和;on-policy 接 PPO/Flow-SDE,off-policy 接 AWR/RECAP。
• 历史长度消融覆盖 1–5 帧,原文报告 3 帧平均最好;world-prediction 权重 λ 在约 0.3–0.5 区间更稳。
原论文图表
▲ 图 2:WCM 的架构以及 on-policy、off-policy 两条训练管线;同一 critic 同时服务未来状态预测和优势估计。 论文原文

实验成果

• ManiSkill 上,π0 + WCM 的 IND/OOD 平均成功率为 84.4±1.2 / 51.5±1.5;π0.5 + WCM 为 91.9±0.4 / 64.4±1.4。
• OpenVLA-OFT + WCM 在 ManiSkill 上为 99.0±0.4 / 77.9±0.8;从 zero-shot 的 0.8 / 0.8 出发,提升幅度很大,但这也说明比较受初始化影响。
• LIBERO-Plus 的 total:π0 为 72.8±1.9,π0.5 为 73.7±1.4,OpenVLA-OFT 为 74.0±1.8;真实机器人中 π0.5 + WCM 的七项成功次数为 44/50、38/50、43/50、38/50、35/50、33/50、24/50。
设置IND avgOOD avg
π0 + WCM84.4±1.251.5±1.5
π0.5 + WCM91.9±0.464.4±1.4
OpenVLA-OFT + WCM99.0±0.477.9±0.8
表中数值来自论文 Table 1;原文
原论文图表
▲ 图 4:MetaWorld 与 CALVIN 的任务结果,误差条显示不同任务上的波动。 论文原文
原论文图表
▲ 图 5:critic 架构和历史长度消融;带 world prediction 的 WCM 在不同设置下更稳定。 论文原文
原论文图表
▲ 图 6:λ 对 IND/OOD 成功率的影响;两种指标的最优点并不完全相同。 论文原文
原论文图表
▲ 图 7:Flow-SDE 的 dropping phenomenon 与 zero-value 对照,说明 critic 质量会改变训练动态。 论文原文
原论文图表
▲ 图 12:ManiSkill 中成功、随机失败和 near-success 轨迹的 value 曲线,成功轨迹更平滑且更易区分。 论文原文
原论文图表
▲ 图 13:真实机器人 value 曲线;真实视觉噪声让曲线波动变大,但成功/失败仍保持可分性。 论文原文
原论文图表
▲ 图 14:可达工作空间的 value 热图,暖色区域表示 critic 预测价值更高。 论文原文

总结与反思

• 结果总结:显式未来预测让 critic 获得了跨时间监督,在 149 个仿真任务和 7 个真实任务上都带来增益。
• 局限性:真实世界只做 off-policy,数据采集和硬件风险限制了验证;作者也没有声称 WCM 对过拟合免疫。
• 前沿见解:VLA-RL 的 critic 可能需要承担一个小型世界模型的职责,而非继续把所有历史压成一个标量回报。

2. Agent 的第一毫秒,可能浪费在重新分词上 原文

信号源:亚利桑那州立大学

认知提取

Coding Agent 每轮只追加一小段工具结果,前端却可能把整段百万字符上下文重新分词。TokTier 的做法像给每个会话保存一把可校验的尺子:只修复追加附近的边界,只有证书不成立才回退到完整分词。
它最有价值的地方不是「更快」三个字,而是把 exactness 放在性能之前;不过结论主要来自 6 位用户、9 台机器的 coding-agent trace,且 WordPiece 等 tokenizer 仍走 CPU 路径。

论文摘要

• 153,951 次调用中,median append 约 1.4K 字符,prompt-cache hit rate 为 94.1%;少数初始化或重建请求却携带可到百万 token 的完整上下文。
• TokTier 保证输出 token IDs 与 reference tokenizer 对完整文本的结果完全一致,并同时处理 session continuation 与无复用前缀的初始化。
• 系统由 session store、stable boundary check、GPU exact tokenization 和 5% 抽样 shadow verifier 组成。
原论文图表
▲ 图 1:典型 agent turn 中,小 append 与长上下文的错配,以及 TokTier 的增量修复、GPU 分词和验证路径。 论文原文
原论文图表
▲ 图 2:153,951 次调用的上下文长度 N 与新增文本 Δ 分布;大多数调用位于「小追加、大上下文」区域。 论文原文
原论文图表
▲ 图 3:TokTier 请求生命周期;session 命中、GPU 路径、CPU fallback 与 shadow verifier 被明确分流。 论文原文

核心方法

• 增量修复保存 token IDs 与 byte spans,只对 append 附近窗口重新分词,并寻找通过稳定边界检查的相同 token run;失败则扩大窗口或完整回退。
• GPU 路径把 GPT-family regex pre-tokenization 改写成 run decomposition,再执行精确 BPE;tokenizer 版本由内容哈希注册,避免进程隐式状态。
• 「相同 token ID」不是充分条件:论文用同步边界证书排除 digit grouping 等上下文依赖,保证 splice 后的串行结果仍与 reference 相同。
原论文图表
▲ 图 4:pipeline 的边界例子;把 pipe 和 line 分开分词会得到与完整 pipeline 不同的 token 序列。 论文原文
原论文图表
▲ 图 5:stable boundary check 通过后 splice,失败时扩大窗口并最终回退。 论文原文
原论文图表
▲ 图 6:把 regex pre-tokenization 拆成可并行的字符类 run,结果进入 size-specialized BPE kernels。 论文原文

实验成果

• 增量修复在 100K–3M 字符范围为 0.5–1.1 ms;1M 字符时比最有利条件下的 GigaToken 快 2.1 倍。
• GPU 完整分词将 1M 字符请求压到 0.87 ms;vLLM 联动后,loaded regimes 的 median TTFT 下降 16%–34%,记录突发流量的 P99 下降 23%。
• 50 ms P99 目标下,四核 repair pool 加一张 GPU 达到 1,821 requests/s;16 核无状态 CPU 前端为 40 requests/s。这是两种硬件配置的系统容量比较,不是等资源效率对照。
指标TokTier 结果论文给出的边界
correctness campaigns divergence017 个 tokenizer families 的测试版本
1M 字符 GPU encode0.87 msexact reference-equivalent IDs
1M 字符增量修复约 0.5–1.1 ms(随长度区间)受 append/window 影响
50 ms P99 容量1,821 req/s四核 repair pool + 一张 GPU
表中数值来自论文 Table 1–3 与正文;原文
原论文图表
▲ 图 7:TokTier 与各 baseline 的延迟、吞吐和 served/scanned 两种口径对比。 论文原文
原论文图表
▲ 图 8:真实 trace replay 的增量修复延迟;Rust session store 在 100K–3M 字符保持低延迟。 论文原文
原论文图表
▲ 图 9:56,052 次真实 splice 的边界检查;默认 512 字符窗口首次通过 56,049 次,仅 3 次扩大窗口。 论文原文
原论文图表
▲ 图 10:GPU 完整分词的单请求延迟;array delivery 与 Python list delivery 的接口开销被分开。 论文原文
原论文图表
▲ 图 11:突发场景下的尾延迟;repair pool 与 GPU 共同压低初始化和 continuation 的 P99。 论文原文
原论文图表
▲ 图 12:P99 sojourn time 与 offered load;论文报告 1,821 req/s 的系统容量结果。 论文原文
原论文图表
▲ 图 13:vLLM 联动 TTFT;引入 tier 后前端 tokenization 段缩短,engine queue 与 prefill 未被混入。 论文原文
原论文图表
▲ 图 14:session state 的内存成本与保留时间收益;状态约 16 bytes/token,但 retention 过短会错失复用。 论文原文

总结与反思

• 结果总结:TokTier 把 agent serving 的分词前端从 O(N) 全量扫描改造成可验证的增量修复加精确 GPU 路径。
• 局限性:私有 trace 规模有限;15/17 个 tokenizer families 满足当前 boundary predicate,WordPiece 和部分 normalizer 仍走 CPU。
• 前沿见解:当 prefix cache 命中率接近 0.99,分词可能从边角开销变成 TTFT 的主瓶颈,serving stack 需要把 tokenizer 当成状态服务管理。

3. 翻译模型开始按难度分配思考预算 原文

信号源:厦门大学

认知提取

同一套翻译推理,不该让简单句和难句排同一条长队。TwT 先用蒸馏轨迹做冷启动,再用 GRPO 让模型学会在 Easy 输入上少想、在 Hard 输入上多想。
它把 reasoning budget 变成可观测的质量—token trade-off;但难度分布、专有模型轨迹和奖励 shaping 仍是结果外推时必须保留的条件。

论文摘要

• 论文面向 10 个领域、De→En、En→Zh、Zh→En 三个方向,评测涵盖 in-domain、OOD 和 59 个 unseen languages。
• 冷启动数据约 7K 条:DeepSeek-R1 生成 Long CoT,GPT-4o 按 Rich Points 判断难度并改写;RL 再使用 20K 条多领域平行语料。
• 奖励由格式奖励、BLEU+COMET 混合质量奖励和 20-gram repetition penalty 组成。
原论文图表
▲ 图 1:TwT 在不同复杂度输入上切换 System 1 与 System 2。 论文原文
原论文图表
▲ 图 2:纯 RL 的训练动态;质量上升并不自动带来更长、更有效的推理轨迹。 论文原文
原论文图表
▲ 图 3:TwT 两阶段训练管线,从难度自适应 Long CoT 冷启动到 GRPO。 论文原文
原论文图表
▲ 图 4:纯 RL 与 TwT 的 CoT trace 相似度;TwT 的轨迹分布更不容易塌缩为单一模板。 论文原文
原论文图表
▲ 图 5:纯 RL 在机器翻译任务中的输出模板,显示格式化推理的重复倾向。 论文原文
原论文图表
▲ 图 6:难度自适应 Long CoT 数据分布。 论文原文

核心方法

• SFT 使用 Qwen2.5-7B/14B-Instruct、Gemma-2-9B-IT,8 张 A100、1 epoch、学习率 1e-5;RL 使用 GRPO、8 张 A100、学习率 1e-6、β=1e-3。
• 奖励形式为 r = rf + rq − λ·rrep;格式错误给固定惩罚,重复推理由 n=20 的 n-gram penalty 抑制。
• 推理使用 vLLM,temperature=0.0、repetition penalty=1.05;模型输出长度随难度变化,而不是简单追求更长 CoT。

实验成果

• in-domain 平均质量:TwT-7B 为 66.27、274 tokens;TwT-14B 为 66.62、291 tokens。OOD 平均质量分别为 66.25/269 和 66.46/288。
• 对比 mExTrans-7B,论文报告 TwT-7B 提升 4.45 分,同时 reasoning overhead 降低 50.27%;总体 token 使用减少区间为 32%–60%。
• TwT-7B 按难度为 Easy 67.93/216 tokens、Medium 64.85/272、Hard 62.78/332;去掉 adaptive CoT 后,tokens 从 278 增至 748。
模型In-domain qualitytokensOOD qualitytokens
TwT-Qwen2.5-7B66.2727466.25269
TwT-Qwen2.5-14B66.6229166.46288
DeepSeek-R165.4058665.62561
GPT-566.0566066.29645
表中为论文 Table 3–4 的平均值;原文
原论文图表
▲ 图 7:RL 期间平均奖励上升、格式错误率下降,说明混合奖励确实参与了训练收敛。 论文原文
原论文图表
▲ 图 8:TwT-7B/14B 的 BLEU、COMET 与响应长度随训练变化;后期模型在维持质量的同时压短推理。 论文原文
原论文图表
▲ 图 9:推理时间比较,补充了质量和 token 数之外的部署代价。 论文原文

总结与反思

• 结果总结:TwT 把「是否需要长推理」变成翻译策略的一部分,在多领域与 OOD 结果中同时报告质量和 token 数。
• 局限性:RL 难度分布未控制;冷启动依赖 DeepSeek-R1 等专有模型轨迹;奖励还没有显式的 difficulty-aware length shaping。
• 前沿见解:推理时扩展不一定是统一加预算,下一步更像是先估计题目难度,再决定把多少计算放进去。

4. KV cache 不必在「保留」和「丢弃」之间二选一 原文

信号源:论文原文未展开作者机构信息

认知提取

传统 KV eviction 把没保留的 token 一起扔掉,merging 又会动到还想精确保留的 token。ResKV 把预算拆成 main cache 和 residual cache:前者保留原 token,后者只负责补回被省略 token 对 softmax 分子和分母的影响。
这种设计的价值在极紧预算下更明显;代价是 residual branch 会拖慢 decode,而且「query-agnostic」残差聚类本质上仍是近似。

论文摘要

• 研究覆盖 LLaMA-3.1-8B-Instruct 与 Qwen-2.5-7B-Instruct,在 LongBench 16 个任务和 RULER 13 个任务、4K/32K 上下文评估。
• 固定预算 b=m+r;main cache 保存精确 KV,residual cache 用 representative key/value 与 population count 重建 omitted side。
• 验证 proxy 在构造时决定每层、每个 KV head 的 residual budget,decode-time dynamic gate 按 main-cache attention sharpness 调整 residual logits。
原论文图表
▲ 图 1:ResKV 的固定预算拆分与 shared-softmax 解码;main cache 保留精确 token,residual cache 重建 omitted side。 论文原文
原论文图表
▲ 图 2:validation proxy 选择 residual allocation,dynamic gate 再按 query 调整残差贡献。 论文原文
原论文图表
▲ 图 3:峰值显存、吞吐和 evicted key 的可聚类性;ResKV 接近压缩 baseline 的显存,但承担一定吞吐开销。 论文原文

核心方法

• 每个 residual entry 记录代表性 key、value 和组大小,decode 时将 log c_j 与动态 gate 加到 residual logits,并和 main branch 参加同一个 softmax normalization。
• 构造阶段使用 128 个 observation queries,其中 96 个 fitting、32 个 validation;候选 residual ratio 为 0、0.05、0.10、0.15、0.20。
• 实验在单张 A100 40GB 上进行,prefill 后一次性压缩;同时区分 query-aware 与更接近部署的 query-agnostic。

实验成果

• LongBench:论文报告所有 32 个展示配置均有提升;两种 backbone 平均提升 1.02 分,在保留 10% 和 20% KV 时分别提升 1.43 和 1.17。
• RULER:63/64 个展示配置提升,平均提升 3.38 分;query-agnostic 平均提升 4.54 分。
• 消融显示,去掉 validation proxy 后 S1 从 67.20 降到 63.20;去掉 dynamic gate 后从 67.20 降到 62.40;separate normalization 使 RepoBench-P 从 50.86 降到 47.86。
设置baseline+ResKV
LongBench,LLaMA,10% retained45.6447.39
LongBench,LLaMA,20% retained47.2548.45
RULER,LLaMA,4K,10% retained58.9470.51
RULER,LLaMA,4K,20% retained75.4483.34
表中为论文 Table 1–2 的代表性平均值;原文

总结与反思

• 结果总结:ResKV 不是重新发明压缩比例,而是把被丢弃 token 的注意力贡献显式收进 residual side,在同一预算下改善长上下文任务。
• 局限性:残差是近似重建,query-agnostic clustering 依赖 key-space surrogate;decode 的 residual branch 带来额外吞吐成本。
• 前沿见解:KV cache 压缩的关键对象可能不是 token 本身,而是 token 对归一化注意力分布留下的统计贡献。

认知模型

5. 把长期记忆从「生成摘要」改成零 token 的证据结构 原文

信号源:原文未在作者列表片段中展开机构信息

认知提取

很多 Agent memory 系统先调用 LLM 写摘要、压缩摘要,再用摘要回答问题。Zero-Mem 反过来保留原始 interaction traces,用 entity–context graph 和 temporal hierarchy 组织证据,最后只在 final QA 阶段调用 LLM。
「零 token」不是零计算:实体识别、向量编码、图结构和确定性校准仍然要付 CPU/GPU 成本。它真正省掉的是记忆阶段反复生成中间文本。

论文摘要

• Zero-Mem 的 memory construction、organization、routing、retrieval、evidence closure 和 calibration 都不调用 LLM;仅 final-QA reader 调用 GPT-4o-mini 或 Qwen2.5-14B。
• 评测 LoCoMo 的 single-hop、multi-hop、temporal、open-domain,以及 HotpotQA 的 56K/224K/448K context。
• 统一设置下最多保留 top-5 检索项,使用 NER、BM25、BGE-M3 等非生成组件。
原论文图表
▲ 图 1:Generative Memory、Raw Retrieval 与 Zero-Mem 三种记忆 regime;Zero-Mem 把 LLM 调用留给 final QA。 论文原文
原论文图表
▲ 图 2:Zero-Mem 总体流程,从原始 traces 到 entity–context graph、temporal hierarchy、证据闭合和确定性校准。 论文原文
原论文图表
▲ 图 3:HotpotQA 消融;图结构与时间层级互补,closure 和 calibration 继续贡献增益。 论文原文
原论文图表
▲ 图 4:retrieval budget 敏感性;top-1 到 top-5 增益明显,top-10 后边际收益变小。 论文原文

核心方法

• query profile 提取 subject、keywords、answer type、temporal cues 和 boundary,再对 graph view 与 hierarchy view 做 query-conditioned routing。
• evidence closure 补回跨实体的桥接证据和局部邻居;deterministic calibration 过滤冲突、越界和不完整证据。
• 所有方法共享 final-QA reader、context budget、top-k 和硬件,避免把记忆侧 token 节省与读者模型差异混在一起。

实验成果

• LoCoMo 上,GPT-4o-mini reader 的 Zero-Mem 平均 F1/BLEU-1 为 59.15/52.96;Qwen2.5-14B 为 57.57/51.41,均高于 GAM。
• Zero-Mem memory-operation tokens 为 0,time/query 为 0.22s;相对最快 baseline,memory-operation latency 降低 57.6%。
• HotpotQA 上,GPT-4o-mini 在 56K/224K/448K 为 72.07/66.43/65.04;Qwen2.5-14B 为 68.58/65.47/61.02。
readerLoCoMo F1memory-operation tokens
Zero-Mem + GPT-4o-mini59.150
Zero-Mem + Qwen2.5-14B57.570
GAM + GPT-4o-mini53.7528,570,674
表中数值来自论文 Table 1–2;原文

总结与反思

• 结果总结:在两个长程证据任务上,Zero-Mem 同时报告了质量、token 和时间,说明非生成记忆并不必然牺牲回答能力。
• 局限性:实验只对 memory operations 计零 token;encoder inference、图组织和校准仍有成本,且结构化视图的泛化依赖实体与时间抽取质量。
• 前沿见解:Agent memory 的基本单元可能从「摘要」退回到可追溯证据,再让 reader 决定如何解释。

多模态

6. 让视频 DiT 自己选择该听 VLM 的哪一层 原文

信号源:中山大学、Moku Lab 橙队、华中科技大学

认知提取

VLM 的浅层和深层藏着不同粒度的信息,视频 DiT 却常常固定取最后一层。MoRoute 给每个 DiT block 一个 router,让它按输入条件选择最相关的 VLM layer,再通过 per-block projection 接入。
结果显示路由确实随任务变化,但 condition interface 新增约 1.89B 参数,且实验只覆盖一组 backbone;这是一条有证据的架构方向,不是免费增益。

论文摘要

• 同一模型支持 text-to-video、image-to-video、reference-guided generation、style transfer 和 source-conditioned editing。
• 冻结 Qwen3.5-9B VLM,连接 Wan2.1-T2V-14B video DiT;每个 DiT block 通过 straight-through argmax 选择 VLM 层。
• 三阶段训练:9.9M LAION-2B 子集做 text-to-image 对齐,再做 600K T2V,最后混合 T2V/TI2V/TV2V/TIV2V。
原论文图表
▲ 图 1:MoRoute 支持的统一多模态视频任务,从 T2V、I2V 到视频编辑。 论文原文
原论文图表
▲ 图 2:动态 layer routing 总览;每个 DiT block 独立选择 VLM hidden state。 论文原文
原论文图表
▲ 图 3:TI2V/I2V、TV2V、TIV2V 三类任务的定性比较。 论文原文
原论文图表
▲ 图 4:不同 routing 策略的定性对比,dynamic routing 更能保留源细节并遵循编辑指令。 论文原文
原论文图表
▲ 图 5:多任务训练如何用真实 reference-to-video 监督改善数据稀缺的 character replacement。 论文原文
原论文图表
▲ 图 6:slotted temporal RoPE 与 sparse attention mask。 论文原文

核心方法

• router 用 block query 与各 VLM 层 key 做 dot product,选择 top-1 layer;选择结果经每 block 的 projection MLP 注入 DiT cross-attention。
• 损失包含 flow matching、diversity、confidence 和 monotonicity regularizer,分别抑制路由塌缩、让 top-1 更尖锐并鼓励层级趋势。
• 推理固定 50 denoising steps、CFG 5.0、81 frames、480×832、24 fps;reference images/source videos 直接拼入 token sequence。

实验成果

• IntelligentVBench AVG 3.98、OpenVE-Bench AVG 3.83、RefVIE-Bench AVG 4.11,三项均为表中最佳。
• 路由分析中,32 个 VLM layers 都被某些 block 选中过;TI2V/TV2V 的 normalized selection entropy 均为 0.50,TIV2V 为 0.47。
• OpenVE-Bench 的 8 类编辑中,MoRoute 赢下 7 类,Camera Edit 仍是相对困难项;condition interface 约 1.89B 参数。
BenchmarkMoRoute AVGfixed multi-layer AVG
IntelligentVBench3.984.00(TIV2V 子集)
OpenVE-Bench3.833.63
RefVIE-Bench4.11
表中为论文 Table 1–2 可直接比较的汇总;原文

总结与反思

• 结果总结:MoRoute 用 block-wise routing 把异构 VLM 与 video DiT 接起来,在三类视频基准上取得最高平均分。
• 局限性:当前只支持 text/image/video,主要基于一组 backbone;audio、3D signals 和更大模型下的路由行为尚未验证。
• 前沿见解:多模态融合的接口不一定是一层固定投影,可能应让生成器的不同深度各自选择条件表征。

具身智能

7. 相机换个角度,机器人不该立刻失忆 原文

信号源:卡尔斯鲁厄理工学院、利兹大学

认知提取

RGB 图像告诉策略「看到了什么」,却不告诉它「从哪个方向看到」。RayViT 把每个像素的 Plücker viewing ray 注入 ViT,让视觉 token 带上相机几何。
相机扰动下性能掉得少,是比默认视角上的绝对成功率更有信息的信号;但方法依赖多视角 anchor view,尚未证明对卷积视觉编码器同样有效。

论文摘要

• RayViT 目标是在不依赖额外深度/点云传感和多视角数据增强的情况下,提高模仿学习策略对 camera perturbation 的鲁棒性。
• 方法在 RoboCasa 16 个任务和 Franka Panda 真实机器人 4 个任务上评估,统一使用 score-based diffusion policy 与 decoder-only xLSTM action head。
• 训练中加入 cross-view cosine similarity loss,对齐不同视角的 geometry-aware class tokens。
原论文图表
▲ 图 1:RayViT 将 ray-conditioned class token、patch-level ray embeddings 和 cross-view consistency loss 接入视觉策略。 论文原文
原论文图表
▲ 图 2:cosine loss 注入不同中间层的效果;深层注入通常更有利,但对 RGB baseline 的收益不稳定。 论文原文

核心方法

• ray map 的每个像素编码 6 维 Plücker ray;一条分支用 2 个 gated cross-attention blocks 汇聚 geometry-aware class token,另一条把 patch-aligned ray features 作为 positional embedding。
• RayViT-cls 只用 geometry-aware class token;完整 RayViT 同时加入 patch-level ray embedding,并用 λ=0.01 的 cosine loss。
• RoboCasa 训练 50 epochs、3 seeds,每任务 50 episodes;真实机器人训练 60 epochs,单张 RTX 5090 32GB,约 7 小时。

实验成果

• RoboCasa 平均成功率在 Default/Variant 下:RGB 42.5/24.0,RayViT-cls 43.2/37.0,RayViT 39.8/37.3;性能 drop 分别为 18.5、6.2、2.5。
• 真实机器人 completed stages:RGB 2.44/0.91,RayViT-cls 2.26/1.70,RayViT 2.81/2.69;RayViT 的 drop 只有 0.12。
• 使用 EUPE backbone 时,RayViT 为 44.3/33.3,仍优于 RGB 的 44.1/18.9,说明收益主要体现在扰动鲁棒性而非默认视角的绝对分数。
方法Default successVariant successDrop
RGB42.524.018.5
RayViT-cls43.237.06.2
RayViT39.837.32.5
表中为论文 Table 1;原文
原论文图表
▲ 图 1:RayViT 方法框架原图,展示相机射线如何进入 class token 和 patch token。 论文原文

总结与反思

• 结果总结:显式相机几何让策略在视角扰动下少掉分,真实机器人结果比单看默认视角的 success rate 更能说明问题。
• 局限性:只研究 ViT;需要多视角设置和任务相关 anchor view,sparse-view/dense-view 与从头预训练仍待验证。
• 前沿见解:具身视觉的鲁棒性不只来自更多数据,也来自把传感器几何写进表征。

AI4Science

8. 科学方程搜索不再只盯着拟合误差 原文

信号源:中国科学院自动化研究所、 中国科学院大学、德国歌德大学

认知提取

LLM 做 symbolic regression 时,拟合得好不等于方程值得相信:表达式可能过长、只在训练分布内有效,或者没抓住变量依赖。MOT-SR 让科学工具先分析数据,再让两个 LLM 围绕 Pareto front 搜索。
它把「找到一个低误差公式」改成「在误差、OOD 和复杂度之间维护一组可选公式」;但工具集合和目标仍由人指定,离自动科学发现还有距离。

论文摘要

• 标准 benchmark 包含 Oscillation 1、Oscillation 2、E. coli growth、Stress-Strain;另测 36 个 LSR-Synth–Chemistry 任务和 EMRI 轨道建模。
• 每轮生成 4 个候选方程,标准任务迭代 2,000 次,化学任务 1,000 次;使用 LLaMA-3.1-8B 与 GPT-4o mini。
• 工具箱覆盖 Pearson/Spearman、互信息、FFT/小波、Granger/CCM、Lyapunov、DTW 和 KS test 等分析。
原论文图表
▲ 图 1:MOT-SR 闭环;Meta Strategy Generator 读取 Pareto frontier、残差和科学工具结果,Equation Generator 再产生候选。 论文原文
原论文图表
▲ 图 2:训练派生的 ID/OOD 空间划分,OOD 是训练集外围而不是测试集泄漏。 论文原文
原论文图表
▲ 图 3:四个标准任务和化学任务的泛化对比。 论文原文
原论文图表
▲ 图 4:训练收敛曲线,MOT-SR 更快降低 NMSE。 论文原文
原论文图表
▲ 图 5:HV 与 IGD 的 Pareto front 质量比较。 论文原文
原论文图表
▲ 图 6:Oscillation 1 消融,去掉数据分析、结构分析或 strategy module 都会损失。 论文原文
原论文图表
▲ 图 7:EMRI held-out 轨迹积分,MOT-SR 更接近 FSI reference。 论文原文

核心方法

• Meta Strategy Generator 分析 Pareto-optimal 候选的残差并调用工具生成搜索策略;Equation Generator 做 diversity-aware parent sampling、生成和多目标评估。
• 三个目标是 train-ID NMSE、train-OOD NMSE 与 AST length;non-dominated sorting 和 pruning 更新 frontier。
• EMRI 案例中,100 个案例去掉 12 个有效状态不足者;余下 88 个按 trajectory level 划分为 58 个 discovery 和 30 个 held-out。

实验成果

• Oscillation 1 上,MOT-SR LLaMA 的 Accavg-0.001 为 100.00、NMSE 1.27e-15;Oscillation 2 的 NMSE 为 1.70e-10。
• LSR-Synth–Chemistry 上,MOT-SR Accall-0.1 为 86.11、NMSE 3.85e-7;EMRI held-out 30 条轨迹 mean NMSE 为 1.17e-3。
• 去掉 multi-objective 后只恢复 9 个符号项中的 1 个,完整 MOT-SR 恢复 6 个中的 4 个;这比单纯报一个平均拟合分更能说明结构搜索的作用。
任务MOT-SR NMSE对照
Oscillation 11.27e-15LLM-SR 2.55e-5
LSR-Synth–Chemistry3.85e-7LLM-SR 8.01e-6
EMRI held-out1.17e-3LLM-SR 3.13e-2
表中为论文 Table 1–3 的代表性数值;原文
原论文图表
▲ 图 8:Oscillation 2 的消融结果。 论文原文
原论文图表
▲ 图 9:E. coli growth 的消融结果。 论文原文
原论文图表
▲ 图 10:Stress-Strain 的消融结果。 论文原文
原论文图表
▲ 图 11:Data Analysis Tools 的消融,显示工具增强对 Oscillation 1 的作用。 论文原文
原论文图表
▲ 图 12:四个 benchmark 的 Pareto front 结果。 论文原文
原论文图表
▲ 图 13:墙钟时间上的 NMSE 下降,MOT-SR 比 LLM-SR 更快收敛。 论文原文
原论文图表
▲ 图 14:Oscillation 1 方程结构的迭代演化,周期工具分析促使 sine/cosine 项出现。 论文原文
原论文图表
▲ 图 15:CRK36 方程结构的迭代演化,候选逐步收敛到主导依赖。 论文原文

总结与反思

• 结果总结:MOT-SR 同时追求误差、OOD 和表达式复杂度,在方程恢复、化学任务和 EMRI 轨迹积分上都报告了更低误差。
• 局限性:固定评估目标和人工指定工具限制了可迁移性;高维科学数据和更复杂动力系统尚未覆盖。
• 前沿见解:科学 Agent 的关键接口不是让 LLM「凭感觉猜公式」,而是让外部测量工具改变搜索策略,并把结构代价放进同一个选择面。

Infra

本期 Infra 的核心论文为头条第 4 篇 ResKV:它把固定预算 KV cache 的「压缩」从 token 淘汰推进到注意力贡献重建,主结果、方法图和限制已在上文完整展开。

Agent

9. 工具 schema 可能让 Agent 的安全对齐失效 原文

信号源:北京邮电大学、北京航空航天大学、清华大学

认知提取

同一个模型在 chatbot 里会拒绝危险请求,换成 Agent、看到 schema-formatted tool specifications 后,却可能顺从并执行。论文把问题定位到表示方式:工具规范改变了模型读到的内部方向,不只是增加了上下文长度。
SafeKeep 的做法很克制:安全判断阶段把工具 schema 展平成文本,执行阶段再保留原 schema;它不更新参数,也不读取 activations。

论文摘要

• 白盒分析使用 Llama3.1-8B-Instruct 与 Qwen3-8B,黑盒评估覆盖 Gemini3.1-Flash 与 GPT5.4-mini。
• 源因分析用 ToolSafety 的 400 对 harmful–benign requests;评测用 AgentHarm 和 InjecAgent。
• 作者用 refusal direction、Schema Direction 和 activation steering 分析 schema 表示对拒答能力的影响。
原论文图表
▲ 图 1:chatbot-formatted 与 agent-formatted 输入的差异,后者额外包含 role、tool-use instructions 和 tool specifications。 论文原文
原论文图表
▲ 图 2:schema representation 转成 flattened textual 的示例。 论文原文
▲ 图 3:Schema Direction 与 chatbot-derived refusal direction 的逐层余弦相似度,harmful 请求整体更偏负。 论文原文
▲ 图 4:首个生成 token 在 refusal direction 上的投影,schema 表示削弱了 harmful/benign 的分离。 论文原文

核心方法

• representation analysis 用 AUROC 评估 harmful/benign 可分性;activation steering 在 peak refusal layer 上减去 harmful-request Schema Direction,检验因果作用。
• SafeKeep 的 Safety Judgment 使用 flattened textual tool specs;判为安全才允许原始 Agent pipeline 执行工具,判为不安全则阻止执行并生成拒答。
• α=0、4、8、12 的 steering 对照显示,适度 steering 可提升拒答,过强则把请求推向 invalid output。

实验成果

• Llama3.1-8B 的 harmful refusal rate 从 chatbot 的 58% 降到 agent 的 3%;加入 tool specifications 后 AUROC 从 0.927 降到 0.740。
• representation conversion 把 Llama AUROC 从 0.740 拉回 0.885;只做 semantic randomization 则为 0.776,说明表示形式比工具语义更关键。
• 四模型平均:SafeKeep refusal 从 23.8% 升到 70.6%,平均 accuracy 从 60.9% 升到 79.6%;InjecAgent ASR 从 25.6% 降到 2.5%。
方法AgentHarm refusal平均 accuracyInjecAgent ASR
Base23.860.925.6
SafeKeep70.679.62.5
表中为论文跨模型汇总;原文

总结与反思

• 结果总结:工具规范的序列化方式会改变 Agent 的安全行为,SafeKeep 在不改模型参数的情况下修正了这一输入层问题。
• 局限性:机制解释主要依赖可访问 activation 的 Llama 白盒分析;四模型结果不能自动证明所有工具 schema 都有同样风险。
• 前沿见解:Agent 安全不只是一层拒答 classifier,tool schema 本身也是安全关键路径。

应用体系

10. 企业文档抽取的难题,不是把字段填出来 原文

信号源:RunLlama

认知提取

企业文档系统最怕的不是少识别一个字段,而是给出一个看似正确、却找不到出处的数字。ExtractBench 把 value accuracy、word/page-level grounding、长文档完整性和每页成本放进同一个 benchmark。
grounding 结果比 value F1 更刺眼:最佳系统的 word-level grounding 仍低于 50%。抽取正在接近可用,证据连接仍像一条断掉的电线。

论文摘要

• 基准包含 370 份文档、4,869 页、8 个业务域和 67 种文档类型,覆盖长列表、needle-in-a-haystack、密集文档、扫描、手写和跨页表格。
• 输入是文档加用户定义 JSON Schema,输出需为 schema-valid JSON;每个值还要提供 source page 与 bounding box evidence。
• 评估 14 个系统,运行时间为 2026 年 6–7 月;成本按实际 token/credit 或发布价格估算。
原论文图表
▲ 图 1:ExtractBench 的五个覆盖轴,370 份文档按任务、感知、表结构、长度和业务域标注。 论文原文
原论文图表
▲ 图 2:ground truth 构建流程,显示模型、代码 Agent 和人工如何共同形成标签并处理分歧。 论文原文
原论文图表
▲ 图 3:总体 unified value F1 与每页成本;质量高和成本低并不是同一条排序。 论文原文
原论文图表
▲ 图 4:4,869 页的覆盖分布,标签可重叠。 论文原文
原论文图表
▲ 图 5:文档页数与 ground-truth field 数量,长文档的完整性压力由字段密度共同决定。 论文原文
原论文图表
▲ 图 6:按文档长度分层的质量—成本关系。 论文原文
原论文图表
▲ 图 7:GPT、Gemini、Claude 家族从 basic 到 flagship 的质量—成本缩放。 论文原文

核心方法

• 统一 value metric 对数组记录使用 Hungarian matching;日期做 ISO 规范化,其余字段要求基本精确一致,缺失字段需显式返回 null。
• grounding 同时考察 word-level box 与 page-level source;VLM 和 coding Agent 默认不返回 grounding,因此 grounding 分数为 0。
• 挑战标签包括 ≤10 页、11–50 页和 >50 页三档长度,以及 rotated/image-only、scanned、handwriting、merged header、cross-page table 等。

实验成果

• 总体 value F1:LlamaExtract Agentic Plus 95.6,Codex GPT-5.5 93.6,Reducto Deep 90.4,Claude Code Opus 4.8 87.1。
• 质量—成本:Agentic Plus 为 95.6% F1、8.1¢/page;Codex 为 93.6%、27.8¢/page;Cost-Effective 为 86.8%、1.0¢/page。
• Agentic Plus 的 word/page grounding F1 为 46.4/84.9;论文报告所有系统的 word-level grounding 都低于 50%。
系统Value F1成本/页word grounding F1page grounding F1
LlamaExtract Agentic Plus95.68.1¢46.484.9
Codex GPT-5.593.627.8¢
Reducto Deep90.443.371.7
LlamaExtract Cost-Effective86.81.0¢
表中为论文 Table 2–3 的代表性结果;破折号表示该原文汇总未给出对应值;原文

总结与反思

• 结果总结:企业抽取的综合评价不能只看字段 F1,还要看证据位置、长文档召回和成本。
• 局限性:grounding 需要系统主动输出,且部分 OSS VLM 没有可比 API 价格;基准中标签重叠,不能把每个切片当成独立难度。
• 前沿见解:文档 Agent 的交付物应是「值 + 出处 + 可复核位置」,没有 grounding 的高分仍然不够进入生产。

Benchmark

11. 真实购物 Agent 的难点藏在图片和多轮约束里 原文

信号源:论文原文作者列表未展开具体机构名称

认知提取

用户说「找一个像图里那件、但要能放进某个位置、颜色还要更浅」时,单轮文本 benchmark 测不到真正的难点。MMShopBench 用真实电商多轮日志,把图像、对话、硬约束、搜索和证据验证放进一个冻结的 10 万商品沙盒。
开放模型经过 SFT 后会明显变好,但仍没有超过最强 proprietary 系统;更值得关注的是,EGVS 能从已经检索到却被漏选的商品池中恢复有效候选。

论文摘要

• 最终评测集 289 cases,来自 2026 年 6–7 月真实购物助手日志;平均 target turn 4.38,中位 4,范围 2–12;每 case 平均 1.38 张用户图像。
• 代理最多进行 8 个工具步,在 100,000 商品离线沙盒里交替使用 BM25 文本检索和区域图像检索。
• EGVS 汇总所有候选,检查标题、主图、结构化属性、SKU 标签和 OCR 证据,再对 top-K 重排;严格判定要求商品满足所有必要属性。
原论文图表
▲ 图 1:MMShopBench 总览,从真实多模态多轮日志到 289 cases,再到 10 万商品沙盒和 EGVS。 论文原文
原论文图表
▲ 图 2:层级 intent 分布;Find Exact Same Product 占 35.8%,Need-Solving Recommendation 占 26.0%。 论文原文
原论文图表
▲ 图 3:去掉对话图像后的影响;image-required 和 mixed 样本下降更明显。 论文原文
原论文图表
▲ 图 S1:EGVS 质性案例;满足约束的托盘已在候选池中,但 baseline 最终漏选,验证与重排将它找回。 论文原文

核心方法

• 每个样本由历史 Ht、购买意图 It 和必须属性集合 Rt 构成;代理看不到标注,只能从多轮图文历史推断。
• 每张用户图像拥有跨轮次可追踪的 img_idx;区域检索由图像、意图和累积约束共同预测 box,减少背景干扰。
• 另用 900 条会话做 companion SFT,教师为 Gemini-3.1-Pro-Preview;Qwen3.5-9B/27B/122B-A10B 冻结视觉模块、训练 4 epochs。

实验成果

• Gemini-3.1-Pro-Preview 的 Judge@1/ID@1/Judge@3/ID@3 为 64.7/61.4/73.4/64.0;Claude Opus 4.8 为 64.4/55.0/72.0/59.9。
• Qwen3.5-122B-A10B + SFT 相比 base:Judge@1 从 5.5 升到 52.9,Judge@3 从 5.9 升到 67.5;ID@1/ID@3 从 4.8/5.9 升到 49.8/55.4。
• EGVS 对 Qwen3.5-9B + SFT 的 Judge@3 从 49.5 提升到 65.4;对 Gemini-3.1-Pro-Preview 从 69.2 提升到 73.4。
系统Judge@1ID@1Judge@3ID@3
Gemini-3.1-Pro-Preview64.761.473.464.0
Claude Opus 4.864.455.072.059.9
Qwen3.5-122B-A10B5.54.85.95.9
Qwen3.5-122B-A10B + SFT52.949.867.555.4
表中为论文 Table 3 的主要结果;原文

总结与反思

• 结果总结:MMShopBench 把真实图文多轮约束和商品侧证据放进同一评测闭环,SFT 与 EGVS 都能带来可量化增益。
• 局限性:样本只有 289 cases,原始语言为中文,且 ID@k 是保守指标;Judge@k 依赖 GPT-5.5,可能带来系统性偏差。
• 前沿见解:购物 Agent 的核心不只是「搜到」,而是能把每个硬约束连接到一个可核验的商品证据。

阅读优先级

想看具身强化学习如何补上时序状态:先读 WCM,再读 RayViT;前者改 critic 的监督,后者改视觉表征的几何接口。
想看 Agent 工程瓶颈:并读 TokTier、ResKV 和 Zero-Mem;它们分别处理分词、KV 和记忆阶段的重复计算。
想看安全与可审计性:先读 Tool Specifications Matter,再读 ExtractBench 和 MMShopBench;三篇都把「结果是否能被复核」放到主指标旁边。
想看推理预算和科学搜索:读 Translation with Thought 与 MOT-SR;一个按输入难度分配思考,一个按 Pareto front 组织方程候选。
想看多模态模型架构:读 MoRoute,重点看不同 DiT block 如何选择 VLM 层,而不是只看最终生成样例。
arXiv 每日论文速读 · 奇绩信号风格

arXiv 每日论文速读 · 奇绩信号风格

每日从 arXiv 最新论文中精选一篇 AI/计算机科学领域的前沿研究,用奇绩信号 Alpha Sight 的结构化模板进行深度拆解——从认知提取、核心方法到实验成果与反思,附带论文原始关键图表。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.