AI 论文早报|8 月 2 日:从 token 剪枝到机器人躲球,5 篇论文把瓶颈变成可测约束

AI 论文早报|8 月 2 日:从 token 剪枝到机器人躲球,5 篇论文把瓶颈变成可测约束

精选 5 篇 7 月 31 日 arXiv 更新批次中的新工作,比较 token 级推理剪枝、多模态证据图、公平审计、级联检索与感知安全控制如何把系统瓶颈落到可测环节。

本期从 arXiv 2026 年 7 月 31 日 recent 更新批次中精选 5 篇工作。论文详情页的 v1 时间均显示为 2026 年 7 月 30 日;它们仍以预印本证据为主,其中 DualG-MRAG 的 arXiv 备注称已被 ACM MM 2026 接收。共同线索是:系统不再只追求一个更大的整体,而是把计算、证据、审计和安全约束放到更小、可测的环节里。1 2

今日看点

  • 推理效率:WIDE 让每个 token 自己选择要保留的 attention head group 和 FFN channel group;在 50% 稀疏度下,论文报告了 prefill 端到端 1.68 倍、decode 端到端 1.55 倍加速。3
  • 多模态检索:DualG-MRAG 把跨文档的宏观推理和图像、表格内部的微观匹配拆成两张图;在 MMQA 上,Qwen3-VL-4B 的 EM 为 44.20,F1 为 47.57。4
  • 公平审计:KAISEN 说明,临床风险模型的公平审计不能只看 gap 或 p 值;把 gap 按最小可检测效应标准化后,跨轴相关性从 ρ=0.56 升到 ρ=0.78。5
  • 视觉检索系统:卫星变化检索论文用便宜的差分模型先筛候选,再用融合模型精排;在 LEVIR-CC 上,级联检索把查询时间降到 89–96 ms,并获得 10.2–15.2 倍加速。6
  • 机器人安全:PAC-MAN 的结论很具体:固定头部相机下,较简单的 Link-CBF 比需要更强状态可观测性的 Joint-CBF 更稳;Unitree G1 的真实躲球实验为 20 次中躲过 19 次。7

1. WIDE:把 LLM 的宽度预算交给每个 token

论文WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning 作者与机构:Haozhe Hu、Hao Wu、Peiran Yin、Chao Han、Yunpu Ma、Xiaoyu Shen;Ningbo Institute of Digital Twin、Eastern Institute of Technology,以及 LMU Munich 的 Munich Center for Machine Learning。3 提交时间:2026 年 7 月 30 日,arXiv:2607.28418v1。1 原文与代码arXiv 摘要页完整 HTML代码仓库

问题背景

静态剪枝对所有输入使用同一套计算结构,稀疏度提高后,容易把本来需要更多计算的 token 一并削弱。动态剪枝能按输入分配计算,但已有方法多停留在层或子层级;即使理论 FLOPs 降了,不规则的 token 路由也未必能在 GPU 上转成真实速度。3

方法要点

WIDE 把可剪枝单元细化到 token 级。每个 token 动态选择 attention head groups 和 FFN channel groups;attention 分组与 GQA 对齐,FFN 则按适合硬件 tiling 的 group size 组织。一个轻量 bottleneck router 先产生路由分数,训练时用 Gumbel-Softmax 做 hard sampling,推理时用 argmax 得到二值 mask。3
训练分两阶段:先冻结基座模型,只训练 router;再可选用 LoRA 恢复质量。真正的系统加速也分两层:先把 token-wise mask 重排成 tile 对齐的活跃前缀,再跳过不活跃的 CTA、loading packet 和 MMA fragment。换句话说,WIDE 没有把「动态稀疏」停留在 mask,而是连同执行 kernel 一起设计。3

结果亮点

实验覆盖 Llama3.1-8B 和 Llama3.2-3B,在 WikiText2、ARC、BoolQ、WinoGrande、PIQA、OpenBookQA、HellaSwag 等任务上评估。50% 稀疏度、仅做 calibration 的设置下,WIDE 的平均准确率如下:3
模型WIDE (32)DDP 基线差值
Llama3.1-8B61.84%53.04%+8.80 个百分点
Llama3.2-3B57.00%48.03%+8.97 个百分点
在相同 50% 稀疏度下,端到端 prefill 加速为 1.68 倍,decode 加速为 1.55 倍;单 kernel 的最高加速分别为 1.98 倍和 4.95 倍。论文还报告,实际稀疏度约为 47.3%,其中 attention 稀疏度 66.2%、FFN 稀疏度 28.5%,说明模型并没有平均削减两类计算。3

适用边界

WIDE 的速度收益依赖 group size、GPU 架构和 kernel 实现。论文的实验主要集中在两种 Llama 模型与固定评测套件,不能直接外推到更大模型、不同硬件或其他推理框架。两阶段训练和可选 LoRA 也意味着部署前仍有校准与恢复成本;router、KV projection、element-wise operation 和 kernel launch 的固定开销,会吃掉一部分理论稀疏收益。3

一句话阅读价值

如果你在做 LLM 推理优化,这篇论文值得用来检查一个常被跳过的问题:稀疏率下降之后,路由模式是否真的适合硬件,而不是只在 FLOPs 表上好看。

2. DualG-MRAG:把多模态 RAG 拆成宏观推理和微观匹配

论文DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation 作者与机构:Jiacheng Tao、Qingyun Sun、Haonan Yuan、Ziwei Zhang、Jianxin Li;北京航空航天大学。4 提交时间:2026 年 7 月 30 日,arXiv:2607.28580v1;arXiv 备注称已被 ACM MM 2026 接收。2 原文arXiv 摘要页完整 HTML

问题背景

多模态 RAG 在跨文档、多跳问题上有一个结构性矛盾:如果只做独立的图文匹配,模型看不到跨文档关系;如果把所有细粒度视觉特征塞进同一张图,图会迅速膨胀,检索噪声也会跟着增加。4

方法要点

DualG-MRAG 用两层图解决这个矛盾。Macro Graph 负责跨文档的全局拓扑路由,Micro Graph 保留图像和表格内部的局部事实、空间关系与属性。查询先被解析成条件、目标和视觉预算,再通过 query-driven GNN 在宏观图上传播;微观图则用近似子图匹配筛选细粒度证据。4
它还从 GNN 的 forward pass 中恢复贡献最大的 reasoning path,用动态规划得到结构化证据路径,再把路径映射回原始多模态来源,交给生成模型。这样,生成模型收到的不是一堆孤立 document chunks,而是一条带结构的证据链。4

结果亮点

实验使用 MMQA、WebQA 和 ScienceQA,生成模型为 Qwen3-VL-4B 或 Qwen3-VL-8B。以 Qwen3-VL-4B 为例,DualG-MRAG 在 MMQA 上的 EM 为 44.20、F1 为 47.57;对应最强基线 ViDoRAG 的 EM/F1 为 37.20/41.77。ScienceQA 上,DualG-MRAG 的平均准确率为 90.99。4
检索端也显示了双层图的作用:MMQA 的 R@2/R@5 为 49.4%/61.9%,而 MMGraphRAG 为 31.8%/42.1%。消融去掉 Micro Graph 后,MMQA 的 R@2 从 49.4% 降到 43.1%,去掉 Macro Graph 则降到 16.4%;但完整系统平均查询延迟约 0.44 秒,仍高于 VLM2Vec-V2.0 的约 0.09 秒。4

适用边界

微观子图匹配占总查询时间的 59.95%,是系统的主要成本;Branch-and-Bound 只是对 NP-hard 子图匹配的近似搜索。WebQA 上,DualG-MRAG 在 R@2 略低于 VLM2Vec-V2.0,扩大到 R@5 后才反超。另一个提醒是,Qwen3-VL-8B 在 MMQA 上去掉 path injection 后 EM 从 46.0 小幅升到 46.5,结构化路径并非对更强模型和每类问题都有效。4

一句话阅读价值

这篇论文适合用来思考多模态 RAG 的系统边界:全局关系和局部证据不必塞进一张图,但拆开之后,检索结构和延迟也必须一起承担。

3. KAISEN:公平审计要报告效应量的可检测程度

论文KAISEN: Reproducible Subgroup Fairness Auditing for Clinical Risk Models 作者与机构:Sparsh Roy(MIT)、Samuel Girmachew(Hopewell Valley Central High School)、Nishita Chavan(East Brunswick High School)。8 提交时间:2026 年 7 月 30 日,arXiv:2607.28608v1。5 原文arXiv 摘要页完整 HTML

问题背景

临床风险模型的总体 AUC 可以很好看,但不同患者子群的错误率、校准误差和漂移风险仍可能差异很大。KAISEN 关注的不是再提出一个公平指标,而是把一整套审计流程逐项压力测试:哪些 gap 能被检出,哪些缓解方法只是平均有效,哪些诊断会在 proxy 选错时悄悄失灵。8

方法要点

流水线分五阶段:子群分层、差异测量、机制诊断、事后缓解和长期漂移监控。实验在合成 SDOH benchmark 上进行,覆盖 16 个疾病任务、15 个社会决定因素轴、3 个预设交叉项;每个疾病生成 12,000 名患者。作者用 conditional permutation test 和 Benjamini-Hochberg 控制显著性,再用 EOD、AUC disparity、ECE 和 MCE 同时看分类公平性与校准。8
一个重要设计是把每个轴的 gap 和它自己的 minimum detectable effect 放在一起。后处理同时比较 group-wise Platt scaling 与 group-specific threshold optimization;漂移监控则使用 one-sided CUSUM。8

结果亮点

跨 15 个轴,原始 EOD 与显著性计数的相关性为 ρ=0.56;把 EOD 按最小可检测效应标准化后,相关性升到 ρ=0.78。也就是说,单看 gap 大小或单看 p 值,都可能把统计支持不足的轴排在前面。8
在 16 个疾病、3 个 seed 的 48 个 held-out runs 中,threshold optimization 的 EOD 全部改善,配对平均变化为 -0.285,95% CI 为 [-0.313, -0.252]。Group-wise Platt scaling 则只有 19/48 次改善,平均变化为 +0.009,95% CI 为 [-0.007, +0.024];它可能改善校准,但不是稳定的公平干预。8
压力测试更值得留意:机制诊断在 144/144 个受控案例中分类正确,但当 proxy misspecified 时,48 个 model-driven 案例一个也没有识别出来。CUSUM 在 6σ 阈值下有 27 次 false alarms、8 次 missed shifts 中有 7 次来自不同的 cohort seed,关联检验 p=0.002。8

适用边界

所有结果都来自作者构造的 synthetic benchmark,不能直接当作真实 EHR 的临床公平性结论。数据生成机制、proxy、标签噪声和样本规模都已知,真实医院数据往往缺失敏感属性,且标签和记录流程纠缠在一起。交叉子群只测试了三个 axis pairs,threshold optimization 还需要推理时知道 group membership,并不能同时保证 EOD、校准和其他公平指标都改善。8

一句话阅读价值

如果你在评估高风险模型,这篇论文的直接启发是:审计报告应同时给出 gap、检测能力、波动和失效案例,而不是只报一个漂亮的公平分数。

4. Finding Change:卫星变化检索先粗筛,再精排

论文Finding Change in Satellite Archives from Text: How to Combine Before-and-After Images Efficiently 作者与机构:Simon Roy、Haechan Mark Bong、Giovanni Beltrame;Polytechnique Montréal。6 提交时间:2026 年 7 月 30 日,arXiv:2607.28571v1。9 原文与代码arXiv 摘要页完整 HTML代码与数据划分

问题背景

任务是根据一句自然语言变化描述,在卫星 before-and-after 图像档案中找出最匹配的图像对,例如检索「新出现建筑物」的时相变化。融合模块要在查询时遍历大量候选 pair,因此每一对图像的计算量会直接变成搜索成本。论文比较的不是单一新模型,而是 attention、Mamba 和压缩式 fusion 在这个瓶颈上的真实表现。6

方法要点

所有方法都使用冻结的 CLIP ViT-B/16 提取 patch 特征,再比较 8 种融合设计:标准 Transformer、TFF、Temporal Bottleneck Fusion,以及三种 Mamba 结构等。论文最实用的系统方案是级联检索:先用便宜的 Subtraction 模型为全库排序,再只对 top-N 候选使用 attention fusion 精排。6

结果亮点

在 LEVIR-CC 上,TBF 级联在 top-25 候选时的查询时间为 89 ms,速度是全量融合的 10.2 倍;Concat. Transformer 级联为 96 ms,速度是全量融合的 15.2 倍。两者的 R@1/R@5 与全量融合相近,作者还报告 TBF 的 R@1、R@5 在 10 个随机 seed 上都优于对应的 full fusion。6
TBF 相比 Concat. Transformer 少 2.3 倍参数、延迟低 1.6 倍,change-only BLEU-1 只低 0.007。另一个反直觉结果是:在标准 ViT patch 数 L=196 时,Mamba 的线性复杂度没有转成实际速度优势;长度增加到约 L=400 后,Mamba 才开始超过 attention。6

适用边界

LEVIR-CC 使用 retrieval-oriented split,不能直接和采用标准 change-captioning split 的已发表数值比较;BLEU、METEOR、ROUGE-L 也只是检索效用的代理,合理的 paraphrase 可能被 n-gram 指标惩罚。延迟实验只在一块桌面 GPU 上进行,Dubai-CC 的训练集只有 300 对图像,级联收益没有在两个数据集上完全复制。6

一句话阅读价值

这篇论文适合系统工程读者:当精确模型太贵时,先问能否用便宜的粗筛把候选空间缩小,而不是直接把复杂模型部署到全量数据上。

5. PAC-MAN:安全结构必须和感知能力匹配

论文PAC-MAN: Perception-Aware CBF-RL for Whole-Body Safety in Humanoid Dodgeball 作者与机构:Lizhi Yang、Junheng Li、Aaron D. Ames;California Institute of Technology。10 提交时间:2026 年 7 月 30 日,arXiv:2607.28623v1。7 原文与项目页arXiv 摘要页完整 HTML项目页

问题背景

人形机器人躲球看似简单,真正的安全判定却是「球是否碰到任意一个 body link,同时机器人不能跌倒」。如果训练时使用精确的球状态,部署时却只能从一枚头戴相机的低分辨率深度图里估计球,过强的安全约束可能反而把策略带偏。10

方法要点

PAC-MAN 在训练时用球与每个身体 link 的距离构造 CBF 引导,并加入 Adversarial Motion Prior,让策略学会下蹲、侧移、躲闪和跳跃。部署时策略只接收 segmentation-masked depth、关节状态、基座角速度、重力投影和上一动作,不接收球的真值状态。作者比较了 Link-CBF、Joint-CBF、无 barrier 和需要特权球状态的在线 filter。10

结果亮点

在固定相机的仿真中,Link-CBF 在每次投掷后 reset 的设置下成功率为 90%,在机器人走回站位再接下一球的 deployment 设置下为 89%;Joint-CBF 对应为 83% 和 76%。需要准确球状态的在线 filter 在固定相机设置下可达 97% 和 90%,但这不是最终部署条件。10
真实机实验把 Link-CBF 策略部署到 Unitree G1,使用头戴式 ZED Mini 和语义分割跟踪球。20 次投掷中,机器人躲过 19 次、被击中 1 次、没有跌倒,成功率为 95%;论文还报告同一策略可躲避不同球类。10

适用边界

真实机结果只有 20 次投掷,不能替代更大规模的可靠性评估。Joint-CBF 的优势依赖更好的可观测性或运行时真值状态;oracle-aimed gimbal 仍是仿真设置。当前任务是站立、恢复状态下躲球,论文把边界明确留在行走中躲避和更复杂的全身运动。10

一句话阅读价值

它给安全控制的启发不是「约束越强越安全」,而是:安全结构的复杂度必须和部署时真正能看到的状态相匹配。

把复杂系统拆成可检查的局部环节

这 5 篇论文没有共享一个任务,却共享一种工程判断:把不可解释的整体性能拆成局部变量,再观察瓶颈是否真的被移动了。
  • WIDE 检查的是每个 token 的计算宽度,以及稀疏 mask 是否能落到 GPU kernel。
  • DualG-MRAG 检查的是宏观关系和局部视觉证据是否需要不同的图结构。
  • KAISEN 检查的是公平 gap 是否超过该轴真正可检测的范围,并把失效案例纳入审计。
  • Finding Change 用粗筛和精排区分全库检索成本与高质量匹配成本。
  • PAC-MAN 则把安全约束和传感器可观测性绑在一起,而不是只看仿真中的特权状态。
如果你只读两篇:做 LLM 推理系统,先看 WIDE;做多模态检索或证据链,先看 DualG-MRAG。关注高风险模型评估,KAISEN 的失效测试比某个单点公平分数更值得看;做机器人安全,则把 PAC-MAN 的固定相机结果和 Joint-CBF 的性能落差放在一起读。3 4 8 10

Related content

  • Sign in to comment.
More from this channel