1/4

arXiv AI 前沿日报|7 月 22 日:视频个性化、代码剪枝与视觉控制

近72小时从具体 X / Reddit 原帖回看 3 篇 7 月 20 日提交的 AI 论文,配图拆解方法、关键结果与可见边界。

本期按「近 72 小时内出现的具体 X / Reddit 原帖」回看,选出 3 篇均于 7 月 20 日提交的论文。排序看直接讨论信号,不把跨平台互动量相加;第 3 篇 Patch Policy 的 X 互动较弱,但它补上了具身控制这一方向,且有可核验的具体原帖。

01|HOMIE:让人、物与关系一起进入视频

提交与作者:v1 提交于 2026-07-20,v2 于 7 月 21 日更新。作者为 Yiyang Cai、Nan Chen、Rongchang Xie、Junwen Pan、Chunyang Jiang、Cheng Chen、Wen Zhou、Zhenbang Sun、Wei Xue、Wenhan Luo、Yike Guo,全部来自 Hong Kong University of Science and Technology。1
方法与结果:HOMIE 统一处理 inter-subject 与 intra-subject 视频个性化:用 MLLM 提取参考关系,再通过 Global Multimodal Guidance(GMG)和 Modality-Reference Embedding(MRE)把关系信息送进视频模型。作者在 200 个 human-object combinations 上评测;Wan2.1-14B 报告 GMEScore 0.691、Face-Sim 0.786、OCR Acc. 0.452,多视角设置的 DINOrec 为 0.685。1
社区信号:X 用户 @wildmindai 的原帖发布于 2026-07-21 19:57,53 likes、8 retweets、54 bookmarks、3,070 views。2

02|SWE-Pruner Pro:Coder LLM 已经知道该剪什么

提交与作者:论文提交于 2026-07-20。作者为 Yuhang Wang、Yuling Shi、Shaoqiu Zhang、Jialiang Liang、Shilin He、Siyu Ye、Yuting Chen、Kai Cai、Xiaodong Gu;Wang、Shi、Zhang、Liang、Chen、Gu 属于 LLM4SE Lab, Shanghai Jiao Tong University,He、Ye、Cai 属于 Douyin Group。3
方法与结果:论文在冻结 backbone 上接一个约 18M 参数的 pruning head,从 agent 读取工具输出时已有的 hidden states 预测逐行 keep / prune,不新增模型调用。SWE-QA-Pro 从 7.60 升至 7.84,同时 token 减少 39.4%;MiMo-V2-Flash 的 SWE-Bench Verified resolve 从 326/500 到 345/500(+3.8%),Oolong 从 92.4 到 94.6、token 减少 30.1%。但 Qwen3-Coder-Next 的 SWE-Bench Verified resolve 下降 1.2%,说明节省上下文不等于所有 backbone 都涨分。3
社区信号:@HuggingPapers 的 X 原帖发布于 2026-07-21 16:56,13 likes、6 retweets、10 bookmarks、1,311 views。r/LocalLLaMA 讨论帖发布于 2026-07-22 02:35,目前 0 分、upvote ratio 46%、3 条评论。4 5

03|Patch Policy:机器人策略直接使用密集视觉 patch

提交与作者:论文提交于 2026-07-20。作者为 Gaoyue Zhou、Zichen Jeff Cui、Ada Langford、Bowen Tan、Yann LeCun、Lerrel Pinto;作者-机构对应为 Courant Institute, New York University:Zhou、Cui、Langford、Tan、LeCun、Pinto,Meta-FAIR:Pinto,AMI Labs:LeCun。6
方法与结果:Patch Policy 保留预训练 ViT 的 dense patch tokens,用 block-causal attention mask 让同一帧内 patch 互相注意、跨帧仍遵守时间因果。在 4 个仿真环境和 3 个真实机器人环境中,论文报告相对全局池化表征提升 40%,相对 fine-tuned OpenVLA-OFT 提升 18%,参数量约为其 0.7%;CAP zero-shot pickup 为 87%,基线为 79%。限制是 dense tokens 会拉长序列,当前只评估冻结视觉 backbone 与 behavior cloning。6
社区信号:@fly51fly 的具体 X 原帖发布于 2026-07-22 05:17,4 likes、3 bookmarks、291 views,无 retweets 或 replies;互动明显弱于前两篇,故不把它包装成「热议」。7
本期图片按「概览 → 视频个性化 → 代码 agent 剪枝 → 具身控制」顺序排列,重点放在方法结构、关键数字和可见边界。

関連コンテンツ

コメント

ログインするとコメントできます。