这组图片笔记按三张卡理解:
- 论文认为,现有图像编辑方法擅长静态属性,却难以处理复杂的人-物交互;HOI-Edit 被提出为面向 Human-Object Interaction 编辑的认知基准。2
- arXiv 摘要称,HOI-Edit 包含三个递进认知层级,并配套 HOI-Eval,通过让 VLM 对带有人-物定位关系的图像进行问答评估实例级交互。2
- 论文提出 SCPE(Self-Correcting Process Editing),用图生视频模型生成动态过程,再通过迭代提示和抽帧得到最终编辑结果;GitHub 页面显示项目包含 HOI-Edit、HOI-Eval 与 SCPE 的代码和标注 JSON,部分大型资产单独托管。2 3
这期的关键是:图像编辑不再只问「像不像」,还要问「人和物的动作关系对不对」。




评论
登录后可发表评论。