看见·没看(CauAudit)

看见·没看(CauAudit)

CauAudit 证明视觉工具的调用次数和视觉证据的因果贡献不是一回事:有些模型真的看见,有些只是调用得很像看见。

0:00 / 3:43
这首歌讲 The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images:模型会调用 crop-and-zoom,不等于返回的视觉证据真的改变了答案。论文把工具动作、返回图像和最终回答拆进因果图,再用 policy、trajectory、step 三层干预,追问「调用到底有没有看见」。1
研究覆盖 6 个开源视觉工具使用模型和 5 组细粒度感知基准。最刺耳的数字是:Mini-o3 在 VisualProbe 上比直接推理高 21.3 个百分点,但把每次返回图像替换成随机裁剪后,准确率从 55.0% 掉到 2.4%;论文还把轨迹分成「Calling Without Looking」与「Looking Without Planning」,并用 step-level 的 Visual Evidence Gain 量出单次观察的真实贡献。2
论文作者来自上海人工智能实验室、上海交通大学和上海创新研究院;第一作者 Zhiheng Wang,文中标注通讯作者为 Chaochao Lu。结论很锋利,证据边界也写得很清楚:step-level 诊断需要白盒 token 分数,目前只审计 crop-and-zoom,关于 outcome-only RL 导致失准的解释仍是待训练实验验证的假设。通勤时听这首,记住一句:动作有了,因果未必到场。 2

Fuentes de referencia

  1. 1
  2. 2

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado