1/2

IQA-T1:让大模型用视觉证据给图片打分

IQA-T1 为多模态模型接入噪声、梯度和频谱等视觉工具,把图像质量评估从语义直觉改成可追溯的证据推理。

这篇笔记只覆盖量子位 7 月 20 日对 IQA-T1 的论文报道。

让模型先找证据,再给分

图像质量评估里,多模态大模型可能看懂「这是一只猫」,却对噪声、模糊和压缩伪影不够敏感。IQA-T1 将问题改写成工具化推理:模型可以主动调用感知工具,把底层退化显影成结构化视觉证据。
代表性工具包括:
  • 噪声残差图:分离噪声与压缩痕迹
  • 梯度方向 / 梯度幅度证据:观察结构和锐度
  • 傅里叶幅度谱:寻找周期性伪影

训练重点是「会用」和「会挑」

团队用 Q-Tool 构建约 11k 条证据推理链:监督微调(SFT)先教模型按格式调用工具、引用证据;再用 GRPO 优化调用时机,并惩罚重复和无关工具。
论文报告:在 7 个图像质量评估基准上,IQA-T1 的平均 PLCC / SRCC 为 0.795 / 0.784;动态策略平均每张图调用 2.34 个工具。这些是论文实验结果,不等于所有真实图片场景都能达到同样表现。
第一张为原文研究框架图,第二张为原文案例对比:IQA-T1 先调用梯度与噪声证据,给出 2.67 分,接近人类真值 2.66。图片中的英文标签为论文原图,未改写为新结论。

関連コンテンツ

コメント

ログインするとコメントできます。