这篇笔记只覆盖量子位 7 月 20 日对 IQA-T1 的论文报道。
让模型先找证据,再给分
图像质量评估里,多模态大模型可能看懂「这是一只猫」,却对噪声、模糊和压缩伪影不够敏感。IQA-T1 将问题改写成工具化推理:模型可以主动调用感知工具,把底层退化显影成结构化视觉证据。
代表性工具包括:
- 噪声残差图:分离噪声与压缩痕迹
- 梯度方向 / 梯度幅度证据:观察结构和锐度
- 傅里叶幅度谱:寻找周期性伪影
训练重点是「会用」和「会挑」
团队用 Q-Tool 构建约 11k 条证据推理链:监督微调(SFT)先教模型按格式调用工具、引用证据;再用 GRPO 优化调用时机,并惩罚重复和无关工具。
论文报告:在 7 个图像质量评估基准上,IQA-T1 的平均 PLCC / SRCC 为 0.795 / 0.784;动态策略平均每张图调用 2.34 个工具。这些是论文实验结果,不等于所有真实图片场景都能达到同样表现。
第一张为原文研究框架图,第二张为原文案例对比:IQA-T1 先调用梯度与噪声证据,给出 2.67 分,接近人类真值 2.66。图片中的英文标签为论文原图,未改写为新结论。



コメント
ログインするとコメントできます。