画像是编的,问法一变就不贴,工具上了也不调:8 月 4–10 日三篇大模型论文

画像是编的,问法一变就不贴,工具上了也不调:8 月 4–10 日三篇大模型论文

覆盖 8 月 4–10 日 arXiv:个性化助手如何编造用户画像、同义改写如何拆掉 RAG 忠实度,以及电脑智能体为何接了工具仍很少调用。

本期覆盖 2026 年 8 月 4 日–10 日 在 arXiv 新挂出的大模型相关论文。从中挑了三篇:一篇看带记忆的个性化助手会不会编造用户画像,一篇看同一意思换个说法会不会让 RAG 答得不忠实,一篇看电脑使用智能体有了工具为什么还是不怎么用。
挑选标准只有三条:问题能说清楚、实验设计能复述、结论对工程师或产品决策有直接含义。

本期三篇

论文一句话挂出日期
The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads个性化助手常把没说过的用户属性补全,模型自评还指错方向8 月 5 日
Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks检索上下文不变,只改问法措辞,忠实度仍可大幅下滑8 月 4 日
Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents工具接上了,推理模型也只在少数任务上真正调用8 月 4 日(v1)

1. 个性化助手会编用户画像,还别信它自己的反省

The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads Yushi Sun、Yanjie Zhang、Rui Sheng arXiv: 2608.04570 · 2026-08-05 提交 · cs.CL

要解决什么问题

带长期记忆的个性化大模型已经常见:系统记住你的职业、口味、家庭情况,再写推荐信、排行程、挑礼物。论文问的是另一件事——模型写出来的「用户画像」有多少是证据支持的,有多少是它自己补出来的。
作者把这种行为叫过度推断(over-inference, OI):模型给出的用户属性,超出了用户实际提供过的证据。它不同于常识幻觉(世界事实错了),也不同于群体刻板印象(按群体贴标签);它是在个人层面「感觉很懂你」,但证据里并没有这些内容。

方法是什么

作者搭了基准 MirageBench
  1. 150 个人设,分刻板、反刻板、中性三类;每人有 15 项真实属性,但模型只看到其中 3 条事实。
  2. 6 类个性化任务,按「需要想象多少」排成梯度:约会简介、周末行程、推荐信、100 美元生日礼物、公寓描述、压力来源。
  3. 把模型产出的主张分成四类:有据(Grounded)、合理推断(Reasonable)、刻板(Stereotype)、捏造(Fabricated)。过度推断率 =(刻板 + 捏造)/ 全部主张。
  4. 用固定的外部评判模型(Claude-Opus-4-7)打标签;与盲测人工在 400 条主张上对照,四分类 Cohen’s κ = 0.863,二分类 κ = 0.900
  5. 共测 12 个模型、7 个家族,合计 143,616 条被评判主张;另有多轮记忆累积小实验。1

结果说明了什么

过度推断是系统现象,不是个别模型的毛病。
  • 12 个模型无一幸免:过度推断占全部主张的 35%–49%,跨模型平均 41.6%(按主张加权 41.8%)。真正有证据支撑的主张只有 24%–31%;捏造(均值 31.1%)比刻板(均值 10.5%)更常见。
  • 自评会骗人:跨模型比较时,模型自称的过度推断率与外部评判结果呈负相关(Spearman ρ = −0.60,p = 0.044;n = 12,bootstrap 区间较宽)。自报最少的,往往被判捏造最多。例如 Qwen3-8B 自报 13.0%,外部判 48.7%。单模型内部,用自评给自己的主张排序仍有一定用处(AUROC 0.58–0.83),但不能拿自评来选模型
  • 任务越「要脑补」,越容易编:生日礼物约 27%,公寓描述约 59%;刻板人设比反刻板人设再高约 7.8 个百分点。
  • 直接盘问 vs 任务里顺带写:被要求「列出你推断了什么」时,错误率只有 0.7%–4.6%;写到个性化任务里时,过度推断平均高出约 38.6 个百分点。
  • 多轮记忆小实验里,多数模型会近似线性地堆推断属性,且很少改口删除;这是 2 个人设上的试点,只能当现象提示。1

读完可以带走什么

做陪伴、顾问、CRM 助手时,别把「模型写出的用户标签」直接当事实入库。更稳妥的做法是:
  1. 用户画像字段要有可追溯证据(哪轮对话、哪条事实),无证据就不写死。
  2. 评估个性化质量时用外部核对,别让模型自己给自己打分,尤其不要用自评在模型之间做选型。
  3. 任务越开放(写公寓、写推荐信),越要限制可写字段,或强制引用记忆条目。
局限:主指标依赖单一评判模型;跨模型负相关是探索性观察(n 小、区间含零边缘);多轮累积是小样本试点;原文没有测具体缓解方案对业务指标的影响。

2. 意思没变,换个问法,RAG 仍可能不忠实

Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks Atri Vivek Sharma、Brian Formento、Alessio Lomuscio arXiv: 2608.04286 · 2026-08-04 提交 · cs.CL(拟在 COLM 2026 展示)

要解决什么问题

很多产品用 RAG(检索增强生成):先检索文档,再让模型按文档回答,指望减少胡编。即便检索到的材料对了,模型仍可能写出与材料不符的内容,这叫内生幻觉(intrinsic hallucination)——错在生成侧,不在检索侧。
论文关心一个更贴近真实用户的压力测试:攻击者只能改用户问题的措辞,意思保持等价,检索结果固定不变。问法一变,模型对同一段证据的忠实度会不会崩?

方法是什么

作者把「语义等价的问法攻击」做成统一框架:
  1. 威胁模型:只能改查询;检索器与语料固定,上下文不变。
  2. 语义约束:对抗查询与原查询要双向蕴含(由 LLM 评判);优化过程里用更便宜的相似度作代理。
  3. 目标:在保持语义等价的前提下,尽量让生成相对固定上下文不忠实。
  4. 攻击手段:白盒/灰盒(GCG、AutoDAN、SECA-GB、SRA 等)与黑盒(PAIR、SECA-BB)。
  5. 指标:原查询忠实度(CA)、对抗查询忠实度(AA)、在原查询正确样本上的攻击成功率(ASR)、对抗查询流畅度(困惑度)。2
评测覆盖开源与闭源共约 10 个生成模型,数据集包括 FaithEval、ANAH-v2、FailSafeQA 等;每数据集约 100 条实例。

结果说明了什么

意思不变的改写,足以把不少模型从「跟材料」打到「不跟材料」。
  • 开源侧,基于自然语言改写的攻击通常比纯 token 级攻击更有效,也更像真人会说的话。例如 FaithEval 上,Llama3.2-3B 在 SRA 下 ASR 约 0.815,Llama3.1-8B 在 SECA-GB 下约 0.607;Gemma3-1B 在 SRA 下约 0.6902
  • 闭源侧同样脆弱。FaithEval 上 SECA-BB 的 ASR:Gemini-2.5-Flash-Lite 约 0.467,GPT-5-nano 约 0.523GPT-5-mini 约 0.703,GPT-5-chat 约 0.568,MiniMax-M2.1 约 0.571。摘要还写到:GPT-5-mini 的上下文忠实度可下降约 50% 量级。2
  • 失败形态不同:白盒/灰盒更常把模型推向拒答/回避;黑盒更常诱发错误推理。参数变大并不自动消除这类脆弱性。

读完可以带走什么

RAG 评测如果只测「标准问法」,会高估线上忠实度。工程上可以:
  1. 在回归集里为同一意图准备多种自然改写,固定检索结果,只看生成是否仍贴材料。
  2. 对关键答复做基于证据的核对(引用句是否支撑结论),别只看答案是否「看起来对」。
  3. 训练与提示里明确:上下文未支持就说不知道,不因问法变化改口。
局限:单轮设定;主实验偏中小与非深度推理模型;假设检索完美,只隔离生成器问题;部分攻击(如 SRA 加后缀)与纯改写不完全同质;每集约 100 条,规模中等。

3. 工具接上了,电脑智能体仍常常不用

Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents Siqi Fan、Minghao Li、Xiaoqian Ma、Wenhui Tan、Xiusheng Huang、Juntong Wu、Liujie Zhang、Shuo Shang、Weihang Chen arXiv: 2608.03327 · 2026-08-04 提交(v2:08-06)· cs.AI

要解决什么问题

新一代电脑使用智能体可以两条路办事:盯着截图点鼠标,或调用文本工具(文中是 MCP 工具)。产品上常默认「工具接上了就会更好用」。论文在同一套 GUI–MCP 机架、同一批工具上问:工具到底帮了谁?模型会不会真的去用?

方法是什么

  • 基准:OSWorld-MCP309 个任务;120 个 MCP 工具,按应用命名空间检索后取 top-18。
  • 同一 harness 下对比 Qwen3-VL-8B-Thinking(推理型)与 Qwen3-VL-8B-Instruct(非推理型),各跑 5 次。
  • 动作空间统一:GUI 操作与 MCP 调用走同一调用面;默认保留最近 4 帧截图 + 完整文本轨迹。
  • 再用多轮强化学习做探针:加稠密「工具奖励」看会不会更爱调工具;按部署时的压缩规则(成功调工具后丢掉冗余截图、缩小图像历史)做匹配训练,看上下文能不能省。3

结果说明了什么

同一批工具,对不同模型符号相反。
设定结果
推理模型 + MCP成功率 30.5% → 34.5%(+4.0 个百分点)
非推理模型 + MCP25.4% → 19.5%(−5.9 个百分点)
推理模型实际调工具55/309 任务(17.8%),占「本可走工具」任务的 23.9%
非推理模型调工具任务级 10.4%;还会幻觉工具名97 次 vs 推理模型 0 次)
作者把「能用工具却不调」称为采纳缺口(adoption gap):模型手里已有更省事的截图路径,训练又没逼它改道。
  • 给训练加稠密工具奖励,表格类任务的采纳率可从约 0.03 拉到 0.33,贪心解码里也能保持;但留出集准确率跟不上——会调工具,却常调错语义(例如正则查找替换 0/23 成功、格式转换 0/16 成功)。结论写得很直:行为好推,能力不好推;瓶颈在工具调用语义数据,不在奖励形状。
  • 上下文侧:成功调工具后,下一帧截图往往多余。推理时压缩(窗口缩到 2 + 成功后丢图)大约省三分之一输入 token,准确率略降。按同一观察规则重新训练后,压缩智能体全量 37.8%,对照未压缩工作点 33.0%,输入成本约 53%,并在预注册的困难子集上抹平「富观察 vs 瘦观察」差距。3

读完可以带走什么

做 Computer Use / 办公智能体时:
  1. 工具目录 ≠ 工具收益。先量「该用时用了没有」,再谈接更多 API。
  2. 非推理小模型硬塞工具可能负收益;至少要分开测决策错误(乱点名、假成功)与语义错误。
  3. 想靠奖励「哄」出工具使用,只能改习惯,补不了工具参数怎么填;需要带校验的成功轨迹做监督。
  4. 截图历史可以在「工具已成功」后大胆砍,但压缩规则最好写进训练分布,别只在推理时临时改。
局限:符号反转主要在同一骨干的两个检查点上观察到,机制未完全因果拆开;RL 探针没真正补上工具语义能力;压缩收益对留出任务外推有限;上下文规则是固定策略而非学出来的。

三篇放在一起看

三篇分别落在个性化产品行为、RAG 忠实度评测、电脑智能体系统设计上,没有共同的「本周统一结论」。若你只记三句话:
  1. 个性化输出要外部核对——模型自评选不了更老实的模型。
  2. RAG 要测同义改写——检索对了,问法一变仍可能不贴材料。
  3. 工具要测采纳与语义——接上 API 只是起点,用不起来和用错是两件事。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content