
语言形式回来了:六篇论文把 LLM 评估推向语境深处
本期精选六篇论文,围绕跨语言因果推理、虚假预设修正、桥接推断、方言偏见与泛化句展开:LLM 的风险不只来自答案错误,也来自语言形式如何改变模型的判断路径。
本期的共同线索很明确:LLM 的问题不只在「懂不懂语言」,还在「把哪种语言形式当成默认结构」。同样的因果链,换一种语序,注意力和准确率会变;同样的意图,换成 AAVE 或德国方言,评分会变;同样一段论证,只要泛化句够多、篇章关系够顺,机器文本就可能看起来更可信。
这比上一阶段的「模型有没有语法/语用能力」更进一步。现在的焦点变成:语言形式本身正在进入模型的判断机制,而且这种进入方式并不总是可控的。
一、语言不是输入皮肤,而是推理结构
Under the Shadow of Babel 用中英双语因果链来测试语言相对性在 LLM 内部是否留下痕迹。作者构造了 BICAUSE:8 个领域、400 个中英对齐样本,每个样本都是三步因果链,并同时提供正向和反向结构。以 Qwen1.5-1.8B-Chat 为主的分析显示,模型在中英正向因果链上准确率接近,分别为 91.0% 和 91.2%;但换成反向结构后,英文为 88.5%,中文降到 76.5%。注意力轨迹的 SVCCA 相似度也同步下降:中英正向链为 0.73,英文正反向为 0.64,中文正反向只有 0.46。1
这篇论文的意思不是「中文让模型变差」。更准确地说,模型学到了某种语言里的常见因果表达顺序,并把它当成了稳定的处理习惯。中文输入里,模型更依赖句首因果线索;当结构反过来,它比英文更难改道。对多语言 NLP 来说,这个结果很麻烦:翻译成另一种语言并不只是换词,可能是在改变模型的推理路径。
Can LLMs Ground when they (Don’t) Know 把问题转向对话里的共同知识。研究团队用德国 Wahl-O-Mat 2024 欧洲议会选举数据构造政治问答:38 个议题、4 个政党、882 个带虚假预设的诱导性问题,以及各 147 个确认/否定型直接问题。三个模型的表现都不理想:GPT-4o 在诱导性问题中接受虚假预设的比例为 41.4%,Mistral-7B-v03 为 64.1%,Llama-3-8B 虽然接受比例较低,但 48.1% 的回答被标成不精确。2
这里真正被测的不是政治知识,而是语用里的「修正共同基础」。如果用户问「法国国王几岁」,理想回答不是编一个年龄,而是指出法国没有国王。论文显示,模型即使知道事实,也不稳定地承担这个修正动作。它们更像在维持对话顺滑,而不是主动拆掉错误预设。
二、话语结构开始变成模型画像的证据
The Pragmatic Persona 试图从话语连贯性里抽取 LLM 的「人格」。作者不用词频或表层风格来判断 persona,而是借用认知话语理论里的 bridging inference:比如一段话先说「谋杀」,后面出现「刀」,读者会把「刀」填进隐含的工具槽。论文把这些隐含连接建成语义图,再用节点中心性推断模型的角色、人格、背景和兴趣。3
实验里,PD-Agent 使用 GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro、o1-mini、DeepSeek-V3、Llama-3.1-70B 等作为推理 backbone,去识别 Qwen3、Llama、Gemini 等目标模型的隐藏 persona。结果是,桥接推断图在所有 backbone 上都高于直接读文本和词频基线;平均相似度大致在 0.90 到 0.98 之间,最高比频率启发式方法提升 0.15。3
这篇论文的强处是把「模型风格」从词面挪到了篇章结构。弱点也在这里:它预设的桥接关系只有 7 类,分类一旦漏掉真实对话中的隐含关系,persona 图就会变窄。但它提醒我们,LLM 的稳定偏好可能不是藏在某几个高频词里,而是藏在它怎样把一段话接到下一段话里。
三、方言和泛化句揭开了评估盲区
两篇方言偏见论文形成了一个互相补位的警告。
Side-by-side Comparison Amplifies Dialect Bias in Language Models 使用 2019 对意图等价的 AAVE 与 SAE 推文,比较独立评分和并排比较两种场景。三种模型包括 LLaMA-3.1-8B、DeepSeek-V3、GPT-4.0-mini。结论很直接:并排比较会放大偏差。DeepSeek-V3 在对比设置下的 Cohen’s d 平均提升 51.78%,91% 的特质效应量超过 0.5;所有模型都更倾向于给 SAE 推文更高的积极特质分,给 AAVE 推文更高的消极特质分。4
这对实际系统尤其关键。很多高风险应用并不是孤立评价一段文本,而是在做排序、筛选、候选人比较。论文还测试了反事实公平微调:它能缓解一部分独立评分里的偏差,但到了并排比较场景,效果不稳定,甚至会在一些特质上扩大差异。4
Large Language Models Discriminate Against Speakers of German Dialects 则把问题扩展到德国方言。作者覆盖 Low German、North Frisian、Saterfrisian、Ripuarian、Rhine Franconian、Alemannic、Bavarian 七种方言,从 WikiDIR 抽取 350 篇方言文本,再经 GPT-4o 翻译和德语母语者校正得到 350 篇标准德语平行文本。10 个模型在关联任务和决策任务上都显示偏差:关联任务的 120 种组合里只有 7 种无显著偏差;决策任务里只有 3 种无显著偏差。5
最刺眼的是显性标签。过去一些研究认为,明确写出人口属性有时会让模型更谨慎;这篇论文发现,对「德国方言使用者」这种语言人口属性,显性命名反而更容易放大偏差。在关联任务的显著比较中,70% 是方言命名偏差更高;决策任务中,这个比例达到 88%。5
最后一篇 Discourse Realization of Generics in Human and LLM-generated Texts 看起来离公平问题远一些,但其实在补另一块拼图。它研究 LLM 生成文本里的 generics,也就是没有明确量化的泛化陈述。作者用 clause-level annotation 构造文本级 genericity score,再用 Rhetorical Structure Theory 分析篇章关系。结果显示,人类文本的泛化程度低于 LLM 文本;泛化程度越高,篇章结构越容易变得并列、松散,但一些模型能靠 elaboration relation 维持表面连贯。6
这说明一种更隐蔽的风险:模型不一定要给出具体假事实,才会让文本显得可靠。它可以用大量「通常」「人们」「系统会」式的泛化句,配上足够顺的篇章展开,把不够扎实的论证包装得像信息密度很高。
本期判断:评估要从答案移到语境
这六篇论文合起来,把同一个问题从不同侧面推了出来:LLM 评估如果只看最终答案,会漏掉语言形式本身造成的偏差。
| 论文 | 被测试的语言现象 | 主要发现 |
|---|---|---|
| Under the Shadow of Babel | 中英因果表达顺序 | 中文反向因果链准确率在 Qwen1.5-1.8B-Chat 上降到 76.5%,低于英文反向链 88.5%。1 |
| Can LLMs Ground when they (Don’t) Know | 虚假预设与共同基础修正 | GPT-4o、Llama-3-8B、Mistral-7B-v03 都不能稳定拒绝诱导性问题里的错误预设。2 |
| The Pragmatic Persona | 桥接推断与话语连贯 | 语义桥接图比词频或直接文本读取更能识别隐藏 persona。3 |
| Side-by-side Comparison | AAVE/SAE 并排比较 | 对比评分比独立评分更容易放大方言偏差。4 |
| German Dialects | 德国方言命名与使用 | 明确标注「方言使用者」比仅呈现方言文本更容易触发偏差。5 |
| Discourse Realization of Generics | 泛化句与篇章关系 | LLM 文本更依赖泛化陈述,且可能用连贯结构掩盖论证空心。6 |
本期没有把 X 或 Reddit 热帖作为判断依据。公开社群里没有形成足够聚焦的直接讨论,最有价值的争议仍然在论文之间:到底该把语言形式视为「噪声」,还是视为模型行为的一部分?这批工作给出的答案偏向后者。下一步更难的问题是,评估基准能不能跟上这一点。
References
- 1
- 2
- 3
- 4
- 5
- 6

AI × 应用语言学前沿
追踪语言学理论与技术在 AI 中的应用进展,每期精选论文解读、学界观点交锋与社群热议
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.