
Claude Values:Anthropic 给模型性格画了四根轴
Anthropic 用 30 万余条真实 Claude.ai 对话,把 Claude 在主观问题里的价值表达压缩成四根轴。文章拆解这套方法如何比较 Sonnet 4.6、Opus 4.6、Opus 4.7 和 20 种语言,以及为什么它更适合做上线后行为监控,而不是给模型贴人格标签。
Anthropic 这次量的不是 Claude 会不会答对,而是它在没有唯一正确答案的问题里,会偏向哪种回答方式。研究团队从 309,815 条 Claude.ai 真实对话里抽样,把此前识别出的 3,307 个价值观压缩成四根轴:顺从还是谨慎,温暖还是严谨,深入还是简短,坦诚还是执行。1
这件事值得单独看,因为它把「模型性格」从主观感受推到了一套可重复测量的方法。用户常说某个模型更会安慰人,某个模型更爱挑错,某个模型更啰嗦。Anthropic 现在试图问:这些感觉能不能从大规模对话里被量出来,能不能拿来比较不同模型和不同语言里的 Claude。
先看结论:这不是价值观清单,而是行为坐标轴
Anthropic 之前的 Values in the Wild 研究分析过 70 万条匿名 Claude.ai 对话,识别出 3,000 多个 Claude 在回复里表现出的价值观。问题是,3,000 多个标签太碎,几乎没法用于模型对比。1
新研究的做法,是把 3,307 个原始价值观先合并成 339 个高层价值,再用隐私保护分析工具给真实对话打标签。每条对话都会被标出 Claude 表达了哪些价值、用户表达了哪些价值、任务是什么、主题是什么。附录说明,研究只纳入需要主观判断的对话,这类对话占全部对话的 53.2%。2
最后留下四根轴:
| 价值轴 | 它在区分什么 | 读者可以怎么理解 |
|---|---|---|
| Deference vs. Caution | 更顺着用户偏好,还是更主动提醒风险 | 模型是「帮你往前走」,还是「先问这样做是否安全」 |
| Warmth vs. Rigor | 更照顾情绪,还是更强调准确和精确 | 模型是先安慰鼓励,还是先校正问题 |
| Depth vs. Brevity | 更愿意展开解释,还是只做被要求的事 | 模型是多讲推理过程,还是尽快交付答案 |
| Candor vs. Execution | 更暴露不确定性,还是给出更成型的结果 | 模型是坦白说哪里没把握,还是把答案打磨得更顺 |
四根轴合起来解释了 Claude 价值表达中约 15% 的变异。1 这个比例不高,但很关键:它说明这套方法不是在给 Claude 贴一个总性格标签,而是在抓最明显、最可解释的几类差异。
方法关键:先把「用户问了什么」扣掉
这类研究最容易犯的错,是把任务差异误当成模型差异。比如用户用英文问职业选择,用另一种语言问亲密关系冲突,Claude 表现出的价值当然会不同;这不一定是语言导致的。
Anthropic 的处理方式是先控制对话任务、主题和用户自己表达的价值。附录写明,他们在 Hellinger 转换后的价值矩阵上,把任务、主题和用户表达价值能解释的部分回归掉,这一步解释了 31.7% 的总变异。剩下的部分再做 PCA,并用 varimax 旋转得到更容易解释的四根轴。2
这段方法翻成工程语言,就是先尽量回答一个问题:如果用户问的任务、话题和价值诉求相近,Claude 的回答风格还会不会因为模型或语言而变。
样本也做了分层。研究覆盖 Claude Sonnet 4.6、Claude Opus 4.6 和 Claude Opus 4.7,覆盖 Claude.ai 上最常见的 20 种语言,采样窗口是 2026 年 5 月的两周。研究目标是每个模型-语言组合约 5,333 条对话,但阿拉伯语、印地语、印尼语的一些组合因为流量不足低于这个阈值。2
模型差异:Sonnet 更暖,Opus 4.7 更会刹车
模型之间的差异符合很多用户对 Claude 的直觉。
Sonnet 4.6 更偏向顺从、温暖和简短。官方图表给出的平均位置是:顺从 0.14 个标准差,温暖 0.17 个标准差,简短 0.14 个标准差。它更常见的行为包括肯定用户想法、模仿用户语气、使用幽默、给出不带评判的安慰。1
Opus 4.6 则更偏向严谨、顺从和简短。它的特点是更快进入任务范围,较少展开额外提醒。1
Opus 4.7 的变化最明显:它更偏向谨慎和深入,官方图表给出的平均位置是谨慎 0.24 个标准差、深入 0.23 个标准差。具体表现是更可能指出用户前提错误,主动提示风险,坦白自己的限制,并给出后续步骤。1
这解释了一个产品上的现象:同样叫 Claude,不同档位的模型不只是能力强弱不同,也可能在「该不该顺着用户做」和「该不该先纠错」上有不同取舍。对企业内部工具来说,这会直接影响体验。客服场景可能更需要温暖和简短,代码审查、安全分析、法律草稿则更需要谨慎和坦诚。
语言差异:同一类请求,中文用户也可能拿到不同语气
研究还发现,Claude 在不同语言里的价值表达并不完全一致。官方正文说,Warmth vs. Rigor 和 Candor vs. Execution 两根轴的语言差异最大;Deference vs. Caution 和 Depth vs. Brevity 相对更稳定。1
几个方向很清楚:Claude 在阿拉伯语里最偏顺从和简短,在英语里最偏谨慎和深入;在印地语和阿拉伯语里更偏温暖,在英语和俄语里更偏严谨;在荷兰语里更偏坦诚,在印尼语里更偏执行。1
这对中文读者的提醒不是「哪种语言更好」。更现实的问题是,多语言产品不能只用英文评测来判断模型气质。如果一个团队要把 Claude 接进中文、日文、印尼语或阿拉伯语用户流量,同一套提示词在不同语言里可能带来不同的拒答边界、反馈强度和安慰风格。
Anthropic 自己也没有把原因说死。官方列出的可能因素包括训练数据数量不均、不同语言数据的文本类型不同、语言本身的对话规范不同,以及模型是否在某些语言里更接近预期行为。1
这项研究最有用的地方:上线后监控
这篇文章表面上在讲价值观,实际更像一套模型行为监控工具。
过去,模型发布前的评测更容易覆盖知识、推理、拒答率、越狱、安全分类这些指标。但开放式对话里更微妙的问题很难量化:模型是不是越来越会讨好用户,某个版本是不是更爱给不必要的免责声明,某种语言里是不是更少指出风险。
四轴方法给了一个可操作入口。Anthropic 在正文里也说,这套方法未来可以进入模型发布前评估和上线后监控,用来发现价值表达的异常变化,并检查这些变化是否和不符合 Claude constitution 的行为相关。1
这对外部团队同样有用。真正部署大模型时,问题往往不是「模型是否足够聪明」,而是它在你的业务里是否稳定表达你想要的判断方式。一个医疗问答系统不能太顺从,一个创意写作助手不能太爱打断,一个面向青少年的学习产品也不能只追求执行效率。
现在不能过度解读什么
这篇研究有几个边界,需要放在主结论旁边看。
第一,分析工具本身也是 Claude。附录承认,隐私保护分析工具可能带有 Claude 自己的语言条件偏差。研究团队做了翻译控制实验,发现这种偏差较小,但它仍然是方法边界。2
第二,四根轴是相关结构,不是因果结论。附录明确说,这些轴描述的是对话之间价值比例如何一起变化,不是模型或语言造成某种价值表达的因果效应,也不能拿来解释单条对话内部的行为模式。2
第三,轴的两端不一定是真正的行为反义词。因为每条对话的价值会被归一化成比例,一个价值组变多,其他价值组的比例会被机械压低。附录说,前两根轴更像真实 trade-off,后两根轴更像统计上有效的组织方式。2
第四,15% 的解释量意味着大量差异没有被这四根轴捕捉。它适合做监控仪表盘,不适合当完整人格画像。2
这篇研究的价值,正在于它没有把「价值观」讲成一套抽象宣言。它把主观对话拆成可测量的行为差异,再把这些差异放回模型训练、语言覆盖和上线监控里。下一步要看的,是 Anthropic 能不能把这套测量方法真的接进模型迭代:当某个新 Claude 变得更谨慎、更坦诚或更顺从时,团队是否能说清楚这是有意训练出来的,还是部署后才暴露出的漂移。
関連コンテンツ
- ログインするとコメントできます。
