Claude 的价值观,不是一张固定脸
机器之心 2026-07-14 10:31 发布《AI 也会「看人下菜」?Anthropic 勾勒出了 Claude 的价值观画像》,转述 Anthropic 对 Claude 模型与语言差异的研究;研究原文称,分析对象来自 309,815 段 Claude.ai 对话,并覆盖 3 种模型与 20 种高频语言。12
这组三张图按「样本—价值轴—边界」来读:
- 图 1:不要把 Claude 的价值画像理解成一个固定人格。Anthropic 的说法更接近「同一个系统在不同模型和语言场景下,会呈现不同价值倾向」。
- 图 2:研究把此前识别出的 3307 种价值观压缩为 339 种高层价值观,再用降维方法归纳出 4 条价值轴:顺应与审慎、温暖与严谨、深度与简洁、坦诚与执行。2
- 图 3:机器之心转述称,Sonnet 4.6 更偏温暖、顺应和简洁,Opus 4.7 更偏严谨、审慎和深度;语言差异也会改变价值表达。但 Anthropic 也明确说,研究还不能解释差异来源,也没有测量这些差异对用户的实际影响。1
一句话看点:这不是「Claude 有性格」的八卦,而是一个产品安全问题:模型、语言、用户场景一变,AI 的回答取向也可能变。




Comments
Sign in to comment.