Anthropic研究:Claude不同模型与语言呈现不同「价值观人格」

AI性格第一次被量化测量

2026-07-14 12:35
Anthropic Claude 价值观研究
Anthropic Claude 价值观研究

7月14日,Anthropic甩出一篇让产品经理和 prompt 工程师都坐不住的研究——《Claude's Values Across Models and Languages》(Claude跨模型与跨语言的价值观)。它第一次用可量化的方法,证明了我们长期以来的「体感」:Claude不是一块没有性格的模板,不同模型、不同语言,它表达出来的价值观真的会系统性地变。

这套方法的底子,来自之前对70万段匿名对话的剖析。当时团队从Claude的回复里提炼出3307种细粒度价值观标签——小到「主动指出逻辑漏洞」,大到「拒绝回答未验证的医学建议」。3307个维度人眼看不出门道,于是他们用聚类压成339组,再用主成分分析暴力压缩,最后锚定出四条核心价值轴:顺从对谨慎、温暖对严谨、深入对简洁、坦诚对执行。

有意思的结论在第一层——模型之间性格分明。Sonnet 4.6最偏向温暖、顺从和简洁,爱肯定你、配合你的语气、还会加点幽默;Opus 4.6更严谨、顺从、简洁,开门见山、严格围绕问题、很少主动扩展;Opus 4.7则明显谨慎、深入、坦诚,会主动挑你假设里的刺、提醒潜在风险、承认自己的局限。这些结果和用户多年形成的印象高度一致——很多人一直觉得Opus 4.7爱「打预防针」,这次被数据坐实了。

第二层更有颠覆性:同一个Claude,换种语言性格当场切换。在「温暖对严谨」这一维上,印地语、阿拉伯语模式下最温暖,英语、俄语模式下最严谨。也就是说,一个用印地语提问、一个用俄语提问,拿到的可能是两份反馈风格迥异的回答。中文反而没那么鲜明,四个维度都贴近整体平均,只是略偏严谨和深入。

为什么会有这种差异?Anthropic自己也没给死答案。训练数据规模不均、不同语言互联网语料本身的风格差异、以及文化对交流习惯的塑造,可能都在起作用。关键是,他们明确说并不认为Claude「真正拥有」价值观,论文里的价值观指的是回复中体现出的规范性倾向。

把视线拉远一点,这项研究真正的价值不在猎奇。过去Anthropic能在训练时影响Claude的行为,却没法在模型上线后持续观察价值是否漂移。如今有了这套「价值画像」,他们打算把它塞进模型发布流程——上线前测一遍、上线后测一遍,看新模型有没有意外偏离预期,看不同语言社区是不是拿到了同样质量的AI服务。说到底,能观测,才算管得住。