Anthropic研究:Claude不同模型與語言呈現不同「價值觀人格」

AI性格第一次被量化測量

2026-07-14 12:35
Anthropic Claude 價值觀研究
Anthropic Claude 價值觀研究

7月14日,Anthropic甩出一篇讓產品經理和 prompt 工程師都坐不住的研究——《Claude's Values Across Models and Languages》(Claude跨模型與跨語言的價值觀)。它第一次用可量化的方法,證明了我們長期以來的「體感」:Claude不是一塊沒有性格的模板,不同模型、不同語言,它表達出來的價值觀真的會系統性地變。

這套方法的底子,來自之前對70萬段匿名對話的剖析。當時團隊從Claude的回覆裡提煉出3307種細粒度價值觀標籤——小到「主動指出邏輯漏洞」,大到「拒絕回答未驗證的醫學建議」。3307個維度人眼看不出門道,於是他們用聚類壓成339組,再用主成分分析暴力壓縮,最後錨定出四條核心價值軸:順從對謹慎、溫暖對嚴謹、深入對簡潔、坦誠對執行。

有意思的結論在第一層——模型之間性格分明。Sonnet 4.6最偏向溫暖、順從和簡潔,愛肯定你、配合你的語氣、還會加點幽默;Opus 4.6更嚴謹、順從、簡潔,開門見山、嚴格圍繞問題、很少主動擴充套件;Opus 4.7則明顯謹慎、深入、坦誠,會主動挑你假設裡的刺、提醒潛在風險、承認自己的侷限。這些結果和使用者多年形成的印象高度一致——很多人一直覺得Opus 4.7愛「打預防針」,這次被資料坐實了。

第二層更有顛覆性:同一個Claude,換種語言性格當場切換。在「溫暖對嚴謹」這一維上,印地語、阿拉伯語模式下最溫暖,英語、俄語模式下最嚴謹。也就是說,一個用印地語提問、一個用俄語提問,拿到的可能是兩份反饋風格迥異的回答。中文反而沒那麼鮮明,四個維度都貼近整體平均,只是略偏嚴謹和深入。

為什麼會有這種差異?Anthropic自己也沒給死答案。訓練資料規模不均、不同語言網際網路語料本身的風格差異、以及文化對交流習慣的塑造,可能都在起作用。關鍵是,他們明確說並不認為Claude「真正擁有」價值觀,論文裡的價值觀指的是回覆中體現出的規範性傾向。

把視線拉遠一點,這項研究真正的價值不在獵奇。過去Anthropic能在訓練時影響Claude的行為,卻沒法在模型上線後持續觀察價值是否漂移。如今有了這套「價值畫像」,他們打算把它塞進模型釋出流程——上線前測一遍、上線後測一遍,看新模型有沒有意外偏離預期,看不同語言社群是不是拿到了同樣質量的AI服務。說到底,能觀測,才算管得住。