Anthropic 在 7/13 發佈「Claude 的價值觀在不同模型與語言間的差異」的研究報告,分析 Claude.ai 平台上超過三十萬個去識別化的對話,分享如何透過技術手段形塑 AI 的性格,以及為何使用者會明顯感覺到不同版本、不同語言的 Claude 在說話語氣與價值取向上有著巨大轉變,這篇研究也證實了使用者對於不同版本模型說話語調的直觀感受不是幻覺。
▎Claude 的價值觀如何定義的
Claude 的核心價值觀受到 Anthropic 提出的《Claude 憲法》(Claude’s Constitution)引導,用以規範 AI 的行為底線。但正如現實中的憲法,原則性的規範難以應對每天數百萬次對話的社會百態或細節,所以除了憲法以外, Claude 在對話中的判斷力,也受到在模型訓練時的「性格訓練(Character Training)」與「微調(Fine-tuning)」所形塑。
▎Claude 的四大價值觀光譜
為了量化並理解 Claude 的表現,Anthropic 將 Claude 表現出的價值觀歸納為四大類別,捕捉 Claude 回答中的關鍵特徵,每個維度都是兩組價值觀之間的光譜
第一是「順應與審慎(Deference vs. Caution)」,意即 Claude 傾向於全盤肯定使用者的想法,還是會主動對潛在風險提出不請自來的警告。
第二是「溫暖與嚴謹(Warmth vs. Rigor)」,反映出 Claude 傾向使用幽默、禮貌與感同身受的文字來安慰使用者,還是傾向挑戰使用者的假設、糾正細節並要求提供證據。
第三是「深度與簡潔(Depth vs. Brevity)」,關乎 Claude 在回答時是否會詳細展示其推理過程並完善細節,抑或是直接切入重點、點到為止。
第四是「坦誠與執行(Candor vs. Execution)」,代表 Claude 傾向主動承認自身的局限與錯誤,還是傾向專注於執行使用者交辦的具體任務。
▎Sonnet 的溫暖與 Opus 的嚴謹
在理解了這四大價值觀維度後,Anthropic 進一步將其套用在不同型號的 Claude 進行實測,研究顯示 Sonnet 4.6 展現出極為鮮明的「親和力」,它是所有模型中最偏向「順應」與「溫暖」的,它傾向正面肯定使用者的想法與工作成果,時常透過幽默、風趣且帶有同理心的語氣安慰使用者。
相較之下,Opus 4.7 則呈現出完全不同的性格曲線,往「嚴謹」、「審慎」、「深度」與「坦誠」的極端靠攏。Opus 4.7 在對話時,它幾乎不做無意義的奉承,傾向於主動警告潛在風險,甚至會直接挑戰使用者的假設、指出錯誤,並對使用者的工作內容給出坦率且尖銳的批評。
同時 Opus 4.7 也有「深度推理」強烈傾向,在給出結論時,會不厭其煩地詳細展示其背後的邏輯與思考過程;也更傾向於主動承認自身的技術侷限與不確定性,而非強行給出看似完美但可能出錯的答案。這種行文風格,正是許多使用者感覺新版模型說話變得像學者、甚至開始「講黑話」的原因。
至於同為 Opus 家族的 Opus 4.6,其表現則介於兩者之間。它在嚴謹度上與 4.7 相似,但在任務執行上卻比 4.7 更注重「效率」與「簡潔」。Opus 4.6 的對話特徵更偏向直奔主題與專注執行,傾向於在使用者要求的框架內迅速完成具體任務,不會不請自來的說明出風險警告或底層邏輯。
▎使用的語言影響 Claude 的價值觀
當使用者使用印地語(Hindi)或阿拉伯語(Arabic)與 Claude 對話時,Claude 會展現出最高的「溫暖」與「順應」特徵。但當使用英語與俄羅斯語時,Claude 則會變得極度「嚴謹」與「審慎」,更傾向要使用者提供實證並指出邏輯漏洞。在荷蘭語的對話中,Claude 表現出最高的「坦誠度」,更樂意承認自身的限制;在印度尼西亞語中則展現出極高的「順應與執行」,會默默完成交辦任務不做多餘的互動。
目前還沒辦法確定為什麼語言會造成價值偏差,但可能與不同語言在網路上的語料規模、行文風格以及文化表達習慣有關。
在 AI 逐步被應用於教育、醫療與法律等領域,模型「會以什麼樣的溝通方式與價值觀與人類交流」,其重要性不亞於模型本身的能力。如何避免因語言不同而產生過大的價值偏差,也會是未來值得關注的點。