实测|同一 Claude 多语言表现差异:语言如何影响大模型价值倾向(附 Anthropic 最新论文解读)
一个问题,换一种语言问 Claude,回答可能会变。
变的地方不只在措辞。语气会变,风险提示会变,批评力度会变,解释深度也会变。
这里说的“性格”,指的是模型回答里呈现出来的行为倾向,不指主观意识。它可能更顺着用户说,也可能更愿意提醒风险;可能更温和,也可能更严谨;可能展开讲清楚,也可能直接给结果。
Anthropic 在 2026 年 7 月 13 日发布了一篇研究,题目是《Claude’s values across models and languages》。研究团队想看清一件事:Claude 在不同模型版本、不同语言环境里,表达出来的“价值倾向”到底有没有差别。
答案是有。而且可以测。
先看研究怎么做
Anthropic 分析了 309,815 段匿名 Claude.ai 对话。样本覆盖 Sonnet 4.6、Opus 4.6、Opus 4.7 三个模型,以及 Claude.ai 上使用量最高的 20 种语言。
研究重点放在开放式、主观性任务上,比如职业选择、朋友冲突、商业计划反馈、内容修改建议。这类问题没有唯一标准答案,模型怎么回应,很容易带出它的偏好。
比如同一份商业计划书,有的回答会先鼓励,有的会直接挑假设漏洞,有的会先提醒风险,再给修改建议。用户读完以后,对方案质量的判断可能完全不同。
四根尺子:顺从、温暖、深入、坦诚
Anthropic 先从此前研究中拿到 3,307 个价值表达,再压缩成 339 个高层标签,最后提炼出四条主要行为轴。这四条轴解释了 Claude 价值表达差异中的 15%。

-
顺从 vs 谨慎。模型更倾向于满足用户偏好,还是更倾向于识别风险、给出保护性建议。
-
温暖 vs 严谨。模型更常鼓励、安慰、积极反馈,还是更强调准确性、透明度和事实校正。
-
深入 vs 简洁。模型会补充背景和推理过程,还是只完成用户明确提出的任务。
-
坦诚 vs 执行。模型会主动说明不确定性、限制和可能错误,还是给出更完整、更确定的结果。
这四根尺子没有覆盖全部模型行为,但已经足够用于企业评估。模型体验不能只靠“感觉不错”来判断,最好能放进测试集里反复看。
换模型,口径会变
研究发现,不同 Claude 模型版本的回答倾向并不一样。
Sonnet 4.6 更温暖、顺从、简洁。它更容易肯定用户想法,也更会匹配用户语气,回答里常见轻松和鼓励。
Opus 4.6 更严谨、顺从、简洁。它通常更直接,更聚焦用户要求,不太会额外展开风险提示。
Opus 4.7 更谨慎、深入、坦诚。它更可能挑战用户假设,主动指出风险,承认自身限制,并给出更详细的理由和下一步建议。

所以企业选模型时,不能只看跑分和价格。
-
客服场景可以接受更多温暖和顺从;
-
合规审查就要防止模型过度配合;
-
代码评审需要严谨和深度;
-
内部办公助手则要控制篇幅,别每次都写成小论文。
模型选型要匹配任务,不同业务要的“回答性格”并不一样。
换语言,反馈尺度也会变标
语言带来的差异更容易被忽略。
Anthropic 发现,语言之间的差异主要集中在两条轴上:温暖 vs 严谨,坦诚 vs 执行。
英文环境里的 Claude 更偏谨慎、严谨、深入和坦诚。
阿拉伯语环境里,Claude 更偏顺从、温暖、简洁和执行。

研究还提到,Claude 在印地语和阿拉伯语里更温暖,在英语和俄语里更严谨;在荷兰语里更坦诚,在印尼语里更偏执行。

这不能推出某种语言更好。更可能的原因包括训练数据规模不同、数据构成不同、语言本身的对话习惯不同,以及安全对齐在不同语言里的迁移效果不同。
有些差异属于合理本地化。比如某些语言环境更重视礼貌、缓和、鼓励式反馈,模型跟着调整语气很正常。D
风险出在另一类情况:同一套合规要求,英文能触发风险提醒,换一种语言后模型直接执行;同一份方案,俄语回答给出严厉批评,印地语回答却更像鼓励。企业要盯住这种偏移。
企业该测什么
很多团队评估模型,还停在准确率、响应速度、调用成本这三项。
这些指标当然要看。但模型进入客服、销售、法务、研发、知识库和跨境业务后,还要测行为稳定性。
上线前,先测边界。拿同一组关键任务,换模型、换语言、换提示词跑一遍。看模型会不会稳定提示风险,会不会说明限制,会不会纠正错误假设。
上线后,要抽样复查。模型版本更新、系统提示词调整、业务话术变化,都可能改变回答方式。调用记录要留,高风险场景要定期回看。
模型升级时,要做回归测试。别只测接口能不能通,也要看新模型是否更容易拒答、更啰嗦、更顺从,或者在多语言场景里出现明显偏移。
企业真正需要的是稳定、可追踪、可切换的模型能力。偶尔一次回答惊艳,不够。
多模型接入,要先管住测试成本
企业用大模型,很少长期只接一个模型。
研发团队可能要测 Claude、GPT、Gemini,也可能接入国产模型;客服、内容、代码、数据分析会有不同模型偏好;跨境业务还会带来多语言评估压力。
如果每个模型都单独接入、单独计费、单独测试,治理成本会很快上来。接口适配、密钥管理、调用记录、成本统计、灰度切换、失败回滚,都会变成工程负担。
ArkAPI这类企业级 AI大模型聚合平台,可以把多模型接入、调用管理、测试验证和成本控制放到同一套环境里。它不替企业拍板“哪个模型最好”,但能让团队更低成本地比较、接入、切换和管理不同模型。
当模型行为差异开始影响业务结果,统一 API 和可治理调用环境就成了基础设施。
盯住那些稳定的小偏移
Anthropic 这篇研究给出的提醒很实际:大模型的差异,不只写在跑分、上下文长度、价格和速度里,也藏在回答倾向里。
-
同一个模型,换语言后反馈方式可能变。
-
同一个产品线,换版本后风险敏感度可能变。
-
同一个业务场景,模型偏顺从、谨慎、温暖、严谨、坦诚还是执行,都会影响最终效果。
差异可以存在。企业要做的是看见它、测试它、记录它,并在需要时调整它。
把 AI 真正放进业务前,这件事最好提前做。
文章来源:
Anthropic Research:Claude’s values across models and languages
更多推荐
所有评论(0)