一个问题,换一种语言问 Claude,回答可能会变。

变的地方不只在措辞。语气会变,风险提示会变,批评力度会变,解释深度也会变。

这里说的“性格”,指的是模型回答里呈现出来的行为倾向,不指主观意识。它可能更顺着用户说,也可能更愿意提醒风险;可能更温和,也可能更严谨;可能展开讲清楚,也可能直接给结果。

Anthropic 在 2026 年 7 月 13 日发布了一篇研究,题目是《Claude’s values across models and languages》。研究团队想看清一件事:Claude 在不同模型版本、不同语言环境里,表达出来的“价值倾向”到底有没有差别。

答案是有。而且可以测。

先看研究怎么做

Anthropic 分析了 309,815 段匿名 Claude.ai 对话。样本覆盖 Sonnet 4.6、Opus 4.6、Opus 4.7 三个模型,以及 Claude.ai 上使用量最高的 20 种语言。

研究重点放在开放式、主观性任务上,比如职业选择、朋友冲突、商业计划反馈、内容修改建议。这类问题没有唯一标准答案,模型怎么回应,很容易带出它的偏好。

比如同一份商业计划书,有的回答会先鼓励,有的会直接挑假设漏洞,有的会先提醒风险,再给修改建议。用户读完以后,对方案质量的判断可能完全不同。

四根尺子:顺从、温暖、深入、坦诚

Anthropic 先从此前研究中拿到 3,307 个价值表达,再压缩成 339 个高层标签,最后提炼出四条主要行为轴。这四条轴解释了 Claude 价值表达差异中的 15%。

 

  • 顺从 vs 谨慎。模型更倾向于满足用户偏好,还是更倾向于识别风险、给出保护性建议。

  • 温暖 vs 严谨。模型更常鼓励、安慰、积极反馈,还是更强调准确性、透明度和事实校正。

  • 深入 vs 简洁。模型会补充背景和推理过程,还是只完成用户明确提出的任务。

  • 坦诚 vs 执行。模型会主动说明不确定性、限制和可能错误,还是给出更完整、更确定的结果。

这四根尺子没有覆盖全部模型行为,但已经足够用于企业评估。模型体验不能只靠“感觉不错”来判断,最好能放进测试集里反复看。

换模型,口径会变

研究发现,不同 Claude 模型版本的回答倾向并不一样。

Sonnet 4.6 更温暖、顺从、简洁。它更容易肯定用户想法,也更会匹配用户语气,回答里常见轻松和鼓励。

Opus 4.6 更严谨、顺从、简洁。它通常更直接,更聚焦用户要求,不太会额外展开风险提示。

Opus 4.7 更谨慎、深入、坦诚。它更可能挑战用户假设,主动指出风险,承认自身限制,并给出更详细的理由和下一步建议。

 

所以企业选模型时,不能只看跑分和价格。

  • 客服场景可以接受更多温暖和顺从;

  • 合规审查就要防止模型过度配合;

  • 代码评审需要严谨和深度;

  • 内部办公助手则要控制篇幅,别每次都写成小论文。

模型选型要匹配任务,不同业务要的“回答性格”并不一样。

换语言,反馈尺度也会变标

语言带来的差异更容易被忽略。

Anthropic 发现,语言之间的差异主要集中在两条轴上:温暖 vs 严谨,坦诚 vs 执行。

英文环境里的 Claude 更偏谨慎、严谨、深入和坦诚。

阿拉伯语环境里,Claude 更偏顺从、温暖、简洁和执行。

 

研究还提到,Claude 在印地语和阿拉伯语里更温暖,在英语和俄语里更严谨;在荷兰语里更坦诚,在印尼语里更偏执行。

 

这不能推出某种语言更好。更可能的原因包括训练数据规模不同、数据构成不同、语言本身的对话习惯不同,以及安全对齐在不同语言里的迁移效果不同。

有些差异属于合理本地化。比如某些语言环境更重视礼貌、缓和、鼓励式反馈,模型跟着调整语气很正常。D

风险出在另一类情况:同一套合规要求,英文能触发风险提醒,换一种语言后模型直接执行;同一份方案,俄语回答给出严厉批评,印地语回答却更像鼓励。企业要盯住这种偏移

企业该测什么

很多团队评估模型,还停在准确率、响应速度、调用成本这三项。

这些指标当然要看。但模型进入客服、销售、法务、研发、知识库和跨境业务后,还要测行为稳定性

上线前,先测边界。拿同一组关键任务,换模型、换语言、换提示词跑一遍。看模型会不会稳定提示风险,会不会说明限制,会不会纠正错误假设。

上线后,要抽样复查。模型版本更新、系统提示词调整、业务话术变化,都可能改变回答方式。调用记录要留,高风险场景要定期回看。

模型升级时,要做回归测试。别只测接口能不能通,也要看新模型是否更容易拒答、更啰嗦、更顺从,或者在多语言场景里出现明显偏移。

企业真正需要的是稳定、可追踪、可切换的模型能力。偶尔一次回答惊艳,不够。

多模型接入,要先管住测试成本

企业用大模型,很少长期只接一个模型。

研发团队可能要测 Claude、GPT、Gemini,也可能接入国产模型;客服、内容、代码、数据分析会有不同模型偏好;跨境业务还会带来多语言评估压力。

如果每个模型都单独接入、单独计费、单独测试,治理成本会很快上来。接口适配、密钥管理、调用记录、成本统计、灰度切换、失败回滚,都会变成工程负担。

ArkAPI这类企业级 AI大模型聚合平台,可以把多模型接入、调用管理、测试验证和成本控制放到同一套环境里。它不替企业拍板“哪个模型最好”,但能让团队更低成本地比较、接入、切换和管理不同模型。

当模型行为差异开始影响业务结果,统一 API 可治理调用环境就成了基础设施。

盯住那些稳定的小偏移

Anthropic 这篇研究给出的提醒很实际:大模型的差异,不只写在跑分、上下文长度、价格和速度里,也藏在回答倾向里。

  • 同一个模型,换语言后反馈方式可能变。

  • 同一个产品线,换版本后风险敏感度可能变。

  • 同一个业务场景,模型偏顺从、谨慎、温暖、严谨、坦诚还是执行,都会影响最终效果。

差异可以存在。企业要做的是看见它、测试它、记录它,并在需要时调整它。

把 AI 真正放进业务前,这件事最好提前做。

文章来源:

Anthropic Research:Claude’s values across models and languages

更多推荐