你有没有遇到过这种情况:花半小时精心设计了一长串提示词,从角色设定到格式要求,从思考步骤到输出规范,恨不得把每个细节都写进去,结果 AI 的反应要么是“好的,我明白了”,然后给出一个平庸的答案;要么干脆无视了后半部分要求,只按前半部分执行。

最近,Anthropic 在 Claude 3.5 Sonnet 和 Claude 5 系列模型上,悄悄做了一次堪称“反向操作”的更新。他们大幅简化了 Claude 的“系统提示词”,删掉了近 80% 的内容。这个举动初看令人费解:提示词不是越详细、越具体越好吗?为什么官方反而要“做减法”?

但更反直觉的是,许多开发者反馈,在使用了这个被大幅精简后的系统提示词后,Claude 在某些任务上的表现,尤其是代码生成和逻辑推理,反而变得更好了。这背后不是一次简单的“删减”,而是一种对 AI 交互本质的重新思考:我们过去追求的“精确控制”,可能恰恰是限制模型发挥其真正潜力的枷锁。

1. 从“精确指令”到“信任模型”:一次认知的转变

我们习惯了把 AI 当作一个需要精确指令的“工具”。在这种思维下,提示词就像一份详尽的“操作手册”,我们试图通过它来消除一切歧义,控制输出的每一个细节。这种做法的逻辑很直接:模型是“笨”的,我必须把一切都说清楚,它才不会跑偏。

然而,以 Claude 3.5 Sonnet 和 Claude 5 为代表的新一代大模型,其能力边界已经发生了根本性的变化。它们不再是简单的模式匹配器,而是具备了更强的上下文理解、意图揣摩和任务分解能力。当你给出一段复杂的、充满约束的提示词时,模型的一部分“算力”可能被消耗在解析你这套复杂规则上,而不是专注于解决核心问题本身。

Anthropic 这次精简系统提示词的核心哲学,可以概括为: 从“微观管理”转向“宏观赋能” 。旧的、冗长的系统提示词,试图事无巨细地规定 Claude 的行为准则、思考框架和输出格式,这是一种“微观管理”。而新的、精简的提示词,则更像是一份简洁的“宪法”或“核心原则”,它只定义最基本的身份、安全边界和协作姿态,把具体如何思考、如何组织答案的自主权,交还给模型本身。

这带来的一个关键变化是: 模型被允许使用其“内部知识”和“涌现能力”来优化任务执行路径 。举个例子,在代码生成任务中,旧的提示词可能会详细规定“先分析需求,再设计数据结构,然后编写函数,最后写测试用例”。而新的模式下,你只需要说“请用 Python 实现一个快速排序函数”,Claude 可能会自动选择最合适的代码风格、添加必要的注释、甚至预判一些边界情况并加以处理。它不再是被动地执行一串指令步骤,而是在理解你的根本意图后,主动规划出一个更优的解决方案。

注意:这种“信任”并非放任自流。精简后的系统提示词依然牢牢守住了安全、无害、诚实的底线。它删除的是对“过程”的过度控制,而非对“结果”的核心要求。

2. 拆解“减法”的艺术:什么被删了,什么被留下了?

要理解为什么“做减法”能“变强”,我们需要具体看看 Anthropic 到底删了什么,又保留了哪些精髓。虽然我们无法获取其系统提示词的全部原文,但根据社区反馈和常见模式,可以推断出这次精简的大致方向。

2.1 被大幅删减或简化的部分

  1. 冗长的行为规则清单 :过去,系统提示词可能包含数十条甚至上百条具体的行为准则,例如“你必须分点回答”、“你必须先确认用户意图”、“你不能假设用户知道某个概念”等。这些规则在模型能力较弱时是必要的脚手架,但在模型足够聪明后,它们变成了冗余的、甚至相互冲突的约束。Claude 5 已经能从对话上下文中自然推断出这些社交和协作规范。
  2. 僵化的思考过程强制披露 :许多提示词工程强调让 AI “一步一步思考”(Chain-of-Thought)。旧系统提示词可能将这种模式固化,要求模型在任何复杂任务前都先输出一段“思考过程”。然而,对于 Claude 5 这类模型,其“思考”很大程度上是内部隐式的、高速的。强制输出每一步的“内心独白”,反而会打断其流畅的推理,降低效率。新的策略是:仅在模型判断有必要时(例如解释一个复杂结论),或用户明确要求时,才展示推理过程。
  3. 过度具体的格式模板 :比如“你的回答必须遵循以下结构:摘要、要点、详细说明、总结”。这种模板对于确保一致性有用,但也扼杀了模型根据问题类型灵活调整回答结构的能力。一个关于哲学问题的讨论和一份数据分析报告,本应有不同的行文结构。精简后,模型获得了根据内容决定形式的自由。
  4. 对模型“能力”的重复描述 :例如反复强调“你是一个具有强大代码能力的助手”。模型本身就知道自己能做什么,这种自我描述更多是给用户看的,而非模型需要的。精简后的提示词更专注于定义“角色”(如助手)和“目标”(如提供帮助),而非罗列功能。

2.2 被核心保留的部分

  1. 根本的身份与安全准则 :这是不可动摇的底线。提示词中一定会保留关于“我是 Claude,一个由 Anthropic 创造的 AI 助手”的基本身份认知,以及最重要的安全原则——不协助进行有害、非法、不道德的活动,保护隐私,诚实作答(不捏造信息)。这些是模型行为的“北极星”。
  2. 核心的协作姿态 :“乐于助人”、“细致”、“准确”这些核心特质关键词会被保留。它们定义了模型与用户互动的基本态度,但不再通过大量举例来定义“如何体现细致”。
  3. 对关键风险的明确警示 :例如,关于代码安全(不生成恶意代码)、事实核查(标注信息不确定性)、隐私(不处理个人身份信息)等最高优先级的警告会得以保留,但表述可能更简洁、更原则化。

这种“减法”的本质,是 “卸载”模型已经内化的能力,转而聚焦于引导和激发其更高阶的智能 。就像一个教孩子骑自行车,最初需要详细指导如何握把、踩踏板、保持平衡(冗长提示词)。当他学会后,你只需要说“注意安全,看着前方”(精简提示词),他就能骑得更好,甚至玩出花样。过多的指导反而会让他分心。

3. 实践出真知:精简提示词在 AI 编程中的威力

理论再好,也需要实践验证。AI 编程是检验提示词哲学的最佳场景之一,因为它对逻辑性、准确性和创造性都有很高要求。让我们看看,在 Cursor、VSCode+Claude 插件等 AI 编程助手环境中,应用“做减法”哲学后,交互体验有何不同。

3.1 新旧提示词对比:一个代码重构案例

假设我们有一个代码重构任务。

旧风格(过度设计)提示词:

你是一个资深的 Python 后端工程师,擅长编写简洁、高效、可维护的代码。请遵循以下步骤重构我给你的函数:
1. 首先,分析原函数的输入、输出和功能。
2. 其次,识别其中的代码坏味道(如重复代码、过长函数、魔法数字等)。
3. 然后,设计重构方案,说明你将应用的重构手法(如提取函数、重命名变量、引入参数对象等)。
4. 接着,给出重构后的完整代码。
5. 最后,解释重构带来的好处。
请确保代码符合 PEP 8 规范,并添加适当的类型注解和文档字符串。

新风格(精简信任)提示词:

请以专业 Python 开发者的标准,重构以下函数,提升其可读性和可维护性。这是原函数:[粘贴代码]。

效果差异分析:

  • 旧提示词下的 Claude :它会严格遵循你的五步法。输出会非常结构化,每一步都有小标题。但你可能发现,它的“分析”和“设计”部分有时流于形式,为了满足你的步骤要求而写。最终代码可能不错,但整个过程略显僵化。
  • 新提示词下的 Claude 5 :它看到任务后,内部瞬间完成了“分析-识别-设计”的过程。它可能直接输出重构后的代码,并在代码中以注释的形式,精炼地指出关键改动点及其原因(例如 # 重构:将魔法数字提取为常量,提高可配置性 )。它跳过了形式化的汇报,直接交付了更核心的成果——高质量的代码。如果它认为某个点需要额外解释,它会主动补充一段简短的说明。整个交互感觉更流畅、更“聪明”。

3.2 如何设计你自己的“精简而有效”的提示词

将 Anthropic 的哲学应用到你的日常工作中,并不意味着提示词越短越好,而是追求“高效”。以下是一个可操作的框架:

  1. 明确核心意图(一句话说清) :在写提示词前,用一句话告诉自己:“我到底想要什么?” 是“修复这个 Bug”,还是“为这段代码写单元测试”,或是“用更优雅的方式实现这个逻辑”?这句话就是提示词的灵魂。
  2. 提供充足上下文(而非指令) :把你知道的、模型需要知道的信息,清晰、完整地提供。这包括:
    • 代码/文本 :完整的待处理内容。
    • 错误信息 :精确的报错日志。
    • 相关背景 :这是哪个项目、模块的一部分?之前有什么相关讨论?
    • 约束条件 :必须使用的库、不能改动的接口、性能要求等。
    • 示例(可选) :如果你有期望的输出格式样例,提供一个是最好的。
  3. 定义角色和边界(而非步骤) :用简单的短语设定角色和范围。例如:“你是一个经验丰富的 DevOps 工程师”、“请专注于算法优化,不要改动输入输出接口”、“确保解决方案兼容 Python 3.8+”。
  4. 信任并迭代 :发出精简提示词后,观察模型的输出。如果它遗漏了某个你关心的点(比如没写测试),不要在第一轮提示词中就加入“必须写测试”,而是在下一轮对话中补充:“很好,现在请为这个函数补充单元测试,考虑边界情况。” 这种基于模型初次反应的“对话式迭代”,往往比试图一次性穷尽所有要求的“巨型提示词”更有效。

下表对比了两种思维下的提示词设计重点:

维度 “控制”思维(旧范式) “信任”思维(新范式)
核心目标 防止模型出错,控制输出格式 激发模型最佳能力,解决核心问题
提示词重点 详细的步骤、严格的格式、无数的规则 清晰的意图、完整的上下文、基本的角色
交互模式 单次发射巨型指令,期望完美结果 多次简短对话,逐步校准和深化
开发者心态 我是指挥官,模型是士兵 我是提出问题的专家,模型是协作的专家
适用模型 能力较弱、不可预测的早期模型 Claude 3.5/5、GPT-4 等具备强推理和遵从性的模型

4. 警惕“减法”的误区:不是所有场景都适合极简

拥抱“做减法”的哲学,并不意味着“越短越好”成为金科玉律。理解其适用边界,才能避免从一个极端走向另一个极端。

4.1 仍然需要“做加法”的场景

  1. 高度专业化或小众领域 :当任务涉及非常冷门的知识、特定的行业术语或独特的业务流程时,模型缺乏相关上下文。此时,必须在提示词中补充必要的领域定义、术语解释或流程规则。例如,为某个特定 ERP 系统编写数据迁移脚本,你需要说明该系统特有的表结构和业务逻辑。
  2. 需要严格遵循特定格式 :当输出必须匹配一个机器可解析的、毫厘不差的格式(如特定的 JSON Schema、API 响应格式、配置文件模板)时,你必须提供该格式的明确定义或示例。模型的理解再强,也无法猜出你自定义的格式。
  3. 规避已知的模型偏见或错误 :如果某个模型在特定类型任务上存在已知的、系统性的弱点(例如,某个版本的模型总在日期计算上出错),你需要在提示词中主动提醒和纠正,例如:“请特别注意日期转换,确保使用闰年-aware 的算法。”
  4. 复杂的、多步骤的智能体(Agent)工作流 :当你设计一个需要自主执行多步任务(如:搜索网页 -> 分析内容 -> 总结 -> 生成报告)的智能体时,你需要为其定义清晰的工作流规划、工具使用规范和状态判断逻辑。这时的提示词(常称为“智能体提示词”或“系统指令”)必然会很长,因为它本质上是在为 AI 编写一个“程序”。

4.2 如何判断该“减”还是该“加”?

一个简单的决策流程是:

  1. 判断任务类型 :这是 创造性/推理性任务 (如写作、代码设计、解题),还是 规范性/格式化任务 (如数据转换、严格按模板填空)?
    • 创造性任务 :优先尝试精简提示词,给予模型发挥空间。
    • 规范性任务 :需要提供更明确的规则和格式。
  2. 评估模型能力 :你使用的是否是 Claude 3.5 Sonnet、Claude 5 或同等能力级别的模型?如果是,可以更大胆地“做减法”。
  3. 进行“最小必要信息”测试 :先只用一句话描述任务核心,并附上全部上下文。看模型的初次反应。
    • 如果它准确抓住了重点,并给出了优质输出的 框架 ,说明可以精简。
    • 如果它完全跑偏或遗漏关键约束,说明需要“加”信息——但应精准地补充缺失的那部分,而不是回头写一份巨长的提示词。
  4. 采用“对话式演进” :永远把与 AI 的交互看作一场对话。从精简提示开始,根据它的回答,像和一位聪明同事协作一样,逐步提出更具体的要求或纠正其偏差。这比试图一次性写出完美无缺的“天书”要高效得多。

Anthropic 对 Claude 系统提示词的这次精简,是一个强烈的信号。它标志着大模型交互正在从“精确指令时代”迈向“意图理解时代”。作为开发者和使用者,我们的核心技能也需要随之升级:从“编写复杂的操作手册”,转变为“清晰地定义问题、提供上下文、并有效地与一个高智商伙伴进行协作”。

这并不意味着提示词工程不再重要。恰恰相反,它变得更加重要,但重点转移了。未来的高手,不是能写出最长提示词的人,而是能用最精炼的语言,最快地引导 AI 抵达问题核心,并通过多轮对话将解决方案打磨至完美的人。当你下次准备写提示词时,不妨先问问自己:我给出的这些规则,有多少是模型已经懂的?有多少是我因为不信任而强加的?删除它们,也许你会收获一个更强大、更智慧的协作伙伴。

更多推荐