1. 智能体安全综述-《From Stateless Queries to Autonomous Actions: A Layered Security Framework for Agentic 》
前言
本文主要记录了 Kexin Chu 发表在 archive 上的论文《From Stateless Queries to Autonomous Actions: A Layered Security Framework for Agentic AI Systems》。文章分别从 agent 的系统组件和攻击时间两个角度分析了 agent 不同于 LLM 的安全威胁:
- LLM 是 agent 的底座,现有的对 LLM 的攻击也有可能发生在 agent 系统的各个环节中。
- 相较于 LLM 的攻击,对 agent 的攻击可能通过长期记忆在数周后才被触发。
推荐另一个讲解博客:
https://moanju.org/posts/lasm-agent-security-seven-layers/
一、预备知识
1. 检索关键词
- 智能体:AI agent、LLM agent、autonomous agent、multi-agent、agentic AI、tool-augmented LLM。
- 安全:security、attack、adversarial、prompt injection、jailbreak、poisoning、safety、trust、vulnerability。
2. 研究趋势
2021 年以来,作者筛选后的相关文献在100篇以内,且主要集中在低层攻击,防御及高层攻击的论文较少。
| 逐年发表趋势 | 类别发表趋势 |
|---|---|
![]() | ![]() |
3. 智能体
智能体系统包括以下六个组件:
- 基础模型:大型预训练语言模型作为智能体的推理引擎。
- 规划与推理模块:将高层目标转化为动作序列,其实现架构包括 ReAct、思维链和思维树搜索等。
- 记忆系统:用于在多次交互之间存储智能体状态,主要包括四种机制:
- 上下文内记忆:当前对话窗口;
- 外部短期记忆:会话范围内的向量存储;
- 外部长期记忆:持久化的情节记忆或语义记忆存储;
- 程序性记忆:已经学习到的工具使用模式。
- 工具执行层:使智能体能够调用外部工具,例如网页浏览器、代码解释器、数据库、文件系统和第三方 API,工具输出通常会在没有显式信任标记的情况下被重新注入智能体上下文。
- 多智能体接口:智能体之间的通信、任务委托和结果聚合。
- 编排与环境:调解所有智能体与外部世界之间的交互,包括对话框架、MCP 服务器、API 网关和容器运行时等。
在执行优先级方面:理论上,开发者的指令 > 操作方 > 用户 > 环境。但实际上,大多数智能体实现会隐式地将环境输入视为高信任内容,从而引入间接提示注入和基于工具的操纵攻击。

4. 威胁模型
智能体的威胁模型可以从以下四个方面定义:
- 位置:包括外部敌手、半可信主体、供应链敌手。
- 外部敌手:没有系统访问权限,但可以向信息环境中注入内容;
- 半可信主体:具有合法但受限的访问权限,例如恶意用户;
- 供应链敌手:能够攻陷上游组件,例如模型、工具或框架。
- 知识:包括灰、白、黑三种敌手。
- 黑盒敌手:只能观察输入和输出;
- 灰盒敌手:了解系统架构但不了解模型权重;
- 白盒敌手:拥有完全访问权限。
- 目标:包括机密性、完整性、可用性。
- 机密性:提取私有数据;
- 完整性:改变智能体行为;
- 可用性:破坏智能体运行。
- 持久性:敌手可能只进行一次性攻击,也可能发起持续性攻击。
二、按攻击时间分类
攻击时间是指攻击被引入到其真正产生负面影响之间的时间差,从这一角度可将现有方法分为四类:
| 层级 | 类型 | 攻击时间 | 特点 | 防御 | 备注 |
|---|---|---|---|---|---|
| T1 | 瞬时型 | 间隔为 0 | 攻击引入和有害效果发生在同一次推理调用之内 | 可被实时检测 | 例如所有经典提示注入和越狱攻击 |
| T2 | 会话持久型 | 间隔在一次会话之内 | 攻击会在单个会话的多个轮次中持续存在,并在会话结束前执行 | 可以通过会话范围内的监控进行检测 | 例如劫持正在进行的规划过程,即上下文操纵攻击 |
| T3 | 跨会话累积型 | 间隔至少跨越一个会话边界 | 攻击在会话中被写入持久记忆,并在未来某个会话中被利用 | 需要通过跨会话记忆审计进行检测 | |
| T4 | 会话栈下层、非会话边界型 | 间隔不受会话结构约束,或者由任意触发条件决定 | 攻击被安装在会话栈之下的层次中,例如模型权重或训练数据 | 包含两个子类型:T4a 和 T4b | |
| T4a | 漂移型 | 间隔是无限且开放的 | 有害行为是在持续暴露于有偏环境后逐渐涌现的,并不依赖某个触发事件 | 通过跨数百次会话的长期分布监测来发现 | |
| T4b | 休眠型 | 有害行为会被延迟,直到某个任意触发条件出现 | 攻击在训练或微调阶段被嵌入模型权重或供应链组件中 | 研究表明,标准安全微调无法移除训练得到的触发器,而在部署前穷尽式检测在计算上不可行。 |
三、按系统组件分类
根据不同受攻击的组件不同,文章将现有的研究分为 7 个层面,每个层面的信任边界、攻防方法如下:
| 层级 | 层名称 | 信任边界 | 保护对象 | 代表性威胁 | 防御手段 |
|---|---|---|---|---|---|
| L1 | 基础模型层(Foundation) | 对预训练权重与 RLHF 对齐的隐式信任 | 模型性能与对齐 | 越狱(Jailbreaking)、对抗性提示、模型提取(Model extraction)、后门(Backdoors) | RLHF / DPO、对抗训练、红队测试 |
| L2 | 认知规划层(Cognitive) | 将自身推理链视为真实依据 | 目标、计划、思维链 | 规划劫持(Planning hijacking)、思维链不忠实(CoT unfaithfulness)、奖励黑客(Reward hacking)、潜伏智能体(Sleeper agents) | 形式化计划验证、CoT 审计、行为不变量 |
| L3 | 记忆层(Memory) | 将检索结果视为可靠上下文 | 长短期记忆、RAG | 记忆投毒(Memory poisoning)、RAG 污染、隐私泄露、行为漂移 | 访问控制、一致性验证、溯源追踪 |
| L4 | 工具执行层(Tool Execution) | 将工具输出视为真实环境状态 | 代码、文件、API、系统动作 | 间接提示注入(Indirect prompt injection)、权限提升、能力膨胀(Capability creep)、自动化攻击执行 | 输出过滤、沙箱隔离、最小权限原则 |
| L5 | 多智能体协同层(Coordination) | 按角色/等级信任其他智能体消息 | 智能体之间的通信与委托 | 信任链攻击、感染式越狱、隐写协同、拜占庭智能体 | 智能体间认证、消息签名、共谋检测 |
| L6 | 生态供应链层(Ecosystem) | 认为已安装工具/模型/软件包是可信的 | MCP、插件、外部服务 | 供应链攻击、MCP 工具投毒、模型后门、依赖注入 | ABOM、代码签名、溯源验证、SBOM |
| L7 | 治理问责层(Governance) | 假设智能体行为与日志真实反映意图 | 日志、审计、归因、责任链 | 问责缺口、对齐漂移、欺骗性对齐、监管套利 | 行为监控、可解释性分析、监管机制 |
1. Foundation Layer
1.1. 攻击

1.2. 防御

2. Cognitive Layer
2.1. 攻击

2.2. 防御

3. Memory Layer
3.1. 攻击

3.2. 防御

4. Tool Execution Layer
4.1. 攻击

4.2. 防御

5. Multi-Agent Coordination Layer
5.1. 攻击

5.2. 防御

6. Ecosystem Layer
6.1. 攻击

6.2. 防御

7. Governance and Accountability Layer
7.1. 攻击

7.2. 防御
由于缺乏监管要求,运营方需承担防御成本,而资金缺口却由下游用户和第三方承受。这是一种经典的负外部性结构,类似于 SBOM 普及之前的软件供应链安全格局。历史上,这类问题往往需要监管干预才能得到解决。
8. 跨层攻击及防御
8.1. 攻击
危险攻击往往会同时跨越多个层次,例如:
- L4 → L3 → L7 :间接提示注入发生在 L4 层,它植入一条记忆项到 L3 层,并最终导致 L7 层的问责归因错误。
- L6 → L2 : 供应链后门发生在 L6 层,它通过触发条件驱动的 sleeper agent 破坏 L2 层规划模块中的目标表示。
- L5 → L1 : 感染式越狱在智能体之间传播(L5),每个智能体都充当中继节点,进一步覆盖下一个智能体的基础模型安全约束(L1)
8.2. 防御

| 防御类别 | 机制原型 | L 覆盖 | T 覆盖 | 关键局限 / 对手假设 |
|---|---|---|---|---|
| 安全训练 | 训练时对齐(RLHF、DPO、CAI) | L1 | T1 | 无法抵御基于梯度或分布外攻击;假设威胁是静态的 |
| 对抗性微调 | 基于攻击样本的对抗性加固 | L1 | T1 | 攻防博弈式循环;无法覆盖训练数据中没有的新型攻击 |
| 输入/输出过滤 | 输入/输出分类(基于分类器) | L1, L4 | T1 | 会漏检语义连贯的攻击;假设对手是非自适应的 |
| 提示注入检测 | 基于模式的检测(语法式 / 基于 LLM) | L4 | T1–T2 | 误报率高;自适应对手可绕过已知模式 |
| 工具沙箱 | 执行隔离(操作系统级、cgroups) | L4, L6 | T1–T2 | 可防止代码级权限升级;但不能阻止语义注入 |
| 记忆访问控制 | 访问控制与命名空间执行(RBAC) | L3 | T1–T3 | 密钥管理开销高;需要按主体设计命名空间 |
| 记忆共识验证 | 共识与多源验证(A-MemGuard) | L3 | T1–T3 | 约 15% 吞吐开销;假设超过 50% 的来源是诚实的 |
| 记忆不变量执行 | 不变量与策略执行(SSGM) | L3 | T3–T4 | 不变量规范负担重;无法处理未预期的漂移模式 |
| 智能体间认证 | 密码学认证(消息签名) | L5 | T1–T2 | 不能防御来自真实被攻陷签名者的消息 |
| 共谋检测 | 行为异常检测(统计分析) | L5 | T2–T3 | 只对已知编码方案有效;新的隐写方式可以规避 |
| MCP 代码签名 | 供应链来源验证(清单) | L6 | T1 | 需要生态系统范围内采用;不审计工具行为本身 |
| ABOM 审计 | 供应链来源验证(枚举) | L6 | T1–T2 | 当前缺乏标准化;闭源模型无法访问权重哈希 |
| 行为监控 | 行为异常检测(长期漂移) | L2, L7 | T3–T4 | 需要持久的跨会话日志;基线必须针对具体部署环境建立 |
| 人在回路 | 操作确认(强制审查) | L4, L7 | T1–T3 | 可扩展性瓶颈;大规模场景下用户疲劳会降低审查质量 |
| 可解释性工具 | 基于可解释性的监控(机制性) | L2, L7 | T1–T4 | 对多步骤轨迹仍不足;目前主要是组件级方法 |
四、评估基线
智能体安全基准的整体情况如下,表中的每个基准都评估 T1 或 T2 威胁,但没有任何安全基准评估 T3 或 T4 威胁。
| 基准 | L 覆盖 | T 覆盖 | 年份 | 关注点 / 关键局限 |
|---|---|---|---|---|
| HarmBench | L1 | T1 | 2024 | 标准化越狱红队测试;不包含工具使用或多智能体场景 |
| AgentBench | L2–L4 | T1–T2 | 2023 | 多领域任务完成能力;不包含对抗性评估 |
| AgentDojo | L4 | T1–T2 | 2024 | 工具使用流水线中的提示注入;仅限单会话 |
| AgentSecBench | L2–L4 | T1–T2 | 2024 | 提示注入与工具误用;不包含多智能体评估 |
| AgentHarm | L1–L4 | T1–T2 | 2025 | 多步骤危害鲁棒性;单智能体,不评估记忆 |
| ARE | L1, L4 | T1 | 2025 | 面向视觉智能体的像素级对抗鲁棒性 |
| Colosseum | L5 | T1–T2 | 2025 | 合作式多智能体系统中的共谋审计 |
五、未来方向
1. 开放问题
1.1. 跨会话攻击基准(L3 × T3)
目前还没有标准化基准用于评估跨会话边界的记忆投毒。弥合这一缺口需要:
- 多会话重放基础设施;
- 记忆状态序列化 / 反序列化协议;
- 对记忆条目进行干净或被投毒的真值标注;
- 衡量 T3 攻击成功率的评估指标,即衡量未来无关会话中的行为变化,而不是衡量 T1 注入是否成功。
1.2. 涌现式失配检测(L7 × T4)
目前没有任何方法能够可靠检测已部署智能体中的渐进式对齐漂移。所需能力包括:
- 适配高维随机行为分布的统计过程控制方法;
- 用于训练和评估的长期智能体行为数据集;
- 能够区分“漂移”和“合法行为适应”的因果归因方法。
1.3. 通用隐写通信检测(L5 × T1–T2)
目前没有一种面向 LLM 生成输出的通用隐写检测器,能够检测新的编码方案。这与检测 LLM 输出分布中的统计异常这一基础开放问题相关,而 LLM 输出本身具有很高的自然方差,使得该问题更加复杂。
1.4. ABOM 标准化与 MCP 安全认证(L6 × T1–T2)
尽管 MCP 漏洞的严重性已有记录,目前仍不存在面向 MCP 服务器的安全标准或认证计划。优先行动包括:
- 建立 ABOM 规范工作组,类似于 NTIA SBOM;
- 开发用于 ABOM 生成和验证的自动化工具;
- 为 MCP 服务器创建安全认证计划,并设置强制披露要求。
1.5. 系统级问责框架(L7 × T1–T4)
组件级可解释性无法解释多步骤智能体轨迹。所需能力包括:
- 轨迹级因果归因方法;
- 面向智能体规划序列的形式化验证方法;
- 法律和组织层面的框架,为智能体造成的损害分配清晰责任。
2. 未来方向
2.1. 面向智能体协议的形式化安全模型
密码学协议通过形式化模型,例如 Dolev-Yao 模型、通用可组合性模型,实现可证明安全。智能体 AI 目前缺乏类似的形式化安全模型。开发这类模型需要:
- 一种用于刻画智能体行为和安全属性的形式化语言;
- 一种面向智能体场景的敌手能力模型;
- 组合定理,使复杂多智能体系统的安全证明能够由组件级证明构建而来。
2.2. 运行时行为证明
面向智能体动作的可信执行环境,如果能够提供密码学证明,证明某个动作是由经过验证的主体层级授权的,就可以缓解问责缺口。硬件可信执行环境提供了计算基础设施,但将其适配到 LLM 智能体的推理栈中,仍然是一个重大的工程挑战,因为 LLM 智能体具有随机性、大内存占用和流式输出等特点。
2.3. 时间异常检测基础设施
应对 T3 和 T4 威胁,需要构建当前智能体并不具备的基础设施,包括:
- 跨越多次会话的、持久且防篡改的行为日志;
- 针对每个部署场景建立的正常智能体行为统计基线;
- 实时异常评分机制,用于区分恶意行为偏移与合法行为适应。
2.4. 多利益相关方治理框架
分布式问责链条需要覆盖开发者、运营者、用户和监管者的治理框架。建立能够为智能体造成的损害分配清晰责任的法律框架已经成为一项紧迫的政策优先事项。
2.5. 缩小防御能力对等缺口
LLM 智能体团队已经能够自主利用零日软件漏洞,但目前并不存在与之对等的防御能力。开发能够自主检测、分析并缓解针对自身及其部署环境攻击的防御型智能体,是一个需要社区协作的长期研究目标。
更多推荐


所有评论(0)