近期,Anthropic发布了《Zero Trust for AI Agents》(面向AI智能体的零信任)白皮书(以下简称《白皮书》),以大模型厂商的视角,为企业Agent安全防护提供了一份完整的、可落地的路线图。

《白皮书》的核心观点直指当前企业AI安全痛点:随着大语言模型(LLM)进化为拥有系统访问权、能自主执行操作的智能体(AI Agent),企业必须摒弃传统的安全理念,将零信任架构作为Agent的安全底座,通过持续的身份校验、精准的权限管理、动态的安全防护,验证Agent的每一次行动。

本文将深入解读《白皮书》,解析企业如何构建针对Agent的零信任安全架构,实现对Agent的“持续验证、永不信任”。

零信任在Agent场景下的“重塑”

在《白皮书》中,Anthropic结合Agent的行为特征与安全态势,对零信任的核心原则进行了全新的阐释:

1.持续验证,永不信任

在Agent时代,每一个访问请求无论源自何处,都必须经过身份验证和授权。即使Agent携带着合法的凭证,其发起的每一次API调用、上下文环境与操作指令,都必须被重新验证,彻底拒绝“隐式信任”。

2.假设失陷

在设计系统时,预期失陷必然会发生。与其专注于阻止入侵,不如限制攻击者可能造成的损失。企业必须规划极端的资源隔离,遏制任何单一失陷的爆炸半径(Blast Radius)。

3.最小化权限向“最小代理权”演进

传统的最小权限限制了用户和系统可以访问的内容,而 OWASP提出的最小代理权则走得更远,它严格限制了每个智能体工具能做什么、执行频率以及在何处执行。

Agent面临的5大核心威胁

《白皮书》梳理了OWASP等组织关注的Agentic系统威胁,将其分为了5大核心威胁:

1.指令失控(提示词注入)

这不仅包含直接注入,更致命的是间接提示词注入。当Agent自主抓取外部网页或解析文档时,极易将隐藏在其中的恶意文本误认为指令,且大语言模型无法可靠地在“信息上下文”与“可执行指令”之间做出区分。

2.工具与资源滥用

拥有工具访问权限的智能体可能会被操纵去恶意使用这些工具。攻击者可以通过篡改工具元数据实施“工具投毒”,或者将几个合法的工具恶意串联(工具链攻击),甚至引发循环放大等资源枯竭攻击。

3.身份与权限滥用

在多Agent协同场景中,高权限的管理智能体往往会无约束地将自身凭证下发给工作智能体(无约束权限继承)。同时,若智能体将凭证或密钥缓存以供跨上下文复用,会造成基于内存的权限残留,导致跨会话越权。

4.供应链风险

Agent 生态系统在运行时动态组合能力。这不仅包含底层的模型投毒后门风险,还包括恶意的MCP(模型上下文协议)服务器以及被破坏的第三方开源依赖。

5.记忆与上下文投毒

跨会话持久化上下文的智能体可能会面临记忆被污染的风险。一旦RAG(检索增强生成)数据源被投毒,或者在多租户环境中发生共享上下文投毒,Agent会出现长期的记忆漂移,进而在后续决策中输出错误信息或执行恶意针对性载荷。

Agent零信任架构的8大核心能力域

为了应对上述威胁,Anthropic在《白皮书》中构建了Agent零信任安全的能力图谱。《白皮书》首先将企业的安全成熟度划分为三个梯次,为企业提供了一把“对号入座”的标尺:

  • 基础级(Foundation):适用于较小规模部署或初始实施的最低可行安全标准。短生命周期令牌、基于密码学的可信身份和自动化告警初筛已是入门要求。

  • 企业级(Enterprise):反映了大多数大规模部署的组织应当看齐的企业标准实践。从死板的RBAC转向动态上下文感知的ABAC(基于属性的访问控制),并实施Agent沙箱隔离和自动化基线学习。

  • 高级(Advanced):面向金融、医疗等强监管高风险场景。要求引入硬件级安全隔离、JIT(即时访问权限)以及机器速度下的自动化响应。

针对这三个层级,《白皮书》提出了一个颇具前瞻性的“动态水位”论断:在AI加速攻防的今天,安全水位正在不断上移。今天的高级要求,会逐渐成为明天的企业级标准;今天的企业级标准,也会逐渐成为明天的基础级底线。

支撑这三个层级不断向上演进的,是零信任架构的8大核心能力域。《白皮书》针对这8大能力域,分别给出了从“基础级”到“高级”的进阶要求:

1.身份与认证

在基础级,企业必须淘汰静态API密钥,采用自动刷新的短期令牌(Token);而向高级演进时,则要求实现硬件绑定的凭证。

2.访问控制与权限

基础级以静态的最小权限(RBAC)起步;企业级必须转向动态、上下文感知的ABAC;高级则要求实现任务级别的即时权限(JIT/JEA)分配与自动回收。

3.资源边界与隔离

基础级依赖基于身份的隔离与网络分段;但在企业级与高级,对于处理未受信输入的Agent,必须强制在沙箱(Sandbox)或机密计算环境中运行,防止横向移动。

4.可观测性与审计

基础级要求留存包含时间戳和上下文的完整日志;企业级则必须建立不可篡改的审计追踪,并实现跨多智能体工作流的分布式链路追踪(Traceability)。

5.行为监控与响应

告别基础级的手动基线定义,企业级需要通过统计学方法自动学习Agent的行为基线;高级更要求部署机器学习行为分析模型,实现编排的响应剧本。

6.输入校验与输出控制

在输入端,企业级需部署特征匹配机制以防御指令注入,高级则应用聚光灯(Spotlighting)技术界定内容;在输出端进行敏感数据过滤,针对高级威胁,必须引入“人在环路(HITL)”的高危审批机制。

7.完整性与恢复

保护智能体配置文件与镜像的完整性。在企业级提供自动化的健康检查与回滚,高级则实现具备自动修复的自愈系统。

8.AI治理策略

除了基础级记录在案的策略,企业级与高级必须建立跨职能的监督框架与自动化的持续策略强制执行机制,应对“影子AI”风险。

为了将上述8大能力域在企业中落地,《白皮书》在文末提出了一套包含8个阶段的实施工作流(8-Phase Workflow):从明确需求边界、管理供应链风险、定义智能体范围开始,到防御提示词注入、确保工具访问安全、保护凭证、保障内存安全,最后落脚于指标度量。

以“减法”思维,推动Agent零信任架构落地

《白皮书》给出的全景工作流非常详尽,但对于大多数企业而言,审核大语言模型的底层权重,或者逐行排查开源依赖树与AI-BOM(AI物料清单),远远超出了现有的安全运营能力。

在真实场景中,想要快速构建针对Agent的零信任安全架构,企业必须学会做“减法”,剥离掉企业难以掌控的外部模型底座与开源环境,在内部业务运行层面,将核心任务收束为两条主线:管好“身份和权限”(控制准入与边界),以及管好“行为和风险”(控制运行与输出)。

这正是芯盾时代长期践行的零信任业务安全建设逻辑。依托对AI安全的前瞻性布局,芯盾时代将零信任理念应用于AI领域,打造了IAM AI Agent身份与访问管理方案、智域·AI安全治理平台等AI安全产品,帮助企业夯实AI安全基座,构建针对Agent的零信任安全架构,管好Agent的身份和权限、行为和风险。

IAM AI Agent身份与访问管理方案

针对Agent的身份和权限管理难题,芯盾时代推出了 IAM AI Agent 身份与访问管理方案,助力企业建立涵盖全生命周期身份管理、细粒度权限管控、标准化认证鉴权、全链路操作审计的管理体系。

图片

1.Agent身份全生命周期管理,确立清晰身份归属

该方案将Agent作为“类人身份”纳入IAM统一管理范畴,为其分配唯一不可更改的ID。同时,建立了一套覆盖身份创建、凭证颁发、角色分配、部署监控直至停用删除的完整机制,确保每次操作都有清晰的身份归属。

图片

2.最小化动态权限与三级鉴权,降低权限滥用风险

针对传统RBAC模型的治理困境,芯盾时代引入了上下文感知的动态授权引擎,将Agent与MCP应用的交互纳入统一管控。系统改变了常驻权限的授予方式,直接根据当前任务授予所需的最小权限——权限随任务激活并随任务回收,大幅降低了权限滥用风险。

图片

3.短期动态凭证取代长期密钥,确保调用真实可信

方案将认证鉴权体系从用户层延伸至Agent层,构建了“Agent认证→用户委托→资源访问”的三级鉴权链路。基于OAuth 2.0等国际标准协议,为Agent生成仅在当前任务窗口内有效的短期凭证,从底层机制上排除了凭据被截获复用的风险,确保AI的每一次API调用都真实可信。

图片

智域·AI安全治理平台

针对企业的大模型安全与治理难题,芯盾时代推出了智域·AI安全治理平台。平台整合统一接入、安全治理、行为审计、合规报告、成本优化、身份管理六大核心能力,助力企业一站式构建覆盖全场景、贯穿全链路的安全治理体系。

图片

1.统一AI入口,压缩“影子AI”风险空间

针对企业内部分散使用外部AI服务带来的数据泄露隐患,平台通过统一AI网关,将公有云模型、私有化模型及企业AI服务集中纳管。平台不仅能对已接入的调用实施包含身份、配额与策略的确定性管控,还能够联动DNS、SWG、EDR或业务日志,精准发现并归因未受管的外部AI访问,有效压缩“影子AI”的风险隐患空间。

图片

2.双向运行时安全护栏,降低指令与内容风险

平台可结合企业数据分类、业务规则和安全策略,对受管Model API的请求与响应执行运行时检测。针对提示词注入、敏感数据外发和不合规输出等风险,可按策略采取阻断、脱敏、改写、观察或受控放行,并记录命中规则、处置动作和最终原因。

图片

3.全链路可追溯审计,提升事件定位与复核效率

平台通过Runtime Trace、运行审计和治理审计,记录调用主体、应用与项目上下文、模型及上游选择、请求摘要、执行阶段、安全与配额结论、Token、延迟、成本和最终状态,支持查询、下钻、追溯与证据导出。对于需要保存请求或响应正文的场景,可按照客户的数据分类、脱敏、加密、授权和留存制度专项配置,满足事件复盘、内控检查和合规审查的相关要求。

图片

正如Anthropic《白皮书》所言,在AI时代,只确保身份清晰可见、权限收放自如、风险精准可控,企业才能真正享受Agent带来的巨大红利。芯盾时代基于零信任理念,助力企业构建AI安全基础设施,帮助企业在复杂的“人机协同”环境中,打造动态、自适应的防御体系,让AI在安全、可控的轨道上释放效能,让企业在数智化浪潮中行稳致远。

更多推荐