当机密数据在云端被处理时,数据库明文、AI模型权重、金融交易数据等均属于“使用中数据”——CPU一旦开始计算,数据就必须解密。这往往是传统安全防线最薄弱的瞬间。

机密计算通过硬件支撑的可信执行环境(TEE),让代码和数据在处理过程中始终保持加密,仅在CPU内部以明文形式存在。ARM机密计算架构(CCA)为此提供了硬件级解决方案,但真正决定安全水位的,是最底层的软件组件——Realm管理监控器(RMM)

图片 1.png

传统的ARM官方RMM采用C语言实现,虽然功能完整,却背负着沉重的内存安全包袱,且为了修补漏洞往往需要牺牲性能。对此,鲲鹏团队给出了全新答案:使用Rust语言从零重构RMM,并通过全映射策略、大页优化、PCIPC设备直通等自研技术,实现安全与性能的“鱼与熊掌兼得”。

从virtCCA到CCA:跨越两代硬件的技术传承

在鲲鹏920代,针对尚未原生支持CCA扩展的硬件,技术团队利用ARM TrustZone与SEL2虚拟化层,在安全世界中成功“模拟”出virtCCA机密计算环境。这不仅证明了通用硬件上实现机密计算的可行性,沉淀下的大页管理、PCIPC设备直通、机密容器编排等关键技术,也为后续演进铺平了道路。

到了鲲鹏950,硬件原生支持ARM CCA,机密计算正式从“软件模拟”跃升为“硬件赋能”:

• GPC(物理地址空间控制)在MMU地址转换末端加上了硬件安全闸。

• 安全内存支持动态分配甚至“超卖”。

• 专用加解密引擎带来数量级的性能提升。

• PCIPC(PCIe Protection Control)实现PCIe设备总线级保护。

• 灵衢总线(UnifiedBus)让设备直通能力大幅扩展。

• 原生vSMMU提供细粒度DMA隔离能力。

而这场演进中最根本的变革,是将RMM的信任根基,彻底替换为内存安全的Rust语言。

C-RMM的困境:为补安全漏洞,性能反复“扣税”

ARM官方的C-RMM将安全模型建立在传统内存管理之上,面临两个难以绕开的痛点:

动态映射,用性能换“时间窗”:为防止任意内存读写攻击,C-RMM处理RMI(Realm管理接口)调用时采用“临时映射、用完即毁”的策略。这种高频的页表操作导致TLB频繁刷新和缓存失效,性能被反复“扣税”。

TCB膨胀,功能越多攻击面越大:随着RMM支持的功能增加,可信计算基(TCB)不断膨胀。官方不得不将部分库(如mbedtls)移至用户态(EL0),这又带来了高昂的上下文切换开销和调试难题。

Rust-RMM:让编译器替你“管”内存

面对上述困境,Rust语言提供了全新的破局范式:保持C语言级性能的同时,从根源重塑安全机制。

得益于Rust的所有权系统(Ownership)与生命周期(Lifetime)检查,缓冲区溢出、悬垂指针等C语言“祖传”内存错误在编译阶段即被消灭。安全保障从“依赖开发者的纪律”升级为了“编译器的强制执行”。

95758e51-1b55-40de-b46f-e83a930ac9fe.png

由于内存漏洞被语言层面堵死,Rust-RMM直接采用了持续内存映射(全映射)策略,彻底消除了频繁映射带来的开销;同时新增功能也能安心留在EL2层,不再需要为隔离支付高昂的“切换税”。

此外,鲲鹏自研Rust-RMM,通过内存压缩技术实现机密内存开销只需ARM CCA的~1/100,单机释放~16 GB 内存。并对齐 ARM CCA 规范与开源参考实现,兼容ARM CCA规范与生态

核心自研增强:大页优化与设备直通

除了语言底座的重构,鲲鹏技术团队还针对核心场景进行了深度自研优化。

大页优化:把页表“走楼梯”变成“坐电梯”

在跑大内存机密计算负载时,C-RMM默认的4KB页面管理会导致页表遍历成本极高、TLB压力巨大。

Rust-RMM推出了增强型高性能RMI接口,支持机密虚机在L1/L2层级进行大页映射,并能自适应选择粒度(中型Realm用2MB,大型直接上1GB)。

• 收益:RTT Walk(页表遍历)路径从4级压缩至1-2级,TLB命中率大幅提升,Realm启动时间显著缩短。针对大内存负载,该优化可带来 5%–10% 的运行时性能提升。

PCIPC设备直通:四重硬件检查,滴水不漏

PCIPC通过总线级保护机制,使标准VFIO PCIe设备能够直接进入Realm运行,包括GPU、NPU、NVMe以及高速网卡等存量设备,都无需修改驱动即可完成接入,并支持SR-IOV。设备MMIO配置空间对机密虚机(RVM)完全可见,DMA内存访问“完美直通”,性能损耗低于5%

为防止普通(Normal)侧越权访问,方案构建了极严苛的四重硬件闸口:

• CPU侧 (GPC):防止Normal侧攻击DMA内存。

• 设备侧 (PCIPC):阻止扰乱设备MMIO配置。

• 虚机侧 (Stage-2 RTT):防止RVM配置非授权MMIO空间。

• 内存侧 (SMMU-Realm):严防直通设备越界访问。

图片 2.png

性能测试:性能开销几乎“无感”

为量化Rust-RMM的性能表现,团队在典型 4U8G 虚机场景下进行了严格的行业标准测试:

图片 3.png

• SPEC CPU2017 & UnixBench:在未开启大页优化时,Rust-RMM因安全边界切换等管理操作,性能劣化约在 3.7% - 4.1% 之间。

开启1G大页优化后:SPEC CPU和UnixBench跑分与普通虚机一致。

结论:硬件级的安全隔离带来的性能开销,已经被压低到几乎“无感”的程度。

应用实践:Rust-RMM如何支撑机密Token

在传统AI服务中,用户只能相信云服务商“不会查看数据”。而在ARM CCA和Rust-RMM构建的TEE中,模型参数、用户Prompt以及推理中间数据始终运行在受硬件保护的Realm内,即使宿主机和管理员也无法访问。基于这一可信底座,机密Token正成为一种新的Token形态和计费方式。用户购买的不仅是一轮模型推理,更是一轮运行于可信执行环境中的推理服务,其可信属性能够通过远程证明进行验证

图片 4.png

一个可信的机密Token需要具备四类证明能力:

• 硬件可信:证明推理运行在真正支持CCA的CPU、NPU上。

• 软件可信:证明操作系统、推理框架和Runtime均经过完整性度量。

• 软件可审计:结合可复现构建和透明日志,确保运行的软件可验证、可追溯。

• 模型可信:将模型哈希与证明绑定,确保部署模型未被替换。

基于Rust-RMM,客户端可以先完成远程证明,再释放Prompt密钥;推理完成后,结果携带TEE签名返回。整个过程中,用户无需信任宿主机和管理员,只需验证硬件信任根和远程证明,即可确认数据始终运行于可信环境。

从“相信云”到“验证云”,这正是机密计算带来的信任模式变革,而机密Token则是这种能力在AI场景中的一次典型实践。

进阶探索:未完待续的硬核能力

目前,Rust-RMM仍在持续演进,以下前沿特性正在紧锣密鼓地开发中:

• 灵衢总线设备直通:构建完整的灵衢总线软件栈,通过UMMU完成DMA地址翻译,保持与PCIe方案的架构一致性。

• 机密虚机热迁移:引入专用迁移代理虚机(MigRealm),状态数据经TLS安全通道传输,全程不暴露明文。

• 多平面(Plane)与内生商密:支持Realm内配置多个独立权限的控制平面,提供vTPM、机密存储服务,支撑内生国密CA的数据安全方案。

• vSMMU:能够在Realm内部建立细粒度DMA隔离。在一个机密虚机中运行多个AI Agent时,不同Agent可以共享同一块GPU/NPU,却拥有各自独立的DMA访问空间。即使其中一个Agent被攻破,也无法读取其他Agent使用的设备缓冲区。

• 机密沙箱: 支持面向Firecracker、StratoVirt等microVM的快速冷启动和机密快照能力。

结语

用Rust重构RMM,绝不是简单地给技术栈“换装”,而是底层安全理念的根本转变——从依赖事后补救,转向由语言机制保证的先天安全。

Rust-RMM用实际数据证明:在机密计算领域,极致的安全与卓越的性能可以兼得。 随着数据隐私与合规要求的日益严格,基于Rust重构的底层基础设施,正在为云上机密计算的未来奠定坚实的底座。

可以预见,未来云平台出售的不仅是CPU、GPU和NPU算力,更是可验证、可审计、可信任的算力

而Rust-RMM,正是这条可信算力链路上的关键一环。


「免责声明」:以上页面展示信息由第三方发布,目的在于传播更多信息,与本网站立场无关。我们不保证该信息(包括但不限于文字、数据及图表)全部或者部分内容的准确性、真实性、完整性、有效性、及时性、原创性等。相关信息并未经过本网站证实,不对您构成任何投资建议,据此操作,风险自担,以上网页呈现的图片均为自发上传,如发生图片侵权行为与我们无关,如有请直接微信联系g1002718958。 

更多推荐