锁不住的“内心戏”:大模型加密推理独白的重放漏洞与安全反噬
锁不住的“内心戏”:大模型加密推理独白的重放漏洞与安全反噬
图宾根 ELLIS 研究所(ELLIS Institute Tübingen)、马克斯·普朗克智能系统研究所(Max Planck Institute for Intelligent Systems)和图宾根 AI 中心(Tübingen AI Center)联合揭示了大型语言模型(LLM)API中存在的一项重大架构漏洞,即加密推理痕迹在不同会话、用户及同一供应商的模型间具有全兼容性。攻击者利用这种兼容性,将强力模型的加密推理块注入到防御较弱的廉价模型中,从而强制其以明文形式解码并提取核心推理过程。这种被称为“推理窃取”的手段不仅能规避知识产权保护,导致专有技术的模型蒸馏,还可能诱发严重的隐私泄露。通过对公开日志的抓取,研究人员成功还原了大量敏感个人信息和API密钥,证明了加密并不等同于安全。此外,该漏洞还支持执行不可见提示词注入,使攻击者能够通过隐藏渠道绕过安全审查并操控模型输出。为此,作者向主流AI厂商提出了包括上下文绑定加密和服务器端存储在内的系统性防御建议。
核心观点
-
加密思维链(Reasoning Traces)存在跨环境兼容性漏洞: 为了保护知识产权并降低服务器端存储成本,诸如 Anthropic、OpenAI 和 Google 等主要 API 提供商目前均不再传输明文思维链(CoT)。取而代之的是,系统将思维链包装为经过加密与认证的文本块(AEAD 封套)返回给客户端,并要求客户端在后续多轮对话中传回。然而,该设计存在关键不对称性:这些加密思维链块具有广泛的跨会话、跨用户以及跨模型兼容性。
-
可扩展的解密越狱攻击(Decryption Jailbreak): 攻击者可利用上述兼容性,将高防护主力模型(如 Claude Opus 4.8 或 GPT-5.6 Sol)生成的加密思维链,直接注入到同提供商旗下防护较弱、价格更便宜的轻量模型(如 Claude Haiku 4.5、GPT-5.6 Luna 或 Gemini Robotics 1.6)的上下文窗口中。通过简单的提示词或越狱手段(如诱导其使用
<thinking-copy>标签),便可迫使该轻量模型充当“解密向导”,在明文中逐字转录并输出原本高度保密的思维链内容,从而完全绕过了主力模型的安全对齐防护。 -
四大核心攻击向量:
- ** circumvents 反蒸馏机制(Anti-Distillation)**:竞争对手无需直接越狱主力模型,便可通过轻量模型大规模还原并窃取其明文思维链,用于高性能“学生模型”的蒸馏训练。
- 大规模隐私数据提取(Private Data Extraction):开发者常将包含加密思维链的会话日志公开发布在网上,完全没有意识到敏感数据已经悄悄泄露并固化在这些加密文本块中。
- 有害信息外泄(Jailbreaking):即使模型最终生成的可见回复安全地拒绝了恶意请求,其内部未公开的思维链也可能深度推导了有害过程(如具体的恶意操作步骤),解密这些思维链可直接导致有害信息外泄。
-
隐形提示词注入(Invisible Prompt Injections):攻击者可在共享轨迹中植入恶意的加密思维链。当受害者重放该会话时,模型会将其当作自己先前的推理并盲目执行恶意指令(如静默外泄数据),由于 payload 隐藏在加密文本内部,外部明文审查器完全无法拦截。
-
思维链摘要极不忠实(Summarizer Unfaithfulness): 研究附带发现,目前 API 协议返回给用户的“思维链摘要”往往存在不忠实的情况,摘要会隐瞒模型“提前知道答案再强行套用公式验证”的事实、进行 post-hoc 强行合理解释,或者直接漏掉关键信息。
-
防御机制(Context-Bound Envelopes): 作者提出“上下文绑定封套”防御体系,建议将封套与用户身份(跨用户绑定)和会话哈希链(跨会话绑定)进行绑定,并在 API 网关层强制执行跨模型隔离,从而彻底消除这些重放与解密通道。
关键数据
-
公开会话日志中的敏感数据泄露规模:
- 研究人员从 GitHub 和 Hugging Face 抓取并解密了 6,708 个公开的智能体(Agent)会话轨迹,其中包含 315,320 个加密思维链块。
- 解密共识别出 367 个个人身份信息(PII)泄露和 182 个凭证(Credentials)泄露。
- 在排除了基准测试干扰的真实用户会话中,成功恢复了 62 个独特的 API 密钥、33 个密码、24 个访问令牌、7 个私钥和 30 个个人邮箱。
- 平均有 4.9% 的公开会话(328/6,708)以及 0.3% 的思维块(1,028/315,320)至少泄露了一项真实的隐私敏感项。
- 有 64 项 敏感凭证与数据在可见的聊天历史中已被用户进行了脱敏清除,但却原封不动地残留在不可读的加密思维链块中。
-
低廉的解密与蒸馏成本:
- 以当前的 Claude Haiku 4.5 价格计算,解密由 10,000 个思维链(输入和输出均达 12k token)组成的语料库,在标准 API 费率下仅需花费约 \$720 的名义成本。
- 该论文在各大主流闭源 API 上的测试和数据抓取总共耗资约 \$30,000。
-
思维链注入对其他模型的行为漂移影响:
- 将 Opus 4.8 恢复出的思维链提取 仅 1% 的前缀 注入到 Kimi-K3 的思维通道中,会直接导致 Kimi-K3 的后续推理和可见输出风格高度同质化(向 Claude 靠拢),在 STEM 问题上的 best-of-k n-gram 重合度提升了 0.15,在非 STEM 问题上提升了 0.09。
- 引用前人研究,若将通过思维链转置生成的思维数据用于微调 Qwen2.5-7B-Instruct,其在 MATH500 上的表现能够从仅用答案蒸馏的 68.4% 大幅提升至 76.0%。
https://arxiv.org/pdf/2608.09867
更多推荐


所有评论(0)