
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
LLM智能体依赖记忆系统从历史交互中学习,但这也引入了严重的安全漏洞。攻击者可注入看似无害的记录来操控智能体的未来行为。此类攻击有两大特徵:第一,恶意效果仅在特定上下文中被激活,单独审计每个记忆条目时难以察觉;第二,一旦触发,操控会引发自我强化的错误循环——被汙染的结果被存为先例,不仅放大初始错误,还逐步降低未来类似攻击的门檊。

随着视觉语言模型(VLMs)的快速发展,计算机使用智能体(CUAs)能够像人类一样通过观察屏幕并执行鼠标点击、键盘输入等操作来自动化完成各类计算机任务。然而,这类智能体面临一个致命的安全威胁——提示词注入攻击攻击者可以在智能体读取的网页、邮件、文档等内容中植入恶意指令,劫持智能体的行为,从而窃取凭证或造成经济损失。目前唯一已知的稳健防禦手段是架构隔离(Architectural Isolation

随着LLM部署从单模型向多智能体集群(fleet)演进,一个人类监督者需要在每轮仅能审计B个(B ≪ N)智能体的情况下,从N个智能体中识别错误。监督者依赖智能体自报的置信度作为优先级信号,但这些置信度可能存在系统性校准偏差,且智能体之间的错误具有相关性。当置信度信号被“污染”到何种程度时,基于置信度的审计策略会比随机审计更差?以及当置信度信号完全失效时,错误相关性能否成为替代的信息来源?

当前大语言模型在医学领域的应用大多局限于狭义的、任务特定的聊天工具,而非真正整合到临床工作流中的系统。有效的临床决策是一个多步骤的迭代过程:医生需要反复获取患者信息(通过病史采集和诊断性检查),整合并推理结果,直到建立工作假设并启动治疗。然而,现有AI系统未能充分覆盖这一完整流程,尤其是在与EHR系统深度整合、执行可操作的临床操作方面存在显著空白。一个能够自主导航于EHR环境、具备端到端临床决策能

本文是KDD 2025上發表的一篇關於LLM智能體可信賴性的綜述論文,提出了,系統性地將LLM智能體和多智能體系統(MAS)的可信賴性劃分為兩大維度。論文全面梳理了針對各模塊的攻擊手段、防禦策略與評估方法,將傳統“可信LLM”的概念拓展至“可信智能體”的新範式。

目前AI Agent安全标准呈现“百花齐放”的格局:有强制性国标(中国41号文)、有管理体系标准(ISO 42001)、有风险分类框架(OWASP Top 10)、有技术规范(ACS)、有实践指南(网安标委指引)、有研究框架(A2AS、MAESTRO)。

目前AI Agent安全标准呈现“百花齐放”的格局:有强制性国标(中国41号文)、有管理体系标准(ISO 42001)、有风险分类框架(OWASP Top 10)、有技术规范(ACS)、有实践指南(网安标委指引)、有研究框架(A2AS、MAESTRO)。

近年来,以GPT、Gemini、DeepSeek为代表的大语言模型在科研自动化方面展现出巨大潜力——从假设生成、实验设计到数据分析甚至论文撰写,AI智能体正在逐步渗透科学研究的各个环节。然而,这种自动化进程也带来了严峻的伦理与安全隐患:恶意利用、有害偏见放大、危险知识传播、不当实验操作等问题日益突出。现有研究大多聚焦于孤立的安全问题(如单一模型对抗攻击、预训练数据偏见等),缺乏针对多智能体科研场景

进攻性安全LLM智能体(即用于自动化渗透测试和CTF解题的AI智能体)是一个快速发展的研究方向。第一,智能体系统和其底层LLM均如同“黑箱”,对超参数(温度temperature、top-p、最大token长度等)极为敏感,但此前尚无研究系统性地考察这些超参数如何影响多智能体CTF解题场景中的行为与表现;第二,现有的评估方法过于粗糙,仅采用“通过/失败”的二元指标来判断智能体是否成功提取flag,

仅需10个完全良性的问答对(QA pairs),通过对LLM进行两阶段微调,即可成功实现模型越狱。论文的核心洞察在于:先让模型在“拒绝回答”任务上过拟合,再使用标准答案进行二次微调,即可触发模型对安全对齐的“灾难性遗忘”(catastrophic forgetting)。该攻击在10个主流LLM上实现了平均94.84%的越狱成功率,且攻击数据完全可通过内容审核。第一阶段:过拟合阶段(Overfit








