logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【论文阅读】-《Prompt Injection Attack to Tool Selection in LLM Agents》

本文提出了一种针对LLM智能体中工具选择机制的新型提示注入攻击方法ToolHijacker。该攻击通过向工具库注入恶意工具文档,操纵工具选择的两个关键阶段(检索和选择),迫使LLM智能体优先选择攻击者指定的恶意工具。研究将恶意工具文档构建问题形式化为优化问题,并提出两阶段优化策略:分别优化检索目标和选择目标,最后组合生成完整攻击。实验表明,ToolHijacker在无盒场景下(目标系统参数未知)仍

文章图片
#论文阅读
【论文阅读】-《ISOLATEGPT: An Execution Isolation Architecture for LLM-Based Agentic Systems》

摘要 本文提出ISOLATEGPT,一种基于大语言模型(LLM)的智能体系统执行隔离架构,旨在解决第三方应用集成中的安全与隐私风险。当前LLM系统(如ChatGPT)允许第三方应用通过自然语言接口无限制访问用户数据并自由交互,类似于早期计算平台缺乏隔离机制的情况,存在数据泄露和恶意操作等风险。ISOLATEGPT采用中心-辐条架构设计,通过隔离执行环境、专用LLM实例和明确定义的通信协议实现安全隔

文章图片
#人工智能#论文阅读
【论文阅读】-《Temporal UI State Inconsistency in Desktop GUI Agents: Formalizing and Defending Against TO》

通过截图-点击循环控制桌面计算机的 GUI 智能体引入了一类新的漏洞:观察-动作间隔(在真实 OSWorld 工作负载上平均为 6.51 秒)创造了一个检查时间到使用时间(TOCTOU)窗口,在此期间,非特权攻击者可以操纵 UI 状态。我们将此形式化为视觉原子性违反,并刻画了三种具体的攻击原语:(A)通知覆盖劫持,(B)窗口焦点操纵,和(C)网页 DOM 注入。原语 B——桌面平台上与 Andro

文章图片
#论文阅读#ui
【论文阅读】-《Zero-Permission Manipulation: Can We Trust Large Multimodal Model Powered GUI Agents?》

摘要 本文揭示了大模型驱动的GUI智能体在Android系统中的安全隐患。研究发现,GUI智能体依赖的"视觉原子性"假设(即UI状态在观察和动作之间保持不变)在Android中并不成立,导致存在"动作重绑定"攻击面。攻击者可通过操纵观察-动作间隙,将智能体的执行重定向到目标应用,无需任何敏感权限。实验在6个主流Android GUI智能体上进行,结果显示原子动作重绑定成功率100%,并能可靠编排多

文章图片
#论文阅读#人工智能#ui
【论文阅读】-《WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks》

WASP基准测试揭示Web智能体面临严重安全风险 摘要:本研究提出WASP基准测试,首次对Web智能体在提示注入攻击下的安全性进行端到端评估。测试结果显示,即使顶级AI模型(包括具备高级推理能力的模型)在86%的情况下会被简单的人工编写注入攻击部分劫持。值得注意的是,当前智能体因能力不足导致完全执行攻击的成功率仅为0-17%,呈现出"能力不足带来的安全性"现象。该基准采用更现实的威胁模型,将攻击者

文章图片
#论文阅读
【论文阅读】-《AgentRAE: Remote Action Execution through Notification-based Visual Backdoors against Scree》

摘要:本文提出AgentRAE,一种针对移动GUI智能体的新型后门攻击方法,利用通知中的视觉自然触发器(如应用图标)实现远程动作执行。通过创新的两阶段训练框架(对比学习+监督微调),解决了移动环境中触发器设计受限、操作系统干扰和多目标映射等挑战。实验表明该方法在10种移动操作上攻击成功率超90%,且能绕过8种先进防御。研究揭示了移动GUI智能体中潜在的系统性漏洞,强调需针对通知行为和智能体内部表示

文章图片
#论文阅读#人工智能#ui
【论文阅读】-《Environmental Injection Attacks against GUI Agents in Realistic Dynamic Environments》

摘要 本文研究了图形用户界面(GUI)智能体在动态网络环境中的安全漏洞问题。研究发现,现有环境注入攻击(EIA)方法在静态假设下评估攻击效果,未能反映真实网络环境的动态特性,导致攻击成功率被高估。为此,作者提出了一个现实的动态环境威胁模型,并开发了Chameleon攻击框架。该框架包含两项关键技术:LLM驱动的环境模拟自动生成多样化网页样本,注意力黑洞机制通过显式监督信号优化触发器在动态环境中的鲁

文章图片
#论文阅读#人工智能
【论文阅读】-《EVA: Red-Teaming GUI Agents via Evolving Indirect Prompt Injection》

摘要 本文提出EVA框架,针对GUI智能体的间接提示注入漏洞进行红队测试。研究发现,当前GUI智能体容易受到环境注入攻击,即通过视觉界面中的恶意元素(如弹窗、聊天消息)误导智能体行为。与静态攻击方法相比,EVA采用闭环优化策略,通过持续监控智能体注意力分布并动态调整对抗性提示(包括关键词、措辞和布局),显著提高了攻击成功率。在六种主流GUI智能体上的实验表明,EVA在弹窗操纵、钓鱼攻击等场景中成功

文章图片
#论文阅读
【论文阅读】-《MELON: Provable Defense Against Indirect Prompt Injection Attacks in AI Agents》

本文提出MELON方法防御AI智能体的间接提示注入攻击(IPI)。IPI攻击通过工具检索信息中的恶意任务重定向智能体执行未授权操作。现有防御方法存在资源消耗大、防御效果有限或损害正常效用等问题。MELON基于关键观察:受攻击时智能体动作对用户任务的依赖性降低。该方法通过掩码修改用户提示重执行轨迹,比较原始与掩码执行的工具调用差异来检测攻击。实验表明,MELON在AgentDojo基准上优于现有方法

文章图片
#论文阅读#人工智能
【论文阅读】-《AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM》

摘要: 本文提出AgentDojo,一个动态评估框架,用于测试LLM智能体在提示注入攻击下的安全性和防御能力。AgentDojo包含97个现实任务(如邮件管理、银行操作等)和629个安全测试用例,模拟智能体在不可信数据环境中的工具调用行为。研究发现,现有LLM在无攻击时任务完成率不足66%,而攻击成功率低于25%。部署防御措施后,攻击成功率降至8%。AgentDojo作为可扩展平台,支持新任务、攻

文章图片
#论文阅读
    共 37 条
  • 1
  • 2
  • 3
  • 4
  • 请选择