logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

清华大学×UW-Madison:AI Agent越会执行越怕越狱?RePD先拆提示再回答

评估时,论文比较了 Self-Reminder、Safe Prompt、GPT Paraphrasing、RePD 和 RePD-M,并在 Vicuna、Llama、Qwen、Llama 3 等模型系列上报告攻击成功率、误报率和准确率。RePD 的思路很清楚:既然很多攻击有模板结构,那就先检索相似模板,再教模型把“包装层”和“真实请求”拆开。在 Agent 安全治理框架里,这类工作给出一个清晰分层

文章图片
#人工智能#深度学习#机器学习
到底了