
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
清华大学×UW-Madison:AI Agent越会执行越怕越狱?RePD先拆提示再回答
评估时,论文比较了 Self-Reminder、Safe Prompt、GPT Paraphrasing、RePD 和 RePD-M,并在 Vicuna、Llama、Qwen、Llama 3 等模型系列上报告攻击成功率、误报率和准确率。RePD 的思路很清楚:既然很多攻击有模板结构,那就先检索相似模板,再教模型把“包装层”和“真实请求”拆开。在 Agent 安全治理框架里,这类工作给出一个清晰分层

到底了







