logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Harness Engineering 简单理解

文章摘要: AI Harness Engineering(AI运行支架工程)是一种专注于设计AI Agent外部运行架构的方法论,旨在确保智能体在受控环境中可靠执行任务。其核心在于构建包含任务规格、上下文装配、工具策略、Agent循环、状态管理、沙箱执行、权限控制、可观测性和结果验证的完整运行系统。与prompt工程等概念不同,Harness更强调整个系统的可靠性、安全性和可追溯性,特别适用于编程

文章图片
#人工智能
翻译文章:ReposVul: A Repository-Level High-Quality Vulnerability Dataset

开源软件(OSS)漏洞对软件安全性带来了巨大挑战,并对我们的社会构成了潜在风险。为了应对这一问题,大量研究工作致力于自动化漏洞检测,其中基于深度学习(DL)的方法被证明是最有效的[1]。纠缠的补丁:开发者可能在补丁中提交与漏洞修复无关的代码更改,导致补丁纠缠不清。缺乏跨过程漏洞:现有的漏洞数据集通常包含函数级和文件级漏洞,忽略了函数之间的关系,从而使方法无法检测跨过程漏洞。过时的补丁:现有数据集通

文章图片
#论文阅读#网络安全#代码复审
翻译:Search-o1: Agentic Search-Enhanced Large Reasoning Models

Search-o1 框架通过将外部知识检索无缝集成到推理过程中,解决了大型推理模型(LRMs)的知识不足问题,同时保持了链式思维的一致性。如图 2 所示,我们对三种方法进行了比较分析:普通推理、代理检索增强生成(RAG)和我们提出的 Search-o1 框架。普通推理模式:考虑图 2(a) 中的例子,任务涉及确定三步化学反应最终产物中的碳原子数量。普通推理方法在遇到知识缺口(例如“反式肉桂醛的结构

文章图片
#人工智能#网络安全#算法
翻译:CyKG-RAG: Towards knowledge-graph enhanced retrieval augmented generation for cybersecurity

近年来,网络安全威胁检测与分析已成为日益重要的研究领域。与其他领域一样,生成式人工智能(generative AI)和大语言模型(LLMs)的兴起为推进网络安全创造了新的机遇,但也突显了LLMs面临的一些关键挑战——包括幻觉问题、知识缺陷以及处理事实信息能力的不足。为了解决这些限制,检索增强生成(Retrieval Augmented Generation, RAG)——通过动态从外部来源检索相关

文章图片
#web安全#安全#网络 +2
翻译:Large language models for software vulnerability detection: a guide for researchers on models ...

大型语言模型(LLMs)在软件漏洞检测与管理领域中,已成为变革性的工具,展现出识别、分析和缓解安全风险的复杂能力。本文深入探讨了LLMs的应用,审视其在革新传统软件漏洞检测方法中的作用。我们探索了多种类别的LLMs,例如基于transformers的双向编码器表示(BERT)和生成式预训练transformer(GPT),以及这些模型如何被用于提高漏洞检测的准确性和效率。本文回顾了LLMs如何被集

文章图片
#论文阅读#web安全#代码复审
翻译:RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent

我们提出了基于代理的红队测试系统 RedAgent,以 1)通过从模型反馈中获取上下文信息生成情境感知越狱提示;2)持续学习利用在附加记忆缓冲区中自我反思的越狱策略。图 3 显示了 RedAgent 的架构,它由三个主要阶段组成。具体来说,在情境感知剖析阶段,Profile Constructor 感知目标 LLM 的特定上下文以制作情境感知的恶意目标(例如,引导目标 LLM 输出特洛伊木马的有害

文章图片
#语言模型#安全#web安全
翻译:Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

高效获取外部知识和最新信息对于大型语言模型(LLMs)的有效推理和文本生成至关重要。检索增强和工具使用训练方法将搜索引擎视为工具,但缺乏复杂的多轮检索灵活性或需要大规模监督数据。在推理过程中提示具备推理能力的高级LLM使用搜索引擎并非最优选择,因为LLM无法学习如何最佳地与搜索引擎交互。本文介绍了SEARCH-R1,这是DeepSeek-R1模型的扩展版本,其中LLM仅通过强化学习(RL)学习在逐

文章图片
#人工智能#网络安全
翻译:PENTESTGPT: Evaluating and Harnessing Large Language Models for Automated Penetration Testing

开发了一个全面的渗透测试基准。我们构建了一个强大且具有代表性的渗透测试基准,涵盖了HackTheBox和VulnHub等领先平台上的众多测试机器。该基准包含182个子任务,覆盖OWASP的十大漏洞,提供了公平且全面的渗透测试评估。据我们所知,这是该领域首个能够提供逐步进展评估和比较的基准。对LLMs在渗透测试任务中的能力进行全面评估。通过使用GPT-3.5、GPT-4和Bard等模型,我们的探索性

文章图片
#语言模型#人工智能#自然语言处理
翻译:REPOAUDIT: An Autonomous LLM-Agent for Repository-Level Code Auditing

代码审计是一种以发现漏洞为目标的代码审查过程。大型语言模型(LLMs)在此任务中展现了巨大的潜力,能够无需编译即可分析程序,并根据指定提示实现定制化的漏洞检测。然而,将LLMs应用于仓库级代码审计存在显著挑战。LLMs固有的上下文限制和幻觉问题可能导致漏洞报告的质量较低。同时,软件仓库的大规模性带来了巨大的时间和token成本,阻碍了在现实场景中的效率和可扩展性。本工作介绍了一种自主LLM智能体R

文章图片
#网络#安全#论文阅读
翻译:Large language models for software vulnerability detection: a guide for researchers on models ...

大型语言模型(LLMs)在软件漏洞检测与管理领域中,已成为变革性的工具,展现出识别、分析和缓解安全风险的复杂能力。本文深入探讨了LLMs的应用,审视其在革新传统软件漏洞检测方法中的作用。我们探索了多种类别的LLMs,例如基于transformers的双向编码器表示(BERT)和生成式预训练transformer(GPT),以及这些模型如何被用于提高漏洞检测的准确性和效率。本文回顾了LLMs如何被集

文章图片
#论文阅读#web安全#代码复审
到底了