logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

[DeepSeek Harness插件内核-07]Context全面解析[动态注入篇]

在[上篇]中,我们刻意漏掉了如下所示的两个部分:一是在`extend`方法中用来包装当前`context`对象的`getTraceable`函数,还有就是`Context`构造函数中将自己包装成代理的`ReflectService.handler`。其实这两者最终的目的只有一个:让绑定到固定`Context`上的同一个服务实例在执行的过程在能过自动跟踪当前提供的`Context`。换句话说,当我们

文章图片
#前端#算法#数据库
[DeepAgents:LangChain的Harness-11]AsyncSubAgentMiddleware如何让Agent像微服务一样远程协作?

本文介绍了如何利用AsyncSubAgentMiddleware构建异步Sub-Agent系统。通过将transport_agent和accommodation_agent部署为独立服务,Main-Agent可以异步调用这些Sub-Agent执行机票购买和酒店预订任务,同时保持与用户交互的能力。文章详细展示了Agent服务器的构建过程、配置方法以及Main-Agent如何通过AsyncSubAge

文章图片
[MAF的Harness-01]穷举MAF所有可能的Harness手段

Agent剔除LLM后的部分,就是Harness,即`Agent = Model + Harness`。LangChain平台的所有Harness手段都体现在相应的中间件中,这些中间件利用Deep Agents的`create_deep_agent`函数被整合在一起,所以Deep Agents又被称为LangChain平台的Harness。与之类似,MAF下的Harness通过`HarnessAg

文章图片
#AI
[基于OpenEvals的自动化评估-15]以LLM-as-a-Judge方式评估Agent生成的代码

[基于OpenEvals的自动化评估-14:以静态代码分析方式评估Coding Agent生成的代码]着重介绍了基于MyPy和Pyright这两种广受欢迎的基于Python的静态代码分析引擎器来评估Agent生成的代码,其实提取出来的代码还可以直接交给LLM进行评估。相关的评估器可以利用create_code_llm_as_judge这个工厂函数来创建,本篇文章就来介绍如何利用这种方式实施针对代码

文章图片
#AI
[LangChain智能体本质论-02]从消息交互角度审视模型组件在Agent中的作用

单纯从消息交互的角度来看待Agent中的model节点,可以看出它旨在利用`AIMessage`提供两种类型的响应: 在需要调用一个或者多个工具情况下,利用`ToolCall`返回针对工具调用意图的描述;做出最终的答复。我们可以利用一个假的模型组件来验证这一点

文章图片
#python
[基于OpenEvals的自动化评估-10]针对Agent对话的评估[上篇]

在本系列前面的文章中,我介绍如何利用OpenEvals提供的预定义提示词,结合LLM-as-a-Judge评估器进行输出文本质量([上篇]、[下篇])、[安全]以及专门[面向RAG的评估]。这篇和下篇则专门聚焦针对用户和Agent之间对话的评估,具体指标包括Agent的语气、是否记住对话历史的内容,以及通过分析用户的言辞和清晰评估用户是否认为Agent犯了错误、答非所问或走错了方向。

文章图片
#AI
[Agent的评估-07]整合MEAI针对自然语言处理相关的评估器

[Agent的评估-05:MEAI用来评估LLM响应质量的9种评估器]介绍了定义在NuGet包`Microsoft.Extensions.AI.Evaluation.Quality`中与质量相关指标(包括完整性、一致性、相关性和等效性等)的各种评估器。除此之外,在NuGet包`Microsoft.Extensions.AI.Evaluation.NLP`还包含两个与自然语言处理(NLP)相关的评估

文章图片
#AI
[基于OpenEvals的自动化评估-08]对Agent的输出和输入进行安全性评估

中文的安全其实对应**Safety**和**Security**两个单词,它们的侧重点和防御的对象截然不同。Safety指的是防止系统出错或失控对人类或环境造成伤害,核心是防范无意的意外、错误或故障。。核心是防范有意的恶意行为。本文将介绍如何利用OpeEvals提供的提示词,结合LLM-as-a-Judge评估器,针对五个安全指标的评估,**分别有害性(Toxicity)**、**公平性(Fair

文章图片
#AI
[基于OpenEvals的自动化评估-12]Agent执行轨迹评估[无LLM参与]

如果您正在构建Agent,OpenEvals包含用于评估Agent完整执行轨迹的评估器,即Agent在解决任务过程中发出的消息和工具调用序列。由于用户与Agent之间采用基于消息的通信方式,所以Agent的执行轨迹通过返回的消息列表来体现。执行轨迹在OpenEvals中以OpenAI风格的消息列表格式呈现。此外,也支持LangChain的`BaseMessage`对象。在进行两个消息的比较时,只考

文章图片
#AI
[Agent的评估-04]利用MeaiEvaluatorAdapter适配MEAI评估系统

MAF(Microsoft Agent Framework)建立在MEAI(`Microsoft.Extensions.AI`)这个AI基础框架之上。MEAI是更加基础和通用的基础框架,以`LLM`/`IChatClient`为核心,MAF建立在MEAI之上,并在此基础上构建Agent。MEAI自身也需要一套评估系统用来评估`LLM`/`IChatClient`的产出。`MeaiEvaluator

文章图片
#AI
    共 321 条
  • 1
  • 2
  • 3
  • 33
  • 请选择