
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在[上篇]中,我们刻意漏掉了如下所示的两个部分:一是在`extend`方法中用来包装当前`context`对象的`getTraceable`函数,还有就是`Context`构造函数中将自己包装成代理的`ReflectService.handler`。其实这两者最终的目的只有一个:让绑定到固定`Context`上的同一个服务实例在执行的过程在能过自动跟踪当前提供的`Context`。换句话说,当我们

本文介绍了如何利用AsyncSubAgentMiddleware构建异步Sub-Agent系统。通过将transport_agent和accommodation_agent部署为独立服务,Main-Agent可以异步调用这些Sub-Agent执行机票购买和酒店预订任务,同时保持与用户交互的能力。文章详细展示了Agent服务器的构建过程、配置方法以及Main-Agent如何通过AsyncSubAge

Agent剔除LLM后的部分,就是Harness,即`Agent = Model + Harness`。LangChain平台的所有Harness手段都体现在相应的中间件中,这些中间件利用Deep Agents的`create_deep_agent`函数被整合在一起,所以Deep Agents又被称为LangChain平台的Harness。与之类似,MAF下的Harness通过`HarnessAg

[基于OpenEvals的自动化评估-14:以静态代码分析方式评估Coding Agent生成的代码]着重介绍了基于MyPy和Pyright这两种广受欢迎的基于Python的静态代码分析引擎器来评估Agent生成的代码,其实提取出来的代码还可以直接交给LLM进行评估。相关的评估器可以利用create_code_llm_as_judge这个工厂函数来创建,本篇文章就来介绍如何利用这种方式实施针对代码

单纯从消息交互的角度来看待Agent中的model节点,可以看出它旨在利用`AIMessage`提供两种类型的响应: 在需要调用一个或者多个工具情况下,利用`ToolCall`返回针对工具调用意图的描述;做出最终的答复。我们可以利用一个假的模型组件来验证这一点

在本系列前面的文章中,我介绍如何利用OpenEvals提供的预定义提示词,结合LLM-as-a-Judge评估器进行输出文本质量([上篇]、[下篇])、[安全]以及专门[面向RAG的评估]。这篇和下篇则专门聚焦针对用户和Agent之间对话的评估,具体指标包括Agent的语气、是否记住对话历史的内容,以及通过分析用户的言辞和清晰评估用户是否认为Agent犯了错误、答非所问或走错了方向。

[Agent的评估-05:MEAI用来评估LLM响应质量的9种评估器]介绍了定义在NuGet包`Microsoft.Extensions.AI.Evaluation.Quality`中与质量相关指标(包括完整性、一致性、相关性和等效性等)的各种评估器。除此之外,在NuGet包`Microsoft.Extensions.AI.Evaluation.NLP`还包含两个与自然语言处理(NLP)相关的评估

中文的安全其实对应**Safety**和**Security**两个单词,它们的侧重点和防御的对象截然不同。Safety指的是防止系统出错或失控对人类或环境造成伤害,核心是防范无意的意外、错误或故障。。核心是防范有意的恶意行为。本文将介绍如何利用OpeEvals提供的提示词,结合LLM-as-a-Judge评估器,针对五个安全指标的评估,**分别有害性(Toxicity)**、**公平性(Fair

如果您正在构建Agent,OpenEvals包含用于评估Agent完整执行轨迹的评估器,即Agent在解决任务过程中发出的消息和工具调用序列。由于用户与Agent之间采用基于消息的通信方式,所以Agent的执行轨迹通过返回的消息列表来体现。执行轨迹在OpenEvals中以OpenAI风格的消息列表格式呈现。此外,也支持LangChain的`BaseMessage`对象。在进行两个消息的比较时,只考

MAF(Microsoft Agent Framework)建立在MEAI(`Microsoft.Extensions.AI`)这个AI基础框架之上。MEAI是更加基础和通用的基础框架,以`LLM`/`IChatClient`为核心,MAF建立在MEAI之上,并在此基础上构建Agent。MEAI自身也需要一套评估系统用来评估`LLM`/`IChatClient`的产出。`MeaiEvaluator








