logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

google文档:用什么来评测现有大模型评测

对于 AI Agent 而言,高分可能只是因为测试题目恰好命中了模型的“舒适区”,掩盖了系统在真实复杂环境下的脆弱性。静态基准测试只测中性措辞,盖上“已解决”的印章,并在本是悬崖的地方报告为平地。我们需要的不是一个标量分数,而是一张展示 Agent 能力边界的“地图”。”考试很难回答这个问题,但地图可以。不再使用固定的测试题,而是通过动态生成不同难度的变体,来测试 Agent 的能力边界。通过引入

#人工智能#语言模型
google文档:用什么来评测现有大模型评测

对于 AI Agent 而言,高分可能只是因为测试题目恰好命中了模型的“舒适区”,掩盖了系统在真实复杂环境下的脆弱性。静态基准测试只测中性措辞,盖上“已解决”的印章,并在本是悬崖的地方报告为平地。我们需要的不是一个标量分数,而是一张展示 Agent 能力边界的“地图”。”考试很难回答这个问题,但地图可以。不再使用固定的测试题,而是通过动态生成不同难度的变体,来测试 Agent 的能力边界。通过引入

#人工智能#语言模型
Harness Engineering工程——AI应用视角理解

主要以简明的定义说明和个人的理解以分享Harness Engineering工程内容

#人工智能#语言模型
【LLM记忆】 Letta梳理

Letta(原 MemGPT)推出了一种更根本的解法:让 LLM 像操作系统一样管理自己的记忆,在“主要上下文”与“外部上下文”之间自主调度,并通过一种可以被称作“回忆与后期思考”的机制,真正长出长期记忆。接下来,我们从技术要点与实现逻辑入手,看清这套架构到底是什么,以及为什么它真的能工作。

#人工智能#语言模型
给产品经理的Data Agent说明

Data Agent的本质不是对话系统,而是将自然语言驱动的业务问题转化为一系列结构化、可审计的数据操作流程。它要解决的核心命题是:如何让AI在企业规则框架内正确地理解、查询、解释和反馈数据。业务问题:输入并非技术指令,而是带有上下文的自然语言提问,如“本月毛利率为何低于预算?数据行动:输出不仅是文本回答,还包括调用SQL引擎、生成可视化图表、触发工单或告警系统的具体行为。可控:所有操作需遵循企业

#人工智能
Harness Engineering工程——AI应用视角理解

主要以简明的定义说明和个人的理解以分享Harness Engineering工程内容

#人工智能#语言模型
大模型强化学习GRPO及其改进

本文系统分析了大模型偏好优化算法GRPO、DAPO和GSPO的技术演进。GRPO通过组内归一化替代Critic网络降低计算成本,但存在熵坍塌和长序列梯度稀释问题。DAPO引入Clip-Higher、动态采样等四项技术提升稳定性,解决GRPO的缺陷。GSPO则通过序列级优化修正GRPO的粒度不匹配问题,实现更稳定的训练。三种算法在计算效率、探索能力和训练稳定性方面各有侧重,共同推动了强化学习在语言模

文章图片
#语言模型#人工智能
在python环境安装opencv

用了好几种方法尝试下载opencv库,但一直没成功,DOS界面内容大致是我的pakage仓库里找不到opencv库。 但原因是输入的库的名称出错。`pip install opencv-python使用下面修改后代码即可顺利下载opencvpip install opencv_python没错! 差别就是横杠和下划线的区别。看过另一个方法是直接在https://www.lfd.uci.edu/~g

#opencv#python
到底了