logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

给Agent调用做限流熔断保护

先把结论甩出来:Agent 调大模型/工具,,三件套缺一不可。我上个月就是没加,被自己写的循环把账号打到限流封了 20 分钟,顺带烧了我自己一笔不算少的 token。下面是我踩完坑后现在固定用的那套写法。

文章图片
#python#开发语言
Agent评测指标怎么设?别只看“答得对不对“

很多人评测自己的智能体,就一个标准:答得对吗?对就行,错就改。我以前也这样,后来吃了亏——有个助手"答得对",但慢得要死、还经常答跑题一大段,用户照样骂。光看对错太粗了。我后来给评测立了一套指标,分享一下。

文章图片
#java#前端#服务器
给Agent接定时任务:每天定点自动跑

我给一个智能体接了定时任务,每天早上 8 点自动跑一遍:抓取昨天的行业新闻、让模型总结成五条、推到我飞书。一个月下来省了我每天半小时的剪报时间。这篇讲清楚怎么让 Agent 从"你问它才动"变成"到点自己动"。

文章图片
同一任务我拿三个大模型跑了一组对比:质量/延迟/成本实测

没有一个模型通吃。对话 ≤ 8 轮 → 用 C(快、便宜,这档质量够)对话 > 8 轮 → 用 B(均衡,长对话也稳)重大投诉工单 → 用 A(质量优先,这类不差钱)整体算下来,综合成本只有全程用 A 的三分之一不到,质量均分还稳在 4.2 以上。混用比一刀切香。

文章图片
让客服Agent学会说“我不知道“:拒答的设计思路

一个客服机器人最值钱的能力,可能不是答得多全,而是知道什么时候闭嘴说"这个我不清楚"。我做客服 Agent 的设计时,花在"怎么让它该拒答时拒答"上的功夫,比花在"怎么让它答得好"上的还多。讲讲这个思路。

文章图片
#java#服务器#前端
RAG为什么会一本正经瞎编?召回这步决定生死

我搭了个会查公司制度的小助手,问它"年假能不能跨年清零",它答得头头是道,引经据典,结果——公司压根没这条规定,它现编的。当时我一身冷汗,这要是给 HR 用了得闹笑话。这事让我去把 RAG 这套东西的原理重新捋了一遍。今天不讲怎么搭,讲讲,搞懂了你才知道该往哪儿使劲。

文章图片
把公司内部接口给Agent用,我对比了两种封装法

模型不接触底层HTTP,它只看到"有个查订单的工具,要传订单号",负责决定什么时候调、传什么值。把内部接口按工具规范注册进去,画布上的智能体就能直接调,不用我给每个接口写胶水代码去对接模型。查询类的工具随它调,但"发工单""改状态"这种有副作用的,我让它调用前先回显一句让人确认。后端视角的一个实际问题:想让智能体能调我们公司内部的接口(查订单、查库存、发工单这些),有两种封装思路,到底选哪个?先说

文章图片
#前端#数据库
同一任务我拿三个大模型跑了一组对比:质量/延迟/成本实测

没有一个模型通吃。对话 ≤ 8 轮 → 用 C(快、便宜,这档质量够)对话 > 8 轮 → 用 B(均衡,长对话也稳)重大投诉工单 → 用 A(质量优先,这类不差钱)整体算下来,综合成本只有全程用 A 的三分之一不到,质量均分还稳在 4.2 以上。混用比一刀切香。

文章图片
机器人答不上来的问题,才是知识库最好的需求清单

我们的内部答疑机器人刚上线时我自信满满,觉得文档备得挺全,结果第一周的对话日志一拉,"未命中知识库"的问题占了快四成。理论上可以再搭个智能体帮我预归类(把未命中问题聚类打标),我试过一版,聚类结果凑合能用,但合并粒度老觉得差点意思,目前还是机器初筛 + 人工定夺。每次大概花一个半小时,烦是真烦,像批作业。但坚持了两个月,未命中率从 38% 降到 12%,而且降得很扎实——补的每一篇文档都对应真实问

文章图片
#机器人
机器人答不上来的问题,才是知识库最好的需求清单

我们的内部答疑机器人刚上线时我自信满满,觉得文档备得挺全,结果第一周的对话日志一拉,"未命中知识库"的问题占了快四成。理论上可以再搭个智能体帮我预归类(把未命中问题聚类打标),我试过一版,聚类结果凑合能用,但合并粒度老觉得差点意思,目前还是机器初筛 + 人工定夺。每次大概花一个半小时,烦是真烦,像批作业。但坚持了两个月,未命中率从 38% 降到 12%,而且降得很扎实——补的每一篇文档都对应真实问

文章图片
#机器人
到底了