Agent评测指标怎么设?别只看“答得对不对“
很多人评测自己的智能体,就一个标准:答得对吗?对就行,错就改。我以前也这样,后来吃了亏——有个助手"答得对",但慢得要死、还经常答跑题一大段,用户照样骂。光看对错太粗了。我后来给评测立了一套指标,分享一下。
一、准确率,但要分层看
对不对当然是第一位的。但别只看一个总数,得分层:
-
完全答对:信息准、覆盖全。
-
部分答对:对一半,漏了关键点。
-
答错:信息有误,这种最危险。
-
拒答/答非所问:没正面回答。
我把测试集的结果按这四档分,光看到"答错"占了 8% 我还能接受,但"部分答对"占了 30% 才是真问题——用户拿到半截答案,有时比明确答错更坑,因为他不知道缺了。
二、相关性:有没有答到点上
有的助手答得不能算错,但绕。问"怎么退货",它先给你讲一段退货政策的历史沿革。信息没错,但用户没问这个。我专门看一项:回答里有多少是用户真想要的。废话占比高的,体验一样差。
三、延迟:答得对也得答得快
我现在每条都记响应时间。客服场景超过三秒,用户就开始烦。有个版本准确率最高,但平均延迟五秒,实际满意度反而最低。准确和速度得一起看,不能为了准把速度搭进去。
四、稳定性:同一个问题问十遍
这个最容易被忽略。我把高频问题各问十遍,看答案稳不稳。有个助手大部分时候答得好,但偶尔抽风给个离谱答案,十次里翻一次车。线上量大了,这一次也是事故。稳定性差的,比平均分低一点的更可怕。
五、兜底质量:它不会的时候怎么表现
模型总有不会的。我专门测它面对超纲问题的反应:是诚实说"这个我不确定",还是硬编一个假答案?后者一票否决。宁可它说不知道,也别让它一本正经地胡说。
怎么落地
我的做法是攒一个固定测试集,每次改完就全跑一遍,五个维度各打分,做成一张对比表。哪个版本好坏,一目了然,不靠"我感觉这版顺眼"。我用的那个能配智能体的平台带个测评功能,能批量跑测试集出结果,比我一条条手测省太多事。
评测这事,单看准确率会骗你。把相关性、延迟、稳定性、兜底都纳进来,你才知道这助手到底能不能见用户。
(测评里跑的对话模型我走的讯飞 MaaS,现成 API,批量跑几百条测试集也不用自己扛推理压力。)
更多推荐
所有评论(0)