在 Agent 盛行的时代,评价一个模型“行不行”,标准正在发生质变。最近我们针对 Claude Code 环境进行了一次小规模对比:命题很简单,让 AI 调用 PDF skill,将一份约 42KB 的中文 Markdown 报告转换成 PDF 文件。

这次尝试让我们深刻意识到,在 Claude Code 这种复杂的 Agent 环境中,传统的“问答式评测”已经失效。评估的核心不再是模型能否给出一个最终答案,而是它能否丝滑地跑完一整套“自动化工作流”。从感知环境、识别工具、执行指令到最后的适时收工,每一个环节都是对模型协同能力的极大考验。

核心复盘:Agent 评测的重心在于“过程控制”

过去我们测模型,习惯看它的回复是否优美。但在调用 Skill 的场景下,PDF 转换任务的结果是极度具象的:文件生成了吗?排版乱没乱?是否在指定目录下?

更关键的是,模型在达成目标的过程中是否表现得足够“理智”。我们发现,模型如果具备良好的 Agent 素质,它应该能准确读文件、发现环境内的可用工具、按路径存放产物,并在任务终结时果断离场,而不是反复折腾直到耗尽 Token 预算。

实验方案:在真实生产环境下“练兵”

为了确保对比的真实性,我们没有采用简单的 SDK 调用,而是在远程 Ubuntu 服务器上搭建了标准的 Claude Code CLI 环境。

以下是本次对比的技术底座:

  • 基础设施:远程 Ubuntu 云服务器。
  • 交互工具:Claude Code 版本 2.1.185。
  • 开发环境:Python 3.12 与 Node v24.17。
  • 模型接入:通过非线智能API提供的 Anthropic 协议接口进行统一调度。
  • 测试插件:Anthropic 官方发布的 pdf skill。
  • 输入输出:输入为 office_skill2pdf.md,目标路径为 outputs/office_skill2pdf.pdf

为了防止上下文污染,我们采用了隔离策略:每个模型运行前都会清理目录并使用 --no-session-persistence 参数,确保每次尝试都是“初次见面”。

关键变量:为何要给 AI “减负”?

在早期的 Prompt 设计中,我们曾试图让模型“尽善尽美”,在提示词里要求它检查乱码、修复表格溢出等。但对比结果显示,这反而成了负担。

AI 在收到“自我检查”的要求后,往往会陷入无限排查的逻辑死循环,极大地推高了 API 成本。因此,我们将 Prompt 进行了极简化处理,只下达核心指令:“使用 PDF skill 转换文件并保存到指定位置,完成后立即停止。”

至于文件质量的验收,我们将其交给了外部的 runner 验证器。这种“执行归 AI,验收归系统”的逻辑,才是评价 Skill 调用能力的科学姿势。

数据对比:成本与效率的冰火两重天

本次对比重点观测了三组运行数据。虽然它们面对的是同样的任务,但表现却大相径庭。

数据揭示了一个有趣的现象:即便模型声称“支持缓存”,如果交互轮数(turns)过多,成本依然会迅速失控。

  • DeepSeek 系列模型:表现相对稳健,通过 11 次请求完成了交付。尽管在最后一轮出现了上下文暴涨,但最终成功落库。

  • GPT 系列(Luna):表现得最为“干脆利落”,仅用 8 次请求就搞定了任务。由于请求频次低、输出精简,其整体费用支出最为低廉。

  • Claude 3.5 Sonnet:这次却“翻了车”。从后台明细看,它的缓存命中率虽高,却陷入了 40 轮的超长拉锯战。

深度剖析:Sonnet 为什么会“跑飞”?

通过回溯 trace 日志,我们发现 Sonnet 并不是不认识 Skill,它确实调用了 anthropic-official-pdf-eval:pdf

悲剧在于它“太努力”了。Sonnet 发现 Markdown 包含图表,于是开始疯狂尝试各种第三方渲染方案:从 Mermaid 的在线 API 到本地的 Playwright 环境,再到 SVG 转换工具。它像一个陷入完美主义泥潭的打工人,在边缘需求上耗光了所有精力,却忘记了把最基础的 PDF 交付给用户。

这就是典型的 Agent 评测 Badcase:模型虽然聪明,但任务优先级管理失控。

质量验收:脱离人工感知的自动化检测

在产物交付后,我们的 runner 会启动多维度的自动扫描,完全不依赖模型的主观反馈。

检测覆盖了文件完整性、页面格式(A4 规范)、内容截断情况、表格还原度以及乱码率等。从结果看,Luna 的产物在表格和锚点还原上略胜一筹,而 DeepSeek 则在排版空间上更具弹性。

总结:如何构建 Claude Code 的 Skill 评测体系?

单次的胜负并不重要,重要的是我们摸索出了一套评价 Agent Skill 表现的六维框架:

  1. 环境适配度:模型能否在 Claude Code CLI 下正常握手并加载插件?
  2. 工具路由准确性:面对任务,模型能否在众多 Skill 中精准选中最合适的那一个?
  3. 执行链路健壮性:调用过程中遇到小报错能否自主修复,而非直接崩溃?
  4. 交付物标准度:产物是否出现在约定的位置,内容是否符合人类阅读标准?
  5. 资源消耗控制:是否能利用缓存降低成本?是否能在任务完成后及时闭环,避免无效轮次?
  6. 逻辑偏差分析:深入挖掘“跑飞”的原因,识别模型是否存在过度思考或指令漂移。

在 Agent 的世界里,过程即答案。一个能快速收工、成本可控的模型,远比一个在细枝末节上死磕的“学霸”更具生产力价值。

更多推荐