
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Agent 评测的核心原则:1. 任务完成度是北极星指标不管 Agent 多聪明、工具用得多好,最终只看"事有没有办成"。2. 评测集必须覆盖端到端任务链不能只用"回答得好不好"来评测 Agent。需要完整的工具调用链、SubAgent 协作、错误恢复场景。3. 死循环和幻觉是 Agent 的红线这两项指标不能有任何妥协。死循环率必须为 0%,幻觉率必须持续压低。4. 按风险投入评测资源Promp
除了 SDK 层的 snapshot / rollback / clone API,本次我们还同步开源了一套基于 CubeSandbox 的 OpenClaw Web 管理(预览版)——把这一版的核心能力做成了点几下鼠标就能完成的可视化体验:实时查看每个沙箱的存档时间线、一键回到过去某个 checkpoint、瞬间裂变多个 OpenClaw、批量管理沙箱生命周期。当需要为运行中的沙箱制作新快照时,
要理解 Claude 代码能力的来源,必须先理解一个技术事实:在所有 AI 应用领域中,代码是为强化学习而生的。这并非比喻。从奖励信号的可得性、推理链的天然约束、到探索空间的特性,代码场景在多个维度上恰好击中了强化学习的核心需求。而强化学习,正是当前大模型能力突破的关键引擎。
AI Agent 成本优化本质不是让你少问一句话而是让系统少重复做无效工作更低成本 = 更少重复上下文(RTK、Caveman、headroom、context-mode、会话管理)+ 更合理模型路由(任务匹配、Skill 绑模型)+ 更精准代码检索(Graphify、CodeGraph)+ 更清晰 Agent 分工(subagent 隔离、worktree 并发、记忆外置)
一个 Tool / MCP 不只是"多一个按钮",而是多一段要让模型理解的说明、参数模式和调用约束。第三,
TPerf AI 分析 Agent 属于「功能工具」类型,部署在 Knot 智能体平台上,通过 MCP 工具调用 TPerf-API 获取各维度性能数据,结合知识库检索进行深度分析,经决策树判断资源瓶颈点和压测有效性,输出包含排查建议和优化方向的结构化性能分析报告。
用例基线是单个用例执行 1 次后,经人工确认的预期过程和预期结果的快照。它回答的是:"这个用例,正确的执行应该长什么样?预期过程过程内容说明思维链(CoT)Agent 的推理过程、决策依据、步骤规划工具调用序列调用了哪些工具、调用顺序、每次调用的入参和返回值中间产物执行过程中产生的临时文件、中间数据、API 响应完整 Trace以上所有内容的结构化记录,可回放完整执行轨迹预期结果结果内容说明最终响
当 AI Agent 从"Demo 可用"走向"生产可靠",测评就是那道必须跨过的门槛。Agent 的输出既有可程序化验证的硬指标(文件存在、调用正确),也有只能靠语义理解才能判断的软指标(推理合理性、建议质量)。:Trace(执行轨迹)是 Agent 执行过程中产生的结构化日志,记录了每一步的工具调用、参数、返回值和思考过程,类似于程序调试中的"调用栈记录"。面对这些痛点,我们需要的不是"偶尔跑
当线上出问题时,可以按这张表快速判断。你看到的问题先问自己优先方案模型不知道某个事实这个事实会不会更新?会更新就 RAG / 工具输出格式错标准格式是否明确?明确就 SFT + 校验内容正确但不够好是否存在主观偏好?DPO / RLHF模型过度拒答是否安全边界标错?偏好样本 + 边界评测引用了错误文档模型是否拿到了正确上下文?优先修检索工具参数错参数规则能否标注?SFT 工具调用样本复杂题推理错是
除了 SDK 层的 snapshot / rollback / clone API,本次我们还同步开源了一套基于 CubeSandbox 的 OpenClaw Web 管理(预览版)——把这一版的核心能力做成了点几下鼠标就能完成的可视化体验:实时查看每个沙箱的存档时间线、一键回到过去某个 checkpoint、瞬间裂变多个 OpenClaw、批量管理沙箱生命周期。当需要为运行中的沙箱制作新快照时,







