
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
OpenAI 8 月 18 日发布的 Asana/Codex 案例显示,Asana 用 Codex 在约两周内完成原本预计 5 年的 Enzyme 测试系统迁移,模型和基础设施成本约 1.2 万美元,对比原计划约 600 万美元。真正关键不是“Agent随便写代码”,而是选择可验证、可并行、边界清晰的技术债。
Anthropic Engineering 在《Demystifying evals for AI agents》中系统拆解 Agent 评测:task、trial、grader、transcript、outcome、eval harness 和 agent harness 必须分清。对研发团队来说,Agent eval 不是上线前的形式化测试,而是防止模型升级、prompt 调整、工具变更和长会
本文解读 Anthropic Managed Agents:长任务 Agent 应拆成 brain、hands 和 session,让模型循环、执行环境和持久状态可以独立恢复、替换和扩展。
本文解读 Microsoft Research 的 MagenticLite、MagenticBrain 和 Fara1.5:小模型 Agent 的关键不只是参数规模,而是编排、分工、上下文管理和沙箱安全。
本文解读 Microsoft Research 的 MagenticLite、MagenticBrain 和 Fara1.5:小模型 Agent 的关键不只是参数规模,而是编排、分工、上下文管理和沙箱安全。
论文指出,Coding Agent 的端到端分数混合了模型、Harness、上下文、环境与验证器。本文拆解三类评测错位,并给出任务、过程、组件和运营四层评测方案。
Dialogue-SWEBench 将 500 个真实仓库任务改造成多轮对话评测。本文解析需求 Schema、模拟用户与关键实验结果,并给出研发团队可落地的提问触发器、需求账本和协作评测指标。
Microsoft AutoGen 仓库 README 显示该项目已进入维护模式,并建议新用户转向后继框架。这不是简单的工具更替,而是 Agent 工程从研究型多智能体编排走向可维护生产架构的信号。本文结合 AutoGen 仓库与 Anthropic Engineering 的 Agent 工程实践,拆解研发团队在框架选型、harness 设计、工具接口和长期维护上的取舍。
AHE 通过组件、轨迹和决策三层可观测性,让 Coding Agent 的工具、中间件和长期记忆自动演进。本文解析其闭环设计、组件消融、迁移结果及生产落地所需的权限与回归治理。
EVMbench 通过 Detect、Patch、Exploit 三种模式,在隔离 EVM 环境中评测 AI Agent 的智能合约安全能力。本文解析可执行评分、确定性交易回放及防守方落地方案。







