logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

5年技术债压到2周?Asana用Codex证明:Agent最适合先啃这类活

OpenAI 8 月 18 日发布的 Asana/Codex 案例显示,Asana 用 Codex 在约两周内完成原本预计 5 年的 Enzyme 测试系统迁移,模型和基础设施成本约 1.2 万美元,对比原计划约 600 万美元。真正关键不是“Agent随便写代码”,而是选择可验证、可并行、边界清晰的技术债。

#人工智能#AI Agent#软件工程
Agent上线后才发现变差?Anthropic提醒:没有eval就是盲飞

Anthropic Engineering 在《Demystifying evals for AI agents》中系统拆解 Agent 评测:task、trial、grader、transcript、outcome、eval harness 和 agent harness 必须分清。对研发团队来说,Agent eval 不是上线前的形式化测试,而是防止模型升级、prompt 调整、工具变更和长会

#人工智能
Anthropic Managed Agents 解读:长任务 Agent 为什么要解耦 brain、hands 和 session

本文解读 Anthropic Managed Agents:长任务 Agent 应拆成 brain、hands 和 session,让模型循环、执行环境和持久状态可以独立恢复、替换和扩展。

#rpc#java#网络协议 +2
Microsoft MagenticLite 解读:小模型 Agent 为什么需要编排、分工和沙箱

本文解读 Microsoft Research 的 MagenticLite、MagenticBrain 和 Fara1.5:小模型 Agent 的关键不只是参数规模,而是编排、分工、上下文管理和沙箱安全。

#microsoft#人工智能#软件工程
Microsoft MagenticLite 解读:小模型 Agent 为什么需要编排、分工和沙箱

本文解读 Microsoft Research 的 MagenticLite、MagenticBrain 和 Fara1.5:小模型 Agent 的关键不只是参数规模,而是编排、分工、上下文管理和沙箱安全。

#microsoft#人工智能#软件工程
别再只看SWE-bench分数:Agentic软件工程需要怎样的新评测体系

论文指出,Coding Agent 的端到端分数混合了模型、Harness、上下文、环境与验证器。本文拆解三类评测错位,并给出任务、过程、组件和运营四层评测方案。

#软件工程#人工智能
Dialogue-SWEBench解读:Coding Agent真正缺的不是代码能力,而是会提问

Dialogue-SWEBench 将 500 个真实仓库任务改造成多轮对话评测。本文解析需求 Schema、模拟用户与关键实验结果,并给出研发团队可落地的提问触发器、需求账本和协作评测指标。

#软件工程
AutoGen进入维护模式:Agent框架选型该从“库优先”转向“架构优先”

Microsoft AutoGen 仓库 README 显示该项目已进入维护模式,并建议新用户转向后继框架。这不是简单的工具更替,而是 Agent 工程从研究型多智能体编排走向可维护生产架构的信号。本文结合 AutoGen 仓库与 Anthropic Engineering 的 Agent 工程实践,拆解研发团队在框架选型、harness 设计、工具接口和长期维护上的取舍。

#架构#人工智能#软件工程
AHE解读:让Coding Agent的工具、记忆与中间件自动进化

AHE 通过组件、轨迹和决策三层可观测性,让 Coding Agent 的工具、中间件和长期记忆自动演进。本文解析其闭环设计、组件消融、迁移结果及生产落地所需的权限与回归治理。

#中间件#软件工程
EVMbench解读:AI Agent如何检测、修复并利用智能合约漏洞

EVMbench 通过 Detect、Patch、Exploit 三种模式,在隔离 EVM 环境中评测 AI Agent 的智能合约安全能力。本文解析可执行评分、确定性交易回放及防守方落地方案。

#人工智能#智能合约#网络安全
    共 70 条
  • 1
  • 2
  • 3
  • 7
  • 请选择