小米的HarnessX在任务中途重写了自己的AI架构——而较小的模型获益最大
随着企业AI代理承担越来越复杂、长期任务,其性能常常受限于连接主干大型语言模型与环境的软件支架——即其框架。
目前,背带大多是静态且手工制作的。改进它们大多是手动完成的,它们不会根据从环境中收集的执行数据自动改进。
为解决这一工程瓶颈,小米研究人员推出了HarnessX框架,将AI框架视为可组合对象,并自主应用代码改进。
在现实世界的企业应用中,这种自动化适应使人工智能系统能够动态调整以满足应用特定需求。实际测试显示,HarnessX在软件工程和网页交互等领域实现了显著的性能提升。
结果表明,扩展基础模型并非实现更强大人工智能的唯一途径——对于较小的模型,这甚至可能不是最佳选择。HarnessX 的线束演进在15个模型-基准组合中平均带来了+14.5%的性能提升;对于开放权重的Qwen3.5-9B,在具体规划任务中获得的提升达到+44%。
线束工程的挑战
在人工智能应用中,基础模型的能力高度依赖其周围的机束。线束作为操作层,将原始模型输出转换为结构化的可执行代理行为。它包括提示、外部工具集成、内存管理和控制流程,这些决定了人工智能系统如何观察环境、理清问题并采取行动。
随着企业代理承担更复杂、长远的工作流程,利用工程已成为人工智能开发的基础部分。尽管其重要性,束带开发仍远未成为成熟的工程学科,面临三大挑战。
首先,安全带是静态且手工设计的。任何基础模型的转变、新工具的引入或转向不同的运营领域,都需要定制的手动代码重写。传统背带缺乏能够自主学习和提升以往执行经验的机制。
其次,大多数现有线束存在建筑纠缠问题。它们紧密结合了提示模板、工具包装器、重试策略和内存管理,集中在同一条代码路径中。这种纠缠意味着调整一个组件可能会悄然破坏其他组件。试图在不同业务领域重复使用线束,往往会沦为原始代码复制,而非干净、模块化的组合。
第三,线束和基础模型在单独优化中进行。当工程师进行测试以改进线束时,生成的执行轨迹通常会被丢弃,而不是作为训练数据来改进模型。因此,模型升级并不会自然带来利用改进,形成瓶颈,团队无法充分捕捉代理运营数据的全部价值。
HarnessX:一个为人工智能智能体打造的自主铸造厂
HarnessX 通过研究人员称之为“统一束束铸造厂”的方式,解决了手工线束开发的工程瓶颈。
HarnessX 的核心创新是将束作为“一流对象”对待。在软件工程术语中,这意味着线束是一个独立可序列化、模块化且可替代的实体。通过将模型配置(即AI模型运行的哪种)与线束配置分离,工程师可以无缝切换、适应和演进脚手架,而无需动用底层模型。

HarnessX(来源:arXiv)
HarnessX 将代理行为拆分为不同的组成部分,如上下文汇编、内存管理、工具生态系统、控制流和可观察性。每一个具体行为都被实现为一个“处理器”,插入线束的精确生命周期钩子。这种模块化结构允许系统在不破坏周边流水线的情况下交换、添加或移除这些处理器。
为了自动化优化这一模块化结构,HarnessX 引入了 AEGIS,一种追踪驱动的进化引擎。AEGIS将束带适应框架为对束体不同符号组成部分的强化学习(RL)问题。
将利用器用优化框架为强化学习问题,引入了研究人员必须明确工程化应对的三种病态:
- 奖励黑客:系统可能会利用捷径来解决问题,而不是真正解决问题。
- 灾难性的遗忘:修复一个领域失败模式的编辑,可能会悄然破坏另一个领域已解决的工作流程。
- 探索不足:系统可能会对提示词进行小幅度的调整,而不是探索结构更优的工具配置。

(来源:arXiv)
为防止这些问题,AEGIS依赖全轨迹可观测性和四级流水线:
- 消化槽:将执行痕迹压缩为结构化摘要,以识别代理失败的地方。
- 规划师:分析这些摘要,使系统能够探索结构性变化,而不仅仅是局部提示的调整。
- 进化者:生成代码级的线束编辑和测试,确保部署前能正常运行。
- 评论家与门槛:批评者通过评估编辑以检测奖励黑客行为,而确定性门则拒绝任何会倒退已解决任务的更新,以防止灾难性遗忘。
HarnessX 进入了一个不断发展的自我提升型束体研究领域——但其区别在于束缚模型的共进化。
研究人员强调,单独优化任一组件最终都会遇到瓶颈。如果底层模型缺乏使用新工具的推理能力,仅进化束带就会触及脚手架天花板。如果线束从未提示模型使用其高级能力,仅训练模型就达到了训练信号上限。
HarnessX 将 Harness 演化与模型训练交织在一起。在线束尝试适应任务时生成的执行轨迹被转化为基础模型的强化学习信号。每当线束改进策略时,模型同时学习更好地利用这一新策略,突破传统AI代理开发的能力上限。

约束模型共进化(来源:arXiv)
HarnessX 通过交叉关系 GRPO(Group Relative Policy Optimization)实现了这种共演化。GRPO是用于训练推理模型(如DeepSeek-R1)的流行强化学习算法。
在微调模型时,交叉线束GRPO会将同一任务的执行轨迹在应用完全不同版本的线束上池化。这使得底层模型能够内化高层策略的转变,比如使用新的API端点或管理执行预算,而不仅仅是学习一些细微的提示表述变化。
HarnessX 在行业基准上的实际应用
为了验证 HarnessX 的实用性,研究人员在五个基准测试中进行了测试,包括软件工程、多轮客户服务对话、网页导航、开放式多步推理和具身规划。
他们把AI分成了两个角色。由Claude Opus 4.6驱动的“元代理”分析日志并编写代码以进化这些安全带。“任务代理”负责实际的工作流程运行。为了证明该框架与模型无关,他们在三个不同的工作模型上进行了测试:Claude Sonnet 4.6、GPT-5.4 和开权重的 Qwen3.5-9B。

HarnessX 在不改变底层模型的情况下提升代理在关键行业基准上的表现(来源:arXiv)
HarnessX与两种主要基线进行了比较。第一个是静态框架,代表了大多数企业今天部署人工智能的方式,使用手工打造的固定架构,配合基准测试特定的提示和工具。第二款是Claude Code SDK,这是一个代表单代理演化器的基线,用于测试复杂的四级AEGIS流水线是否优于单一语言模型迭代代码的表现。
动态进化线束可在同一基础模型上获得显著提升。HarnessX 在 15 种型号-基准组合中提升了 14 种性能。在所有测试中,线束的进化平均绝对性能提升为+14.5%。
最弱的型号从动态线带改进中获益最大。开放权重的Qwen3.5-9B在ALFWorld内在规划基准中性能提升了+44.0%,在软件工程领域SWE-bench Verified中提升了+18.2%。
共进化也被证明非常有效。当研究人员利用线束进化过程中生成的数据训练基础模型时,他们看到了额外+4.7%的平均性能提升。同时改进背带和模型可获得最高的上限。共演增益仅适用于开放权重模型。
实验中的轶事证据表明,HarnessX在为现实任务创建代理工具时解决了有害问题。例如,在GAIA多步推理基准测试中,任务代理持续失败,因为它用来抓取维基百科的无头浏览器工具在网站JavaScript密集的前端超时。HarnessX 分析了执行痕迹,诊断了错误,并编写了一个新工具,完全绕过浏览器,直接查询 MediaWiki API 获取明文。它把这个工具换到安全带上,立刻解锁了失败的任务。
在WebShop电子商务测试中,AI代理经常陷入分页循环,不断点击“下一页”,重新调整搜索,却从未承诺购买产品。HarnessX 不仅仅调整提示,还构建了一个顾问处理器,能检测代理何时重复导航操作。它向上下文注入警告,强制决策,修复循环行为并提升性能。
自动化线束工程的局限性
一个重要的警告是,系统目前依赖强大的模型作为元代理,重写束缚代码。在他们的实验中,研究人员依赖于像Claude Opus这样的封闭前沿模型。开放权重模型正在迅速改进,但它们作为元代理的能力尚未经过验证。
另一个值得考虑的限制是所用模型的固有能力。如果底层任务模型根本上过于薄弱,无法执行新工具所提出的复杂工作流,HarnessX 将无法提升代理的整体能力(研究人员在 SWE 工作台编码测试中观察到 Qwen3.5-9B 模型的表现)。
尽管存在这些局限,HarnessX 坚定地证明了线束工程——不仅仅是模型缩放——现在已成为从业者可以利用的杠杆。对于在复杂工作流程上运行较小开放权重模型的团队来说,这里的收益足够大,值得在采用更昂贵的前沿模型之前,先评估线束演进作为第一步。研究人员计划在未来的更新中发布该代码。
更多推荐


所有评论(0)