由大语言模型驱动的多智能体系统通过预定义的交互拓扑结构来协调专业化智能体之间的协作,已在竞赛级代码生成等复杂任务中展现出巨大潜力。

最新研究表明,通过精心设计的多智能体工作流与通信图谱,能够借助协同推理机制显著提升代码生成性能。然而现有方法既未能根据任务难度动态调整拓扑密度,也未能在单个任务实例中利用执行反馈迭代优化拓扑结构,导致通信冗余与性能瓶颈。

为解决上述问题,我们提出AgentConductor——一种以基于大语言模型的编排智能体为核心的强化学习优化多智能体系统,能够实现端到端的、基于反馈的交互拓扑动态生成机制。针对每个查询请求,AgentConductor首先推断智能体角色与任务难度,随后构建适应任务需求的、密度感知的分层有向无环图拓扑结构。

其核心创新体现在两个方面:其一,我们设计了新型拓扑密度函数,实现了对多智能体交互过程的通信感知数学表征;其二,采用难度区间划分策略,通过精准界定各难度层级的拓扑密度上界实现细粒度调控,避免过度剪枝。实验结果表明,在三个竞赛级与两个基础代码数据集上,AgentConductor取得了最先进的准确率,在pass@1准确率上最高超越最强基线14.6%,同时实现13%的密度降低与68%的令牌成本缩减。

更多推荐