SwarmBench评估大模型作为Agent集群编排器能力
原文:SwarmBench: Can Large Language Models Act as Agent Swarm Orchestrators?
基于大语言模型的多智能体系统正从固定交互拓扑向动态编排的智能体集群演进。然而,现有基准大多基于单智能体或通用智能体任务,难以系统性评估关键的编排能力。我们提出 SwarmBench,一个从准确性、效率、成本和过程质量等多个视角评估模型性能的基准。实验结果表明,当前模型在编排能力上存在显著差异。这些差异不仅体现在最终的准确性、效率和成本上,还体现在编排过程本身的整体质量上。基于这些发现,我们进一步提出 SwarmExp,一种基于经验提取与经验回放的简单而有效的方法,能够持续提升大语言模型的编排性能。作者:Jinshan Gao, Zhuoran Jin, Tianyi Men, Kang Liu, Jun Zhao 分类:cs.CL