← 返回信息流
产品 arXiv 论文 · Jinshan Gao, Zhuoran Jin, Tianyi Men, Kang Liu, Jun Zhao 2026-08-31 12:02 🔥 热度 5

SwarmBench:大语言模型能否胜任智能体集群编排者?

SwarmBench评估大模型作为Agent集群编排器能力

原文:SwarmBench: Can Large Language Models Act as Agent Swarm Orchestrators?

基于大语言模型的多智能体系统正从固定交互拓扑向动态编排的智能体集群演进。然而,现有基准大多基于单智能体或通用智能体任务,难以系统性评估关键的编排能力。我们提出 SwarmBench,一个从准确性、效率、成本和过程质量等多个视角评估模型性能的基准。实验结果表明,当前模型在编排能力上存在显著差异。这些差异不仅体现在最终的准确性、效率和成本上,还体现在编排过程本身的整体质量上。基于这些发现,我们进一步提出 SwarmExp,一种基于经验提取与经验回放的简单而有效的方法,能够持续提升大语言模型的编排性能。作者:Jinshan Gao, Zhuoran Jin, Tianyi Men, Kang Liu, Jun Zhao 分类:cs.CL

查看原文 ↗ 技术论文Agent

📌 相关阅读

【开源】Player-YN/PawWork_ZhuaZhua:Paw Work——面向 Chrome 的“先选中”网页代理 热度 10 自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 热度 9 [开源] ashutoshsinghpr7/wikiskill:Hermes Agent 的 WikiSkill(arXiv:2608.27454)——通过持久化知识维基实现自进化智能体技能 热度 9 AIVC只是前菜!复旦提出生命算子,统一生命建模 热度 9 125-基于深度学习的黄瓜病害识别系统-yolo11(附赠任务书、开题报告模板课程) 热度 8