MAgent‑Eval:面向多智能体协作与博弈的大规模评测套件
MAgent‑Eval:面向多智能体协作与博弈的大规模评测套件arXiv编号:arXiv:2609.21325v1 [cs.AI]摘要多智能体系统包含协作、竞争博弈、混合动机交互,是大模型智能体重要研究方向,但目前缺少统一、大规模、场景丰富的标准化评测套件。本文提出MAgent‑Eval,一套面向大语言模型多智能体交互的大规模开源评测套件。数据集包含1200条完整多智能体交互实例,覆盖三大交互范式:纯协作、零和博弈、混合动机博弈;涵盖谈判、团队规划、密室逃脱、资源竞争、社会困境、道德权衡等12类现实世界场景。MAgent‑Eval设计分层评测指标:包含单智能体个体能力指标、交互过程指标、全局系统级指标;同时提供可复现运行脚手架、参考评判脚本、标准化评估流水线。在10个主流大模型上开展大规模评测;实验揭示:模型在单智能体任务上的性能不能直接迁移预测多智能体交互表现;博弈对抗场景下,强单基座模型仍然会出现策略误判、被对手诱导等问题。消融实验分析智能体数量、信息不对称、角色分配对交互结果的影响。整套数据集、运行脚手架、评判脚本全部开源。关键词多智能体;多智能体评测;博弈;协作;混合动机;大语言模型智能体目录引言相关工作MAgent‑Eval评测套件设计3.1 任务分类与场景3.2 实例构造流程3.3 交互环境脚手架3.4 分层完整指标体系3.4.1 个体智能体指标3.4.2 交互过程指标3.4.3 全局系统指标实验设置4.1 被测模型集合4.2 评测执行配置4.3 对比参考基线主实验结果5.1 不同交互范式下模型整体表现