多智能体评估框架:轨迹、任务与协作质量的三层指标
前置知识
一句话定义
多智能体评估在三个层面展开——组件层(单个智能体是否合格)、协作层(分解、交接、聚合这些机制是否高质量)、端到端层(任务成功率、成本与延迟)——以固定的金标准集加 LLM-as-Judge 与消融实验为主要方法,把「感觉变好了」替换为可比的数字。
直观类比
评估一支球队不能只看比分(端到端),还要看每个球员的传球成功率(组件)与整体战术执行(协作);而且要在固定对手(金标准集)和固定场地(固定输入)下比,否则每场都「感觉踢得不错」。
为什么重要
没有评估的多智能体开发是开环驾驶:每次调提示词、加智能体、换框架都在凭感觉下注。更隐蔽的是反直觉结论的发现依赖评估——例如复杂协作模式未必跑赢同预算的群体投票基线(kp-009),只有消融实验能揭示「这个主管到底贡献了什么」。评估也是 kp-021 模型参数(p、q)的唯一实测来源。
前置知识
kp-020(失败类型——评估指标与其对位);kp-009(投票基线——消融的对照组)。
核心概念:三层指标体系
组件层(对每个角色单独考):验收遵循率(输出通过该角色契约断言的比例)、单角色任务成功率(喂固定子任务样本)。协作层(机制的中间质量):分解合理率(子任务覆盖目标且不重叠,judge 按 Rubric 评)、交接完整率(交接包必填字段齐备率)、聚合一致率、通信冗余比(智能体间消息 token / 有效产出 token)。端到端层(对外承诺):任务成功率(金标准集上的通过率)、首次通过率(无重试一次过)、平均修正轮数、每任务成本(token 与费用)、关键路径延迟(P50/P95)。
原理与机制
金标准集的构建:20–100 条覆盖典型与边界场景的任务(含 kp-020 七类失败的历史样本),固定输入、明确验收断言;它比「真实流量随便试」贵得多但唯一可信。评估方法三件套:(1) 断言优先——能用确定性断言(格式、引用、数值范围)的指标绝不交给模型判;(2) LLM-as-Judge 处理语义维度——按 Rubric 打分,须防三类已知偏差:位置偏差(偏好特定位置的答案)、长度偏差(偏好长答案)、自我偏好(偏好自己生成的内容),缓解手段是交换位置取均值、限定评分维度、judge 与被评者不同源;(3) 消融实验回答结构性问题——移除某智能体或替换为直连调用,看端到端指标的边际变化:边际为零的角色应被砍掉,整体跑不赢同预算投票基线的模式应被质疑(kp-011 反模式的量化检测)。非确定性的处理:每条样本跑 k 次(如 k = 5)取均值与方差;只报均值不报方差的多智能体评估基本不可信。
图示
组件层 协作层 端到端层
验收遵循率 分解合理率·交接完整率 任务成功率
单角色成功 聚合一致率·通信冗余比 成本·延迟(P95)
▲ ▲ ▲
方法: 断言 · judge(Rubric/防偏差) · 消融(vs 同预算投票基线)
协议: 金标准集(20-100条) × k次重复 → 均值±方差实例或案例
给 kp-006 的报告系统建评估:金标准集 30 个研究任务;组件层给检索工人 50 条固定检索子任务测验收遵循率;协作层用 judge 给 30 份「分解方案」按覆盖度 Rubric 打分,同时统计交接包字段齐备率;端到端层记录成功率与每任务成本。上线前的一次消融发现:去掉「精简主管」(改为代码固定分解)成功率持平而成本降 28%——这个智能体被移除,换成确定性分解。没有评估,这个「看起来有用」的角色会一直烧钱。
公式或模型
成功率报告:â = m/k(k 次中 m 次通过),标准误 σ = √(â(1-â)/k);k = 5、â = 0.8 时 σ ≈ 0.18——即 80% ± 18%,这就是「为什么小样本评估必须报区间、为什么不跑重复的对比结论都不可靠」的定量理由。成本效率:每任务成本 C 与成功率 S 的比值 C/S 用于跨方案比较(同预算投票基线是默认对照组)。
常见误区
- 误区一:只评端到端。 端到端失败无法归因,三层缺一不可(协作层指标直接对接 kp-023 的定位);
- 误区二:judge 直接打分不设防。 不控制三类偏差的 judge 分数噪声大于信号;
- 误区三:跑一遍就下结论。 非确定性下 k = 1 的差异大概率是噪声,必须重复并报方差。
与其他知识点的关系
组件层评估校准 kp-021 的 p 与 q;消融对照组来自 kp-009;评估产生的持续运行数据流是 kp-025 看板的数据源;评估集是 kp-028 生产化的第一道基建。
自测题
- 三层指标各举两例,并说明为何端到端层无法替代前两层。
要点:组件(验收遵循率/单角色成功率)、协作(分解合理率/通信冗余比)、端到端(成功率/成本);端到端失败无法归因到机制。
- LLM-as-Judge 的三类偏差与缓解?
要点:位置(交换位置取均值)、长度(限定维度按 Rubric 评分)、自我偏好(judge 与被评对象不同源)。
- k = 5 次评估得到 80% 成功率,如何报告与解读?
要点:80% ± 18%(标准误约 0.18);区间过宽,需加样本或加重复次数才能支持方案比较。
延伸阅读
Zheng 等人的 MT-Bench 论文系统论述了 LLM-as-Judge 的偏差与缓解,是 judge 方法的标准参考。