kp-009 核心 25 分钟 角色与协作模式

群体模式与聚合策略:并行采样、投票与法定人数

#协作模式 #投票 #聚合 #self-consistency

前置知识

一句话定义

群体模式让 N 个(近似独立的)智能体对同一问题并行作答,再用聚合策略——多数投票、加权投票、法定人数或裁判合并——收敛出最终答案,用冗余换可靠性。

直观类比

气象台问「明天会不会下雨」,问一个预报员不如问十个再取多数;但如果十个预报员都看同一份过期的雷达图(相关性),多数也会一起错。

为什么重要

它是唯一「不需要设计协作过程」的增益手段:只要任务有可判定的答案,加机器就能提准确率(Self-Consistency 与《More Agents Is All You Need》的实证)。它也是评估其他模式的基线——任何复杂协作模式,都应先证明自己跑赢了同等成本的群体投票。

前置知识

kp-004(投票公式与独立性前提——本知识点是其工程展开)。

核心概念

  • 并行采样(Parallel Sampling):对同一问题以不同随机性/提示/模型并行生成 N 份答案(与 kp-019 的扇出机制配合);
  • 多数投票(Majority Vote):超过半数一致的选项胜出;
  • 法定人数(Quorum):要求至少 k/N 一致才采纳,k 可调高于简单多数以换取保守性;
  • 加权投票(Weighted Vote):按智能体历史准确率或置信度加权;
  • 裁判合并(Judge-Merge):生成型任务无法「选项投票」时,由裁判智能体从 N 份草稿中融合或择优。

原理与机制

适配性决定聚合方式。判别型任务(选择、判断、抽取)→ 答案空间有限 → 投票/法定人数直接可用,公式沿用 kp-004 模型一(多数投票成功率 = 二项分布右尾和,前提 p < 0.5 且近似独立)。生成型任务(写作、方案)→ 没有「相同答案」可比 → 投票失效,改用裁判合并:裁判按评审标准(kp-008 的 Rubric)对 N 稿评分择优,或取各稿之长合成终稿。规模效应:实证显示准确率随 N 近线性提升后饱和,饱和点由错误相关性决定;因此提升空间排序为「先降相关性(不同模型/不同检索源/不同提示框架),再加大 N」。成本结构:token 成本约 N 倍线性增长,而增益边际递减——N 通常取 3–7,再大性价比陡降;延迟因并行只增一个汇合等待(kp-019)。

图示

          ┌─ Agent1 ─┐
 问题 ────┼─ Agent2 ─┼─▶ 聚合器 ──────────────▶ 最终答案
          ├─ Agent3 ─┤   ├ 判别型: 多数投票 / 法定人数 k/N
          └─ …  N路  ─┘   └ 生成型: 裁判按Rubric评分合并
              ▲
              └ 独立性来源: 不同提示/温度/模型/检索上下文

实例或案例

数学竞赛题:单次思维链正确率 70%,Self-Consistency 采 10 条推理路径投票后升至约 85% 以上(按 kp-004 公式,p = 0.3、n = 10 的多数投票约 0.85)。工单分类任务:5 个分类智能体(其中 3 个用不同厂商模型打散相关性)投票,法定人数 k = 3;不足 3 票一致时降级为「转人工」,把分歧本身当成风险信号。

公式或模型

法定人数判定:若 ≥ k 个智能体给出同一答案则采纳,否则拒判。设单智能体答案为「多数正确」的分布,k 越高假阳性越少、拒判率越高。工程上把 (N, k) 当作精度-召回旋钮:高危操作取 (5, 4),普通任务取 (3, 2)。残留错误期望(K 个独立验证者场景)沿用 kp-008 的 E·Π(1-qⱼ)。

常见误区

  • 误区一:对生成型任务投票。 「三份不同的报告」之间没有可投的选项,强行按字面聚类投票会选出最平庸的中间稿;
  • 误区二:用同一提示复制 N 份就当群体。 完全同源的回答近似自采样,增益远低于公式预测;
  • 误区三:N 越大越好。 边际增益递减而成本线性,饱和后继续加 N 只烧钱。

与其他知识点的关系

扇出/汇合的工程实现(含部分失败处理)在 kp-019;投票收敛不了的高分歧是 kp-023 排错的重要线索;「先问是否跑赢同预算投票」是 kp-024 评估的关键消融项。

自测题

  1. 判别型与生成型任务的聚合策略为何不同?

要点:判别型答案空间有限可投票;生成型无可投选项,用裁判按 Rubric 评分合并。

  1. 为什么「打散相关性」优先于「加大 N」?

要点:相关错误使有效样本数 n_eff < N,公式增益坍缩;打散相关性才能让每个新增智能体贡献真实信息。

  1. (N=5, k=4) 的法定人数相比 (5,3) 改变了什么?

要点:更保守——假阳性更少、拒判(转人工/降级)率更高,适合高危操作。

延伸阅读

Wang 等的 Self-Consistency 论文给出投票在推理任务上的原始实证;Li 等的《More Agents Is All You Need》给出规模曲线。

相关知识点

学习状态:
未学