kp-020 进阶 25 分钟 失败与鲁棒性

失败模式分类:级联错误、循环、任务漂移与幻觉扩散

#失败模式 #分类 #排错

前置知识

一句话定义

多智能体系统的失败可归纳为七类可识别的模式——级联错误、循环不收敛、任务漂移、幻觉扩散、角色失效、资源失控、死锁/活锁;分类的价值在于每类有独特的症状、检测信号与首查位置,把排错从玄学变成检索。

直观类比

急诊分诊:胸痛、发烧、骨折各有不同的检查路径。把「系统跑出烂结果」这一个笼统症状拆成七种「病」,才能对症下药而不是给所有病都开止痛药(盲目重试)。

为什么重要

实证研究 MAST(Why Do Multi-Agent LLM Systems Fail?)对多家框架的真实运行失败做了系统归类,发现失败大量源于系统与组织设计(规范不清、交互错配、任务验证缺失)而非模型能力本身——这意味着分类学的价值极高:大多数失败是可预防、可检测、可归因的结构问题。本知识点是模块 05 的地图:kp-021 量化其中一类,kp-022 给通用防护,kp-023 给定位流程。

前置知识

kp-017(图编排——失败在节点与边上显形);kp-004(级联的概率视角)。

核心概念:七类失败对照表

失败模式症状检测信号首查位置
级联错误下游产物错,上游看似正常下游错误溯源到某个交接点;上游验收却通过交接包完整性(kp-012)
循环不收敛两个智能体反复互改同一产物相似度高的消息/调用重复出现,计数不降收敛判定权与轮数上限(kp-008/kp-017)
任务漂移产出「相关但不对题」当前动作与初始目标的相关性逐轮下降验收标准是否在上下文中被压缩掉(kp-015)
幻觉扩散编造事实成为「共识」多智能体引用同一无出处断言;引用编号查无此人幻觉源头的检索与引用断言(kp-008 批评者)
角色失效越权、漏做、风格错乱产物违反角色卡 schema;owner 字段错乱角色卡负面清单与工具白名单(kp-005)
资源失控费用/时长爆炸token 消耗曲线陡增;递归深度逼近上限预算与递归上限(kp-022/kp-017)
死锁/活锁系统停滞或空转等待环(A 等 B 等 A);无进展但有调用依赖图与仲裁权威(kp-011 反模式)

幻觉扩散值得单独强调:它是多智能体特有的放大器——单 Agent 的幻觉止于自己,而多智能体系统中一条无出处断言会被下游当作「已确认事实」引用,经两三跳后成为黑板上的「共识」。检测特征是引用断言的出处核验失败,防御是在黑板写入规则中强制「结论条目必须带证据指针」(kp-013)。

原理与机制

分类背后的三条结构性成因(与 MAST 的三大类对应):规范缺陷——角色卡与交接包没有把「做什么、什么算做好」说清楚(对应角色失效与级联);交互错配——协作结构选错或缺少仲裁(对应循环、死锁);验证缺失——没有阶段门、预算与终止兜底(对应漂移、资源失控)。因此预防的优先级是:把规范写进契约(kp-005/kp-012)→ 选对结构(kp-011)→ 配齐验证与预算(kp-022)。

实例或案例

一次典型的复合失败:写作智能体为凑字数编了一条市场数据(幻觉源头)→ 分析智能体把它画进图表(级联)→ 评审智能体看到「图表与文字一致」放行(验证缺失)→ 主管重派三轮仍未发现(循环 + 漂移),费用翻倍(资源失控)。七类失败在一条轨迹上串联——这也解释了为什么排错(kp-023)必须沿轨迹倒推找第一因,而不是修最后一个症状。

图示

 幻觉源          级联            验证缺失        循环+漂移      资源失控
 [写作编造] ──▶ [分析引用] ──▶ [评审放行] ──▶ [主管重派×3] ──▶ [费用×3]
    ▲                                                    │
    └────────────── 排错目标: 沿轨迹倒推找第一因 ◀──────────┘

常见误区

  • 误区一:把失败归咎于「模型不行」。 MAST 的实证指向系统设计;先查结构再怪模型;
  • 误区二:失败类型互斥。 实际轨迹常是复合失败,需找第一因;
  • 误区三:重试是万能药。 对循环与角色失效重试只会烧钱(持久性错误不可重试,见 kp-022)。

与其他知识点的关系

kp-021 对级联错误做定量建模与抑制设计;kp-022 的错误分级(瞬态/持久)与七类分类对接;kp-023 把本表用作排错的诊断字典。

自测题

  1. 说出七类失败中任意五类及其各自的检测信号。

要点:对照表——级联(下游错上游过)、循环(重复相似调用)、漂移(相关性下降)、幻觉扩散(出处核验失败)、角色失效(违反 schema)、资源失控(token 曲线陡增)、死锁活锁(等待环/空转)。

  1. 为什么幻觉扩散是「多智能体特有」的放大器?

要点:单 Agent 幻觉止于自身;多智能体把无出处断言当事实传递,两三跳后固化为共识。

  1. MAST 研究给出的三大结构性成因是什么?

要点:规范缺陷、交互错配、验证缺失——对应「契约、结构、验证」三条预防线。

延伸阅读

Cemri 等人的 MAST 论文提供了带标注的失败数据集与归类方法,是本分类最重要的实证来源。

相关知识点

学习状态:
未学