kp-021 进阶 30 分钟 失败与鲁棒性

级联错误的量化:错误传播模型与可靠性设计

#公式 #级联错误 #可靠性 #验证器

前置知识

一句话定义

级联错误可用「逐步错误率 + 验证器检出率」的乘法模型定量刻画:L 步链路的全对率为 (1-p)^L,在级联点加装检出率 q 的验证器后有效错误率降为 p(1-q)——由此推出多智能体可靠性的第一设计原则:缩短不可验证的跳数,把验证器放在错误率最高、代价最大的级联点上。

直观类比

传话游戏:十个人逐个传一句话,第一个人说「买八斤苹果」,传到最后变成「拔八斤芒果」。每传一次都有走样概率;如果在第五个人那里对一遍原文(验证器),走样会被拦住重传。

为什么重要

kp-004 给了级联的基础公式,本知识点把它升级为带验证器的完整模型并推导出可操作的设计规则。它解释了大量经验观察:为什么五智能体流水线比三智能体更容易烂尾;为什么「每个阶段加一次检查」的效果远大于「最后统一检查」;为什么缩短链路往往比换更强的模型更划算(复合系统的 Scaling Laws 研究亦印证:级联级数是复合系统可靠性的主导变量)。

前置知识

kp-004 模型二(P_ok = (1-p)^L);kp-020(级联错误的症状学)。概率要求:独立事件乘法。

核心概念、原理与机制(含公式推导)

基础模型:链路 L 步,每步引入不可检出错误的概率 p(步间独立),全对率:

P_ok(L) = (1 - p)^L

数值表(全对率):

L \ p0.020.050.10
30.9410.8570.729
50.9040.7740.590
100.8170.5990.349

加验证器模型:在若干级联点加装验证器,检出率 q(发现错误并触发重做/修正的比例),漏检率 (1-q),则被验证覆盖的步骤有效错误率:

p_eff = p · (1 - q)

推导:步骤出错概率 p;验证器独立地以 q 的概率检出并拦截;错误「漏网」需两个独立事件同时发生——出错且未检出——概率 p(1-q)。代入:p = 0.05、q = 0.8 → p_eff = 0.01,十步链全对率从 0.599 提升到 (0.99)^10 ≈ 0.904。

设计推论(按性价比排序):

  1. 减 L 优先:p_eff 从 0.05 降到 0.01 与「砍掉一半步数」效果相当,且砍步骤还省 token;
  2. 验证器放级联点:每段之后放,而不是终点放一次——终点验证只能拦截、不能阻止污染已扩散的下游计算;
  3. q 的边际递减:q 从 0.8 到 0.95,p_eff 从 0.01 降到 0.0025,但 LLM 级验证器的成本近似翻倍——先用廉价断言把 q 抬到 0.6–0.8,再考虑加 LLM judge;
  4. 相关性折损:步间错误不独立(同一模型同源偏置)时,实际 P_ok 低于公式值,模型给出的是乐观上界。

图示

无验证:  A ──p=5%──▶ B ──5%──▶ C ──5%──▶ … ×10   P_ok = 0.95^10 ≈ 60%
有验证:  A ─▶[断言 q=0.7]─▶ B ─▶[LLM judge q=0.85]─▶ C ─▶ … ×10
         p_eff = 0.015 / 0.0075            P_ok ≈ 88%–92%
                   ↑ 检出 → 就地重做(有限次), 不让错误过河

实例或案例

翻译流水线(翻译 → 术语审校 → 排版 → 抽检):实测 p ≈ 0.08(术语用错率)。方案一:终点加一次 LLM 全文校对(q = 0.6,作用于最后一跳)→ 全链 p_eff ≈ 0.032。方案二:每跳后加术语一致性断言(q = 0.75,廉价)覆盖全部三跳 → 每跳 p_eff = 0.02。方案二质量更高且更便宜——位置与覆盖比验证器强度更重要。

常见误区

  • 误区一:在链路终点做一次「终极校验」就安全。 终点验证拦住了错误交付,但拦不住中途已被污染的计算与浪费的成本;验证必须前置到级联点;
  • 误区二:换最强模型可以替代验证。 p 从 0.05 降到 0.03 的收益(0.95^10 → 0.97^10 ≈ 0.74)不如一个 q = 0.8 的廉价验证器(≈ 0.90),且成本更高;
  • 误区三:公式给出精确预测。 p 与 q 都是估计值且错误相关时公式偏乐观——把它当设计罗盘而非精密仪表(真值靠 kp-024 的实测)。

与其他知识点的关系

验证器的分级实现(断言 → LLM judge → 人工)在 kp-022;本模型的实测校准依赖 kp-024 的组件级评估;流水线(kp-007)是本模型最直接的应用场景。

自测题

  1. 推导「验证器把有效错误率降为 p(1-q)」。

要点:错误需同时满足「步骤出错(p)」与「未被检出(1-q)」,两事件独立,概率相乘。

  1. p = 0.05,十步链:无验证与加 q = 0.8 验证器后的全对率各是多少?

要点:0.599;p_eff = 0.01,0.99^10 ≈ 0.904。

  1. 为什么「减步数」通常比「换更强模型」性价比更高?

要点:减 L 同时降低错误概率与成本;换模型只小幅降 p 且全线涨价,公式显示 L 的杠杆更长。

延伸阅读

Chen 等人关于复合推理系统 Scaling Laws 的论文从另一角度印证级联级数对系统质量的主导作用。

相关知识点

学习状态:
未学