kp-028 前沿 30 分钟 框架与实践

工程实践:从原型到生产的关键清单

#工程实践 #生产化 #清单

前置知识

一句话定义

把多智能体原型推进到生产的路径是一条有序的检查清单:确认必要性 → 评估先行 → 最小闭环 → 契约固化 → 可靠性三件套 → 安全治理 → 可观测 → 灰度回归;顺序错了(比如先堆智能体后建评估)会把系统锁死在不可改进的状态。

直观类比

装修房子:先确认真的需要四室(必要性),再画图纸(评估标准),先装一个能住的主卧(最小闭环),水电走管要有图纸规范(契约),烟感喷淋不能省(可靠性),门锁分级(安全),装监控(可观测),最后分批入住(灰度)。先买十套家具再画图纸的房子没法住。

为什么重要

演示与生产之间隔着一条被低估的鸿沟:演示只需要「跑通一次」,生产要求「失败也有底线」。清单的价值在于顺序——评估先于迭代,契约先于规模化,可观测先于优化;跳步的项目典型死法是:五个智能体跑通演示后无法归因任何失败,因为既没有轨迹(kp-025)也没有测试集(kp-024),改哪里都是盲改。

前置知识

kp-027(框架已选定);kp-022(防护栏——清单的可靠性段落的实现件)。

核心概念:十条清单(按执行顺序)

  1. 确认必要性:过 kp-011 决策链,写出「为什么单 Agent 不够」的一句话论证——写不出来就别开工;
  2. 评估先行:在建第二个智能体之前先建金标准集与指标(kp-024),哪怕只有 10 条样本;
  3. 最小闭环:从两个智能体的最小协作开始,跑通「分解→执行→验收→终止」全环,再逐步加角色——每加一个角色都要有消融证据(kp-024);
  4. 契约固化:所有角色卡输出 schema 与交接包字段进版本管理(kp-005/kp-012),契约变更是变更评审事件;
  5. 可靠性三件套:检查点持久化、防护栏与预算、降级路径(kp-018/kp-022),上线前逐项验收;
  6. 安全治理:工具最小权限、高危操作审批门、注入消毒与可信边界(kp-026);
  7. 可观测上线:trace 埋点、成本看板、循环检测在开放流量之前就位(kp-025);
  8. 成本与容量:预算四层(kp-022)、限流、模型分级(贵模型只放关键节点);
  9. 灰度与回归:影子流量 → 小比例真实流量 → 全量;回归集随每次事故增长(kp-023 第 7 步的持续化);
  10. SOP 与文档:角色职责、交接契约、失败处置手册写成文档——多智能体系统的运维对象是「组织」,组织需要手册。

原理与机制

清单的顺序蕴含一条依赖律:后续步骤都以先前步骤为地基——没有评估(2)就无法判断加角色(3)的收益;没有契约(4)防护栏(5)就没有断言对象;没有可观测(7)灰度期的问题无法归因。反面教材模式(「先堆后补」)的机理是:智能体数量增长使组合空间爆炸,之后补建的每一项基建都要在更大的搜索空间上工作,成本超线性上升。另一条经验律:生产问题八成出在清单 4–7 段(契约、可靠性、安全、观测),而非模型能力——与 kp-020 引用的实证(失败主因是系统设计)一致。

图示

 必要性 ─▶ 评估先行 ─▶ 最小闭环 ─▶ 契约固化 ─▶ 可靠性三件套 ─▶ 安全治理 ─▶ 可观测 ─▶ 成本容量 ─▶ 灰度回归 ─▶ SOP
    ▲                                                                                    │
    └────────────── 事故/消融证据回流: 砍角色·改契约·加防护(持续循环) ◀──────────────────────┘

实例或案例

对照两组团队做同一个「研报生成系统」:A 组先搭五个智能体两周跑通演示,第三周开始被生产问题淹没——无评估无法证明改动有效,无 trace 无法定位失败,回炉补建耗时两月。B 组按清单走:第一周建评估集与两个智能体的最小闭环,第二周固化契约接防护栏与 trace,第三周灰度——第四周起每次迭代都有数据支撑,事故平均修复时间以小时计。两组写代码的时间相近,差距全在顺序。

公式或模型

本节不适用:清单是工程序而非数学对象;其量化支撑分散在各知识点(评估的区间估计 kp-024、防护的 q 配置 kp-021、成本归集 kp-025)。

常见误区

  • 误区一:演示通过 = 可以推广。 演示只验证了快乐路径(happy path),生产价值由失败路径的底线决定;
  • 误区二:一次上齐所有智能体。 无法归因单角色的边际贡献(消融失效),也无法逐步验证契约;
  • 误区三:文档最后再说。 多智能体的隐性知识(角色边界、交接约定)不落文档就会锁在个别开发者脑中,人员一走系统变黑箱。

与其他知识点的关系

本清单是全库工程线(kp-011/022/024/025/026)的总装序;每条清单项都回链到对应的机制知识点,清单负责「何时做」,机制知识点负责「怎么做」。

自测题

  1. 复述十条清单并指出哪两条最常被跳过。

要点:必要性/评估先行/最小闭环/契约固化/可靠性/安全/可观测/成本/灰度/SOP;最常被跳过的是「评估先行」与「确认必要性」。

  1. 为什么「评估先行」必须先于「加角色」?

要点:无基线则无法度量新角色的边际贡献,智能体数量增长后归因空间爆炸,补建成本超线性。

  1. 生产问题的主要来源区间在哪?依据是什么?

要点:清单 4–7 段(契约/可靠性/安全/观测);与 MAST 实证一致——失败主因是系统设计而非模型能力。

延伸阅读

Anthropic《Building Effective Agents》的部署建议段与本清单互补;团队内部的运维手册模板可直接以十条清单为骨架。

相关知识点

学习状态:
未学