本节摘要:生成式引擎优化(GEO)实施失败,多半不是模型不够新,而是把第五阶的形容词用在第零阶的系统上。五阶成熟度从手工作坊到自主演进,每一阶有必须具备的门禁、数据和协作方式。提示、评估集、规则库要像代码一样进持续集成;观测要能看到检索块和策略版本。跳阶等于无证驾驶。
阅读完本节,你应当能够:
传统软件把构建、测试、部署流水线化之后,才从作坊变成工厂。GEO 还要管数据、提示、检索索引、评估闸,手工打包一次 A/B,会在业务节奏里输掉,也会因人为疏漏出事。原文集把这称为超越代码交付的持续进化骨架。骨架不是集群浪漫,是把「感知-决策-执行」写进发布。
成熟度模型给出诊断语言,避免所有人自称「我们在做智能体」。原文集的五阶如下,我主张当硬门槛用,不当海报。
L0 初始混沌。 个人兴趣驱动的验证。输出不可复现,不接业务指标。GEO 还是玩具。
L1 基础可控。 有提示模板库,有基础安全过滤,接到一两个场景。评估靠人工抽检,没有自动指标,优化靠直觉。
L2 流程集成。 进了人机协作:草稿、润色、客服辅助。开始有上下文感知和对照实验,能说清对转化或停留的影响。
L3 智能优化。 行为数据能改提示或重排,甚至触发受控的参数高效更新。评估融合自动指标与业务指标,有对抗测试。系统开始主动参与体验,而不只是应答。
L4 自主演进。 能建议新场景,与推荐、投放协同,组织把生成当基础设施。人定义策略与价值校准。没有 L3 的闸,宣称 L4 是危险的修辞。
⚠️ 常见坑:把 L4 写进立项书的「三个月目标」。三个月能做的是 L1 到 L2,外加一条评估闸。
晋升条件要写成可检查,不要写成愿景。
| 从 | 到 | 硬条件 | 仍不准做 |
|---|---|---|---|
| L0 | L1 | 模板库、安全过滤、可复现配置 | 全流量自动学习 |
| L1 | L2 | 对照实验、至少一个业务指标、状态摘要 | 多助手无主状态 |
| L2 | L3 | 评估服务、归因日志、回滚开关 | 无闸的在线微调 |
| L3 | L4 | 跨系统协同接口、治理委员会、价值检查点 | 无人值守的高伤害任务 |
持续集成对 GEO 要扩展对象。代码之外:提示模板、规则库、评估集、检索索引版本。一次「只改了一句提示」也应跑静态门禁和仿真抽样。监控要能看:延迟、工具失败率、拦截率、引用覆盖、漂移。观测不是只看显存。原文集强调自省能力:系统要能说出自己刚走了哪条配方。
提交:提示或规则或代码 → 静态闸:格式、安全、对齐抽样 → 仿真:已知多轮脚本 → 影子流量 → 对照 → 全量或回滚
组织机制。L1 可以藏在小组。L2 必须有内容和法务的评审位。L3 必须有谁能按冻结按钮,按钮不能只在模型训练同事电脑上。这是治理,不是流程美学。
项目启动的精准锚定:选一个高价值、边界清晰、伤害可控的场景。内部政策问答优于公开医疗诊断。用 4.3 的「从解释已有材料起」。成功定义写 5.1 的最小看板,不写「全面智能化」。

统一工具链底座要打破数据、模型、应用孤岛:同一套标识看一次失败。提示存放不要散落在个人对话里。索引重建要有版本,能回滚到「上周还能引用正确政策」的状态。这些比选择哪家看板软件重要。
可观测性的最小集:请求标识、策略版本、检索块列表、工具返回码、评估三态、用户是否转人工。缺检索块列表,你无法修 4.1 的隐形;缺策略版本,你无法修 3.2 的过优化。
💡 关键直觉:成熟度晋升靠闸和复现,不靠模型参数变大。参数变大可以发生在任何一阶,闸不会因此自动出现。
不能。L1 的模板库和过滤非常便宜,跳过只是为了叙事。小团队更该用托管完成 L1,而不是用智能体叙事跳到 L3。
从 L2 起要。没有对照,你分不清季节因素和策略效果,长期反馈会改错目标函数。
「只改了一句提示」是线上事故的常见提交说明。提示必须进版本库,变更走和代码相同的闸:静态安全、必填引用抽样、已知多轮脚本。规则库同样。检索索引重建要能回滚到「上周还能引用正确政策」的版本,否则政策更新会变成不可逆伤害。评估集版本与生成版本成对出现,防止用新题夸旧模型或用旧题夸新模型。
观测最小集再列一遍,因为它比选哪家看板软件重要:请求标识、策略版本、检索块列表、工具返回码、评估三态、是否转人工。缺检索块,修不了内容隐形;缺策略版本,修不了过优化;缺工具码,会把超时伪造当幻觉。统一标识让数据、模型、应用孤岛能对上一次失败。提示不要散落在个人对话软件里,那是 L0 的标志,无论模型多大。
组织上,L2 必须有内容和法务评审位,L3 必须有冻结权不在训练同事个人电脑上。项目启动选高价值、边界清晰、伤害可控的场景:内部政策问答优于公开诊断。成功定义写 5.1 看板。对照实验从 L2 起是硬条件,没有对照,季节因素会冒充策略效果,长期反馈会改错目标函数。
小团队不能跳 L1。模板库和过滤非常便宜,跳过只为叙事。小团队更该用托管完成 L1,而不是用智能体叙事跳到 L3。参数变大可以发生在任何一阶,闸不会因此自动出现。把 L4 写进三个月立项书,是把事故写进日程。
用五阶给自己打分时,请对照硬条件而不是愿望。没有模板库和过滤就是第零阶,模型再大也是玩具。没有对照实验和业务指标不要自称第二阶。没有评估服务、归因日志和回滚开关不要自称第三阶。没有治理委员会和价值检查点不要自称第四阶。提示、规则库、评估集、索引版本都要进持续集成,「只改了一句提示」也要过闸。观测最小集缺一不可:请求标识、策略版本、检索块、工具返回码、评估三态、是否转人工。冻结按钮不能只在训练同事的电脑上。三个月目标最多走到第二阶外加一条闸。跳阶写进立项书,等于把事故写进日程。
实施方法论真正要防的是用第四阶的词描述第零阶的现场。请把当前系统按五个问题自检:提示是否在版本库;安全过滤是否在发布路径上而不是在演示里;有没有对照实验;日志能不能指到检索块;有没有人不在训练岗位也能冻结。五个「否」里占得越多,越应停止采购新模型。持续集成要把提示和评估集当作一等公民,改一句提示就跑已知多轮脚本,脚本里必须包含改口退货和请求法外例外。观测不是看显存曲线,是看一次差评能否在五分钟内定位到策略版本和材料版本。定位不了,成熟度就不该升。组织上,内容和法务进入评审不是走流程好看,是因为口径和违法承诺往往在这两侧被发现。立项只选一个伤害可控的场景,用解释已有材料当第一刀,成功标准写成引用覆盖和拦截次数,而不是全面智能化。小团队用托管走完第一阶完全正当,用智能体叙事跳阶完全不正当。
五问自检决定能不能买新模型。持续集成把提示和评估集当一等公民,改口退货和法外例外必须在脚本里。观测五分钟内定位策略版本和材料版本,定位不了不准升阶。内容和法务在评审位上是为了发现口径和违法承诺。立项第一刀解释已有材料,成功标准写覆盖和拦截。小团队托管走第一阶正当,智能体叙事跳阶不正当。第四阶词描述第零阶现场,是实施期最大的认知债。参数变大可以发生在任何一阶,闸不会因此出现。三个月目标最多第二阶加一条闸。跳阶写进立项,等于事故写进日程。运行手册写清谁能冻结,按钮不在训练岗位私有设备上。
五问自检决定能不能买模型。改口退货脚本必须在集成里。五分钟定位不了版本不准升阶。三个月最多第二阶加闸。冻结按钮不在私有设备。运行手册写清人名。跳阶等于把事故写进日程。内容和法务在场是为了抓住违法承诺,不是为了签字好看。
改口退货脚本必须绿。五分钟定位不了版本不准升阶。三个月最多第二阶加闸。冻结人名写进手册。法务在场为了抓住承诺句。跳阶就是把事故排进日历。提示改动与代码改动走同一闸,谁跳过谁回滚。
提示与代码走同一闸。谁跳过谁回滚。升阶前先演示五分钟定位。定位不了就留在本阶。手册里的冻结人名必须能按到按钮。
成熟度靠闸和复现晋升,不靠参数变大。提示改一句也要过已知改口脚本。脚本不绿不准放量。冻结人名必须能按到真实按钮。
下一节用陷阱和案例把「不要做什么」写死,并给多模态与智能体一个冷静的插入位置。