本节摘要:营销文案、行业报告、垂直领域助手——这一类任务的共同点是评价主观、风格重要、知识专属。本节讲主观任务的指标设计(双裁判加风格锚点)、领域知识的三种注入方式(示范、检索、微调)及其选型决策,以及把领域专家经验转成编译原料的工作流。
内容创作任务的编译难点不在"写得出来",在"说不出什么叫好"。手工时代的解法是找一位资深编辑把关——这正是编译范式要转译的对象:把关人的标准必须显式化为指标,把关过程必须转化为可搜索的信号。转译的第一步是拆解"好"的维度:营销文案的好,通常包含转化要素齐备(卖点、行动号召)、风格符合品牌调性、事实准确(不得虚构产品参数);行业报告的好,包含结构完整、数据有出处、结论克制。每个维度请领域专家用一句话描述判断标准,这句话就是裁判签名的雏形——领域专家不需要懂任何框架技术,他们只需要回答"你审稿时看什么",而这恰恰是他们最擅长的事。
主观任务指标的实操形态是"多裁判加权加硬约束":
class BrandToneJudge(dspy.Signature): """判断文案是否符合品牌调性:专业但亲切,避免夸张用语。""" brand_guideline = dspy.InputField(desc="品牌调性说明") copy_text = dspy.InputField() on_tone = dspy.OutputField(desc="1 到 5 的整数评分") class ConversionCheck(dspy.Signature): """检查营销文案的转化要素是否齐备。""" copy_text = dspy.InputField() has_hook = dspy.OutputField(desc="开头是否有抓注意力的钩子:true/false") has_cta = dspy.OutputField(desc="是否有明确行动号召:true/false") tone_judge = dspy.Predict(BrandToneJudge) conv_check = dspy.Predict(ConversionCheck) def copy_metric(pred, example, trace=None): tone = int(tone_judge(brand_guideline=example.guideline, copy_text=pred.copy).on_tone) conv = conv_check(copy_text=pred.copy) hard_ok = conv.has_hook == "true" and conv.has_cta == "true" return (tone / 5.0) * (1.0 if hard_ok else 0.3)
结构上的三个要点:调性裁判给连续分(主观看程度),要素检查给硬门(转化要素缺一个就重创得分,硬约束编码业务底线);品牌调性说明作为输入字段传给裁判而不是写死在签名里——同一个裁判服务多个品牌线,调性说明换成哪家的就用哪家的标准。裁判模型的纪律沿用 3.5 与 5.5 的规定:与生成模型异源,定期人工抽检对齐。
创作任务编译的一个特有现象值得记录:示范的风格传染性极强。自举示范会把"程序现有的风格"放大固化,如果起点文案风格就不对,自举只会把错误风格越滚越浓。所以创作任务的示范池应当手工参与构造——请编辑按品牌调性写几条"金标准示范",用 max_labeled_demos 主导示范池,自举只做补充。这与代码生成任务"自举为主"的配方恰好相反:裁判越硬,越信自举;裁判越软,越信人工锚点。
垂直领域落地(医疗文书辅助、法律合同初审、工业设备工单)的核心难题是领域知识从哪来。三种注入方式各有领地。方式一,示范注入:把领域专家处理过的真实案例(脱敏后)做成标注示范,编译后模型"看过怎么处理"——注入的是操作范式,成本最低,见效最快,适合专家经验主要是"手法"的领域。方式二,检索注入:领域文档库(规范、指南、案例库)进检索索引,程序按证据契约作答——注入的是事实与规则,适合知识密集、且知识更新频繁的领域,知识更新只是更新索引,无需重编译。方式三,权重注入(微调):BootstrapFinetune 把编译轨迹固化进开源模型权重——注入的是稳定性与成本优势,适合任务形态已完全固化、调用量大到小模型经济性显著的生产场景。
选型决策按两个问题走:知识是"手法"还是"事实"?事实类选检索(可更新),手法类选示范(可编译)。追加问题:调用规模是否支撑微调经济性?日均调用量上到可观规模、任务形态半年内不变,再考虑权重注入,否则前两者已够。三种方式不互斥——成熟的领域助手常常是"检索保事实、示范定手法、微调降成本"的组合拳,但组合应当从单一开始逐步叠加,每加一种都过一遍 5.1 的评估回路确认增量。
创作任务几乎必然走向人机协同,编译系统在其中的角色要摆正:它产出的是"结构合格、调性达标、事实有据"的初稿,编辑的精力从"从头写"转向"审核与润色"。工程上两个配套:初稿必须携带证据引用与置信字段(沿用问答任务的契约,编辑一眼知道哪些段落有据可查、哪些是模型发挥);编辑的修改结果回流为新的标注数据(改前改后对齐存储,定期入训练池重编译)——编辑的每一次润色都在训练系统,这才是协同的复利所在。
一个诚实的预期管理:主观任务的编译收益通常小于封闭任务——分数提升的空间与可测性都有限。它的真实价值在把"风格是否达标"从玄学变成可复核的评分,让编辑团队敢于把初稿权交给机器。
最后补一个领域落地的起步建议:不要试图一次性覆盖领域全貌。先选一个边界清晰、验收标准明确、事故代价可控的子任务(比如"辅助起草标准条款的回复函"而不是"处理一切法律文书"),把编译与评估回路完整跑通,再逐子任务外扩。领域信任是按子任务逐个挣来的,一次大而全的上线若在某个边角场景出丑,损失的信任要花数倍力气才能赢回——这与 6.5 节的灰度发布策略是同一套逻辑在领域维度的应用。