本节摘要:生成是大模型的看家本领——写作、文案、翻译、摘要都是"文本进文本出"的基础应用,也是多数团队接入大技术的第一站。本节讲生成参数(温度、top-p)的机制与调法、大模型翻译的强项与低资源语言的坑、摘要的两种模式与长度控制,最后覆盖所有生成场景的共同敌人:幻觉的分层防御。
阅读完本节,你应当能够:
5.2 节说过模型每步输出的是概率分布,采样参数决定"从分布里怎么取词"——这是生成应用的第一层控制:
温度(temperature):缩放 logits 再 softmax。温度低于 1,分布变尖——高概率词更被偏爱,输出稳定、可预期;温度高于 1,分布变平——低概率词有更多机会,输出多样、跳跃。直觉:温度调的是"保守程度"。
top-p(核采样):只从累计概率达到 p 的最小候选集合里采样,动态截断——本步分布本来就集中(下一词很明确)时候选少,分布平(下一词很多选择)时候选多。比固定取前 k 个(top-k)更自适应,常与温度配合使用。
停止条件与最大长度:控制生成边界——遇到特定标记(如结尾符号、指定的分隔符)停止;最大长度兜底防失控。
按任务的参数起点(工程经验值,以此为基线再调):
| 任务 | 温度 | top-p | 理由 |
|---|---|---|---|
| 事实问答 / 代码 | 0~0.3 | 0.9 | 要稳定可复现,不要发挥 |
| 摘要 / 改写 | 0.3~0.6 | 0.9 | 忠实原文为主,允许措辞变化 |
| 营销文案 / 创意 | 0.7~1.0 | 0.95 | 要多样性与新鲜感 |
⚠️ 参数坑两条:其一,温度接近 0 仍不等于完全确定(浮点与批处理仍有微小波动),对"必须逐字一致"的需求要固定输出或走模板;其二,创意任务温度拉满易产出不通顺的"高热胡话"——多样性超出语言结构的约束范围。先从保守值起步,用第 8 章的评测集量化调整,别拍脑袋。
翻译曾是专用神经翻译系统(NMT)的领地,大模型入场后格局重写。三个结构性优势:
两个短板要心里有数:低资源语言(训练数据少的语种)质量仍不稳定,专业场景需要回译校验或换专用模型;超长文档的术语一致性会漂移(前后章同一术语译法不一),工程上靠术语表注入与分段翻译后统一校对来补。
实用模式是"翻译 + 后处理"的组合:模型翻译 → 规则检查术语一致性 → 关键文档人工抽检。把大模型当高水平的翻译初稿引擎,而不是终审。
摘要两种模式由来已久:
大模型时代,生成式成为默认选择——流畅度优势压倒性,忠实性风险改用工程手段控制:
长度控制。大模型对"摘要控制在 100 字"这类指令遵循不精确,且不同模型对"字"的理解不一。可靠做法是"先粗后精":先生成要点列表(可控性强),再按要点压缩成文;或生成后按长度二次裁剪。
要点覆盖。指示模型先列出原文的核心论点再压缩,比"直接摘要"的覆盖率明显更好——思维链在摘要场景的直接应用。
幻觉防御。摘要的幻觉形态是"概括性添加"——原文说"销量增长",摘要写成"销量大幅增长 40%"(数字是编的)。防御层:指令明确"不得添加原文没有的信息与数字";对含数字、引语、人名的摘要做事实核对(与原文比对或 LLM 裁判判忠实性,8.1 节的忠实性维度在此落地)。
所有生成类应用的共同敌人是幻觉,防御要分层搭:
第一层 · 源头:低温度、指令明确"不确定就说不确定"、few-shot 给"正确拒答"的示例 第二层 · 供给:事实类内容走 RAG(下节详解),把"回忆"变成"看着材料回答" 第三层 · 校验:关键字段(数字、日期、引用)与来源比对;LLM 裁判判忠实性 第四层 · 兜底:产品层设计——引用可点击溯源、免责声明、人工审核位(高风险内容)
一个务实的判断标准:幻觉的容忍度与错误的可发现性成反比。营销文案里一个夸张(用户能看出、后果轻)容忍度高;财报摘要里一个编造的数字(用户难发现、后果重)必须零容忍——后者的第四层兜底不可省略。
正常。温度大于 0 就是带随机的采样。需要可复现时用温度 0(近似确定)或用 API 的种子参数(若提供,也只近似)。产品演示前先固定输出,避免现场翻车。
三个手段按序尝试:指令里给硬约束("不超过三点,每点一行")加示例;提供"啰嗦扣分"的 few-shot 正反例;换对简洁性对齐更好的模型。多数情况第一条就见效——很多啰嗦其实是提示词没说清楚。
生成类批处理的要点:固定参数、每条输入结构化(字段化比自由文本稳)、抽样人工质检 + LLM 裁判全量评分(第 8.3 节漏斗管线)、失败自动重试。把生成当数据流水线管理,而不是一次性脚本。
生成类应用从"能跑"到"可上线",中间隔着一批产品化的细节。这份清单按用户旅程排列,逐条过关再上线:
输入侧:是否防住了超长输入(截断策略与提示)?是否处理了空输入与纯符号输入?多语言混合输入的表现测过吗?
生成侧:参数按任务定档并写进配置(而非每次手调);批量场景固定随机种子与输出;敏感词过滤在生成后立即执行。
输出侧:格式校验(要求 JSON 的地方真的合法吗);长度控制有兜底(截断要截在句子边界,不是硬切);失败重试策略(格式非法自动重试几次,仍失败给降级文案)。
体验侧:流式输出接好了吗;生成中断(用户关闭页面)有处理吗;历史记录与"重新生成"按钮——生成产品用户最常用的两个功能。
合规侧:AI 生成标识加上;版权与事实风险高的输出(新闻类、数据类)有人审位;用户数据不留存或脱敏的承诺与技术实现一致。
二十条里最容易被漏掉的是"降级文案"——生成总会偶发失败,用户看到一个报错还是一个礼貌的兜底回复,直接决定产品的可信度。把失败当成正常路径来设计,是生成类应用成熟度的分水岭。
生成类产品常遇到"指标都好、用户就是不满意"的错位。根源在于自动指标测的是可量化维度(格式、长度、要点覆盖),而用户的不满常来自机测盲区:语气生硬、节奏单调、形容词空洞、"正确的废话"。弥合办法:定期做"人感对照"——同一批输出,人工按"你会转发这段话吗"的朴素标准排序,再与机测分数对照,找出排名严重背离的样本,分析其共性并补进检查清单。生成产品的护城河,往往就在这批被反复打磨的人感细节里。
两个机制叠加:其一,长文本的注意力稀释——写到后段,开头的关键约束(人物设定、格式要求)在上下文里的相对权重下降,模型"忘了"前面的要求;其二,错误累积——前文的瑕疵成为后文的条件,越写越偏。对策:关键约束在提示词中重复强调并要求生成前先列大纲(把长任务拆成受控的短任务);或在长任务中途让模型复述关键设定做自检。理解这个规律,就理解了长文生成产品的"分段生成再拼接"设计。
三层治理框架:技术层,用查重工具比对输出与训练语料及全网内容,高重合触发审查;产品层,明确标注 AI 生成、对高风险用途(学术、新闻)加提示与限制;法务层,跟进所在司法辖区的生成内容规则。目前行业共识是"AI 生成内容可版权性存疑、责任在使用者",把这句话写进产品条款,能挡掉大部分未来的纠纷。
模型能力趋同后,竞争点沿三处迁移:数据与风格的私有性(你的应用是否长出了独一无二的语料与审美)、场景理解的深度(对用户真实意图的把握,而非泛泛而谈)、交付的可靠性(校验与兜底的工程质量)。三处都不是"更强的模型"能直接给的——这也解释了为什么生成类产品的头部,往往是深耕场景的公司而非模型厂商。你的护城河在场外,这个认知越早建立越好。
单纯的生成够用了,但企业落地真正要的是"用我的知识回答"——下一节讲 RAG 与对话、抽取、代码这些架构级应用。