章节摘要:前四章把 laya「用对」,本章开始「调好」。官方诚实声明的另一面是:底座检查点 zero-shot 接近随机猜,价值在微调——对 laya 而言,微调不是进阶选项,而是把「形态正确」变成「能力可信」的必经工序。5.1 节拆 RLCD 训练循环:基于对比偏好信号更新决策头,讲清 laya 侧的三件事——偏好数据长什么样、训练循环怎么写(代码骨架)、为什么几百到几千条样本就能撬动一个 BERT 级检查点;概念背景在《Jev 决策编程》已有交代,本章不重复。5.2 节走官方微调 notebook 在 Kaggle 2×T4 免费 GPU 上的复现:环境准备、数据上传、会话时长与断点保存,不买卡也能上手(官方口径)。5.3 节复盘两个官方案例:typed-decisions 基准微调后 0.362 升到 0.766(官方口径)的提升从哪来;browser-agent 决策头怎么把「下一步点哪里」变成 choice 问题。微调让答案变对,概率变可信还要靠第 7 章校准。
微调在整条链路里的位置:从「会用」到「懂你」 第 3~4 章的 laya 第 5 章的 laya 第 7 章的 laya ┌──────────────────┐ ┌──────────────────────┐ ┌──────────────────┐ │ 底座检查点 │ RLCD │ 懂业务的检查点 │ 校准 │ 概率可信的检查点 │ │ zero-shot 近随机 │ ──────▶ │ 你的偏好数据注入决策头 │ ───▶ │ 温度重新拟合 │ │ 形态正确·能力存疑 │ (5.1) │ 答案对了·概率还未必准 │(7.1) │ 可挂置信门控 │ └──────────────────┘ └──────────────────────┘ └──────────────────┘ │ │ │ 5.2 官方 Kaggle 2×T4 notebook │ 5.3 两个官方案例复盘 ▼ ▼ 不买卡也能微调 0.362→0.766(官方口径)·browser-agent
一句话金句:laya 卖的不是开箱即用的判断力,而是「你的偏好数据加一块免费 GPU」就能炼出来的判断力。
(文字流程图)准备偏好数据 ──▶ RLCD 训练循环 ──▶ Kaggle 2×T4 上跑通 ──▶ 留出集验证提升 ──▶ 案例复盘校准预期 ──▶ 交棒第 7 章重新校准。
三节按序读:先懂训练循环本身,再借免费算力跑通一次,最后用官方案例校准自己的预期。
┌──────────────┐ 提供可运行的循环 ┌──────────────────┐ 提供参照系 ┌──────────────┐ │ 5.1 RLCD │ ──────────────────▶ │ 5.2 Kaggle │ ────────────────▶ │ 5.3 两个提升 │ │ 训练循环 │ │ 双 T4 复现 │ │ 案例复盘 │ └──────┬───────┘ └────────┬─────────┘ └──────┬───────┘ │ 数据格式是 notebook 的输入 │ 免费算力降低试错成本 │ 预期管理 ▼ ▼ ▼ 第 7 章 校准(微调后的概率必须重新温度拟合,不是自动可信的)