第 6 章 · 扩编与生态:走得更远 本章要回答的三个问题:同一个训练闭环,换上卷积和注意力机制能走到多远?训练过程本身怎么被记录、被诊断,而不是靠 print 碰运气?模型练成了,怎么交到别人手里?三个问题对应扩编的三个方向:更强的装备、更好的后勤、体面的移交。 为什么会有这一章 第 5 章末尾训练闭环已经完整,按理说远征可以结束了。但把这套骨架放进真实工作里,你马上会遇到三类新需求。其一,骨架上的层要升级:全连接换成卷积能看图像,加上注意力能读序列——机制不变,装备换代。其二,训练过程需要后勤:loss 曲线打印在终端里既没法回看也没法对比实验,你需要专业的行军日志。其三,终点不是"我训练好了",而是"别人用得上"——模型要导出成交换格式,交到没有 PyTorch 的运行时里去。
本章要回答的三个问题:同一个训练闭环,换上卷积和注意力机制能走到多远?训练过程本身怎么被记录、被诊断,而不是靠 print 碰运气?模型练成了,怎么交到别人手里?三个问题对应扩编的三个方向:更强的装备、更好的后勤、体面的移交。
第 5 章末尾训练闭环已经完整,按理说远征可以结束了。但把这套骨架放进真实工作里,你马上会遇到三类新需求。其一,骨架上的层要升级:全连接换成卷积能看图像,加上注意力能读序列——机制不变,装备换代。其二,训练过程需要后勤:loss 曲线打印在终端里既没法回看也没法对比实验,你需要专业的行军日志。其三,终点不是"我训练好了",而是"别人用得上"——模型要导出成交换格式,交到没有 PyTorch 的运行时里去。
本章前两节换装备(卷积与注意力),后三节配后勤(日志、体检、移交)。学完你会发现一件让人踏实的事:第 5 章那个训练循环一字不改,把这些新装备装进去照样跑——体系没变,变的是体系里的部件,这正是前五章坚持把机制讲透的回报。
本章知识点清单:
| 节 | 回答哪个问题 | 关键产出 |
|---|---|---|
| 6.1 卷积实战 | 闭环怎么跑视觉任务 | 升级版卷积模型与完整训练对照 |
| 6.2 序列与 Transformer | 闭环怎么读序列 | 注意力的最小实现 |
| 6.3 TensorBoard | 训练过程怎么被记录 | 可对比的实验面板 |
| 6.4 Profiler | 时间花在了哪里 | 瓶颈定位与提速决策 |
| 6.5 ONNX 移交 | 模型怎么交付 | 导出与数值验证流程 |
问:6.1 和 6.2 只讲卷积和注意力,够吗? 作为机制入口,够;作为技术全景,不够。但本册的策略是"一个机制讲透,而不是十个机制讲浅"——检测、分割、语音、强化学习都是这两类骨架加领域先验的组合,地图有了,岔路自己能走。原素材里各领域一节的篇幅,摊薄后每一处都只剩名词,不如在这里给你一把能撬动它们的钥匙。
问:TensorBoard 之外还要学别的日志工具吗? 换汤不换药。任何训练面板的核心都是"标量曲线、参数分布、实验对比"三件事,6.3 节按这三件事讲的纪律(标签规范、实验命名、记录频率)迁移到任何工具上都成立。工具会过时,纪律不会。
问:模型导出后 PyTorch 侧还要维护吗? 要,但职责分开了:训练侧继续用 PyTorch 迭代模型,部署侧只消费导出的产物。每次迭代重新走一遍 6.5 节的三步流程即可——把移交做成流水线,而不是每次上线都手忙脚乱。
本章是主干课程的终点,不是你学习路径的终点。卷积一节通向检测、分割等视觉进阶,注意力一节直接通向大语言模型时代的技术栈——查询、键、值三个词在如今几乎所有前沿模型里都是地基。后勤三节则伴随你的每一次真实实验。远征队的地图到这里画完了最后一站,但图上每一处岔路,都通向更大的疆域。