9.1 深度学习革命:从神经网络到大模型
本节摘要:人工智能的历史是一条两落三起的曲线:1956 年达特茅斯会议命名(麦卡锡等人发起,史料),1958 年感知机引来第一轮狂热;1970 年代与 1980 年代末两度因承诺落空跌入寒冬(学术通说);1997 年"深蓝"靠搜索而非学习赢棋,恰与人工神经网络的低谷同期。转机来自三要素的会师:游戏产业养出的并行显卡(2007 年通用计算接口开放,史料)、互联网沉淀的标注数据(2009 年李飞飞团队建成大规模图像数据集,史料)、以及坚持下来的少数研究者(1986 年辛顿等人复兴反向传播算法,史料)。2012 年深度网络在图像识别竞赛中将错误率一举拉低十个百分点(史料),2016 年围棋(史料),2017 年注意力架构(史料)统一了自然语言处理,2020 年千亿参数模型显现"规模定律"(史料),2022 年 11 月 30 日对话大模型上线,两个月用户破亿(学术估计)——人工智能第一次成为大众日用品。本节同时清点这场革命的账单:算力、能耗与数据,并记录开放权重与科学发现两条支线。
学习目标
- 复述人工智能两落三起的关键节点,并解释两次寒冬的成因;
- 说明"三要素会师"的具体内容与"为什么是 2010 年代";
- 解释注意力架构与大模型各自解决了什么瓶颈;
- 概述开放权重生态与中国的"百模大战",并说明"涌现"之争的两种口径;
- 说出这场革命在能源尺与材料尺上的账单(训练耗电、先进封装)。
一、时代之问
第 8 章结束时,互联网把人类知识搬上网,但机器只会"存"与"找",不会"懂"与"写"。
- 信息尺的旧瓶颈:筛选靠人工编辑,后来靠点击投票(搜索)——但理解语言的机器仍不存在;图灵 1950 年之问(史料)悬置半个世纪;
- 规则路线的天花板:1970—1980 年代"专家系统"把人类规则写成代码,在医疗诊断等窄域见效,却无法穷尽常识——1987 年专用硬件市场崩盘(史料),日本"第五代计算机"计划未达目标(史料);
- 连接主义的长夜:模拟神经网络的路线 1958 年就有样机(罗森布拉特的感知机,史料),1969 年被明斯基等指出单层局限(史料)、此后长期缺算力缺数据。
时代之问:**机器能不能不从规则学起,而是像孩子一样,从海量例子里自己学?**这个问题的答案要等三样东西同时到位。
二、关键技术群
1. 深度神经网络——让特征自己长出来
- 原理一句话:堆叠多层简单单元,逐层把原始数据(像素、音素)提炼成抽象特征——过去靠工程师手工设计的"特征",改为从数据中自动学习。
- 关键事实:1986 年反向传播算法让多层网络可以训练(史料);1989 年杨立昆的卷积网络已能识别手写邮编(史料)——但彼时算力与数据均不足;2012 年八层网络在图像竞赛中夺冠,错误率从约百分之二十六降至约百分之十五(史料),深度学习时代开场。
- 为什么是那时:训练用了两块游戏显卡(史料)——游戏产业三十年替人工智能付了算力的学费,"为什么是那时"的答案常常藏在另一个产业的钱包里。
2. 注意力架构——并行压倒串行
- 原理一句话:让序列中每个位置直接"注意"所有其他位置,取代逐词传递的旧结构——训练可以大规模并行,正合显卡的胃口。
- 关键事实:2017 年 6 月论文发表(史料,题目直译"注意力就是你所需要的一切");此后它统一了机器翻译、语音与图像的建模方式,成为大模型的标准底座;
- 深远意义:一次架构红利吃足十年——第 9.3 节"范式转移"的当代样本。
3. 大模型与规模定律——越大越能,直到拐点之辩
- 原理一句话:在海量文本上预测下一个词,规模(参数、数据、算力)按比例扩大,能力大体沿幂律上升(2020 年实证化,史料);再以人类反馈微调对齐意图(史料)。
- 关键事实:2020 年千亿参数模型展示少样本能力(史料);2022 年 11 月对话产品上线,两个月用户约一亿(学术估计);2023 年起多模态(图文音视)与长上下文渐次标配(史料);
- "涌现"之争(并列):一方认为规模跨过阈值会突现新能力,另一方认为"涌现"是度量方式造成的假象(2023 年起公开论战,学术)——本教程并列两说,读者以可复现实验为准。
4. 开放权重与"百模大战"——扩散的双轨
- 关键事实:2023 年起多个开放权重模型相继发布(史料);中国团队成为开放生态的主力之一,2025 年初的开放权重推理模型引发全球关注(史料,论文发表于学术期刊);截至 2026,开放权重与封闭前沿的性能差距已缩短到"以月计"(学术机构的追踪估计);
- 结构判断:半导体时代的"军用先行、民用跟进"变成了"前沿封闭、开放追赶"——扩散速度更快,规制的窗口更短。
5. 人工智能用于科学——实验室的新同事
- 关键事实:2020 年蛋白质结构预测在评估中达到实用精度(史料),2022 年两亿多个预测结构开放数据库(史料);2024 年诺贝尔物理学奖授予神经网络先驱辛顿等人,化学奖授予哈萨比斯、江珀等蛋白质预测团队(史料);
- 意义:信息尺的跃迁第一次直接反哺材料尺与生命科学——三把尺子开始互相加速(第 9.3 节"新循环"的名字由此而来)。
三、加速器与瓶颈
加速器:
- 算力的商品化:云厂商把上万颗加速芯片攒成集群出租——大科学(曼哈顿式)与车库革命(个人计算机式)第一次合流;
- 开源工具链:深度学习框架 2015 年起开源(史料),一篇论文几天内就能被全球复现——第 7 章开源运动的最高回报;
- 竞赛与资本:图像竞赛、棋类对弈与产品用户数的军备竞赛,把人才与资金吸入同一条赛道;动手实践的门槛也随开放生态下降——本站《大模型微调与参数训练》等文集即沿这条线展开,供读者从原理走向操作。
瓶颈:
- 能耗与碳账单:训练一个大模型耗电以吉瓦时计(学术量级),推理的累计成本更高——数据中心用电进入各国电网规划(第 9.3 节展开);
- 数据的边际:高质量公开语料趋紧,版权与授权诉讼增多(2023 年起多起,史料)——"数据燃料"从免费沉积物变成需谈判的资产;
- 可靠性:模型会"一本正经地胡说"(幻觉),对齐与可解释性仍是开放研究问题(学术共识表述);
- 制度滞后:训练数据版权、生成内容标识、责任归属的规则在各国仍处拼图状态(第 9.2 节)。
四、社会结构的改变
- 知识工作的范式震动:编程、写作、翻译、设计的"初稿"成本骤降——职业的重组已经开始,最终图景未有定论(本教程给判据不给结论,判据见第 9.2 节);
- 生产率悖论第三次挂账:第 4.1 节的规律再次应验——技术红利要等组织与流程重构后才能进入统计;截至 2026,多数行业仍处"搬上云"而非"围绕智能重构"的阶段(学术与业界通行判断);
- 教育重新出题:作业与考试的意义在"答案免费"的世界里被重写,各国教育系统开始转向过程评估(社会讨论框架);
- 治理的开局:中国 2023 年施行生成式人工智能管理暂行办法(史料),欧盟人工智能法 2024 年通过、分阶段生效(史料),首届国际人工智能安全峰会 2023 年在英国召开(史料)——大科学时代"核恐惧—制度回应"的剧本,以更快节奏重演;
- 中国的位置:从"百模大战"到应用落地,中国在模型数量、开源生态与行业渗透上居第一梯队,在最前沿芯片上受限(2022 年起出口管制,史料)——算力的地缘约束成为变量(学术与业界通行表述)。
五、留给下一时代的接力棒
- 会说的模型,交给下一节"会做的智能体"——从生成答案到完成任务,中间隔着可靠性、工具与责任三道坎(第 9.2 节);
- 能源账单——训练与推理的用电,与光伏、储能的降价曲线在同一时间轴上赛跑:再平衡的结局决定这个时代的高度(第 9.3 节);
- 材料账单——先进制程放缓后,产业以封装与堆叠续命,高带宽内存与三维集成成为新瓶颈点(第 9.3 节);
- 信任基建——生成内容水印、检索与溯源工具:信息尺的下一个工程学命题;
- 六条规律的试金石——本章现象是检验"加速律、范式转移、通用目的技术、互补性、瓶颈转移、重演律"的最好样本(第 9.3 节逐一对照)。
(本节三把尺子刻度,文字框图)
能源 ── 训练耗电吉瓦时级(学术量级),数据中心进入电网规划
信息 ── 生成边际成本坍塌:复制→检索→生成三级跳完成
材料 ── 硅的三维续命:先进封装·高带宽内存·三维堆叠(截至2026)
递出的尺子 ── 可靠性、能耗、数据产权、信任基建
已在望的下一卡 ── 从会说 到 会做:智能体与正在发生的未来
本节要点回顾
- 人工智能两落三起:命名(1956)—感知机热—第一次寒冬—专家系统—第二次寒冬—三要素会师;
- 三要素:显卡算力(游戏产业付账)、互联网数据(平台经济沉积)、算法耐心(反向传播一脉);
- 2012 年图像竞赛、2016 年围棋、2017 年注意力架构、2020 年规模定律、2022 年对话时刻——五级台阶;
- 开放权重与封闭前沿的差距以月计(截至 2026 的学术追踪);
- 三把尺子:能源=训练与推理耗电,信息=生成成本坍塌,材料=硅的三维续命;
- 接力棒:可靠性、能耗、数据产权、信任基建——全部指向下一节。
过渡:会聊天与会做事之间隔着一整个工程学:工具、记忆、长程规划与责任。截至 2026,这道工程题解到哪一步了?下一节给出进度与判据——以及本教程对"正在发生的历史"的处理方式:只记录,不预言。