9.2 智能体与正在发生的未来
本节摘要:大模型解决了"会说",智能体要解决"会做":感知环境、拆解目标、调用工具、核对结果、记住教训——一个闭环。截至 2026 的进度可以概括为三条战线:软件侧,推理模型(2024 年起以长思维链换取准确率,史料)与工具调用标准接口(2024—2025 年间多种开放协议出现,史料)让"让模型操作电脑、写完整段代码、跑通实验流程"从演示变为日常工具,但长程任务的可靠率仍是工程瓶颈;身体侧,人形机器人在 2024—2025 年迎来资本与样机热潮("元年"是业界叙事,非定论),自动驾驶则经历了从承诺跳票到无人出租真正载客的二十年长跑(2016 年的乐观预言与 2020 年代初的落地节奏差了约五年,学术与业界复盘的通行结论);科学侧,人工智能已进入材料筛选、气象预报与数学证明的实验室。本节是全书唯一"正在发生"的时代卡:所有判断标注"截至 2026",本教程只给判据与边界,不给预言。
学习目标
- 说明智能体闭环(感知—规划—工具—核对—记忆)与聊天机器人的差别;
- 概述推理模型"以算力换准确率"的机制与代价;
- 复述具身智能与自动驾驶"截至 2026"的真实刻度(含过度承诺的教训);
- 列出判断智能体成熟度的四条判据(成功率、成本、责任、能耗);
- 说明"正在发生的历史"的读法:以可核验指标替代立场叙事。
一、时代之问
对话模型像一个博览群书却无法伸手的顾问:能写方案,不能提交方案;能诊断代码,不能上线系统。
- 答案与行动之间的鸿沟:现实任务是长链条的——查资料、用工具、核对、返工;模型每次"张口"都可能出错,错误在链条上复利累积(示意:十步各九成把握,全程只剩约三成五);
- 责任的真空:聊天出错可以道歉,行动出错要有人负责——法律与保险尚未跟上;
- 身体的缺席:物理世界的维修、护理与制造,仍是人工的天下;机器人学六十年的老问题与人工智能的新能力尚未合流。
时代之问:怎样让"会说"的模型变得"可靠地会做"——并且可问责?
二、关键技术群
1. 推理模型——把"想一想"变成显式过程
- 原理一句话:让模型生成较长的推理链并自我核对,以更多推理算力换取更高准确率——从"脱口而出"改为"打草稿再答"。
- 关键事实:2024 年起头部厂商发布推理模型(史料);2025 年初中国团队的开放权重推理模型以低成本训练路线引发全球反响(史料,成果发表于学术期刊)。
- 截至 2026 的边界:在数学、编程等可验证任务上提升显著,在开放闲聊上收益有限(业界通行观察)——算力换来的可靠,首先出现在"对错可判定"的领域。
2. 工具调用与智能体框架——给模型接上手脚
- 原理一句话:把搜索、代码执行、文件与支付等能力封装成标准接口,模型按需调用并依据结果调整计划——智能体=模型+工具+循环。
- 关键事实:2024 年起多家厂商开放"计算机操作"能力,2024—2025 年间模型—工具连接的开放协议陆续发布(史料),编程智能体率先成为日常生产力工具(业界通行判断,截至 2026);
- 判断刻度:衡量一个智能体,看"最长能自主完成多少步任务"与"每千步的失败率",而非演示视频。
3. 具身智能——五十年老学科的新引擎
- 关键事实:人形机器人在 2024—2025 年密集发布,中国厂商的样机登上 2025 年春晚舞台(史料),多条产线宣布投产(厂商口径);
- 冷静判据(本教程立场):硬件供应链成熟与资本热度不等于任务能力成熟——判断要看连续工作时间、跨场景成功率与单位成本三条硬指标(学术与业界通行口径);"机器人元年"的说法是叙事,不是判据。
4. 自动驾驶——二十年长跑的启示
- 关键事实:美国的无人出租 2020 年起在凤凰城公开载客、其后扩展多城(史料);中国的无人出租 2024 年在武汉形成千辆车级规模(史料);同时期,辅助驾驶成为新车标配,但"完全无人"仍限于划定区域(行业口径);
- 史学价值:2016 年前后"两年内全面无人化"的产业预言集体跳票(学术复盘通行结论)——对新技术的近期进度,市场惯于高估;对十年尺度,往往又低估(阿玛拉定律的通行表述,学术引述)。
5. 人工智能进入实验室——科学发现的第二引擎
- 关键事实:材料筛选(2023 年起数百万候选晶体结构的模型预测,论文口径)、气象预报(2023 年起神经网络预报在中期时效上接近乃至超越传统数值方法,学术)、数学证明(2024 年达到国际竞赛银牌水平、2025 年多家实验系统宣称金牌水平——后者为受控演示,非正式赛绩,史料与官方声明口径并列);
- 判断刻度:以"能否提出可实验验证的新假设"为分水岭——截至 2026,多数成果仍在"加速已知方法"层,"自主提出新范式"仍属个别(学术讨论的通行分层)。
三、加速器与瓶颈
加速器:
- 头部厂商的军备竞赛与开源扩散并行——能力贬值周期以月计(截至 2026 的业界观察);
- 资本市场持续输血,机器人与算力基建两线同时吸金(公开市场数据);
- 竞赛基准公开化:长程任务基准让"真实进度"可比较——指标文化抑制了纯叙事泡沫。
瓶颈:
- 长程可靠性:错误随步数复利累积,多数智能体产品仍需人工"在环"把关(业界共识,截至 2026);
- 成本与能耗:推理阶段的累计用电超过训练(研究机构估计,学术)——每回答一个问题的电费开始进入商业模型的定价公式;
- 责任与安全:自动驾驶事故责任、智能体越权操作、生成内容滥用——制度供给显著慢于技术部署(学术通说);安全研究(对齐、可解释)投入仍远小于能力研究(业界公开讨论);
- 地缘与算力:先进芯片出口管制使算力成为外交筹码(2022 年起,史料)——大科学时代的"保密与扩散"老问题,以光刻机的形式重演。
四、社会结构的改变
- 知识工作流的重排:从"人做、机器帮忙"滑向"机器做、人审核"——初级岗位的形态先变,职业阶梯的入口正在改写(社会讨论与初步统计,结论未定——本教程给判据:看任务可验证度与责任可追溯度两个维度);
- 教育再定义:"答案免费"的世界里,提问、核查与判断成为核心课程——各国课标修订已在途中(政策动态,截至 2026);
- 信任基建的社会需求:生成内容的标识、水印与溯源从技术议题升格为公共基础设施议题——信息尺"鉴别成本"的工程学回应;
- 新的劳动分层:云上工程师、数据标注车间(第 8.2 节伏笔)与"给智能体打工"的审核员——平台经济的劳动议题整体平移进智能时代;
- 国际格局:算力、模型与规则三条战线的竞争同时展开,多边安全对话开始(2023 年首届国际安全峰会起,史料)——核时代的军控剧本被重新翻出,但节奏更快、演员更多。
五、留给下一时代的接力棒
- 三本账单——可靠性(工程)、责任(法律)、能耗(能源与材料):三本账都结清,智能时代才算完成成年礼(第 9.3 节统一结算);
- 鉴别的军备竞赛——生成与鉴别的拉锯将长期进行:信息尺的新循环交给下一个时代;
- 具身化的未竟之路——机器人的"寒武纪"是否到来,判据在硬件成本曲线与通用任务基准(第 9.3 节候选清单的外围);
- 六规律的活体样本——本章是"加速律"与"重演律"的最佳观测点:预测的系统性偏差本身,已成为可研究的规律(第 9.3 节);
- 把"正在发生"交给读者——本节所有"截至 2026"的刻度都会过期:请读者带着四条判据(成功率、成本、责任、能耗)自行更新——这也是本教程最后想教会的方法。
(本节三把尺子刻度,文字框图)
能源 ── 推理耗电超过训练(研究机构估计,学术):每次提问都有电费
信息 ── 行动成本下降,鉴别与问责成本上升:信任成为基建
材料 ── 机器人供应链+先进封装受限:硬件成为智能的地缘变量
递出的尺子 ── 可靠性、责任、能耗三账单+鉴别军备竞赛
已在望的下一卡 ── 全书收束:六条规律与下一个时代的判据
本节要点回顾
- 智能体闭环=感知—规划—工具—核对—记忆;判断它看步数与失败率,不看演示;
- 推理模型以算力换准确率,收益集中在可验证任务(截至 2026);
- 具身智能与自动驾驶都要防"叙事先行":阿玛拉定律——短期高估、长期低估;
- 人工智能进入实验室:以"能否提出可验证新假设"为分水岭;
- 四条判据:任务成功率、单位成本、责任归属、能源账单——判断智能体的通用尺;
- 三把尺子:能源=推理电费显性化,信息=鉴别与问责成本上升,材料=硬件供应链地缘化;
- 本节方法:正在发生的历史,用可核验指标读,不用立场叙事读。
过渡:万年技术史走到这里,三把尺子第一次互相追讨:算力要电、电要矿物、矿物要开采与回收的技术、回收又要靠信息去优化。这个循环会把我们带向哪个时代?最后一节不预测——它交付六条规律、一份候选名单和一套判据,然后把手里的尺子交给你。