文集文档索引

AI 智能体基础:认知、决策与学习


  • 文集信息
  • 目录大纲
  • 最新文档
  • 知识宇宙

文集详情

文集导读

教程导读 一句话定位:AI 智能体不是一堆互不相关的算法,而是一套感知—决策—行动循环;本教程用概念筑基把状态、奖励、策略这组坐标系立住,再讲认知、决策与学习如何嵌进循环。 这个教程解决什么问题 很多人第一次接触「智能体」会把词拆碎:这边是视觉模型,那边是规划器,再那边是强化学习。拆完之后说不清一件事——这些零件怎么拼成一个能在环境里连续活下去的东西?Russell 与 Norvig 把智能体写成从感知序列到行动的映射;强化学习又把它写成状态、行动、奖励、策略四元组。两套话如果不先对齐,后面读任何架构图都会飘。 本教程先把循环和坐标系讲透,再按「看见世界 → 选出行动 → 用经验改策略 → 把循环装进系统」往下走。感知、知识表示、世界模型属于认知,负责把原始信号收成状态;目标、效用、规划、行动选择属于决策,负责在状态上给出行动;监督、无监督、强化学习属于学习,负责改策略或改内部模型。第 5 章把循环装进反应式、慎思式、混合式架构;第 6 章才碰到多智能体与大模型——它们改变的是循环的实现形态,不是循环本身。 适合谁读 需要一张总图、而不是立刻上手某个框架的工程师与学生 已经会一点机器学习、但说不清智能体和「训练一个分类器」差在哪的人 读强化学习或大模型智能体之前,想先把术语钉死的人 不适合:只想抄一段可运行的对话机器人脚手架。那类动手教程请去智能体开发类文集。

教程导读

一句话定位:AI 智能体不是一堆互不相关的算法,而是一套感知—决策—行动循环;本教程用概念筑基把状态、奖励、策略这组坐标系立住,再讲认知、决策与学习如何嵌进循环。

这个教程解决什么问题

很多人第一次接触「智能体」会把词拆碎:这边是视觉模型,那边是规划器,再那边是强化学习。拆完之后说不清一件事——这些零件怎么拼成一个能在环境里连续活下去的东西?Russell 与 Norvig 把智能体写成从感知序列到行动的映射;强化学习又把它写成状态、行动、奖励、策略四元组。两套话如果不先对齐,后面读任何架构图都会飘。

本教程先把循环和坐标系讲透,再按「看见世界 → 选出行动 → 用经验改策略 → 把循环装进系统」往下走。感知、知识表示、世界模型属于认知,负责把原始信号收成状态;目标、效用、规划、行动选择属于决策,负责在状态上给出行动;监督、无监督、强化学习属于学习,负责改策略或改内部模型。第 5 章把循环装进反应式、慎思式、混合式架构;第 6 章才碰到多智能体与大模型——它们改变的是循环的实现形态,不是循环本身。

适合谁读

  • 需要一张总图、而不是立刻上手某个框架的工程师与学生
  • 已经会一点机器学习、但说不清智能体和「训练一个分类器」差在哪的人
  • 读强化学习或大模型智能体之前,想先把术语钉死的人

不适合:只想抄一段可运行的对话机器人脚手架。那类动手教程请去智能体开发类文集。

学完你能做什么

  1. 用感知—决策—行动循环画任意一个智能体,并标出状态、奖励、策略落在哪一段
  2. 区分简单反射、基于模型、基于目标、基于效用、学习型五类智能体,并说出各自对环境的假设
  3. 解释知识表示、世界模型、规划、行动选择各自解决循环里的哪一截
  4. 判断一个问题该用规则、规划、还是从经验里学策略,而不是默认「上强化学习」
  5. 看懂混合架构和大模型智能体时,能指出哪一层在感知、哪一层在决策、哪一层在学习

学习路线

要立住的概念 读完应能画的图
第1章 循环、四元组、环境属性 感知到行动再回到环境
第2章 感知、表示、世界模型、推理 原始信号如何变成状态
第3章 目标、效用、规划、不确定决策 状态如何变成行动
第4章 三种范式、更新、泛化 经验如何改策略
第5章 反应式到混合式 循环如何落成模块
第6章 多智能体、大模型、可解释 循环在边界上怎么变形

图:智能体坐标系总览

图:智能体坐标系总览

怎么用这个教程

按章顺序读。第 1 章是坐标系,后面每章都在同一张图上加一层。遇到算法名(Q 学习、MCTS、Transformer)先问:它改的是状态、策略,还是奖励的用法?不要跳去背公式。每节约 25–40 分钟;章支柱页先读摘要和概念图,再进节。

⚠️ 常见坑:把「训练一个模型」直接叫智能体。没有与环境的闭环,只是函数拟合。
💡 关键直觉:智能体的智能不在某一个模块最强,而在循环能否稳定地把观测变成更好的下一步行动。

阅读时手里该有的一张纸

建议准备一张纸,左边画环,右边留空填字段。每读完一节,只往空里加东西,不另起炉灶。第 2 章结束时应能写出某场景的状态清单;第 3 章结束应能写出目标是到达还是维持、冲突怎么公度;第 4 章结束应能写出学习改的是策略、模型还是表示;第 5 章结束应能标出谁拥有执行器否决权。第 6 章是把这张纸拿到客服或仓储上对照,不是另学一套行业黑话。

纸上禁止出现「智能」「赋能」「大脑」这种占位符。写得出「观测是轮速与前视图像」「状态是相对距离与货位占用」「合法集禁止在未确认时调用下单工具」,才算坐标系立住。写不出时,回到对应节,不要用后一章的算法名来填空。

不需要编程环境。若你想动手,用纸面伪代码走完温室或仓库一圈即可:给出一帧观测,写出状态,选出行动,标明奖励是否出现。真要训练网络,请去强化学习或开发类教程;本教程若开始贴训练曲线,就把主调带偏了。

与相邻教程的边界:强化学习入门文集把马尔可夫决策过程与 Q 学习讲深;智能体开发文集讲工具链与落地;AI 伦理文集从事故切入。本文集停在概念坐标系,算法与治理点到即止。同批对话式框架教程走对比选型,本文集不评框架品牌。坐标系立住之后,任何新名词都应能坐回状态、策略、奖励三个座位之一。

目录大纲

    最新文档

    知识宇宙

    正在加载知识图谱...


    转发
    作者与出处
    发布者 / 整理账号: 灏天文库
    来源:灏天文库
    由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
    《AI 智能体基础:认知、决策与学习》是什么?
    AI智能体:探索具备认知、决策与学习能力的智能体。 本站提供目录导航、全文检索与在线阅读,便于系统化学习。
    《AI 智能体基础:认知、决策与学习》适合谁阅读?
    适合希望系统学习《AI 智能体基础:认知、决策与学习》的初学者,以及需要查漏补缺、按需查阅的进阶学习者。
    《AI 智能体基础:认知、决策与学习》包含哪些内容?
    文集围绕主题系统展开,共收录 29 篇文档。本站将全部内容按目录结构化呈现,支持全文检索与在线阅读,方便按主题跳转与反复查阅。
    《AI 智能体基础:认知、决策与学习》的内容从何而来?
    本文集由灏天文库平台收录,内容或由平台用户上传分享,仅供学习交流,版权归原作者所有。
    《AI 智能体基础:认知、决策与学习》的版权如何归属?
    本文集版权归原作者所有,灏天文库平台仅提供在线收录与学习展示;如需转载或商用请遵循原版权方要求。