2.2 知识表示


2.2 知识表示

本节摘要:知识表示把世界里的事实与规则,编码成机器能存储、检索、推理的结构。逻辑适合严格蕴含;语义网络与框架适合概念关系;本体给领域约定公共词汇;产生式规则适合反应式决策;向量与神经网络给出可学习的分布式表示。选表示就是在选后续能做哪种推理,以及学习更新时改的是符号还是参数。

核心问题

阅读完本节,你应当能够:

  1. 用「猫是动物、猫喜欢牛奶」比较命题逻辑、谓词逻辑与描述逻辑的表达力差别
  2. 说明语义网络、框架、本体各自解决什么组织问题
  3. 指出向量表示擅长相似与泛化、不擅长可追溯的硬约束
  4. 按任务需要在符号与向量之间做混合,而不是站队

表示是给推理准备的数据结构

SOURCE 用「教电脑理解猫」开头:塞一张照片不等于拥有概念。概念要能回答没见过的问题——这只动物会不会喝牛奶、能不能当货物堆压。感知给出的是这一次的观测;知识表示给出的是可复用的架子。架子选错,后面的推理引擎再强也是空转。

命题逻辑用整句当真值单位:「天下雨」「地湿」,再用蕴含连起来。它简单,但无法谈论「某一个」对象。谓词逻辑引入对象、谓词与量词,才能写「所有猫都喜欢牛奶」。描述逻辑把表达力收到本体工程常用的那一档,强调概念包含与角色约束,例如「猫是动物的子类」。三种逻辑不是年代替换,是表达力与可判定性的阶梯:越能说复杂的话,越要小心推理还停不停得下来。

命题:下雨 → 地湿 谓词:对所有 x,若 x 是猫,则 x 喜欢牛奶 描述:猫 包含于 动物;有母亲且母亲为猫 包含于 雌性

💡 关键直觉:先问「我需要量词和对象吗」。只做开关控制,命题或规则表就够;要处理「这一托盘是那一订单的易碎品」,必须有对象身份。

图、框架、规则、向量

语义网络用节点当概念、边当关系:鸟 —是一种→ 动物,鸟 —能→ 飞。检索是走图,直观,但默认语义容易含糊——「能飞」是必然还是典型?企鹅一来,图就要加例外。框架把对象收成槽:汽车有颜色、品牌、轮数,槽还可以有默认值与附加过程。对结构化记录很顺手,和数据库一行很像,只是槽可以指向另一个框架。

本体在工程上往往是「大家约定用同一套类与关系」。医学、物流、设备管理靠它避免各模块各说各话。它不是一种全新的数学,而是描述逻辑加工程纪律。产生式规则「若条件则行动」则更靠近决策:温度高于 28 则开窗。规则可以当知识,也可以当策略;若两者混在一个文件里,学习更新时会分不清改的是世界事实还是行为习惯。

分布式表示把对象收成高维向量。相似的东西靠近,适合从数据里长出类比,也适合作为深度模型的输入。代价是:你很难指出向量的第 17 维对应「易碎」,也很难保证「绝不能把腐蚀品和食品同箱」这种硬约束被向量「差不多」地遵守。记忆网络、知识图谱嵌入都在这条路上。

表示 擅长 不擅长 学习更新时改什么
命题/谓词逻辑 严格蕴含、可检查证明 噪声、例外、规模 增删公理
描述逻辑/本体 领域词汇、分类 数值连续控制 改 TBox/ABox
语义网络 关系浏览 精确量词 改边
框架 对象槽与默认 灵活例外 改槽值
产生式规则 反应式策略 长期规划 改规则或权重
向量/网络 相似、感知接地 硬约束可追溯 改参数

工程上怎么选,怎么混

仓库智能体需要对象身份(哪一托盘)、类别约束(易碎、冷链)、空间关系(在哪一层)和感知接地(摄像头看到的就是这个托盘)。纯向量能做识别,难做「冷链品不得在缓冲区停留超过时限」的审计。纯符号能做审计,难从像素认出托盘。混合几乎是默认:感知输出实体 ID,挂到本体实例上,规划读符号约束,视觉模型只负责接地。

对话智能体常把用户画像、工具目录、对话状态用框架或槽填充;把句子意思用向量检索。槽满了才触发下单,是硬约束;检索只负责候选。若反过来,用向量相似度直接当「用户已经同意付款」,会出现不可追溯的误操作。这不是模型不够大,是表示承担了它不该承担的承诺。

⚠️ 常见坑:把知识图谱当感知的替代。图谱里没有的物体,相机刚刚看到,状态里也不会有——除非感知把新实例写进图谱。表示不会自动生长,除非学习模块有写权限。

SOURCE 还提到知识库、记忆网络、语义网络、分布式表示作为组织与存储手段。存储形态要和服务对象匹配:规则引擎要可匹配的工作记忆;规划器要谓词世界;策略网络要定长向量。一个智能体里出现多种表示并不丢人,丢人的是没有一张表写清「决策读哪一种、学习写哪一种」。

选表示时可以用三问:要不要对象身份?要不要可审计的硬约束?主要知识从专家来还是从数据来?三问的答案会把你推向表格里的某一两行,而不是「全都要一份」。全都要可以,但接口必须显式,否则循环会在转换处丢字段——感知检出了「易碎」,向量状态里却没有这一维,决策就当普通货来插。

工作记忆与长期知识要分柜

产生式规则若既描述「货位占用是事实」又描述「看见人就停」,事实与策略会挤在同一抽屉,学习改停的阈值时可能误改占用逻辑。分柜是表示层的卫生:世界事实、任务目标、行为规则、参数向量,四柜钥匙不同。2.2 选逻辑还是向量之前,先把柜子划开。柜子混了,后面任何更新纪律都像在公共冰箱里抢菜。

命题逻辑够用的标志:不需要谈论「某一个托盘」。一旦要指称个体,谓词或框架立刻上场。描述逻辑适合「冷链品不得在缓冲区超时」这种分类约束,规划器可以问本体「此实例是否属于禁入类」。向量检索适合「相似历史订单」,给出候选,不给出许可。许可必须回到符号约束。客服里用向量找知识库文章,用规则决定能不能承诺退款,是同一焊法。

分布式表示的记忆网络能把长历史压进向量,适合对话。压完之后若还要审计「系统根据哪条用户原话决定下单」,向量不够,必须另存槽。槽是框架的当代形态。不要因为网络能记住,就删掉槽。删槽等于删追溯,6.3 会找上门。表示选择在这一刻已经是安全选择,不只是精度选择。

SOURCE 把知识图谱构建放在感知附近,容易让人以为图谱是传感器。它不是。传感器产出实例假设,图谱提供类与关系,焊接靠实体链接。链接阈值应保守:宁可不链,也不要把腐蚀品链成食品。错误链接比漏链更伤,因为决策会非常自信地用错约束。

图:符号约束与向量接地的焊接

图:符号约束与向量接地的焊接

本节检查清单

世界事实与行为规则是否分柜?需要对象身份时有没有从命题升级到谓词或框架?硬约束是否只认符号柜,向量是否只负责接地与召回?实体链接阈值是否偏保守?槽与向量记忆是否并存以便追溯?学习改规则时会不会误改占用事实?许可能不能被相似度「差不多」地批准?图谱会不会被误当成传感器?新物体有没有写权限?三问(身份、审计、知识来源)有没有把你推向表格里的一两行而不是「全都要一份却不声明接口」?接口不声明,感知检出的易碎会在转换处丢维。丢维等于表示层把认知成果扔了。扔了还开会讨论决策,是找错科室。

用退款许可测符号柜

向量检索到「类似已退款订单」,不得直接退。许可只认符号柜:窗口内、已支付、规则命中。命中才行动。这一条测的是 2.2 的焊法。焊法失败,相似度会买通约束。买通是表示层事故。事故预防是许可不走向量。向量只召回。召回给假设。假设进检查。检查进符号。符号进行动。行动可追。可追是槽还在。槽删了只留向量,6.3 追不到原话。追不到是表示选择已经变成安全选择。安全选择在本节就要做:硬约束走符号。符号柜与向量柜分开放。分开放是作业。作业用退款测。测不过,不要上线对话下单。下单是执行器。执行器不认差不多。差不多是向量的美德。美德不批准退款。批准在规则。规则在符号柜。符号柜过关,2.2 毕业。毕业不发逻辑证书。发的是不会用相似度批准的习惯。习惯抗忘。抗忘才能进世界模型。世界模型写在字段上。字段要身份。身份在谓词或框架。框架在符号柜。符号柜这一条退款测试钉死。钉死过关。

符号柜这一条退款测试钉死。钉死过关。过关后才允许向量检索存在,并且只负责召回候选。候选不是许可。许可在规则。规则在符号。符号与向量分柜。分柜是卫生。卫生才能进 2.3 写动态。动态写在有身份的字段上。身份在架子上。架子在本节。架子上没有身份字段,世界模型会把动态写到空气里。空气里的动态看起来像规划,其实是在做梦。

本章回顾

  • 表示服务推理:选逻辑、图、框架还是向量,等于选能做的推理种类
  • 逻辑阶梯:命题到谓词到描述逻辑,表达力上升,可判定性要盯
  • 规则兼当策略:世界事实与行为习惯分开存,学习才知道改哪
  • 向量擅相似:硬约束与审计不要指望「差不多」
  • 混合是常态:感知接地用向量,约束用符号,用实体 ID 焊接
  • 写权限:图谱与知识库不会自动出现新物体,要感知或学习写入

下一节在表示之上加时间与因果,构成世界模型。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U