2.1 感知:从原始信号到状态


2.1 感知:从原始信号到状态

本节摘要:感知是智能体把环境信号变成内部可用信息的入口。流水线通常是采集、预处理、特征提取、模式识别,再交给表示与推理收成状态。视觉通道覆盖分类、检测、分割、姿态;听觉覆盖识别、事件检测、声源定位;物理传感器给出温度、距离等量。感知成功的标准不是「像人一样看」,而是状态里有没有决策下一步真正要用的变量。

先说结论

阅读完本节,你应当能够:

  1. 按采集到识别列出感知流水线,并指出每步的典型损失
  2. 区分图像分类、目标检测、分割对下游决策的不同含义
  3. 说明多传感器融合解决的是部分可观测,不是「越多越智能」
  4. 用自动驾驶或仓库例子写出「观测清单」与「状态清单」的差别

感知是压缩,不是复刻

走进陌生房间,眼睛接收的是光强阵列,你不会把阵列存下来当记忆,而是几乎立刻得到「门在左侧、桌在中央」。智能体同样必须压缩。SOURCE 把步骤写成采集、预处理、特征提取、模式识别、理解。理解其实已经跨进表示与推理;感知模块在工程上常常停在「识别出物体与事件」。停在哪一层,决定决策吃到的是框、是语义图,还是一句自然语言描述。

采集阶段的选择等于声明环境的可观测切片。只用前视摄像头,就主动放弃了侧后方;只用麦克风阵列,就放弃了几何形状。预处理(降噪、去畸变、同步时间戳)看起来像脏活,却决定后续特征稳不稳。特征提取把高维信号收成边缘、关键点、频谱;模式识别把特征接到类别或检测框。每一步都丢信息。好的感知不是少丢,而是丢掉决策用不上的,留下决策用得上的。

原始帧 → 去畸变/同步 → 特征 → 检测/分割 → 跟踪与关联 → 状态变量 像素 仍是像素 向量 物体假设 轨迹 决策输入

💡 关键直觉:感知的 KPI 应能翻译成状态误差。mAP 很高但把「行人」和「影子」在决策用的距离上搞反,循环仍然会撞。

通道:看、听、量、读

SOURCE 强调计算机视觉、自然语言、传感器处理,以及知识图谱——图谱更偏表示,但感知常要往图谱上挂实体。视觉任务对决策的含义不同。分类只回答「这张图主要是什么」,适合整图质检,不适合避障。检测给出框与类别,规划能用中心点当障碍。分割给出像素级占据,适合精确抓取。姿态估计给出关节点,适合判断行人是否要迈步。选错任务,等于状态里缺字段。

听觉同理。语音识别把声波变成词,对话智能体的观测常常从这里才开始。声音事件检测回答「是不是玻璃碎了」,安防机器人用它触发另一套策略。声源定位给出方向,主动感知才能把摄像头转过去——这是用行动改善下一轮观测,已经碰到决策,但动机来自感知不足。

物理量通道最容易被忽视,因为它「不够 AI」。温度、湿度、压力、轮速、电池,往往是状态里最稳的几维。温室控制几乎全靠它们。把它们和视觉拼在一起时,真正的难题是时间对齐与坐标系:轮速是车体坐标,检测框是相机坐标,不标定就没有统一状态。

通道 典型观测 对状态的贡献 决策若缺少它
视觉 图像、点云 物体、占据、姿态 看不见障碍与货位
听觉 波形、文本 指令、事件、方向 听不懂人、听不见警报
本体传感 温度、力、IMU 自身与物理量 控制发散
语言/API 消息、数据库行 任务与约束 目标本身不完整
图谱挂接 实体链接 把物体接到常识 只认识「框」不认识「易碎」

语言作为观测时,切记:用户一句话同时可能是目标、约束和世界事实。「把易碎品放到上层」既改目标也改知识。感知模块若只做分词,把语用全部丢给决策,决策会膨胀;若在这里做意图识别,又要承认意图是状态的一部分,会错。

从识别到状态:还差关联与记忆

检测框是假设,不是状态。同一行人在连续帧里必须关联成轨迹,否则决策会把一个人当成每帧新出现的障碍。仓库里同一托盘被遮挡后再现,要靠记忆把它认回来。这就是 1.2 节说的:部分可观测逼你维护内部状态。感知团队若只交付单帧模型,认知在循环里是断的。

多传感器融合常被宣传成「更全面」。它真正解决的是:单个通道的可观测切片不够。激光看几何、相机看纹理与灯色、雷达看相对速度。融合失败的典型不是算法名词,而是时间戳差几十毫秒,运动物体在状态里裂成两个。工程上先对齐再融合,比先上复杂网络更重要。

⚠️ 常见坑:用单帧检测的准确率验收感知,却让规划吃没有跟踪的框。规划会在闪烁的幽灵障碍上急刹。

概念上,状态清单应在写模型之前就列出。自动驾驶最小状态可能包括:自车速度、车道、前方车辆相对距离与速度、信号灯相位、行人轨迹。仓库最小状态可能包括:自身位姿、目标货位、持货种类、前方动态障碍。观测清单可以更长;状态清单必须短到决策能用、长到决策够用。多出来的通道若进不了状态,只是在烧算力。

图:感知流水线与信息损失

图:感知流水线与信息损失

主动感知:行动为了下一帧观测

感知不足时,决策可以选「看」作为行动:转云台、减速靠近、打开货架缝上的探头、对话里追问。这不是感知模块内部的事,但动机来自状态里的高不确定。流水线设计应给「主动感知」留行动位,否则 3.4 会变成只能保守停住。仓库里探一眼的时间代价,通常低于按「缝后无人」规划后的碰撞。驾驶里点头确认行人意图,代价是减速。

标定与同步值得单独当一节工程,而不是附录。多相机外参错一厘米,检测可以仍「准」,融合状态里同一行人裂成两个。裂开的状态会让规划在两个幽灵之间摆。验收要用静止物体的多传感器距离一致性,不只用单相机 mAP。麦克风阵列若要做声源定位,同样要与云台零位对齐,否则「听见左边、转到右边」。

知识图谱挂接发生在识别之后:把「这个框」变成「订单 77 的易碎托盘」。挂接失败时,状态里只剩几何,决策会按普通货插入。挂接不是感知竞赛的标准任务,却是智能体感知的完成态。完成态要用业务字段验收:易碎、冷链、超重,缺一就在状态清单上画叉,而不是在论文指标上画勾。

夜间与天气是分布问题,留给 4.4;本节只需承认:流水线在训练光照下漂亮,不代表状态在雨夜仍可规划。可以先用简单的置信门槛,置信低则把该通道降权,让更稳的物理量顶上。降权是感知给决策的诚实,比硬输出一个漂亮框更有用。

本节检查清单

状态清单是否先于模型存在,字段是否决策真用得上?检测框有没有经过跟踪才进状态?多传感器时间戳与坐标系有没有先对齐再融合?语言观测里的目标与事实有没有分字段?主动感知有没有行动位?图谱挂接失败时决策会不会把易碎当普通货?单帧 mAP 有没有冒充状态误差?夜间低置信有没有降权而不是硬输出漂亮框?通道进不了状态的,有没有当成算力税删掉或降频?清单超过二十还不够用,是压缩失败还是任务真需要?需要应写理由。无理由的长清单是认知肥胖,规划会喘。喘的时候不要先换规划器。

用急刹次数差验收跟踪

只交单帧框,规划急刹次数高。交跟踪轨迹,次数应下降。差是 2.1 的分数。分数不来自 mAP。mAP 可以很高,框仍闪。闪让规划看见幽灵。幽灵急刹。急刹差测的是关联。关联是部分可观测的补丁。补丁在本节完成态:框不是状态,轨迹才是。轨迹进清单。清单先于模型写。写了才知道通道进不进得来。进不来的降频。降频是算力税管理。管理很土。土的感知才决策。决策要稳定字段。稳定来自跟踪与时间对齐。对齐先于融合。融合先于网络更深。更深不修时间戳。时间戳错,行人裂成两个。两个幽灵。幽灵急刹。急刹用这一条差来抓。抓住了,2.1 过关。过关还要挂接:易碎字段丢了,插入当普通货。普通货刮损。刮损是挂接失败。挂接失败也是感知未完成。完成态含业务字段。业务字段在清单里。清单是作业。作业先写后训。训完用急刹差与刮损差验收。两差是本节的 G。G 很土。土过关。

两差是本节的 G。G 很土。土过关。过关还要把业务字段写进清单:易碎、冷链、超重,缺一画叉。画叉比在排行榜上画勾重要。勾不插入。插入认字段。字段先写后训。训完用急刹差与刮损差验收,不要用单帧冠军代替状态误差。冠军可以很高,框仍闪。闪让规划看见幽灵。幽灵急刹。急刹差测的是关联。关联补上,2.1 才完成从框到状态的那一跳。跳完还要把时间戳对齐写进验收,不对齐的融合只会产生裂开的幽灵障碍。幽灵障碍会让规划急刹,急刹差就是本节还没过关的分数。

重点提炼

  • 感知是压缩:流水线每步丢信息,目标是留下决策变量
  • 通道不同贡献:分类/检测/分割对规划的字段不同;物理量往往最稳
  • 语言既是观测也可能是目标:要在状态里声明字段,避免语用被吞掉
  • 框不是状态:跟踪、关联、记忆才把部分可观测补成内部状态
  • 融合先对齐:时间戳与坐标系比网络结构更先决定状态是否裂开
  • 先写状态清单:观测可以多,进不了状态的通道只是算力税

下一节讨论这些识别结果如何放进可推理的知识结构。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U