1.3 目标检测面临的挑战


1.3 目标检测面临的挑战

本节摘要:目标检测为什么这么难?本节盘点尺度变化、遮挡、小目标、密集、形变等核心挑战——这些正是后续算法要逐一解决的问题。

你能学到什么

阅读完本节,你应当能够:

  1. 列举目标检测的主要挑战
  2. 理解每个挑战为什么难
  3. 知道算法如何应对

概念脉络

一、为什么检测比分类难

分类只要认"是什么",检测还要找"在哪里、有多少"。位置连续、数量未知、尺度多变,让检测的搜索空间爆炸。分类的搜索空间是类别数,检测的搜索空间是"位置 × 尺度 × 长宽比 × 类别"——这还没算目标数量。搜索空间大,意味着模型要用同样多的数据学到多得多的判别信息。

二、核心挑战

图 1-3 目标检测核心挑战

图 1-3 目标检测核心挑战

挑战 难点 应对
尺度变化 同类目标大小差几十倍 多尺度预测、FPN
遮挡 只露部分,特征不全 上下文、部分特征
小目标 像素少信息不足 高分辨率特征、FPN
密集目标 NMS 误删重叠框 Soft-NMS、Repulsion 损失
形变视角 外观变化大 数据增强、形变不变特征

三、尺度变化

同一张图里,近处的人可能占满画面,远处的人只有几十像素。同一类目标尺度差几十倍,单一尺度特征图处理不了。深层特征图语义强但分辨率低,小目标早已被下采样抹平;浅层特征图分辨率高但语义弱,大目标信息不足。

应对:FPN 多尺度特征金字塔,不同尺度目标用不同层级特征检测;图像金字塔(多分辨率输入)。

四、遮挡

目标被其他物体或同类挡住,只露一部分。严重遮挡时连人都难认,何况机器。行人被车挡住、产品被工件压住、人脸被口罩遮住,都是工程里天天见的场景。被遮挡部分没有像素证据,模型只能靠可见部分的特征和周围上下文推断。

应对:利用上下文(周围环境推断)、部分特征匹配、时序信息(视频里多帧累积)。

五、小目标

小目标(如 COCO 定义 <32x32 像素)像素少,经多次卷积下采样后特征几乎消失,是检测老大难。一个 20x20 的物体经过 32 倍下采样,在特征图上只剩不到 1 个像素点,任何检测头都无从下手。小目标难还因为正样本少:同一张图大目标占几十个像素的标签,小目标只有几个,损失被大目标主导。

应对:高分辨率特征图(少下采样)、FPN 融合高分辨率特征、超分辨率预处理、时序累积。

可以用一个简单统计脚本感受小目标的占比:

def area_ratio(boxes, img_hw): """统计小目标(面积<32x32)在全部目标中的占比""" small, total = 0, 0 for x, y, w, h in boxes: total += 1 if w * h < 32 * 32: small += 1 return small / total if total else 0

很多真实业务里这个比例超过一半,这也是为什么只报总 mAP 会掩盖小目标问题。

六、密集目标

行人/车辆密集场景,目标框高度重叠。NMS 会误删重叠的真框(把相邻行人删掉)。密集场景的本质矛盾:NMS 用 IoU 判断"是否同一目标",但密集人群里不同行人的框 IoU 也可能超过 0.5。阈值设低漏删,设高误删,怎么调都难受。

应对:Soft-NMS(降低而非删除重叠框分数)、Repulsion 损失(让同类框互相排斥)、DIoU-NMS。

七、形变与视角

同一物体不同视角、姿态、光照下外观差异大(侧脸 vs 正脸、白天 vs 夜晚)。猫弓背和伸懒腰是同一只猫,但从像素上看差异巨大。检测器需要学到"类别不变性"——忽略视角、姿态、光照这些与类别无关的变化,保留类别判别特征。

应对:数据增强(Mosaic、MixUp)、形变不变特征、多尺度训练。

八、长尾分布

真实数据类别极不均衡,常见类样本多,稀有类样本少,模型偏向常见类。自动驾驶场景里,"小轿车"样本几十万,"马车"样本可能只有几十张。训练时常见类主导梯度,稀有类权重被压下去,推理时稀有类几乎检不出。

应对:focal loss(RetinaNet)、重采样、数据增强。

九、背景复杂与噪声

真实图像背景千奇百怪:纹理、阴影、反光都可能被误认为目标。监控里飘动的树叶、水面的波光,都是经典的误检来源。检测器要同时学会"找目标"和"拒绝背景",后者往往更难。

应对:难例挖掘(把误检样本加入训练)、背景类增广、更大数据集。

⚠️ 常见坑:只追求 mAP 不看小目标/密集场景表现——COCO 的 mAP 是平均的,小目标 AP(AP_small)和密集场景才是工程难点,要单独看。

💡 关键直觉:检测难在尺度变化、遮挡、小目标、密集、形变、长尾。每个挑战催生一类技术:FPN(多尺度)、Soft-NMS(密集)、focal loss(长尾)、数据增强(形变)。

核心回顾

  • 尺度变化:同类大小差几十倍 → FPN 多尺度。
  • 遮挡:特征不全 → 上下文、时序。
  • 小目标:像素少信息不足 → 高分辨率特征、FPN。
  • 密集目标:NMS 误删 → Soft-NMS、Repulsion 损失。
  • 形变视角:外观变化大 → 数据增强、形变不变特征。
  • 长尾分布:类别不均衡 → focal loss、重采样。
  • 背景噪声:误检来源 → 难例挖掘、背景增广。
  • 评估:别只看 mAP,看 AP_small 和密集场景。

第 1 章结束。下一章回顾深度学习基础。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U