目标检测与分割 目标检测(object detection)对图像中每个物体进行定位和分类;分割(segmentation)给每个像素分配一个标签。本文件涵盖 IoU、mAP、锚框、R-CNN 家族、YOLO、SSD、特征金字塔网络、语义/实例/全景分割(U-Net、Mask R-CNN、SAM),以及用来评估它们的指标。 图像分类(文件 02)回答"这张图里有什么?"目标检测则问一个更难的问题:"这张图里有哪些物体,它们在哪里?" 分割更进一步:"哪些像素属于哪个物体或类别?"这些任务构成了一组越来越精细的空间理解层级。 目标检测模型输出一组边界框(bounding box),每个框由四个坐标(左上角 $x, y$、宽度、高度)和一个带置信度分数的类别标签定义。