8.3 视觉高频题:架构演进与任务族


8.3 视觉高频题:架构演进与任务族

本节摘要:视觉面试题的骨架是两条线:架构线从卷积网络走到视觉 Transformer,任务线从分类走到检测与分割。高频追问集中在任务定义的差异、数据增广为什么有效、以及视觉 Transformer 凭什么挑战卷积。本节给出两条线的追问链与标准答法。

视觉与 NLP 在面试里像一对镜像:主线都是表示学习的演进,差异在于视觉的归纳偏置更重、任务族更碎。这节的考点密度集中在「任务定义的精确性」上——很多候选人分不清检测、分割、分类的输出空间,这恰恰是视觉题的第一道分水岭。

主问题:三大任务族的定义与关联

主问题:「图像分类、目标检测、语义分割的区别是什么?它们的模型结构有什么关系?」

标准答案

三者的输出空间粒度递细。分类给整图一个标签;检测输出「每个物体的边界框加类别」,即既要知道有什么、又要知道在哪;语义分割给每个像素分类,实例分割进一步区分「同一类的不同个体」。结构上是同一骨架的不同头:主干网络(卷积或视觉 Transformer)提特征,分类任务接全局池化加全连接头,检测在多尺度特征上接回归与分类头,分割用编码器-解码器逐像素恢复分辨率。理解「共享主干、任务定头」这句话,三个任务的结构题就都有了统一答案。

「共享主干、任务定头」还能引出迁移学习:预训练主干加任务头微调,是视觉领域资源效率的支柱——这与 8.2 节 NLP 的预训练范式是同一条思想在不同模态的落法。

追问一层:数据增广为什么有效

追问:「随机翻转、裁剪这些增广为什么能提升效果?什么增广会出错?」

参考答法分机制与边界。机制上,增广以近乎零成本扩充了训练分布:翻转与裁剪注入了「类别与这些变化无关」的先验(平移不变性、镜像不变性),色彩抖动注入光照不变性——模型被迫学习对这些变化稳健的特征,等效于强正则化,直接呼应第 1 章的偏差方差框架。边界在于增广必须尊重任务语义:数字识别里左右翻转会让六变九;车牌识别裁掉边缘等于销毁证据;细粒度分类里强色彩抖动可能抹掉判别性花纹。增广不是免费午餐,它是「先验的正确性」与「正则化的收益」之间的交易。

追问二层:视觉 Transformer 凭什么挑战卷积

追问:「既然卷积的归纳偏置那么适合图像,为什么视觉 Transformer 能赢?」

这是视觉章的思想题,参考答法分三步。第一步承认事实:纯 Transformer 缺少卷积的局部性与平移等变性归纳偏置,小数据上从头训练确实不如卷积网络。第二步解释反转条件:大规模数据或大规模预训练可以把「先验」用数据学回来——归纳偏置的价值随数据量增大而衰减,这是「大数据吃掉先验」的一般规律,NLP 侧的演进是同一逻辑。第三步落到工程判断:数据少、算力紧、要快速落地,卷积基线(含预训练)依旧是最稳的默认;数据与算力充足、追求上限,视觉 Transformer 或混合架构是现在的答案。「先验与数据的此消彼长」这句抽象总结,是这题的满分句。

import torchvision.transforms as T train_tf = T.Compose([ T.RandomResizedCrop(224, scale=(0.6, 1.0)), # 尺度不变性 T.RandomHorizontalFlip(), # 镜像不变性(任务语义允许时) T.ColorJitter(0.2, 0.2, 0.2), # 光照鲁棒性 T.ToTensor(), T.Normalize(mean=[0.485, 0.456, 0.406], std=[0.229, 0.224, 0.225]), ]) eval_tf = T.Compose([T.Resize(256), T.CenterCrop(224), T.ToTensor(), T.Normalize(mean=[0.485, 0.456, 0.406], std=[0.229, 0.224, 0.225])]) # 纪律:增广只进训练管线;验证与测试必须用确定性变换,否则指标不可比

代码注释里那句纪律是本节隐藏考点:增广是训练期的正则化手段,评估期的任何随机性都会让指标失去可比性。

易错点

  • 混淆语义分割与实例分割:前者同类像素不分个体,后者要分;全景分割再叠加背景语义——输出空间的精度是这个家族的坐标系。
  • 检测评估说成用准确率:检测用 IoU 判定匹配、按置信度阈值算 AP,mAP 是多类别均值;指标说错直接暴露没用过检测管线。
  • 增广选择性失明:训练集与测试集的预处理不一致(只在训练时归一化或只在测试时裁剪)是高频事故,管线分离要作为条件反射。
  • 谈视觉 Transformer 只谈精度不谈数据需求与算力成本:缺少条件化判断的「站队式」回答是开放题大忌。

评分要点

及格:三大任务族定义准确,说出主干加任务头的结构共性;良好:增广的先验机制与失效边界讲清,视觉 Transformer 之争能给条件化结论;优秀:能把「归纳偏置与数据量的此消彼长」作为一般规律横向对照 NLP,检测评估指标细节无死角。视觉题的高分答案有一个统一气质:每个论断都带适用条件——这也是整章开放题训练的目标气质。

下一节回到与 6.3 呼应的话题:可解释AI。区别在于,这次我们谈的是方法论版图,而不只是两把尺子。

高频追问速答

问:小目标检测为什么难,有什么对策?
小目标在特征图上只剩几个像素、下采样后信息几乎消失、且对增广与定位误差极敏感。对策围绕「保分辨率」:高分辨率特征金字塔、更浅层的特征融合、切片推理。这是「感受野与分辨率是一对矛盾」的经典体现。

问:迁移学习在视觉里怎么操作,什么时候全部重训?
常规操作是预训练主干加任务头微调,数据量大时以更小的学习率整体微调。全部重训只在分布特殊(医疗影像、遥感、工业质检)且数据充足时值得——通用图像的底层特征(边缘、纹理)跨域通用,重训是浪费。

问:视觉任务的数据标注成本怎么压?
按性价比排序:主动学习(挑模型最不确定的样本标注)、半自动标注(模型预标加人工修正)、弱监督(图像级标签训练检测)、合成数据(渲染引擎生成完美标注)。组合使用能把标注预算压一个数量级。

表达纪律:视觉题把「输出空间」和「评估指标」成对记忆——任务定义说准了,指标才不会张冠李戴。

边角案例两则

问:域偏移(domain shift)在视觉里怎么缓解?
训练时增广模拟目标域变化(光照、天气、传感器)、域自适应(无标签目标域数据对齐特征分布)、或直接收集目标域数据微调。「增广预防、自适应补救、数据根治」是三级梯度的标准答案。

问:视觉任务里标签噪声为什么格外常见,怎么办?
图像标注主观性高(边界框抖动、类别歧义)、众包质量控制难。缓解按成本排:清洗规则(尺寸与长宽比异常过滤)、噪声鲁棒损失、多标注员一致性加权。视觉工程的一半功夫在标注治理,这句话在工业界是常识。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U