本节摘要:真实数据不够,要增强和合成。本节讲自动驾驶数据增强和合成数据(CARLA 等)——补长尾、降成本的关键。
阅读完本节,你应当能够:
自动驾驶数据需求大且长尾多:
数据增强扩充真实数据,合成数据补长尾。

自动驾驶数据增强:
| 增强 | 说明 |
|---|---|
| 几何变换 | 翻转、缩放、裁剪(框同步) |
| 色彩 | HSV、亮度、对比度(模拟光照) |
| 天气模拟 | 雨雾雪叠加 |
| Copy-Paste | 目标粘贴到不同背景 |
| 多尺度 | 不同输入尺寸 |
合成数据用仿真平台生成:
| 平台 | 特点 |
|---|---|
| CARLA | 开源,学术主流 |
| AirSim | 微软,开源 |
| LGSVL | 自动驾驶仿真 |
| NVIDIA DriveSim | 商业,高保真 |
| Waymo Simulation | 自研 |
合成数据最大挑战是仿真到真实的差距(Sim2Real Gap):
应对:
| 维度 | 数据增强 | 合成数据 |
|---|---|---|
| 来源 | 真实数据变换 | 仿真生成 |
| 标注 | 已有 | 自动 |
| 成本 | 低 | 中(仿真搭建) |
| 长尾 | 弱 | 强 |
⚠️ Sim2Real Gap:合成数据在仿真上效果好,真实可能差。用域适应、域随机化、混合训练缩小差距。
💡 关键直觉:数据增强(几何/色彩/天气/Copy-Paste)扩充真实数据。合成数据(CARLA/AirSim)仿真生成,自动标注,补长尾,安全。挑战 Sim2Real Gap(仿真到真实差距),用域适应/域随机化/混合训练应对。
第 3 章结束。下一章讲模型与算法。
数据增强不是无脑变换,必须保持"语义不变性"——翻转后红色信号灯不能变成左侧灯(在左舵国家翻转图像会破坏交通规则的左右语义),放缩时框要同步变换,Copy-Paste 时目标的光照和透视要与背景一致,否则模型会学到错误的相关性。所以自动驾驶团队在增强 Pipeline 里会做很多"语义感知"的设计:如只在非标志类上做水平翻转、对框做等比例缩放、对颜色扰动加边界(避免把雨天训练成黑夜)。
增强流水线(按概率组合) 翻转(仅非交通规则目标) -> 色彩扰动 -> 模糊/噪声 -> 裁剪与缩放(框同步) -> Copy-Paste -> 混合
仿真转真实的核心矛盾是"仿真太干净"。域随机化通过在仿真里随机改变光照、天气、纹理、摄像头参数,让模型见过足够多"变异",学到的特征更本质,而不是依赖某个固定渲染风格。合成数据与真实数据的配比也讲究:一般先让合成数据在预训练阶段占大头,微调阶段回归真实数据,或者按 1:1 到 1:3 比例混合。经验上,合成数据对"长尾类别"(施工场景、罕见车辆)贡献最大,对常见场景提升有限——因为它真正补的是真实数据里稀有、危险、难以采集的部分。