本节摘要:事件相机(DVS)的每个像素独立监测对数亮度的变化,超过阈值就发出一个带地址、时刻、极性的事件。三个标志性指标——微秒级时间戳、120 dB 以上动态范围、静止场景近零数据率——全部来自这个像素电路,而不是任何算法增强。本节拆原理、算数据率、给任务适配判据。
1.2 节的时间线里提过 Misha Mahowald 的硅视网膜,本节把它讲透。事件相机(Event Camera / DVS,动态视觉传感器)是神经形态计算商业化最成功的分支——Prophesee、iniVation、Samsung 的传感器已经进入车规与消费供应链,它也是第 7 章几乎所有应用案例的输入源。
第一步是对数转换:光电二极管的电流经过对数电路,输出电压正比于光强的对数 \log I。这一步直接送出第一个礼物:人眼能适应十个数量级的光强范围,线性传感器做不到(强光饱和、暗处一片黑),对数电路天然覆盖 120 dB 以上动态范围——帧相机典型的 60 dB 在它面前是"半聋"。隧道口的忽明忽暗、车间里的电弧光、逆光人脸,这些场景帧相机要靠多帧曝光融合硬凑,事件相机一个像素电路就解决了。
第二步是变化检测:像素电路持续比较当前对数亮度与上次事件时刻的参考值,差值超过正阈值发一个 ON 事件(变亮),超过负阈值发 OFF 事件(变暗)。第三步是异步输出:事件经 AER 仲裁总线串行化输出,时间戳精度达到微秒级——不是"帧率的倒数",而是每个事件自带独立时刻。三个指标各自对应一步:动态范围来自对数化,微秒时序来自异步触发,低数据率来自"不变不发"。

把 1.3 节的稀疏账落到事件相机上。设 1280×720 分辨率:帧相机 30 fps 的原始数据率约 800 兆比特每秒(8 位灰度);事件相机的输出完全由场景活动率决定——桌面静止场景每秒几十万事件(每事件按地址加时间戳约 32 比特计,约 10 兆比特每秒量级),繁忙交通场景每秒上亿事件(逼近帧流)。规律很明确:活动率越低省得越狠,活动率逼近全像素高频率变化时两者打平。高速运动反而是事件相机的优势区——帧相机运动模糊,它照样输出清晰的事件轨迹,这就是高速检测任务选它的核心理由(第 7 章的无人机避障案例)。
处理侧的收益同样实在:事件流直接就是第 2 章讲的脉冲流,下游 SNN 免去帧到脉冲的编码转换(省一层量化误差与延迟),且第 5 章的芯片接口原生对齐。一个经过反复验证的系统组合是:事件相机 + TTFS/直接脉冲透传 + 异步芯片,端到端延迟可以压到毫秒以内。
两问过滤器。第一问:你需要"静止时的完整画面"吗?需要——监控取证、拍照存档类任务,事件相机单独不成立,要用 DAVIS 类"事件加帧"的混合传感器补帧通道。第二问:场景的活动率分布如何?长期静止、偶发事件的场景收益最大(安防、工业检测、待机感知);持续高动态且需要稠密纹理重建的(三维扫描、摄影测量),事件流的稀疏性反而是缺陷。第三类坑值得单独提醒:事件相机输出的"噪声"(热噪声触发的伪事件)在阈值调低时急剧增多,阈值调高又丢真实事件——阈值是每颗传感器要标定的核心参数,换场景就重标,这不是 bug 是物理。
💡 系统设计的一个实用技巧:用事件相机的"低活动静默"做系统级待机。静止时整条 SNN 无脉冲流动,芯片接近零功耗(5.2 节的静默核),有事件才唤醒完整链路——这是帧方案物理上做不到的功耗曲线形状,也是"常开感知"类产品(可穿戴、电池安防)选事件方案的决定性理由。
数据格式与预处理的最小知识也值得一并交代,拿到真传感器时直接用得上。事件流的原始输出是四元组序列(x, y, t, p),典型编码下每事件 32 比特上下;读出接口以 USB 评估套件和 MIPI 接口为主流。拿到手的第一件事是跑一次"事件率画像":把你的典型场景录一段,统计每秒事件数的时间分布——这个分布直接决定后续所有设计(带宽、网络规模、功耗)。第二件事是噪声标定:遮住镜头录一段,得到的背景事件率就是热噪声底(现代传感器能压到每像素每小时几个事件的量级);处理时用"坐标时间窗过滤"(同一像素在极短窗内的重复事件只算一个)能砍掉大部分噪声。第三件事是阈值实验:把偏置电流换两三档,看事件率与信噪比的权衡曲线——6.1 前面说过阈值是每颗传感器要标定的核心参数,这三件事就是标定的具体动作。
数据集与工具方面给一个起点清单:手势识别的 DVS128 Gesture、物品识别的 N-Caltech101、驾驶场景的 DSEC 是最常用的三个公开基准,自带事件格式与评测协议;处理库方面,Python 生态有成熟的事件流工具包(读文件、时间表面、体素化表示一行命令搞定),配套第 5 章的训练框架可以直接进管线。冷启动者按"公开数据集跑通、自家数据标定、阈值画像建档"的顺序走,两周内可以建立完整的数据能力。
分辨率与工艺的进展坐标系也给你补齐,看新品发布时有个参照。第一代商业化传感器在 VGA 级(640×480),当前主流是 VGA 到 HD(1280×720),旗舰产品已到百万像素级;工艺从 180 纳米演进到 40 纳米级,带来的直接改善是每像素电路面积缩小、等效噪声降低、时间戳精度稳定在微秒以内。选型时比分辨率更值得看的三个参数:每瓦特事件处理能力(把功耗除以典型事件率)、背景活动噪声(每像素每秒的伪事件数,直接决定静止场景的底噪)、以及抗瞬态光损能力(车灯直射、探照灯扫过的场景不"致盲")。很多场景里,一台噪声低一半的 VGA 传感器比分辨率翻倍的 HD 传感器产出质量更高——事件相机的选型逻辑与帧相机在这里是反的。
最后回应一个采购清单上常出现的问题:要不要选"事件加帧"的混合传感器(DAVIS 类或 RGB-DVS 类)?判断依据是两个通道在你任务里的占比。事件为主的任务(高速检测、常开感知)配一个低分辨率帧通道做参考——混合方案合适;帧为主、事件做辅助(需要成像质量,偶尔关心高速事件)——分立的双传感器方案反而更灵活,因为混合传感器的帧通道画质通常弱于同代纯帧传感器。混合不是万能升级,是任务配比的决定。
事件相机的本质是把"稀疏账"从算法层前移到了光电子层:像素自己完成了变化检测,下游收到的直接就是脉冲。传感与计算的融合不是接口协议,是同一个电路哲学的两端。
下一节进入听觉:硅耳把 cochlea 的频率分解做进电路,你会发现视觉与听觉的事件化遵循同一张蓝图。