视频与三维视觉 视频与三维视觉(video and 3D vision)把图像理解扩展到时间域和空间域。本文件涵盖光流、视频分类(3D CNN、TimeSformer)、目标跟踪(SORT、DeepSORT)、动作识别、深度估计(单目和立体)、点云、NeRF 和三维高斯泼溅(3D Gaussian splatting)。 文件 01 到 04 把图像当作孤立的快照来处理。但视觉世界是连续的:物体会动、场景会变、深度客观存在。本文件把计算机视觉扩展到时间域(视频)和空间域(三维),讨论模型如何理解运动、跟踪物体、估计深度、重建场景。 视频(video)是随时间捕获的一串图像(帧)。30 帧每秒时,一段 10 秒的片段包含 300 帧。