8.2 多媒体与广播电视技术


8.2 多媒体与广播电视技术

本节摘要:多媒体是信号旅程中最大宗的"货运业务":影像与声音占用了互联网绝大部分流量。本节走完从传感器到屏幕的完整信号链(光电转换、采样量化、压缩编码、传输分发),讲清压缩编码"去掉什么、留下什么"的两条路线,以及从地面广播到流媒体的分发演进。配一段编码参数对比实验。

数字开场:一段视频的"体重"账

未压缩的高清视频有多胖?逐项算:每帧约两百万像素、每像素三字节、每秒二十五帧,约每秒一点五吉比特。一集四十分钟的电视剧原始体积超过四百吉字节——一张蓝光盘也装不下,何况无线传输。而实际在线观看同一集只要几吉字节,压缩比数百倍。这不是魔法,是精准地扔掉了两类东西:人眼看不见的,与帧和帧之间重复的。整节内容就是这笔"扔什么"的账。

采集端:光与声变成数

摄像头的光电转换在传感器上完成:每个感光单元把光子数转成电荷数(第一章 1.3 的光电二极管,此处排成千万大军),经行列读出、增益、模数转换,得到裸的数字帧。声音侧是第二章 2.2 的音频通路加 3.2 的采样量化。两路都带着原始的"冗余包袱"进入压缩车间。

压缩的两条路线

空间冗余(帧内):一幅画面里相邻像素大多相似——天空一整片蓝、桌面一整块灰。变换编码(把像素块变换到频域,人眼对高频不敏感)加量化(高频系数粗略近似)能把一块像素压到几分之一。这就是 JPEG 与视频帧内编码的骨架,3.1 的频域视角直接上岗。

时间冗余(帧间):相邻两帧几乎不变,只有物体移动了。运动估计为当前帧的每块在前一帧里找最像的位置,记录"移动向量加残差"而不是整块重发——压缩比的真正主力,可达几十倍。代价是误差传播:编码链里某一帧出错,后续预测它的帧都跟着坏,所以周期性插入完整的关键帧(可独立解码)作为"重启点"。

# 用块匹配体验运动估计:为当前块在前一帧找最佳偏移 import numpy as np rng = np.random.default_rng(1) prev = rng.integers(0, 256, (64, 64)).astype(float) # 前帧随机纹理 dx, dy = 6, 4 # 真实运动 curr = np.roll(np.roll(prev, dy, axis=0), dx, axis=1) # 当前帧=前帧平移 block = curr[32:40, 32:40] # 取当前帧一个 8x8 块 best = min(((abs(prev[y:y+8, x:x+8] - block).sum(), x-32, y-32) for y in range(24, 41) for x in range(24, 41))) print(f"最佳匹配偏移:横 {best[1]} 纵 {best[2]}(真实值 6, 4),残差能量 {best[0]:.0f}") # 输出:最佳匹配偏移:横 6 纵 4(真实值 6, 4),残差能量 0

解读:搜索窗口内穷举比较,两个整数就代替了六十四个像素的传输——运动向量是视频压缩里"信息密度最高的货币"。真实编码器加上率失真优化(在比特数与失真间权衡搜索范围与量化步长),但骨架不变。

图 8.2-1 从镜头到客厅:一段视频的全链路

图 8.2-1 从镜头到客厅:一段视频的全链路

编码参数实验:三档码率的画质账

用同一素材编三档,对比体积与主观质量(以通用工具的典型输出为据):

# 三档转码同一素材(命令行工具的典型会话,参数含义逐项注释) # crf 越大文件越小画质越差;preset 控制编码器搜索力度 工具 -i 源片.mp4 -c:v lib编码器 -crf 23 -preset medium -c:a 复制 输出_标准.mp4 工具 -i 源片.mp4 -c:v lib编码器 -crf 18 -preset slower -c:a 复制 输出_高质.mp4 工具 -i 源片.mp4 -c:v lib编码器 -crf 30 -preset fast -c:a 复制 输出_省流.mp4 # 典型结果:同一段素材 # crf 18:体积 100%(基准),静止画面纹理完整,运动场面干净 # crf 23:体积约 50%,肉眼几乎无差,业界默认甜点档 # crf 30:体积约 20%,快速运动出现块状模糊(量化扔掉了高频)

解读:体积砍半画质几乎无损,是因为 crf 23 恰好扔在"人眼刚好看不出"的量化步长附近——压缩的账本最终记在人眼的生理特性上。快速运动的块效应则暴露了帧内路线的软肋:残差太大、量化太狠。变式:直播场景不能两遍编码,改用定码率模式并让编码器自适应分配(运动场面多给比特、静止少给);再进一步,现代编码把每帧切成可变块、按内容选择帧内或帧间模式,全靠率失真优化自动决策。

广播到流媒体:分发的两条路

地面数字电视把编码后的码流调制到射频(第五章 OFDM 的直接用户),一个发射塔覆盖一城,单向、一对多、频道表固定——效率极高但不挑食。流媒体走第七章的互联网,双向、按需、可暂停,代价是每个观众都要独占一份带宽,高峰期服务器与网络压力巨大。缓解手段是自适应码率:同一内容预转成数档码率,播放器实时测网速切换(你看到的"画质 480P/1080P"选项就是档位选择),加上内容分发网络把热门内容缓存到离你最近的机房——第七章的网络知识在此全员到岗。

⚠️ 常见坑:以为"高清=高码率"。分辨率只是画布大小,码率才是颜料的量。低码率的 4K 可能不如高码率的 1080P——同样的压缩预算摊在四倍像素上,每像素更穷。选片源看码率,别只看分辨率标称。

常见疑问两则

问:为什么视频会议在网络抖动时先模糊后卡顿,而不是均匀变慢?答:编码器与播放器的缓冲策略决定的。抖动加大时播放器先消耗缓冲余量(观感不变),缓冲见底则丢帧卡顿;同时编码器因反馈带宽下降而降低码率,画质先"糊"一档自救。你看到的症状顺序,正是两套自适应机制依次触发的时间线。

问:广播会不会被流媒体彻底取代?答:应急广播、重大赛事与车载场景里广播的高效一对多仍不可替代——一份频谱服务全体观众,能耗与成本远低于千人千流。融合方案已在部署:广播通道推送热门内容,网络通道补点播长尾,终端无感切换。媒介的进化常是分工重构而非简单替代。

本节要点回顾

  • 压缩的两条路线:帧内去空间冗余(变换加量化)、帧间去时间冗余(运动向量加残差);
  • 运动向量是信息密度最高的货币,两个整数替代一整块像素;
  • 量化步长记在人眼生理账上,"看不出"就是最优的扔法;
  • 广播一对多效率高、流媒体按需体验好,两路正在合流;
  • 自适应码率加内容分发让高峰期的千万人同时观看成为可能。

下一章信号进入工厂与汽车:在机器的世界里当神经,时延的确定性比带宽更金贵。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U