4.3 复合预测与运动场推断对照


4.3 复合预测与运动场推断对照

本节摘要:单一预测块应付不了遮挡、透明与交叉运动时,复合预测把两份预测按楔形、加权或差值调制合并;运动场推断则让无矢量的块从全帧运动场"借"信息。AV1 的复合模式族与 OBMC、warped motion 构成组合拳,对照 VVC 的 GPM/CIIP/SMVD,本节讲清各家合并策略的取舍与适用边界。

一、什么时候需要"两个预测合并"

运动补偿假设一个块只做一种运动。现实里的失效场景有三类:物体边缘(一半背景平移、一半前景移动)、半透明物(玻璃、水面,两路运动叠加)、交叉遮挡(两人错身而过)。硬用单一运动,边缘处残差暴涨;编码器的对策要么把块切得更碎(代价是信令与无效边界),要么引入复合预测——把两份预测信号按某种权重合成一份。

三套方案的对照:

合并策略 HEVC/VVC AV1
平均合并 HEVC 双向加权预测(B 帧时域加权) COMPOUND_AVERAGE
距离加权 HEVC 加权预测(切片级参数) COMPOUND_DISTWTD(按帧距自动加权)
差值调制 —(VVC 有 CIIP 联合帧内帧间) COMPOUND_DIFFWTD(用第二预测的梯度做掩码)
几何分割 VVC GPM:几何直线分割双预测 楔形分割(wedge):预置掩码模板族
帧内帧间混合 VVC CIIP 帧内与帧间复合(inter-intra wedge/diff)
边界重叠修正 OBMC:与相邻块的运动预测重叠平均

楔形与 GPM 是最像的一对:VVC 的 GPM 在块内画一条几何直线,两侧各用一路运动补偿;AV1 的楔形则从一族预置模板里挑一个软过渡掩码。区别在掩码性质——GPM 是硬分割,楔形是软混合,过渡带渐变,对半透明与羽化边缘更友好。CIIP 与 AV1 的帧内帧间复合同理成对:都承认"这块既有运动成分又有静止成分"。

图:复合预测合并策略对照

图:复合预测合并策略对照

二、MFMV:把运动场当公共设施

前两节讲过块级投影,这里补上它背后的全局视角:MFMV(运动场估计)在编码当前帧前,先从已解码参考帧里读取运动场,为当前帧整体构造一份"邻域运动共识"。没有足够信令预算的小块可以直接取共识矢量当预测,信令开销近乎为零;正常块的时间投影候选也来自这份场。对照 H.264——时间候选在标准里根本不存在,一切靠编码器自带技巧;VVC 把时域候选规则化到并置块,AV1 则把整帧运动场都纳入标准设施。三代的演进方向是"时间维度的信息越来越标准化"。

OBMC 值得单独一提,因为它是"边界失真"的对称解:块级运动补偿各扫门前雪,边界两侧的预测彼此矛盾,闭环里就留下接缝。OBMC 把当前块的预测与相邻块运动所暗示的预测做重叠加权平均,等于在解码端再对齐一次。VVC 没有对等的块级 OBMC,它选择的补丁是更精细的块划分与仿射——同样是边界问题,一家用"重叠平均"修,一家用"切得更准"修,路线差异一目了然。

三、代价与开关策略

复合与场推断都不是免费的:复合意味着两路运动补偿算力翻倍(插值、掩码、合并),OBMC 与 warped motion 在解码端同样要付算力。实践开关策略可以归纳成一张决策单:

场景 → 建议配置 固定机位监控/会议: GLOBALMV 受益大, 复合收益低, 可收缩 wedge 电影/剧集点播: ALTREF + DISTWTD + wedge 全开, 离线码率最优 直播低延迟: 关前瞻, 复合只留 AVERAGE/DISTWTD, OBMC 保留 游戏串流(屏幕内容): 楔形与 DIFFWTD 谨慎, 优先 IBC/调色板(见 3.3)

率失真的裁决逻辑始终如一:合并省下的残差比特,要能覆盖多写的那点信令与解码算力的期望成本。哪一路赢,取决于内容——这也是为什么四代标准都不把这些工具做成强制项,而是留给编码器按内容裁决。

💡 一个验证直觉的小实验:同一段双人访谈视频,分别关闭与开启复合预测压两版,人像交叠的瞬间是差距最大的画面。找到"哪类画面在受益",比背工具名有用得多。

常见追问

问:复合预测和 B 帧双向预测是什么关系?
答:B 帧的双向加权是复合预测的一个特例(两个时间方向的距离加权)。AV1 把"两路信号怎么合并"抽象成了独立维度:两路可以来自过去与未来,也可以都来自过去(两个不同参考帧),合并方式可选平均、距离加权、楔形或差值调制。维度解耦后,工具的组合空间大了,编码器的裁量权也大了。

问:MFMV 会不会在场景切换后给出离谱的预测?
答:切换后的首个参考不可用时,运动场投影自然失效,机制退化为零矢量与空间候选兜底——设计上已经考虑了"场"的边界条件。这也是把运动场放进标准而非编码器私有技巧的好处:失效行为也是标准化的,所有实现一致地退化,不会出现"某些播放器鬼影"的差异化故障。

问:这些工具全开是不是一定更好?
答:单看率失真多半更好,但算力与延迟未必允许。每个复合模式都是双份运动补偿,OBMC 是额外的重叠计算——直播与串流场景常常"纸面收益让位给延迟预算"。工具集丰富的标准同时要求使用者更懂取舍,这正是第 7 章档位体系存在的理由。

本节要点回顾

  • 失效场景驱动:边缘、半透明、交叉遮挡催生复合预测,平均、加权、楔形、差值调制是四种合并范式。
  • 软硬之分:AV1 楔形软掩码对羽化边缘友好,VVC GPM 硬几何分割对锐利边界高效。
  • 运动场公共化:MFMV 把整帧运动共识纳入标准设施,时间维度信息标准化程度逐代加深。
  • 边界问题两条修法:OBMC 重叠平均 vs VVC 精细划分与仿射,殊途同归。

预测至此讲完,残差接下来要被变换、量化并写进码流——第 5 章从变换核对照开始。

补一组工具的适用场景对照。复合预测(双向加权、遮挡-混合模式)的甜点:转场、交叉剪辑、前后景深度差异大的镜头——单参考解释不了的画面,加权混合能把两路残差都压小;它的代价是每个块多一路参考的算力与码字。运动场推断(OVERLAPPED BLOCK MOTION)的甜点:平滑运动区域里的小块——邻居块的运动矢量延伸过来覆盖自己,省掉自己的 MV 信令与预测计算;它在低动态内容(访谈、风景)里使用占比显著,高动态体育内容里占比骤降。两个工具共享同一个工程哲学:用"相邻块的信息"替代"本块的独立决策"——这是 AV1 对照前代的共同省码率思路,也解释了为什么 AV1 的码率优势在低动态内容上比高动态内容更明显。给测试同事的提示:跑 BDRate 对照时按运动强度分桶统计,混合桶的平均值会把"低动态优势"稀释得看不见,分桶才能定位收益的真实来源。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U