本节摘要:单一预测块应付不了遮挡、透明与交叉运动时,复合预测把两份预测按楔形、加权或差值调制合并;运动场推断则让无矢量的块从全帧运动场"借"信息。AV1 的复合模式族与 OBMC、warped motion 构成组合拳,对照 VVC 的 GPM/CIIP/SMVD,本节讲清各家合并策略的取舍与适用边界。
运动补偿假设一个块只做一种运动。现实里的失效场景有三类:物体边缘(一半背景平移、一半前景移动)、半透明物(玻璃、水面,两路运动叠加)、交叉遮挡(两人错身而过)。硬用单一运动,边缘处残差暴涨;编码器的对策要么把块切得更碎(代价是信令与无效边界),要么引入复合预测——把两份预测信号按某种权重合成一份。
三套方案的对照:
| 合并策略 | HEVC/VVC | AV1 |
|---|---|---|
| 平均合并 | HEVC 双向加权预测(B 帧时域加权) | COMPOUND_AVERAGE |
| 距离加权 | HEVC 加权预测(切片级参数) | COMPOUND_DISTWTD(按帧距自动加权) |
| 差值调制 | —(VVC 有 CIIP 联合帧内帧间) | COMPOUND_DIFFWTD(用第二预测的梯度做掩码) |
| 几何分割 | VVC GPM:几何直线分割双预测 | 楔形分割(wedge):预置掩码模板族 |
| 帧内帧间混合 | VVC CIIP | 帧内与帧间复合(inter-intra wedge/diff) |
| 边界重叠修正 | — | OBMC:与相邻块的运动预测重叠平均 |
楔形与 GPM 是最像的一对:VVC 的 GPM 在块内画一条几何直线,两侧各用一路运动补偿;AV1 的楔形则从一族预置模板里挑一个软过渡掩码。区别在掩码性质——GPM 是硬分割,楔形是软混合,过渡带渐变,对半透明与羽化边缘更友好。CIIP 与 AV1 的帧内帧间复合同理成对:都承认"这块既有运动成分又有静止成分"。

前两节讲过块级投影,这里补上它背后的全局视角:MFMV(运动场估计)在编码当前帧前,先从已解码参考帧里读取运动场,为当前帧整体构造一份"邻域运动共识"。没有足够信令预算的小块可以直接取共识矢量当预测,信令开销近乎为零;正常块的时间投影候选也来自这份场。对照 H.264——时间候选在标准里根本不存在,一切靠编码器自带技巧;VVC 把时域候选规则化到并置块,AV1 则把整帧运动场都纳入标准设施。三代的演进方向是"时间维度的信息越来越标准化"。
OBMC 值得单独一提,因为它是"边界失真"的对称解:块级运动补偿各扫门前雪,边界两侧的预测彼此矛盾,闭环里就留下接缝。OBMC 把当前块的预测与相邻块运动所暗示的预测做重叠加权平均,等于在解码端再对齐一次。VVC 没有对等的块级 OBMC,它选择的补丁是更精细的块划分与仿射——同样是边界问题,一家用"重叠平均"修,一家用"切得更准"修,路线差异一目了然。
复合与场推断都不是免费的:复合意味着两路运动补偿算力翻倍(插值、掩码、合并),OBMC 与 warped motion 在解码端同样要付算力。实践开关策略可以归纳成一张决策单:
场景 → 建议配置 固定机位监控/会议: GLOBALMV 受益大, 复合收益低, 可收缩 wedge 电影/剧集点播: ALTREF + DISTWTD + wedge 全开, 离线码率最优 直播低延迟: 关前瞻, 复合只留 AVERAGE/DISTWTD, OBMC 保留 游戏串流(屏幕内容): 楔形与 DIFFWTD 谨慎, 优先 IBC/调色板(见 3.3)
率失真的裁决逻辑始终如一:合并省下的残差比特,要能覆盖多写的那点信令与解码算力的期望成本。哪一路赢,取决于内容——这也是为什么四代标准都不把这些工具做成强制项,而是留给编码器按内容裁决。
💡 一个验证直觉的小实验:同一段双人访谈视频,分别关闭与开启复合预测压两版,人像交叠的瞬间是差距最大的画面。找到"哪类画面在受益",比背工具名有用得多。
问:复合预测和 B 帧双向预测是什么关系?
答:B 帧的双向加权是复合预测的一个特例(两个时间方向的距离加权)。AV1 把"两路信号怎么合并"抽象成了独立维度:两路可以来自过去与未来,也可以都来自过去(两个不同参考帧),合并方式可选平均、距离加权、楔形或差值调制。维度解耦后,工具的组合空间大了,编码器的裁量权也大了。
问:MFMV 会不会在场景切换后给出离谱的预测?
答:切换后的首个参考不可用时,运动场投影自然失效,机制退化为零矢量与空间候选兜底——设计上已经考虑了"场"的边界条件。这也是把运动场放进标准而非编码器私有技巧的好处:失效行为也是标准化的,所有实现一致地退化,不会出现"某些播放器鬼影"的差异化故障。
问:这些工具全开是不是一定更好?
答:单看率失真多半更好,但算力与延迟未必允许。每个复合模式都是双份运动补偿,OBMC 是额外的重叠计算——直播与串流场景常常"纸面收益让位给延迟预算"。工具集丰富的标准同时要求使用者更懂取舍,这正是第 7 章档位体系存在的理由。
预测至此讲完,残差接下来要被变换、量化并写进码流——第 5 章从变换核对照开始。
补一组工具的适用场景对照。复合预测(双向加权、遮挡-混合模式)的甜点:转场、交叉剪辑、前后景深度差异大的镜头——单参考解释不了的画面,加权混合能把两路残差都压小;它的代价是每个块多一路参考的算力与码字。运动场推断(OVERLAPPED BLOCK MOTION)的甜点:平滑运动区域里的小块——邻居块的运动矢量延伸过来覆盖自己,省掉自己的 MV 信令与预测计算;它在低动态内容(访谈、风景)里使用占比显著,高动态体育内容里占比骤降。两个工具共享同一个工程哲学:用"相邻块的信息"替代"本块的独立决策"——这是 AV1 对照前代的共同省码率思路,也解释了为什么 AV1 的码率优势在低动态内容上比高动态内容更明显。给测试同事的提示:跑 BDRate 对照时按运动强度分桶统计,混合桶的平均值会把"低动态优势"稀释得看不见,分桶才能定位收益的真实来源。