3.1 超级块与划分树对照:从 16×16 到 128×128


3.1 超级块与划分树对照:从 16×16 到 128×128

本节摘要:H.264 的 16×16 宏块、HEVC 的 64×64 四叉树、AV1 的 128×128 十种划分、VVC 的 128×128 四叉加二叉三叉,是同一问题的四份答卷。超级块变大摊薄了信令开销,划分形状变多让矩形内容少切几刀,代价是编码器搜索空间指数膨胀。本节用递归树对照把这笔账摆清楚。

从一个 1080p 画面说起

把一段 1080p 视频停在某帧:上半是平静的天空,下半是密密的文字字幕。H.264 会把整帧切成八千多个 16×16 宏块,每个宏块都要写一遍自己的预测模式——天空部分其实整片都一样,却被迫重复了上千次"我是平静的"这句话。HEVC 的对策是把块放大到 64×64 并允许四叉树下钻:天空整块搞定,字幕区自动递归切到 8×8。AV1 再进一步,超级块大到 128×128,同时提供十种划分形状,让"字幕行"这种横向结构可以沿行切分而不用切成正方形。

体系 最大块 最小块 划分方式 每块信令负担
H.264 宏块 16×16 4×4 固定分割类型枚举 高(块数多,每块都报模式)
HEVC CTU 64×64 8×8 四叉树(帧间另有对称/非对称) 中(递归深度隐式表达层级)
AV1 超级块 128×128 4×4 十种形状递归 低(大块一次声明覆盖更多像素)
VVC CTU 128×128 4×4 四叉 + 二叉 + 三叉 中低(MTT 表达竖长横长形状)

图:同一画面在四代划分体系下的递归过程对照

图:同一画面在四代划分体系下的递归过程对照

信令成本:块变大真正的收益

很多人把"超级块 128×128"理解为"能编码更大的均匀区域",这只说对了一半。更关键的是每像素信令成本:一个 128×128 块声明一次模式要覆盖 16384 个像素,而 16×16 块同样的一次声明只覆盖 256 个像素。对天空、墙面这类大面积平滑内容,大块相当于把"我是平滑的"这句话的传播成本摊薄了几十倍。H.264 时代信令开销能占到码率的近一成,到大块时代被压到低得多的水平。

划分形状的多样化则服务另一类内容:文字行、UI 栏、栅栏这类强方向性结构。四叉树只会切正方形,遇到一行 8×64 的字幕只能切成四个正方形再补一刀;AV1 的 HORZ_4 直接按行四等分,VVC 的三叉树也能一次切出 1/3 条带。形状库越贴合内容,无效边界越少——无效边界不仅浪费信令,还会让预测和变换都失去抓手。

搜索空间:收益的账单

工具对照不能只算收益。把乘积展开看编码器要搜索的组合数:H.264 宏块候选大致是"分割类型 × 帧内九方向 × 若干帧间模式";AV1 在同等内容上变成"十种划分 × 方向加密后的上百候选 × 多参考组合",搜索空间比 H.264 大几个数量级,比 HEVC 也明显更大。这就是第 7 章"编码时间账单"在算法层的根子:划分树每漂亮一分,编码器的睡眠时间就少一分。

工程上的应对在第 7 章会展开(快速决策、提前退出、基于统计的划分预判),这里先记住因果链:划分体系决定搜索空间,搜索空间决定编码速度

⚠️ 易错点:超级块尺寸是序列级开关(use_128x128_superblock),同一条流里不会混用 64 与 128。做解码器适配或转码参数规划时,把它当成整条流的属性而不是逐帧属性。

划分决策的工程视角

把划分树当作"编码器的预算分配器"来看会更通透:划分选择本质上是编码器在给每块区域分配"描述精度"——平滑区域用大块少说话,复杂区域用小块细描述,而每次细分都要在码流里多写一次划分符号。率失真优化做的就是这个分配的全局寻优:省下的预测与残差比特,要能覆盖多写的信令比特,细分才划算。

这个视角解释了三个常见现象。其一,为什么低码率下画面"块变大":预算紧张时,编码器倾向于用大块少写信令,宁可粗糙也要省——你看到的马赛克变大,其实是划分决策在预算压力下的合理退缩。其二,为什么同一编码器在高分辨率上相对收益更好:像素多了而块级信令不按比例增长,大块工具的摊薄效应放大。其三,为什么快速档与慢速档的划分决策不同:慢档真的去试各种划分,快档用统计与纹理分析预判——同一棵树,搜索深度不同,落点就不同。

常见追问

问:划分符号本身占多少码率?
答:量级上通常在总码率的几个百分点以内,随内容复杂度与码率水平浮动。低码率时占比上升(残差被压得极小,信令相对显眼),这也是低码率场景偏爱更大块的原因之一。看懂这层占比,就理解为什么各家都想把划分信令做得更省。

问:128 超级块是不是对所有内容都更好?
答:不是无条件更好。对极高复杂度内容(如噪点密集的夜景),大块递归到底的开销增加而收益有限;对存储或算力受限的极端场景,64 模式反而稳妥。序列级的二选一开关正是承认了这种内容相关性——它是工程判断,不是技术信仰。

本节要点回顾

  • 四级阶梯:16×16 固定宏块 → 64×64 四叉树 → 128×128 十种划分 → 128×128 QTMT,每级都在平衡"贴合内容"与"信令成本"。
  • 摊薄信令:大块的最大收益是每像素信令成本骤降,平滑区域受益最大。
  • 形状贴内容:矩形、T 型、1/4 细分让文字行、UI 栏少切无效边界。
  • 搜索空间是账单:划分越灵活,编码器搜索越贵,这条因果链直通第 7 章的速度对照。

下一节进入块内部的预测词汇量对照:方向模式从九个到上百个,每一轮膨胀买到了什么。

补一个划分树与内容形态的匹配直觉:四叉树加多向划分的完整空间对真实编码器来说是用不起的(组合爆炸),所以实用编码器都在 RDO 里做了剪枝——剪枝策略的激进程度正是各档位(preset)速度差异的主要来源之一。屏幕内容与动漫在超大平坦区受益于 128×128 超级块的整块直通(一次划分决策覆盖大片区域,省的是决策码字与决策算力);实拍人像的纹理区则把划分树推到叶子,划分决策本身占了可观的码率与算力。对照实验的设计要点:比较划分行为时用"每帧平均划分深度"与"各深度块占比"两个统计量,比单看码率更能说明划分树对内容形态的适配度。给转码平台的启示:内容形态分池(屏录/动漫/实拍)后按池选 preset 与划分相关的开关,比全池一套参数的混合管线在同等算力下能多榨出可观的效率——划分树不是标准给定的免费午餐,是编码器与内容共同演奏的结果。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U