本节摘要:H.264 的 16×16 宏块、HEVC 的 64×64 四叉树、AV1 的 128×128 十种划分、VVC 的 128×128 四叉加二叉三叉,是同一问题的四份答卷。超级块变大摊薄了信令开销,划分形状变多让矩形内容少切几刀,代价是编码器搜索空间指数膨胀。本节用递归树对照把这笔账摆清楚。
把一段 1080p 视频停在某帧:上半是平静的天空,下半是密密的文字字幕。H.264 会把整帧切成八千多个 16×16 宏块,每个宏块都要写一遍自己的预测模式——天空部分其实整片都一样,却被迫重复了上千次"我是平静的"这句话。HEVC 的对策是把块放大到 64×64 并允许四叉树下钻:天空整块搞定,字幕区自动递归切到 8×8。AV1 再进一步,超级块大到 128×128,同时提供十种划分形状,让"字幕行"这种横向结构可以沿行切分而不用切成正方形。
| 体系 | 最大块 | 最小块 | 划分方式 | 每块信令负担 |
|---|---|---|---|---|
| H.264 宏块 | 16×16 | 4×4 | 固定分割类型枚举 | 高(块数多,每块都报模式) |
| HEVC CTU | 64×64 | 8×8 | 四叉树(帧间另有对称/非对称) | 中(递归深度隐式表达层级) |
| AV1 超级块 | 128×128 | 4×4 | 十种形状递归 | 低(大块一次声明覆盖更多像素) |
| VVC CTU | 128×128 | 4×4 | 四叉 + 二叉 + 三叉 | 中低(MTT 表达竖长横长形状) |

很多人把"超级块 128×128"理解为"能编码更大的均匀区域",这只说对了一半。更关键的是每像素信令成本:一个 128×128 块声明一次模式要覆盖 16384 个像素,而 16×16 块同样的一次声明只覆盖 256 个像素。对天空、墙面这类大面积平滑内容,大块相当于把"我是平滑的"这句话的传播成本摊薄了几十倍。H.264 时代信令开销能占到码率的近一成,到大块时代被压到低得多的水平。
划分形状的多样化则服务另一类内容:文字行、UI 栏、栅栏这类强方向性结构。四叉树只会切正方形,遇到一行 8×64 的字幕只能切成四个正方形再补一刀;AV1 的 HORZ_4 直接按行四等分,VVC 的三叉树也能一次切出 1/3 条带。形状库越贴合内容,无效边界越少——无效边界不仅浪费信令,还会让预测和变换都失去抓手。
工具对照不能只算收益。把乘积展开看编码器要搜索的组合数:H.264 宏块候选大致是"分割类型 × 帧内九方向 × 若干帧间模式";AV1 在同等内容上变成"十种划分 × 方向加密后的上百候选 × 多参考组合",搜索空间比 H.264 大几个数量级,比 HEVC 也明显更大。这就是第 7 章"编码时间账单"在算法层的根子:划分树每漂亮一分,编码器的睡眠时间就少一分。
工程上的应对在第 7 章会展开(快速决策、提前退出、基于统计的划分预判),这里先记住因果链:划分体系决定搜索空间,搜索空间决定编码速度。
⚠️ 易错点:超级块尺寸是序列级开关(use_128x128_superblock),同一条流里不会混用 64 与 128。做解码器适配或转码参数规划时,把它当成整条流的属性而不是逐帧属性。
把划分树当作"编码器的预算分配器"来看会更通透:划分选择本质上是编码器在给每块区域分配"描述精度"——平滑区域用大块少说话,复杂区域用小块细描述,而每次细分都要在码流里多写一次划分符号。率失真优化做的就是这个分配的全局寻优:省下的预测与残差比特,要能覆盖多写的信令比特,细分才划算。
这个视角解释了三个常见现象。其一,为什么低码率下画面"块变大":预算紧张时,编码器倾向于用大块少写信令,宁可粗糙也要省——你看到的马赛克变大,其实是划分决策在预算压力下的合理退缩。其二,为什么同一编码器在高分辨率上相对收益更好:像素多了而块级信令不按比例增长,大块工具的摊薄效应放大。其三,为什么快速档与慢速档的划分决策不同:慢档真的去试各种划分,快档用统计与纹理分析预判——同一棵树,搜索深度不同,落点就不同。
问:划分符号本身占多少码率?
答:量级上通常在总码率的几个百分点以内,随内容复杂度与码率水平浮动。低码率时占比上升(残差被压得极小,信令相对显眼),这也是低码率场景偏爱更大块的原因之一。看懂这层占比,就理解为什么各家都想把划分信令做得更省。
问:128 超级块是不是对所有内容都更好?
答:不是无条件更好。对极高复杂度内容(如噪点密集的夜景),大块递归到底的开销增加而收益有限;对存储或算力受限的极端场景,64 模式反而稳妥。序列级的二选一开关正是承认了这种内容相关性——它是工程判断,不是技术信仰。
下一节进入块内部的预测词汇量对照:方向模式从九个到上百个,每一轮膨胀买到了什么。
补一个划分树与内容形态的匹配直觉:四叉树加多向划分的完整空间对真实编码器来说是用不起的(组合爆炸),所以实用编码器都在 RDO 里做了剪枝——剪枝策略的激进程度正是各档位(preset)速度差异的主要来源之一。屏幕内容与动漫在超大平坦区受益于 128×128 超级块的整块直通(一次划分决策覆盖大片区域,省的是决策码字与决策算力);实拍人像的纹理区则把划分树推到叶子,划分决策本身占了可观的码率与算力。对照实验的设计要点:比较划分行为时用"每帧平均划分深度"与"各深度块占比"两个统计量,比单看码率更能说明划分树对内容形态的适配度。给转码平台的启示:内容形态分池(屏录/动漫/实拍)后按池选 preset 与划分相关的开关,比全池一套参数的混合管线在同等算力下能多榨出可观的效率——划分树不是标准给定的免费午餐,是编码器与内容共同演奏的结果。