本节摘要:所有"H.266比H.265省多少"的说法都依赖一套测量协议。本节把这套协议拆开:BD-rate如何把两条率失真曲线折算成一个数、PSNR/SSIM/VMAF各自量什么与盲什么、以及VVC效率数据的正确读法——分内容类、分延迟档、分编码器成熟度。读完你能识别一份编码评测报告里的每一个坑。
第9章第一站:先立尺子,再去量东西。9.2节将用这把尺子完成一次完整实测。
回顾1.1节的直觉版,这里给完整版。比较编码器A与B:
它的力量在于把整条曲线的信息压成一个可比数;它的坑也来自同样的压缩——以下三种情况BD-rate会骗人:
| 指标 | 量什么 | 盲区 |
|---|---|---|
| PSNR | 逐像素误差的均方对数 | 与主观质量弱相关:块效应与振铃的可见度差异被平均掉 |
| SSIM | 结构相似度(亮度对比结构) | 对几何错位过于宽容;对色度不敏感 |
| VMAF | 机器学习融合的多特征(主为 Netflix 场景调优) | 训练域外内容(屏幕内容、动画)参考性下降 |
| 主观测试(MOS) | 人眼真实感受 | 贵、慢、样本量小——但低码率与HDR场景不可替代 |
实践口径:效率对比用PSNR系(业界惯例,可复现),产品验收补VMAF,画质争议点(低码率、HDR、屏幕内容)上主观测试。VVC早期评测里有个著名现象:同等PSNR下VVC的主观质量往往更好(ALF与去块的功劳)——只看PSNR会低估VVC,这解释了为什么主观测试在标准制定后期权重上升。
三个"分"字诀:
分内容类。JVET CTC把测试序列按内容特性分桶。典型图景(量级示意,具体数字随版本与配置浮动):纹理复杂的自然内容收益大;运动剧烈的体育内容收益中上;屏幕内容在SCC工具加持下收益最大(对照HEVC的SCC扩展版本则收窄);平坦对话内容收益偏小。"VVC平均省四到五成"是均值,你的内容类落在哪一桶才是决策依据。
分延迟档。CTC定义了全帧内、随机访问、低延迟数种配置。工具收益随档位变化明显:随机访问档(可用双向预测与更多参考)收益最大;低延迟档砍掉未来帧参考,收益缩水;全帧内档只剩帧内工具(第3章),收益最小。直播业务要看低延迟档的数据,别拿点播档的数字做预算。
分编码器成熟度。VTM是研究模型(效率上限的标尺,速度不可用);VVenC是生产级编码器(效率略低于VTM、速度可用且多档可选);各家硬件编码器效率与速度各有取舍。"标准能到"与"你的编码器能到"中间隔着一个工程周期——1.3节复杂度对比表已经预告了这一点。

把本节要点压成一份检查单(9.2节将实际执行):
💡 职业习惯:看到任何"XX比YY省NN%"的说法,先问三个问题——什么内容、什么延迟档、什么编码器版本。三个答案齐了,这个数字才有意义;缺一个,就只是宣传。
方法论的最好教材是事故。复盘一次典型的"评测翻车"(细节做了匿名化处理,情节是业界常见戏码):
某团队宣称自家优化让VVC效率再提一成,评审时被三连问击穿。第一问:两个对比组的速度档不同——优化组用slow、基线组用medium,效率差异里混着档位差异;第二问:素材只有一段风光片——单桶结论被包装成了普适结论,屏幕内容桶复测后差异消失;第三问:质量区间不重叠——优化组的工作点整体偏高质量侧,BD-rate的积分区间大部分落在拟合外推段。三问之后,"提升一成"退化为"特定内容特定档位下的边际变化"。
这个案例的教训清单:对比组除自变量外逐项对齐(含速度档这个隐形变量);素材按业务分桶并逐桶报告;BD-rate必须附上有效区间说明。评测报告的可信度不来自结论多漂亮,而来自限制条件交代得多干净。
问:BD-rate能用VMAF当质量轴算吗?
能。BD框架本身与质量度量无关——把PSNR换成VMAF即可得到"同VMAF下的码率差"。实务上双轴都要算:PSNR轴保证与历史数据可比,VMAF轴更贴主观。两轴结论打架时(PSNR持平而VMAF提升),往往意味着优化作用在结构保真上——这本身就是有价值的信号。
问:编码时间要不要一起报?
必须。效率结论脱离速度档没有意义(同一编码器换个档位效率就能差出一成)。规范做法是把速度-效率曲线族一起呈现,或至少注明所有对比组的档位与实测耗时——第9.3节的账本正是从这里接棒的。