本节摘要:"AV1 比 HEVC 省约三成"是行业最常被引用的口径,但它有三个前提:用高质量档的参考编码器、按 VMAF 等感知指标对齐、面向离线转码内容。本节讲清 BD-rate 的测量方法,梳理公开评测的量级区间,并标出数字失效的三类边界。
直接比较文件大小是外行读法——两个编码器在同一码率下画质不同,比大小没有意义。规范做法是 BD-rate(Bjontegaard 速率):在多个码率点上分别测两边的画质(PSNR/SSIM/VMAF),拟合两条率失真曲线,然后计算"达到相同画质时,一边平均省下多少码率"。BD-rate 为负说明更省,负得越多省得越多。
# 一次诚实对照的要素清单 1. 对齐指标: VMAF(感知)或 PSNR/SSIM(信号),写明用哪个 2. 测试集: 内容分布决定结论(动画/实拍/屏幕内容分开看) 3. 编码档位: 双方各用哪些 preset,"公平"是各自调到同等主观质量 4. 输出口径: BD-rate 均值 ± 区间,单点数字要警惕
省三成的完整表述因此是:高质量档位的 AV1 编码器,对高质量档位的 x265,在混合实拍内容上按 VMAF 对齐,BD-rate 约为负三成。Netflix 与学术机构的早期评测曾给出接近四成的数字(离线慢档、高分辨率内容),而 SVT-AV1 中速档对 x265 medium 的对照则收敛到一到两成。区间跨度这么大,正说明"编码器与档位"是结论的一部分,不能只背数字。

数字只在边界内有效,三条边界必须记住。延迟边界:直播实时编码只能用高速度档,搜索深度、前瞻窗口全被压缩,省三成缩水到一成甚至更少——拿离线数字去许诺直播收益是常见事故。分辨率边界:低分辨率内容里,大块工具施展不开,信令占比却更高,AV1 相对 HEVC 的优势明显收窄;反之 4K 场景收益放大的案例最多。内容边界:屏幕内容要走第 3.3 节的专用工具,颗粒内容走 6.4 的颗粒合成,各自的收益曲线与实拍内容不同,混在一张表里会误导决策。
对内容平台,效率数字最终要换算成钱。带宽侧:省三成码率约等于省三成 CDN 流量费;存储侧:同画质库存缩小三成;转码侧:AV1 的算力开销比 HEVC 高(第 7.2 节展开),离线转码池要么扩容、要么接受更长的转码时延。行业实践中的盈亏平衡点大致在"内容热度高、观看量大"的一侧——长尾冷片用 AV1 转码可能省的带宽还覆盖不了算力开销,头部热门内容则几乎稳赚。这也是为什么各平台都从"热门内容优先、移动端优先"开始灰度 AV1。
💡 给一个可复用的口头禅:"哪个编码器、什么档位、对齐什么指标、什么内容"——四要素说全,效率数字才有意义。 少说一个,都是在给别人挖坑。
公开实测的代表性结论可以这样归纳:以 VMAF 为质量标尺,AV1 相对 HEVC 的码率节省普遍报在两成到三成,相对 H.264 报在四成上下;高分辨率(1080p 以上)与中低码率区间的优势更明显,低分辨率高码率区间收益收窄。但比数字更重要的是产生数字的方法论——任何一家给出的对照都受四个变量支配:测试集构成(实拍/屏录/动漫的比例)、质量指标(PSNR 偏结构、VMAF 偏主观拟合)、编码器调校水平(libaom 与 SVT-AV1 的差异可以大到掩盖代际差)、目标档位(中低码率区间优势最大)。引用外部数据的核对清单:样本量与内容构成是否公开、编码器版本是否标注、是否同一 preset 档位下对比、是否做了统计显著性处理。自己复测的最小方案:从业务内容池抽三十条代表样本、两套编码器各按目标质量档跑、用同一 VMAF 版本算 BD-Rate,两小时内可得自己的真实数字——这个数字才是转码预算审批的依据,论文数字只是参考系。
补一组分场景的细粒度读数,供不同业务对号入座。长视频流媒体(电影剧集):AV1 在 1080p 中低码率区间的节省最扎实,VMAF 口径两成起步、字幕密集与暗场多的内容更高;短视频(竖屏、强剪辑、高饱和):节省缩水到一成出头,原因是剪辑频繁破坏时域预测的积累;动画与动漫:大面积平坦色块加上稳定镜头,节省可以超过三成,是 AV1 的甜点内容;摄像头监控类长静场:时间冗余极高,节省幅度同样可观,但要注意噪声(低照度传感器噪声)会显著侵蚀收益——先做时域降噪再编码,节省率可以恢复大半。屏幕共享与游戏串流是另一族:调色板与屏内工具发力,但实时档位的 preset 限制会让部分工具闲置。把这组读数和 1.3 的 preset 曲线、6 章的滤波栈收益叠在一起,才构成一张完整的收益地图——单看任何一层都会高估或低估。最后一个实操纪律:所有内部对照结果都要归档到版本化的基准库里(内容样本、编码器版本、参数、指标、日期五要素齐全),半年后争论收益时,基准库就是唯一的仲裁者。
再补一个指标选择的专门讨论,因为它是对照结论分歧的最大来源。PSNR 是像素级保真度,对压缩工具的结构性取舍不敏感(AV1 的滤波栈与颗粒合成恰恰牺牲像素保真换主观观感),用它对照会系统性低估 AV1;SSIM 加入了结构感知,改善有限;VMAF 由Netflix用主观分训练而来,是流媒体行业的事实标尺,对滤波与颗粒合成友好,但它的训练集偏实拍内容,屏录与动漫场景要改用 UMAF 或补充主观抽检。指标之外还有口径问题:BD-Rate 的计算要在同一质量锚点区间内插值,锚点选择(低质端还是高质端)会平移结论几个百分点。给报告作者的模板:公布任何对照时附上四件套——内容样本清单、指标与版本、编码器与参数、BD-Rate 区间而非单点。给报告读者的口诀:没有四件套的对照结论,一律当营销材料处理。这套纪律不只适用于 AV1,它是所有性能对照报告的通用免疫机制。