本节摘要:HE-AAC 的两大工具走的是"参数化重建"路线:SBR 不编码高频频谱,而是从低频复制并施加包络与噪声修饰;PS 不编码第二声道,而是用少量空间参数从单声道恢复声像。本节拆解两件工具的原理、码率收益与听感边界,并给出可复现的验证实验。
2.2 节的工具都在"把既有频谱编得更精",本节的工具换了个思路:"不编码某些东西,用参数把它猜回来"。这条参数化路线在低码率区间的效率提升是数量级的,也是后来神经编码"生成式重建"思想的直系前辈(6.1 节会接上这条线)。
乐器与语音的高频段有一条统计规律:谐波结构、瞬态节奏与低频段高度相关。SBR(Spectral Band Replication)利用它做了一个激进的决定——核心编码器只编码到交叉频率(典型约 8 至 12 kHz),以上的频谱完全不传波形,解码端从低频段"平移复制"一份过来,再按传来的少量参数修正。
修正参数有三类:包络(分时间-频率格子描述每个区域该多响,用熵编码压得很紧)、噪声 floor(真实高频里有低频没有的噪声成分,纯复制会"太干净",按参数注入白噪声补质感)、反向与弦音调整(个别区域需要频谱反转或额外正弦补丁)。开销典型每秒几 kbps,换来的却是整个高频段的"存在感"。

PS(Parametric Stereo)把同样的参数化思想用到声道维度:核心编码器只编一个下混单声道,立体声像用三类空间参数描述——声道间电平差(谁响多少)、相位差/时间差(谁先到)、相干性(两个声道多像同一个声源)。参数按少数几个频带量化,开销以每秒几百比特计。解码端由单声道加参数"合成"左右两路。
它的听感边界同样清晰:对"人声居中、伴奏铺开"的常见内容效果良好;对声像快速移动、双声道独立性强的素材(某些电子乐、双语言播客)会露馅。工程上还有一条隐藏约束:PS 之后不能再独立处理左右声道(均衡、声像调整都要在编码前做),这对制作链路是个流程性限制。
收益与边界的分界线大致如下表:
| 配置 | 立体声参考档位 | 听感边界 |
|---|---|---|
| AAC-LC | 128–256 kbps | 高码率基准,工具链最通用 |
| HE-AAC v1 | 32–80 kbps | 高频为参数化重建,锐利高频乐器可辨 |
| HE-AAC v2 | 16–48 kbps | 再加声像参数化,复杂声场会收缩 |
| (对照)Opus 音乐 | 48–96 kbps VBR | 波形编码路线,同档位高频为真实编码 |
验证实验可以直接跑:同一份母带分别编 HE-AAC v1 与 v2,用频谱图对比高频段形态,再用一段镲片密集的音乐做 AB 听感。
# 生成同码率对比样本(需要构建带 libfdk_aac 的 FFmpeg) ffmpeg -i master.wav -c:a libfdk_aac -profile:a aac_he -b:a 48k he_v1.m4a ffmpeg -i master.wav -c:a libfdk_aac -profile:a aac_he_v2 -b:a 48k he_v2.m4a ffmpeg -i master.wav -c:a libopus -b:a 48k opus48.opus # 频谱图直观对比高频段:SBR 重建的"格子感" vs 真实编码的细节 sox he_v1.m4a -n spectrogram -o spec_he1.png sox he_v2.m4a -n spectrogram -o spec_he2.png sox opus48.opus -n spectrogram -o spec_opus.png
观察要点:HE 样本在交叉频率以上能看到包络格子留下的块状纹理,Opus 样本的高频则是连续的噪声样纹理——两条路线在频谱图上留下的指纹完全不同。听感上,镲片的衰减尾、齿音的"沙沙"质感是 SBR 最容易露馅的位置。
参数化重建的"露馅点"值得专门测。SBR 的三个典型暴露位置:镲片与打击乐的衰减尾(复制的高频包络跟不上真实的快速衰减,尾音"变硬");女声齿音的质感(噪声填充的沙沙感与真实齿音的频谱细节有别);极高频的"空气感"(重建的 16 kHz 以上听感偏"平")。PS 的暴露位置:声像快速移动的内容(空间参数按帧更新,跟不上瞬移);双声道独立性强的素材(左右各自独立内容的段落声像会糊)。把这些素材编成一段三分钟的"暴露测试集",是维护 HE 链路的团队值得投入的半天工作。
判读频谱图的两个具体指标:交叉频率处的过渡带是否平滑(陡峭跳变说明参数配置或滤波有问题);高频段的噪声底形态(HE 的重建高频有轻微的"块状"纹理,属正常指纹;出现大面积空洞则是码率不足的信号)。日常巡检里,把这两个指标做成脚本自动比对(编码输出与上一基线的频谱差),能在用户感知之前发现档位漂移。
与 Opus 的同档位对照还有一个实用结论:48 kbps 档位上,HE-AAC v2 与 Opus 的立体声听感各有拥趸(HE 的高频更"亮"、Opus 的高频更"真"),真正拉开差距的是 32 kbps 以下——那里 Opus 的波形编码路线开始明显占优。这也是很多平台把 HE 系下限设在 32 kbps、再往下直接换轨的原因。
问:HE-AAC 的"交叉频率"能调吗,调高好还是调低好?答:交叉频率(核心编码与重建高频的分界)多数实现不暴露直接旋钮,而是由采样率与 Profile 推导;个别实现允许配置时,原则是"核心编码带宽不低于素材的主要能量区间"——人声内容交叉点下移(保中频精确度)收益更大,器乐内容上移(保谐波连续性)更安全。调完必看频谱图验证过渡带。
问:同码率下 HE-AAC v2 与 Opus 该怎么选?答:按 4.3 的约束场走,不按听感微差走——生态锁定 AAC(广播、存量设备)选 HE,浏览器与 App 实时链路选 Opus,两条都通的分发场景再看内容:高频泛音密集的古典与爵士,Opus 的真实编码更稳;人声为主的电台流,HE 的参数化完全够用且生态更顺。真正拉开差距的是 32 kbps 以下——那里 HE 的参数化链开始吃力,能不用就不用。
⚠️ 常见坑:交叉频率与采样率联动。HE-AAC 的标称采样率是输出采样率,核心编码器实际工作在一半采样率上;转码命令里采样率参数配错,会出现"名义 44.1 kHz 实际只有 22 kHz 带宽"的隐性劣化,频谱图一看便知。另一个坑是级联:对已经是 HE-AAC 的素材再次 HE 编码,参数化重建的高频被再次"猜"一遍,失真会叠乘(5.2 节级联损伤专题)。
💡 关键直觉:SBR/PS 的哲学是"高频与声像是低维参数就能骗过耳朵的维度"。它赌的是听众在意整体质感胜过细节真伪。这个赌注在移动网络时代大获成功,也定义了 HE 系的边界——一旦听众开始在意细节真伪(高保真场景),就该换回 LC。
下一节离开算法、走进比特的组织方式:ADTS、ADIF 与 MP4 三种封装如何让 AAC 码流在广播、文件与流媒体生态里各自落地。