第 1 章 · 公共地基:数字音频与心理声学 本章要回答的三个问题:一,一段未经压缩的音频到底占多少比特,这些比特分别买到了什么?二,有损压缩为什么敢丢数据——丢的依据是什么?三,AAC 与 Opus 共用同一套听觉生理学,为什么会在"怎么用这副耳蜗"上分岔? 为什么会有这一章 直接从编码器参数表学起的人,多半会在两个地方卡住。一是看到"128 kbps 立体声""掩蔽阈值""临界频带"这些词时只能死记,因为缺一层从声波到比特的推导;二是遇到音质问题时无从下手,比如"这段语音为什么发闷",答案往往不在编码器选项里,而在采样率、量化噪声与人耳频率敏感度的关系里。
本章要回答的三个问题:一,一段未经压缩的音频到底占多少比特,这些比特分别买到了什么?二,有损压缩为什么敢丢数据——丢的依据是什么?三,AAC 与 Opus 共用同一套听觉生理学,为什么会在"怎么用这副耳蜗"上分岔?
直接从编码器参数表学起的人,多半会在两个地方卡住。一是看到"128 kbps 立体声""掩蔽阈值""临界频带"这些词时只能死记,因为缺一层从声波到比特的推导;二是遇到音质问题时无从下手,比如"这段语音为什么发闷",答案往往不在编码器选项里,而在采样率、量化噪声与人耳频率敏感度的关系里。
这一章把 AAC 与 Opus 共同站立的地板铺好:PCM 如何把连续声压变成整数序列、码率账本怎么算、有损压缩的合法性来自哪里、心理声学模型如何把"人耳听不见什么"翻译成"编码器不用传什么"。这些内容在后面每一章都会被反复引用——AAC 的尺度因子、Opus 的频带能量,本质上是同一批概念的不同实现。
对照开头的三个问题,本章结束时你应当能够:
其中最后一条是全册对比主线的第一处伏笔:第 2 章会看到掩蔽阈值如何变成 AAC 的尺度因子与比特分配循环,第 3 章会看到 Opus 如何用感知加权与频带能量绕开整套 FFT 掩蔽计算。
| 节 | 回答的问题 | 关键产出 |
|---|---|---|
| 1.1 从声波到比特流 | PCM 链路每一步做什么,码率怎么算 | 码率账本与算例 |
| 1.2 有损压缩的两本账 | 压缩的合法性来自哪里 | 冗余分类框架与率失真视角 |
| 1.3 心理声学模型 | "听不见"如何被计算 | 掩蔽曲线解读方法 |
| 1.4 感知策略的分岔 | 两种编码器怎么用同一副耳蜗 | 方法论对比表 |
全章的概念流可以用一张图串起来:时域采样得到整数序列,变换或预测剥掉统计冗余,心理声学模型决定感知冗余的边界,最后量化器在预算内落子。
注意图中"心理声学分析"这一支:AAC 把它实现成独立的 FFT 掩蔽计算模块,Opus 把它揉进 LPC 加权与频带能量估计——同一格,两种实现,这正是 1.4 节的主题。
本章出口是一张"感知策略分岔"的对比图。带着它进入第 2 章,你会看到 AAC 如何把心理声学模型工程化成一条完整的频域流水线:MDCT 变换、窗切换、TNS、尺度因子循环——每一个工具都能在 本章 1.2 与 1.3 的概念里找到对应物。而第 3 章的 Opus 会展示另一条路线:当延迟预算被压到毫秒级时,这套经典心理声学机器是如何被拆掉重造的。