第一章 公共地基:数字音频与心理声学


文档摘要

第 1 章 · 公共地基:数字音频与心理声学 本章要回答的三个问题:一,一段未经压缩的音频到底占多少比特,这些比特分别买到了什么?二,有损压缩为什么敢丢数据——丢的依据是什么?三,AAC 与 Opus 共用同一套听觉生理学,为什么会在"怎么用这副耳蜗"上分岔? 为什么会有这一章 直接从编码器参数表学起的人,多半会在两个地方卡住。一是看到"128 kbps 立体声""掩蔽阈值""临界频带"这些词时只能死记,因为缺一层从声波到比特的推导;二是遇到音质问题时无从下手,比如"这段语音为什么发闷",答案往往不在编码器选项里,而在采样率、量化噪声与人耳频率敏感度的关系里。

第 1 章 · 公共地基:数字音频与心理声学

本章要回答的三个问题:一,一段未经压缩的音频到底占多少比特,这些比特分别买到了什么?二,有损压缩为什么敢丢数据——丢的依据是什么?三,AAC 与 Opus 共用同一套听觉生理学,为什么会在"怎么用这副耳蜗"上分岔?

为什么会有这一章

直接从编码器参数表学起的人,多半会在两个地方卡住。一是看到"128 kbps 立体声""掩蔽阈值""临界频带"这些词时只能死记,因为缺一层从声波到比特的推导;二是遇到音质问题时无从下手,比如"这段语音为什么发闷",答案往往不在编码器选项里,而在采样率、量化噪声与人耳频率敏感度的关系里。

这一章把 AAC 与 Opus 共同站立的地板铺好:PCM 如何把连续声压变成整数序列、码率账本怎么算、有损压缩的合法性来自哪里、心理声学模型如何把"人耳听不见什么"翻译成"编码器不用传什么"。这些内容在后面每一章都会被反复引用——AAC 的尺度因子、Opus 的频带能量,本质上是同一批概念的不同实现。

读完能解决什么

对照开头的三个问题,本章结束时你应当能够:

  • 用采样率乘位深乘声道数,算出任意 PCM 配置的原始码率,并解释 44.1 kHz、48 kHz 两类采样率约定各自来自什么行业背景;
  • 区分统计冗余与感知冗余,并指出预测编码与变换编码分别在消除哪一本账;
  • 说清绝对听阈、频域掩蔽、时域掩蔽、临界频带四个概念,以及它们如何被换算成量化噪声的分配预算;
  • 解读一条掩蔽阈值曲线,判断某段量化噪声会不会被听见;
  • 概括 AAC 的显式心理声学路线与 Opus 的加权残差路线在方法论上的差异。

其中最后一条是全册对比主线的第一处伏笔:第 2 章会看到掩蔽阈值如何变成 AAC 的尺度因子与比特分配循环,第 3 章会看到 Opus 如何用感知加权与频带能量绕开整套 FFT 掩蔽计算。

各节怎么分工

回答的问题 关键产出
1.1 从声波到比特流 PCM 链路每一步做什么,码率怎么算 码率账本与算例
1.2 有损压缩的两本账 压缩的合法性来自哪里 冗余分类框架与率失真视角
1.3 心理声学模型 "听不见"如何被计算 掩蔽曲线解读方法
1.4 感知策略的分岔 两种编码器怎么用同一副耳蜗 方法论对比表

全章的概念流可以用一张图串起来:时域采样得到整数序列,变换或预测剥掉统计冗余,心理声学模型决定感知冗余的边界,最后量化器在预算内落子。

注意图中"心理声学分析"这一支:AAC 把它实现成独立的 FFT 掩蔽计算模块,Opus 把它揉进 LPC 加权与频带能量估计——同一格,两种实现,这正是 1.4 节的主题。

先决条件

  • 高中物理的波概念(频率、振幅)即可,傅里叶变换不要求先修,用到处会就地解释;
  • 会用命令行执行程序,能读懂简单 Python 或 C 代码;
  • 建议准备一段 48 kHz 的 WAV 测试音频,1.1 节的算例可以直接复算。

往下走到哪

本章出口是一张"感知策略分岔"的对比图。带着它进入第 2 章,你会看到 AAC 如何把心理声学模型工程化成一条完整的频域流水线:MDCT 变换、窗切换、TNS、尺度因子循环——每一个工具都能在 本章 1.2 与 1.3 的概念里找到对应物。而第 3 章的 Opus 会展示另一条路线:当延迟预算被压到毫秒级时,这套经典心理声学机器是如何被拆掉重造的。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U