语音由声带振动(声源)经声道(滤波器)成形,元音的共振峰是声道的共振频率;乐器按激励方式分弦、管、膜、板四族,音色由谐波结构与起振瞬态决定。声源-滤波器模型把"人的声音"还原成第1章语言能处理的物理系统。
全册知识在"人的声音"上合流:声带是第1章的振动源,声道是第3章的声学腔体,元音分辨是第2章的听觉滤波器问题,语音识别特征则借走了第2章的频谱分析。这一节用最少的工具把两件事讲透:人是怎么发声的,乐器是怎么歌唱的。
发元音时,肺部气流吹动声带周期性开合(成人约 100 至 250 赫兹基频),产生富含谐波的脉冲串——这是声源;声道(咽喉到唇,约 17 厘米的弯管)像一支随形状变化的号角,对谐波做带通滤波,强化某些频带——共振峰 F1、F2、F3……元音的身份就写在共振峰位置里。改变舌头与嘴唇形状等于改变这支声管的腔体分布,共振峰随之移动:口型从"啊"滑到"衣",F1 从约 700 降到 300 赫兹附近。
import numpy as np def vowel_formants(vowel): """成年男性典型元音前两个共振峰(Hz,量级参考)""" return {"a": (730, 1090), "i": (270, 2290), "u": (300, 870), "e": (530, 1840), "o": (570, 840)}[vowel] f0 = 120 # 声带基频 for v in "aiueo": f1, f2 = vowel_formants(v) print(f"元音 [{v}]:F1={f1:4d} Hz, F2={f2:4d} Hz") # 元音 [a]:F1= 730 Hz, F2=1090 Hz # 元音 [i]:F1= 270 Hz, F2=2290 Hz # 元音 [u]:F1= 300 Hz, F2= 870 Hz # 元音 [e]:F1= 530 Hz, F2=1840 Hz # 元音 [o]:F1= 570 Hz, F2= 840 Hz # F1 低 + F2 高(i)舌位高靠前;F1 高(a)口大开 —— 共振峰即"口型坐标"。
元音识别在二维 (F1, F2) 平面上天然聚类——这是语音学教科书第一张图,也是"为什么电话只传 300 至 3400 赫兹还能听清"的答案:前两三个共振峰全在带内。辅音是另一套机理:塞音是短暂爆破的瞬态,擦音是湍流噪声,它们的信息在更高频段与更快的时间尺度上。

弦乐器(琴弦振动经琴体辐射)、管乐器(空气柱共振,一端策略决定奇偶谐波:闭管只有奇次、开管全谱)、膜与板(鼓膜、镲片,非谐波泛音造成"噪声性"音色)。拨弦与拉弦的差别不在频率而在起振瞬态与谐波包络;小提琴与吉他弹同一个音,听感分野来自频谱细节与时间包络——音色的完整定义是三维的:谐波幅度、相位关系、时间过程。十二平均律把八度按 2 的 1/12 次幂等分,保证任意转调都不跑调,代价是除八度外全是近似纯律的有理比——物理的整数比与音乐的等比折中,是音乐声学最漂亮的妥协。
import numpy as np fs = 22050 f0, dur = 220.0, 0.5 t = np.arange(int(fs*dur))/fs n_harm = np.arange(1, 25) # 同一音高、两种"音色":谐波按 1/n(近似弦)vs 指数衰减(近似管+簧) str_harm = 1.0/n_harm reed_harm = 0.5**((n_harm-1)/6) def synth(amps): sig = np.zeros_like(t) for a, k in zip(amps, n_harm): sig += a*np.sin(2*np.pi*f0*k*t) return sig/np.max(np.abs(sig)) s1, s2 = synth(str_harm), synth(reed_harm) def centroid(sig): spec = np.abs(np.fft.rfft(sig*np.hanning(len(sig)))) f = np.fft.rfftfreq(len(sig), 1/fs) return np.sum(f*spec)/np.sum(spec) print(f"谐波 1/n:谱质心 {centroid(s1):6.0f} Hz(暗,接近弦)") print(f"谐波指数衰减:谱质心 {centroid(s2):6.0f} Hz(亮,簧管类)") # 谐波 1/n:谱质心 500 Hz 左右(暗,接近弦) # 谐波指数衰减:谱质心 1100 Hz 左右(亮,簧管类) # 谱质心是音色"明暗"的一维近似 —— 心理声学与音频检索都用它。
(输出具体数值随谐波数与窗长略有浮动,量级如注。)谱质心把"音色明暗"压缩成一个数,是乐器分类与心理声学实验的常用特征——又一次,频谱(第1章 1.2)成为证据。
💡 关键直觉:人声与乐器都是"简单激励 + 复杂共振腔"。改音色调腔(口型、琴体、指孔),改音高调源(声带张力、弦长气压)——调源与调腔,是所有发声系统的两个旋钮。
最后一节望向边界之外:超材料与智能声学。
基频和音高一一对应吗? 大体对应但听感音高还受强度与谐波结构影响(低频提升响度会感觉音高略降,历史上有名的听觉错觉)。音乐家的"音准"是听感量,仪器测的基频只是它的最佳近似。
共振峰不变时改变基频,元音会变吗? 不会变元音身份——歌手唱同一个"啊"跨越两个八度,F1/F2 基本不动,这正是共振峰理论的经典验证。听感上"还是那个字",只是音高在爬。
为什么管乐器温度一高整体跑调? 管内声速随温度升,波长-指位关系整体上移,音高变高。乐队演出前管乐调音、长笛手把笛身捂热再上台,都是这个物理的日常 ritual。