Appearance
数字音频
概念
数字音频只做三件事,然后倒着做一遍还原出来。
| 步骤 | 做什么 | 关键参数 |
|---|---|---|
| 采样(sampling) | 在时间轴上取离散点 | 采样率 |
| 量化(quantization) | 把每个点的幅度变成有限档位 | 位深 |
| 编码(coding) | 把数字流组织成存储/传输格式 | 码率、格式 |
还原由 DAC(数模转换)完成:读离散值 → 重建连续波形 → 低通滤波去掉采样带来的镜像。
与基础乐理的接口在这里:声音的一切听感(音高 = 频率、音长 = 时值、音强 = 振幅、音色 = 泛音结构)都可以被 频率—时间—振幅 三个维度完整描述,所以只要采样率够、位深够,数字音频原则上可以无损地还原任何声音。
本章是音乐一科唯一技术向的一章,它与主线的交叉点最多——采样与量化是 ADC/DAC 器件的活,滤波与频域是信号与系统的活,压缩编码与网络传输是同一套思路。"把连续世界切成数字"这件事,在音频、图像、传感器里是同一个问题。
原理
采样定理:为什么必须
奈奎斯特—香农采样定理:若信号最高频率为
就能由采样序列无失真地重建原信号。
定理的直观解释:要确定一个正弦波,至少需要在一个周期内取到 2 个点(一个说"高点在哪",一个说"低点在哪")。少于 2 个点,你就分不清它到底是低频还是高频——这不是"采少了失真",而是"高频被伪装成低频"。
**混叠(aliasing)**就是这种伪装:
例如用
你录进去 10 kHz,放出来变成 2 kHz——而且它和真的 2 kHz 完全无法区分。所以 ADC 前面必须有一个抗混叠低通滤波器,先把
| 采样率 | 奈奎斯特频率 | 说明 |
|---|---|---|
| 8 kHz | 4 kHz | 电话语音,够听懂 |
| 22.05 kHz | 11.025 kHz | 早期多媒体 |
| 44.1 kHz | 22.05 kHz | CD 标准,略高于人耳上限 20 kHz |
| 48 kHz | 24 kHz | 影视与专业音频 |
| 96 / 192 kHz | 48 / 96 kHz | 高解析录音与后期处理余量 |
为什么 44.1 kHz 而不是 40 kHz:人耳上限 20 kHz,理论上 40 kHz 就够,但抗混叠滤波器需要一段过渡带(不可能做到理想砖墙),预留 2 kHz 让滤波器有地方"爬坡"。
量化:位深决定动态范围
量化把连续的幅度值映射到有限档位。
| 位深 | 档位数 | 典型用途 |
|---|---|---|
| 8 | 256 | 老式游戏、电话 |
| 16 | 65 536 | CD |
| 24 | 16 777 216 | 录音棚 |
| 32 | 4 294 967 296 | 内部处理(浮点) |
量化必然引入量化噪声(幅度误差 ≤ 半个量化台阶)。对满幅正弦信号,理论信噪比:
"每增加 1 位,动态范围约提升 6 dB" 这条经验公式的全部内容就是这个式子。另一个常用口径是仅按满幅峰值比算:
两种口径差 1.76 dB,引用时必须说清用的是哪一个——这是最常见的口径混淆。
抖动(dither):在量化前加入幅度约 1 LSB 的随机噪声再量化。听起来像"故意加噪",实际效果相反——它把与信号相关的规则失真(听感上像"颗粒感""金属声")换成了与信号无关的随机噪声(听感上是轻微底噪)。人耳对随机噪声的容忍度远高于规则失真,所以加抖动后主观音质更好。这是"用可容忍的误差换取误差类型的改善",与中国音乐史里十二平均律"牺牲 1.955 音分换自由转调"是同一种取舍思维。
PCM 与码率
**脉冲编码调制(PCM)**就是"采样 + 量化 + 编码"三件套的标准实现,WAV 里的音频数据基本都是 PCM。码率(bit rate):
这是本章最该背下来的一条公式:三个因子各对应一个可调的音质维度。
| 格式 | 类型 | 典型码率 | 说明 |
|---|---|---|---|
| WAV / PCM | 无压缩 | 1411.2 kbps(CD) | 原始数据 |
| FLAC / ALAC | 无损压缩 | 约 700~1000 kbps | 熵编码,还原后与原始逐位相同 |
| MP3 | 有损 | 128 / 192 / 320 kbps | 心理声学模型 |
| AAC | 有损 | 128~256 kbps | 同码率优于 MP3 |
| Opus | 有损 | 32~128 kbps | 低码率与网络通话强 |
有损压缩靠什么省
关键不在"删数据",而在**"删听不见的数据",依据是心理声学**:
| 现象 | 内容 | 用途 |
|---|---|---|
| 同时掩蔽 | 强音附近的弱音听不出来 | 强音附近的分量可以粗量化 |
| 时域掩蔽 | 强音前后一小段(约 5~20 ms)内的弱音被掩蔽 | 帧间冗余可丢 |
| 临界频带 | 人耳对频率的分辨不是线性的,而是按频带打包 | 频域按临界带宽分组成"尺度因子带" |
| 绝对听阈 | 低于听阈的成分一律听不见 | 直接丢弃 |
实现路径:分帧 → 加窗 → MDCT(改进离散余弦变换)→ 心理声学模型计算"掩蔽阈值"→ 对每个频带按可容忍误差分配比特 → 熵编码。码率低时,被砍掉的是"被掩蔽掉的细节",不是"整体音质"。 这也解释了为什么 MP3 在低码率下听感劣化明显(掩蔽模型不够用了),而在 128 kbps 以上对多数听众已接近透明。
频域:FFT 与频率分辨率
把时域样本变到频域用 DFT / FFT。做
时频不确定性在这里直接显形:想要精细的频率分辨(小
加窗(Hanning、Hann、Blackman 等)是为了抑制泄漏:直接截断会使频谱"漏"到相邻频点,加窗让两端渐变为 0,代价是主瓣变宽(分辨率略降)。"更好的窗"总是"以分辨率换泄漏抑制",没有免费的选择。
示例
例 1:CD 的码率与文件大小
题目:CD 音频为 44.1 kHz、16 位、双声道。求码率、1 分钟与 10 分钟的原始数据量。
完整计算过程:
1 分钟(60 s)的总比特数:
换成字节(÷8):
10 分钟:
结论:CD 每分钟约 10.58 MB(10.09 MiB)。标准音频 CD 的 74 分钟上限对应的音频数据量:
(80 分钟的 CD-R 则为
而 CD 的时长标准被定为 74 分钟,通行的解释是**"刚好容纳一张贝多芬第九交响曲"(全曲约 74 分钟)**——技术标准的参数常由具体需求反推确定,而不是取一个漂亮的整数。
注意 10.584 MB 与 10.09 MiB 的差别:前者按
例 2:位深与动态范围
题目:给出 8、16、24、32 位的量化档数与两种口径下的动态范围。
完整计算过程:
档位数
峰值口径
正弦 RMS 口径
| 位深 | 档位数 | 峰值口径 (dB) | 正弦 RMS 口径 (dB) |
|---|---|---|---|
| 8 | 256 | 48.16 | 49.92 |
| 16 | 65 536 | 96.33 | 98.09 |
| 24 | 16 777 216 | 144.49 | 146.25 |
| 32 | 4 294 967 296 | 192.66 | 194.42 |
另一个常用量是最小可分辨台阶(1 LSB)相对满幅:
结论:16 位有 65 536 档、动态范围约 96.3 dB(峰值口径)/ 98.1 dB(正弦口径)。而人耳的可听动态范围约 120 dB——所以16 位在极安静段确实不如 24 位:24 位的 144.5 dB 才真正覆盖人耳全范围。
这就是录音棚用 24 位的原因:不是因为"听着更好",而是因为 24 位把量化底噪压到了人耳听阈以下,给后期留下了不损失信息的剪辑与增益调整空间。母带最终发布成 16 位(CD)时,量化噪声已可忽略。
例 3:FFT 分辨率与时间分辨的取舍
题目:分别求
完整计算过程:
结论:
另一头同样重要:
例 4:压缩比与 MP3 帧结构
题目:求 CD 音质压到 128、192、256、320 kbps 的压缩比,并求 MP3 一帧的时长。
完整计算过程:
压缩比 = 原始码率 ÷ 压缩后码率:
无损压缩(FLAC 约 700 kbps):
MPEG-1 Layer III(MP3)每帧 1152 个样本,帧长:
在 32 kHz 采样时:
结论:无损压缩只能省约一半(压缩比 2.02),因为有损格式的 11 倍压缩比里,多出来的那 5 倍全靠"丢掉听不见的东西"——这两者的差距就是心理声学模型的价值。
26.12 ms 这个帧长还解释了 MP3 的一个已知缺陷:编码器有约 26 ms 的算法延迟,加上滤波器组延迟,总延迟常在 50 ms 以上。这就是为什么实时通话、现场监听不用 MP3 类格式,而用低延迟的 Opus / AAC-LD——压缩率与延迟在音频编码里是一对结构性矛盾。
要点
要点与常见误区
- 数字音频三步:采样(时间离散)、量化(幅度离散)、编码(组织数据);还原由 DAC 完成。
- 采样定理
,奈奎斯特频率 = 。44.1 kHz 对应 22.05 kHz,不是 44.1 kHz——把奈奎斯特频率当成采样率是最常见的口误。 - 欠采样的后果是"混叠"而不是"变糊":8 kHz 采 10 kHz 会得到 2 kHz 的假信号,与真 2 kHz 无法区分;所以抗混叠滤波器是采样的前提,不是可选配件。
- 编码前必须滤波,编码后必须重建滤波:少了任一侧,要么进混叠,要么出镜像频率。
- "每 1 位约 6 dB",公式是
dB(满幅正弦)或 dB(峰值口径)——引用时必须说明用的是哪个口径,差的 1.76 dB 常被当成错误答案的来源。 - 抖动(dither)不是"加噪声污染音质":它把与信号相关的规则失真换成随机噪声,主观音质反而更好。这是"换误差类型"的经典手法。
- 码率公式
:三个因子各对应一个可调维度;CD 为 1411.2 kbps。声 道 数 - 无损压缩(FLAC)只能省约一半,有损压缩(MP3 320k)能省 4.4 倍、128k 能省 11 倍——多出来的部分全部来自心理声学的"掩蔽"。
- FFT 分辨率
,与窗长 互为倒数关系:频率分辨与时间分辨不可能同时最优,这是数学边界,不是算法缺陷。 - 不要用高采样率去补救"听不出差别":44.1 kHz 已覆盖人耳 20 kHz 上限;96/192 kHz 的价值主要在后期的滤波余量与处理精度,而不是回放听感。"采样率越高音质越好"是个被营销强化的半真命题。
小结
- 三步走:采样(
)→ 量化( 位)→ 编码(格式与码率),还原靠 DAC。 - 采样定理
;奈奎斯特频率 = ;欠采样导致混叠(8 kHz 采 10 kHz → 假 2 kHz),故必须配抗混叠低通滤波。 - 量化档数
;动态范围约 dB(满幅正弦)或 dB(峰值);16 位 = 65 536 档 ≈ 96.3/98.1 dB。 - 抖动 dither 用随机噪声替代规则失真,主观上更干净。
- 码率
:CD 为声 道 数 bps,每分钟 10.58 MB(10.09 MiB),10 分钟 105.84 MB。 - 有损压缩靠催眠声学的同时掩蔽、时域掩蔽、临界频带、绝对听阈:1411.2 kbps 压到 320 kbps 为 4.41 倍,128 kbps 为 11.03 倍;无损 FLAC 只能到 2.02 倍。
- FFT:
,窗长 ;44.1 kHz 下 1024/2048/4096 点分别为 43.07 / 21.53 / 10.77 Hz,窗长 23.22 / 46.44 / 92.88 ms——时频分辨率的取舍是数学边界。 - 帧长与延迟:MP3 一帧 1152 样本,44.1 kHz 下 26.12 ms;实时场景要用低延迟编解码(Opus / AAC-LD)。
👉 这条线在主线上的落点(本章标 ★ 的原因):数字音频的四块技术,在主线里各有对应的章节——
- 采样定理、滤波器、DFT/FFT、Z 变换:属于信号与系统与数字信号处理的正式内容,见 分支 · 电子与通信;本章只用了它的结论,推导在那里展开。
- 采样保持电路、ADC/DAC 的精度与速度:本质是模拟与混合信号电路问题,见 电 · 电路与数字逻辑;而"用什么工艺做出更快的比较器"回到 硅 · 半导体与器件。
- 码率、压缩与传输:与 计算机网络 里"带宽是稀缺资源,靠压缩换效率"是同一套经济学;音频编解码也算一种信源编码。
- 位深与动态范围的定量关系,与 计算机组成原理 里定点数/浮点数的表示范围与精度是同一个问题:用有限的位表示无限的连续量,必然要在范围与精度之间做取舍。
一句话收束整门音乐课:乐理给出度量(音高、音长、音强、音色),视唱练耳建立感知(内心听觉),音乐史提供上下文(为什么这么写),曲式回答组织(怎么铺开),数字音频交代载体(怎么变成可以用来计算和传输的数据)。从振动到比特,音乐就是这样一路走过来的。
评论(0)
当前浏览器不允许本地存储,评论无法保存。
还没有评论,来说两句。