|
|
科普常识:常见音频参数解析/ I+ E9 Z5 [, ?: Q/ m0 d' _* n$ X' Q
* _% e3 k' S8 M" U2 Y. x
一、音频
- [# }+ b* ]# ~# M4 V4 V* x7 ~) G0 S) y; }) F
指人耳可以听到的声音频率在20Hz~20kHz之间的声波。. d+ I- W+ N3 G
+ J: S8 A1 f4 m1 E& K8 k1 u 如果在计算机加上相应的音频卡—就是我们经常说的声卡,我们可以把所有的声音录制下来,声音的声学特性如音的高低等都可以用计算机硬盘文件的方式储存下来。反过来,我们也可以把储存下来的音频文件用一定的音频程序播放,还原以前录下的声音。
, A1 u- {6 ~& H1 {1 `
& W2 Y. t5 \% W$ L二、采样频率
. {7 \" @, T$ p& B0 z- d
7 j4 x0 ^6 d$ h 指每秒钟取得声音样本的次数。声音其实是一种能量波,因此也有频率和振幅的特征,频率对应于时间轴线,振幅对应于电平轴线。波是无限光滑的,弦线可以看成由无数点组成,由于存储空间是相对有限的,数字编码过程中,必须对弦线的点进行采样。
1 R, K8 F* p) n# `9 n* P& F4 `( Q
* m' E' X! _9 N* Z+ Q _2 _+ ]" q 采样的过程就是抽取某点的频率值,很显然,在一秒中内抽取的点越多,获取得频率信息更丰富,为了复原波形,采样频率越高,声音的质量也就越好,声音的还原也就越真实,但同时它占的资源比较多。由于人耳的分辨率很有限,太高的频率并不能分辨出来。22050 的采样频率是常用的,44100已是CD音质,超过48000或96000的采样对人耳已经没有意义。这和电影的每秒24帧图片的道理差不多。如果是双声道(stereo),采样就是双份的,文件也差不多要大一倍。
% T* E M, s* q `( ]" c9 J! m# G% \; f4 V& k- U6 S
根据奈奎斯特采样理论,为了保证声音不失真,采样频率应该在40kHz左右。这个定理怎么得来,我们不需要知道,只需知道这个定理告诉我们,如果我们要精确的记录一个信号,我们的采样频率必须大于等于音频信号的最大频率的两倍,记住,是最大频率。: K, K5 J6 T B
3 Y0 v' W* Z# d& p4 M6 X# I* H# Z8 C6 D 在数字音频领域,常用的采样率有:' d/ f/ \8 O, i+ s X
! \* H% \0 I% K( ^- O2 m' j 8000 Hz - 电话所用采样率, 对于人的说话已经足够
- z5 V0 w8 \5 o! Q
4 T6 u2 S/ j) M8 Q% ~ 11025 Hz - 电话所用采样率
- @& Z% \5 q. `& \
# V% w. C8 h0 P `) c 22050 Hz - 无线电广播所用采样率
/ K- c! @; n. p; | ~9 G4 p4 h% |. b- F0 ]- f% b
32000 Hz - miniDV 数码视频 camcorder、DAT (LP mode)所用采样率
/ v1 Q$ h$ \2 C& I5 u7 [5 E3 D9 D# R; }. M
44100 Hz - 音频 CD, 也常用于 MPEG-1 音频(VCD,SVCD,MP3)所用采样率
' h) F9 Y* J, v
$ D0 w* H, O2 P2 o2 ]. A 47250 Hz - 商用 PCM 录音机所用采样率
( B R6 t+ |8 R& K I4 D s2 s* I8 ]: K: {
48000 Hz - miniDV、数字电视、DVD、DAT、电影和专业音频所用的数字声音所用采样率
' X, _/ Q. c( w: ?, v8 |; v9 f9 H
50000 Hz - 商用数字录音机所用采样率' @5 r6 ~$ C3 u) z& _
, ]1 Q0 v) a f( o" e. W- B
96000 Hz或者 192000 Hz - DVD-Audio、一些 LPCM DVD 音轨、BD-ROM(蓝光盘)音轨、和 HD-DVD (高清晰度 DVD)音轨所用所用采样率+ P, q( L1 d! ?. V% `
" S; U' j" k. U二、采样位数% D0 A4 r- O; l& J
5 Q" Y9 b; j/ ^) P6 v0 B) Z
采样位数也叫采样大小或量化位数。它是用来衡量声音波动变化的一个参数,也就是声卡的分辨率或可以理解为声卡处理声音的解析度。它的数值越大,分辨率也就越高,录制和回放的声音就越真实。而声卡的位是指声卡在采集和播放声音文件时所使用数字声音信号的二进制位数,声卡的位客观地反映了数字声音信号对输入声音信号描述的准确程度。常见的声卡主要有8位和16位两种,如今市面上所有的主流产品都是16位及以上的声卡。* Z" E' K; V6 Q$ x3 f2 J4 `/ Q
* l" Q0 j' y {1 _! I% C5 l6 ?
每个采样数据记录的是振幅, 采样精度取决于采样位数的大小:5 `5 y5 z$ e& E+ v
9 y5 t! E+ l! V3 Q" {& m 1 字节(也就是8bit) 只能记录 256 个数, 也就是只能将振幅划分成 256 个等级;
: D( Q. w- S+ r8 J1 ?- Z! L# C' s. a q& P. ]- R* g* k& T
2 字节(也就是16bit) 可以细到 65536 个数, 这已是 CD 标准了;
1 J* x3 M: x. p7 x# J$ l- h3 g* @* ]9 L- E- W0 a
4 字节(也就是32bit) 能把振幅细分到 4294967296 个等级, 实在是没必要了.
6 O6 m6 y; d/ } R4 `' B
U9 R8 L" X& l: b* ^- m; j* k9 N三、通道数
9 X8 a- I+ m, ]! t! _
$ Q; ^ W* B) d# ~( E 即声音的通道的数目。常见的单声道和立体声(双声道),现在发展到了四声环绕(四声道)和5.1声道。& S3 [5 c4 x# ^- ?+ x$ P/ j
, c. o# h- C9 i1.单身道
) r5 D! d; s7 N8 L8 O& P6 o4 t5 }) M' B8 Y+ l
单声道是比较原始的声音复制形式,早期的声卡采用的比较普遍。单声道的声音只能使用一个扬声器发声,有的也处理成两个扬声器输出同一个声道的声音,当通过两个扬声器回放单声道信息的时候,我们可以明显感觉到声音是从两个音箱中间传递到我们耳朵里的,无法判断声源的具体位置。/ l+ Z Q2 X! q6 W
4 @3 k: h/ e" |4 s8 k$ `. d1 g- A
2.立体声
j9 e! p+ k7 y/ M* R8 f
6 B1 _, b) \* v, R$ F$ w* Z7 c) o _' o* ] 双声道就是有两个声音通道,其原理是人们听到声音时可以根据左耳和右耳对声音相位差来判断声源的具体位置。声音在录制过程中被分配到两个独立的声道,从而达到了很好的声音定位效果。这种技术在音乐欣赏中显得尤为有用,听众可以清晰地分辨出各种乐器来自的方向,从而使音乐更富想象力,更加接近于临场感受。
# e P. d- h% X$ x5 d
5 T; h' w) H/ } 双声目前最常用途与两个,在卡拉OK中,一个是奏乐,一个是歌手的声音;在VCD中,一个是普通话配音,一个是粤语配音。
4 N* @$ W) `" i. w' H. X& v* g% t8 S9 l7 o: E
3.四声环绕
. C6 b. L* [* c' `% y) d- Y! T# x2 S. x
四声道环绕规定了前左、前右,后左、后右四个发声点,听众则被包围在这中间。同时还建议增加一个低音音箱,以加强对低频信号的回放处理(这也就是如今4.1声道音箱系统广泛流行的原因)。就整体效果而言,四声道系统可以为听众带来来自多个不同方向的声音环绕,可以获得身临各种不同环境的听觉感受,给用户以全新的体验。如今四声道技术已经广泛融入于各类中高档声卡的设计中,成为未来发展的主流趋势。
: n3 B3 j; J2 H8 m8 r$ t. @0 _8 s8 R- K, q, a
4.5.1声道
% H3 N- q4 [ ^* i" V" A% g7 ~
0 S+ o4 _$ o, a5 B6 n+ k: n+ d" ` 5.1声道已广泛运用于各类传统影院和家庭影院中,一些比较知名的声音录制压缩格式,譬如杜比AC-3(Dolby Digital)、DTS等都是以5.1声音系统为技术蓝本的,其中“.1”声道,则是一个专门设计的超低音声道,这一声道可以产生频响范围20~120Hz的超低音。其实5.1声音系统来源于4.1环绕,不同之处在于它增加了一个中置单元。这个中置单元负责传送低于80Hz的声音信号,在欣赏影片时有利于加强人声,把对话集中在整个声场的中部,以增加整体效果。
9 W# ?9 ^( Y- p& I; b% r' j1 t+ F! g7 I! |: F6 W
目前很多在线音乐播放器,比如说QQ音乐,已经提供5.1声道音乐试听和下载。2 M- {% T: Y. k! [: M/ O6 {! t
$ _2 k6 x) d0 n3 M& j. k四、帧4 h* `$ |3 G. X7 k0 j0 o
! n( f' J4 z8 A9 ?( A7 m 音频的帧的概念没有视频帧那么清晰,几乎所有视频编码格式都可以简单的认为一帧就是编码后的一副图像。但音频帧跟编码格式相关,它是各个编码标准自己实现的。因为如果以PCM(未经编码的音频数据)来说,它根本就不需要帧的概念,根据采样率和采样精度就可以播放了。比如采样率为44.1kHZ,采样精度为16位的双音频,你可以算出比特率是44100*16*2bps,每秒的音频数据是固定的44100*16*2/8 字节。: E, \. A( _+ R0 g7 P; N
/ i+ | }* l7 E$ B2 X8 \ amr帧比较简单,它规定每20ms的音频是一帧,每一帧音频都是独立的,有可能采用不同的编码算法以及不同的编码参数。" U& }4 M- x1 |0 b1 }! y3 H/ a' s! Q
8 C7 w# p# e/ w! k' S1 `1 l mp3帧较为复杂一点,包含了更多的信息,比如采样率,比特率,等各种参数。1 J; ?$ M; V4 x. {+ r3 A
5 E/ |- g4 J$ e9 R- K( k( _5 U% f$ O
五、周期5 r; ]7 e+ J( }) H
( N1 u: H8 X+ o 音频设备一次处理所需要的帧数,对于音频设备的数据访问以及音频数据的存储,都是以此为单位。 V9 d' f/ E" J, `
6 t7 m* o7 ]! Q" _, `4 l7 B8 d `
六、交错模式) o$ M' u5 B+ a& w Z$ z$ n* M* g. g
, f, u; p+ y% x 数字音频信号存储的方式。数据以连续帧的方式存放,即首先记录帧1的左声道样本和右声道样本,再开始帧2的记录。
1 O* k* i9 m0 b0 f) p h" P( E4 k6 C+ i5 b9 A; F" N4 w
七、非交错模式
# D. |9 Q; b" U* m
& o P/ r' d0 f6 u. ]5 {8 o g$ x 首先记录的是一个周期内所有帧的左声道样本,再记录所有右声道样本。
3 G2 G( P; _; F& @& I. f$ u
( o. Y( K0 h$ h八、比特率+ `3 _2 `# \6 Y z! h
" M; f, h* P( E 比特率也叫码率,指音乐每秒播放的数据量,单位用bit表示,也就是二进制位。 bps就是比特率。b就是比特(bit),s就是秒(second),p就是每(per),一个字节相当于8个二进制位。也就是说128bps的4分钟的歌曲的文件大小是这样计算的(128/8)*4*60=3840kB=3.8MB,1B(Byte)=8b(bit),一般mp3在128比特率左右为益,也大概在3-4 BM左右的大小。
8 n* p; H5 Y8 f" O6 X* F6 E: a7 n' e8 i" g* v0 }; G5 _) m, y1 ]
在计算机应用中,能够达到最高保真水平的就是PCM编码,被广泛用于素材保存及音乐欣赏,CD、DVD以及我们常见的 WAV文件中均有应用。因此,PCM约定俗成了无损编码,因为PCM代表了数字音频中最佳的保真水准,并不意味着PCM就能够确保信号绝对保真,PCM也只能做到最大程度的无限接近。' Q9 p: Q1 H) K0 d5 B; G
# @+ s# k4 ]( k( `, ^/ h. W
要算一个PCM音频流的码率是一件很轻松的事情,采样率值×采样大小值×声道数 bps。一个采样率为44.1KHz,采样大小为16bit,双声道的PCM编码的WAV文件,它的数据速率则为 44.1K×16×2 =1411.2Kbps。我们常见的Audio CD就采用了PCM编码,一张光盘的容量只能容纳72分钟的音乐信息。( [0 g; t5 v4 ~3 e- G5 ^
! b$ a* c) f% Q; ? 双声道的PCM编码的音频信号,1秒钟需要176.4KB的空间,1分钟则约为10.34M,这对大部分用户是不可接受的,尤其是喜欢在电脑上听音乐的朋友,要降低磁盘占用,只有2种方法,降低采样指标或者压缩。降低采样指标是不可取的,因此专家们研发了各种压缩方案。最原始的有DPCM、ADPCM,其中最出名的为MP3。所以,采用了数据压缩以后的码率远小于原始码。 |
|