声音四要素:音强、音调、音色与波形包络全解析

发布时间:2026/9/23 17:54:24
声音四要素:音强、音调、音色与波形包络全解析
做音频这行久了我看每一个声音都会不自觉地把它拆开来看——音强、音调、音色、波形包络。这四个概念听起来像是声学课本上的老古董但说真的这些年不管是调混音、做音色、选麦克风还是跟朋友解释“为什么手机外放听着刺耳”最后都会绕回到这四个词上。这篇文章我想把它们从头到尾聊透每个要素在物理上到底是什么耳朵是怎么感知的以及在录音、混音、声音设计里能拿来怎么用。如果你是刚接触音频的新人这套框架能帮你快速建立对声音的系统认知如果是老手也可以看看有没有哪部分是你平时忽略的。1. 为什么这四个词能概括耳朵听到的一切任何一个声音进入耳朵本质上就是空气压力随时间发生变化耳膜感受到这个波动再传给大脑。所以描述一个声音归根到底就是在描述这个“压力波动”的几个侧面波动得有多剧烈对应音强波动得有多快对应音调波动的形状长什么样对应音色波动持续多久、是从大到小还是从小到大对应波形包络。这四个要素不是四个无关的属性而是同一个物理对象的不同投影。就像描述一个人可以从身高、体重、长相、气质四个角度来谈缺一个都不完整。声音也一样只告诉别人“这一个音是A4”就像只说“这个人一米七五”信息量太少加上“音量中等”再补上“是钢琴弹的”“延音踏板踩着让他自然衰减”对方脑子里就能浮现出完整的声音。正好对应音调、音强、音色和包络。我记得刚接触合成器的时候面对一大堆旋钮完全不知道从哪下手。后来把声音拆成这四个方向一下子就通了——振荡器负责音调和基础音色滤波器改变谐波结构也就是音色音量包络控制响度随时间的变化这就是波形包络。所有复杂的声音设计底层全是这套逻辑。所以这篇内容我会按四个要素逐一生拆解再聊它们怎么配合。每部分我都会把物理原理、听觉感知和实际应用捆在一起讲因为只有这三件事对齐了你才算真正理解了一个要素是怎么回事。2. 音强响度不只是“大”和“小”2.1 振幅、声压级还有那个听感不太“线性”的分贝音强的物理来源是声波的振幅也就是空气分子被压缩和稀疏的程度。振幅越大空气压强变化越大鼓膜受到的推力也越大大脑就判断“这个声音更响”。听起来很直白但人耳的听感范围横跨了六个数量级最轻能听见的声音和最响能忍受的声音声压比大约是1比200万。你要是用线性刻度来标音量日常声音几乎都挤在最前面那一小块区域根本没法用。所以就有了分贝dB。声压级用 dB SPL 20 × log10(p / p0) 表示其中 p0 是听觉阈参考值20微帕斯卡。因为声功率和声压的平方成正比所以算功率或能量时用 10 × log10算声压时用 20 × log10。这也就是为什么常说“功放功率翻倍声压级只增加3dB”——功率翻倍即10log10(2)≈3dB折算到声压上听感上只是“稍微响了一点”。这里有个很多新手容易算错的地方两个完全相同频率、相同相位的喇叭叠加声压是翻倍的SPL增加约6dB但如果是两个不相关的乐器声叠加能量上增加约3dB。因为同相位叠加是振幅直接相加而无关声源是功率相加。现场扩声里加一只相同的音箱想让声音明显变响其实收益很有限就是这个原因。刚入行的朋友在系统调试时最容易在这里犯迷糊我先提前把这个坑指出来。日常声源参考值如下方便你建立直觉场景大致声压级感受深夜安静的卧室30-40 dB安静得能听见自己的呼吸正常交谈距离1米55-65 dB舒服、轻松大音量耳机播放85-95 dB时间久了会疲劳摇滚现场前排105-120 dB耳朵开始发闷、刺痛痛阈130 dB立刻难受可能损伤听毛细胞长期在85dB以上环境中工作听力损伤是不可逆的。每次演出或排练之后耳朵里嗡嗡响其实就是听毛细胞在报警了。2.2 耳朵不是音量表等响曲线到底告诉你什么如果只把音强理解为“声压级有多高”那离真实的听觉还差一层。人耳对不同频率的敏感程度完全不同。你对3kHz左右的声音最敏感这是耳道共振的频率区间在进化上有利于我们分辨说话声和危险声音。但对低频和高频灵敏性就差很多尤其在小音量的时候。这就是著名的等响曲线也叫Fletcher-Munson曲线最新的国际标准是ISO 226。简单说它记录的是“在不同频率上要让人觉得和1kHz某个声压级一样响需要多少声压级”。比如你觉得1kHz、60dB的声音是“中等音量”那么100Hz可能要开到70dB10kHz可能要开到70多dB听起来才是同样响。这套响度级别用phon来表示1000Hz处声压级数就等于phon数。这条曲线对混音和听音习惯的影响非常直接。第一小音量听歌时你会觉得低频明显少了高频也不够亮于是容易下意识去拧大低音和亮度等音量一大低频又轰头。所以专业混音时通常会用比较接近最终听音音量的声压级来检查至少要在70-80dB SPL区间否则判断会失真。第二很多监听控制器上带一个“响度补偿”按钮就是按等响曲线在中低频和高频加了低频的增益让你在小音量时也能听得见细节。但它不是Hi-Fi别开着它做混音判断。响度感知里还有一个单位叫sone。1sone对应40dB SPL的1kHz声音2sone是两倍响的主观感知。大致上每增加10dB SPL主观响度感翻倍。注意这不是说3dB的增益变化就完全听不出来而是说“响度翻倍”这种明显程度需要约10dB。2.3 动态范围、压缩器以及响度战争的一笔账动态范围就是最响和最轻声音之间的跨度。乐器的天然动态范围非常宽一架钢琴可以做到从极弱到极强之间接近40-50dB的落差。麦克风拾音后信号进入调音台或声卡数字音频的动态范围由位数限制16bit大约96dB24bit大约144dB但实际可用的动态能到120dB就已经很不错。混音里天天见到的压缩器本质上是在控制音强——把超过阈值的部分压下来再把整体增益提上去让信号的平均响度变大。这里要区分“峰值”和“平均响度”。两个音轨峰值一样并不意味着听感一样响平均能量决定了主观响度。一首歌的打击乐瞬态峰值很高但听起来可能比一个人声更“轻”因为人声的持续能量更强。看电平表时不能只盯峰值表也要用带平均模式或RMS模式的表最好看LUFS——这是衡量节目响度的标准单位流媒体平台如今都按它来归一化。现在很多人做母带的时候还是习惯把音量拉到临界的0dB甚至往限幅器上死磕把波形压成砖块。这就是响度战争的老毛病——大家为了比谁响把动态压得越来越扁。实际上流媒体平台都会统一到一个目标响度你做得再响到平台也会被衰减反而因为过度限幅产生的失真去不掉。我现在做母带的习惯是动态优先LUFS做到-14到-9之间给真峰值留出至少-1dB的余量让平台有空间处理。别迷信越响越好。3. 音调频率不是唯一的决定因素3.1 基频定音高但频率感知是对数的音调对应的物理量是频率正常人耳能听到20Hz到20kHz。一个单纯的正弦波频率越高听到的音高就越高。但人耳对频率的感知不是线性的而是接近对数关系。每提高一个八度频率翻倍。比如标准音A4是440HzA5是880HzA6是1760Hz。你在频谱图上看到两条距离很远的谱线觉得它们可能差很多听感上只是一个八度远没有“数字差距”那么大。十二平均律里每个半音的频率比是2的1/12次方约1.05946。想算任意音高频率用 f 440 × 2^(n/12)n就是距离A4的半音数往高为正、往低为负。比如D3距离A4是-10个半音频率就是440 × 2^(-10/12) ≈ 146.8Hz也就是大家熟悉的D3。这个公式在电子乐器调音和做音高修正时到处都在用建议直接背下来。自然界的音高感知范围也有规律。在1000Hz以下人耳分辨频率的能力很强200Hz和202Hz就能听出差别到了4000Hz以上需要差几十Hz才能有感觉。这和我们前面讲的等响曲线其实是一回事人耳在中低频对频率变化敏感在高频更多靠强度变化获取信息。所以调音师在调低频乐器时频率拧动几Hz都会带来明显的“音准不顺”而切高频EQ时动几百Hz可能才觉得“亮了一点”。3.2 基频缺失你听到的音高是大脑算出来的一个自然声音很少是纯正弦波基本都是复合音包含基频f0和一系列谐波。通常情况下基频决定了我们感知到的音高。但有一个很有意思的现象如果把基频完全滤掉只留2f0、3f0、4f0这些谐波耳朵依然能听到原来的音高。这叫“基频缺失”现象。原因是大脑并不是直接读取频率而是通过谐波之间的间隔来推算基频。比如谐波间隔是200Hz大脑就推断基频是200Hz即使200Hz这个成分根本不存在。这就是为什么手机话筒和听筒的频响曲线都很窄只有300Hz到3.4kHz左右跟你打电话的人声音听起来音高并不会变——低频基频虽然被切掉了但高次谐波间隔保留着基频信息大脑自动补全了。顺便说一个生活中的例子很多人用普通蓝牙音箱放电子低音觉得“听不到低音但感觉有”一部分原因是小喇叭根本放不出很低的频率但那些谐波成分仍然在大脑潜意识地把基频“脑补”出来了。当然真正的体感低音还是需要足够大的振膜去推动空气。3.3 拍频、音分以及调音时为什么总会觉得“糊”两个频率非常接近的声音同时播放时会听到音量周期性忽大忽小这就是拍频。拍频的速率等于两个频率之差。比如一个440Hz一个442Hz会听到每秒2次强弱起伏。这是吉他调音和乐器校音的基本原理也是“听起来抖”的来源。乐队现场经常出现两个吉他手明明都用调音器调准了一合奏却觉得音不准多半是各弦基频虽然准但高次谐波和另一些弦产生了慢速拍频让人听着不舒服。音分cents是比半音更小的单位一个半音等于100音分。人耳大约能分辨5-6音分的偏差在低音区差3音分就可能察觉。所以做修音时不是把每个音符都死吸到0音分就好——修得过头声音就变成了没有生气的“机器人”。我见过有人把整段人声全部对到绝对平均律上结果唱片的感染力全没了。好的人声修音一般设置Auto-Tune的retune speed为20-30ms让音高缓慢滑到目标保留演唱的自然滑音和表情。这里给调吉他或贝斯的朋友一个建议如果你发现和弦总觉得糊别急着换琴弦或调八度先看是不是个别音符的谐波在某些把位上产生了明显的拍频把琴弦新旧程度统一、用较准的调音器逐弦校对后很多时候问题就解决了。4. 音色没有它吉他和小提琴就没有区别4.1 音色的核心谐波结构“音色”在物理上最核心的来源是谐波结构。傅里叶定理说任何周期性波形都可以拆成一系列频率为基频整数倍的正弦波f0、2f0、3f0……这些正弦波的幅度比例决定了声音的明暗和性格。举个例子同样是440Hz的音高、同样的响度钢琴和长笛完全不一样因为它们的频谱成分不同。长笛的低次谐波非常强高次谐波很少波形接近纯正弦波所以音色干净、柔和单簧管只有奇次谐波2f0、4f0这些偶次谐波很弱所以声音带一种特有的“空心感”小号的谐波非常丰富尤其高次谐波比例大所以明亮、有穿透力。我做合成器音色时经常做一个实验用同一个频率的振荡器分别设置成正弦波、三角波、方波、锯齿波然后切到频谱分析仪看。它们基频相同音高就一样但谐波结构完全不同——方波的奇次谐波按照1/n幅度衰减锯齿波则所有谐波都有、幅度按1/n衰减。只要闭着眼睛听就能立刻区分出是哪种波形这就是音色在起作用。如果你想让声音更暗就低通滤波把高次谐波砍掉想让声音更亮就多用锯齿波和小波叠加提高高频比例。4.2 频谱包络与共振峰一个演奏者无法直接控制的“指纹”谐波结构不是永远固定不变的。每个发声体都有自己天然的共振特性有些频段的谐波会被增强有些被削弱。整个频带上谐波幅度的形状叫频谱包络。那些被增强的凸起部分叫共振峰。人声是最直观的例子。声带发出的声源本身是一个锯齿波状的声音包含丰富的高次谐波但口腔、鼻腔、咽腔构成的“管子”有自己共振峰当你说“a”“e”“i”“o”“u”时嘴巴形状改变了共振峰的位置和幅度于是谐波被过滤成了不同样子人耳听到的就是不同元音。这也是声乐里讲的“共鸣”——唱歌时喉咙放松、让口腔打开实际是在调整共振峰让自己的嗓音响亮而不用蛮力。乐器也一样。小提琴的琴体、吉他的箱体、萨克斯的号管都有固定共振频率。同一把吉他在同一位置用不同力度拨弦音高音量都会变但共振峰位置基本不变所以它的“性格”保持稳定。混音时EQ就是在修改频谱包络——提升某个频段相当于强化那一带的谐波比例。比如想让军鼓更有“木感”在200-400Hz提3-5dB想让女声更有“空气感”在8-10kHz做一个宽峰提升。这些操作本质上就是人手去画一个频谱包络。4.3 瞬态和噪声音色里最容易被忽略的那部分谐波结构只能解释稳态延长音的部分。真实乐器的音色里还有大量非周期成分——起音瞬态和噪声。钢琴锤头敲击琴弦的一瞬间指甲触碰琴弦的摩擦声管乐器的气流噪声手在琴颈上滑动的杂音……这些信号不是任何谐波的整数倍关系但正是它们让声音“活”起来。有一个著名的实验把钢琴声音的起音瞬态最初的几毫秒到几十毫秒剪掉大多数听众会认不出这是钢琴听起来反而像管风琴。所以很多音乐教学只听录音时学生很难区分钢琴和管风琴的区别但现场一听就知道了。瞬态是乐器身份识别的重要线索。这也是为什么硬件音源和高端采样器总在强调“多层采样”和“释放采样”——它们不只是录延音还把不同力度下的瞬态和松开琴键时的机械噪声一起录下来听起来才真实。那种只循环采一个长音、不采瞬态的廉价音源总有一种“合成味”。5. 波形包络声音的“形状”比你想的更关键5.1 ADSR音量随时间的变化轮廓波形包络就是声音振幅随时间变化的轮廓。最常用到的描述工具是ADSRAttack、Decay、Sustain、Release。它描述了一个声音从触发到消失的四个阶段Attack从按下琴键/开口发声到音量上升到峰值所需的时间。Decay从峰值降到延音电平所需的时间。Sustain声音持续期间保持的电平。注意它是“电平大小”不是“持续时间”这是最常见的误区。Release从松开按键/停止发声到声音完全消失的时间。给几个典型乐器的包络特征感受一下乐器AttackDecaySustainRelease钢琴很短几到几十毫秒较长接近0自然衰减受延音踏板控制小提琴中等偏长几十到几百毫秒短可以持续弓离开弦后快速消失军鼓极短1ms中等无短管风琴很短几乎无极长松开琴键立即消失这个差异直接决定了乐器在你脑海中的“形状”。钢琴声音像一个大钉子敲进去然后慢慢衰退弦乐像推土机一样平滑地推进打击乐像针扎刺一下很快就没了。合成器里那个叫ENV的包络发生器就是用来让声音具备这种“起止表情”的哪怕波形完全一样、音高完全一样把Attack从2ms拉到2秒耳朵立刻会觉得这不是同一种声音——从“叮”变成“呼”。5.2 包络是乐器识别的大杀器我经常在合成器课上做两个听感实验反响都很好。第一个是把钢琴单音的初始起音部分全部裁掉再慢慢淡入所有人都说“像手风琴或键盘”因为人耳判断乐器时起音瞬态比稳态谐波更重要。第二个是把一段人声的每个字的前10ms都削平听起来像合唱团的“挨个冒头”但还是能认出来是人声因为决定人声识别的主要是共振峰而人声的共振峰本身是包络的一部分。所以你做声音设计的时候如果想让它接近某个真实乐器优先调整的重点不是滤波器和波形而是包络。鼓组里很多合成Kick听起来不像真鼓不是因为频率不对而是attack太慢缺少锤头砸在鼓皮上的那个瞬态有些Pad音色很假是因为attack为零或者太快没有木管或弦乐那种“吸气”的过程。包络不只是音量在变音高也有包络。很多真实乐器的音高在起音瞬间会轻微“上滑”比如人声、小提琴、铜管几音分到几十音分不等然后才稳定到目标音高。调制器的pitch envelope就是模拟这一点如果一点不加合成器独奏怎么听都呆板加一点“pitch attack”下滑或上滑立刻像真人演奏。5.3 混音中包络操纵压缩器不是“音量自动旋钮”混音里最重要的包络操纵工具是压缩器但很多人没用对。压缩器本质上是在改变信号的幅度包络threshold决定包络从哪个电平开始被削平attack控制压缩器介入的速度release控制它退出的速度。你要是把release调得比乐器自然衰减更快会听到明显的“呼吸感”或“抽吸感”正好利用这一点可以做侧链泵动效果但如果是鼓组和贝斯release太快会损掉音尾的延音反而让低频变得顿挫。我个人的做法是给军鼓做压缩attack一般放在1-10ms之间保留敲击瞬态的冲击如果attack放到20ms以上瞬态过去之后压缩器才动作鼓的味道会完全变。给贝斯做压缩时release时间跟歌曲速度对齐大概值可以这样估算release秒数 ≈ 240 / BPM 的一半左右让增益恢复正好卡在下一拍之前这样贝斯的包络会特别“黏”贴着节拍走。另外现在很多现代音乐制作会用“clip/maximize”一类工具把波形的峰全部贴上0dB配合压缩器已经把动态压平包络就变得非常“砖块化”。如果你想让声音听起来自然些可以刻意留出包络的动态差异不要让每一拍都顶得一样满。包络的起伏是音乐表情的原材料。6. 四要素协同工作从物理量到听感的工作流6.1 用四要素描述任何声音一个完整的声音画像单个声音的完整描述可以这样写这是一个A4音高的钢琴音中等偏强的力度60dB SPL左右明亮度适中谐波比较丰满但不扎耳踩下延音踏板让它自然衰减持续了大约三秒钟。这一句话里音调A4、音强60dB、音色钢琴、明亮度、波形包络延音衰减全齐了。任何一段音乐、一个音效你都可以用这套坐标去标注。实际操作中还有一个很重要的经验四要素之间会互相影响。音高越高的声音人耳对音强的主观感觉越强声压级越大人对音调的感知也会略有偏移。音色和包络的耦合最明显——把慢attack放到一个明亮的锯齿波上比放到一个暗淡的正弦波上更容易听出“管乐味”。所以做声音设计时不要孤立地调单个参数要来回试它们组合在一起的效果。我一直建议刚入坑声音设计的朋友听到任何喜欢的音色不要急着找预置先在脑子里回答四个问题音高大概在哪一段整体响度是稳定还是起伏大谐波是偏亮还是偏暗起音和尾音是快是慢能把这四个问题答出来你离复刻这个音色就已经很近很近了。6.2 用耳朵和免费工具做实验把四个要素“看”出来纸上谈兵没意思建议抽半小时用电脑做几个小实验工具用Audacity就够了免费、跨平台、中文界面。第一个实验生成一个440Hz的正弦波再生成一个660Hz的正弦波分别听一下确认它们音高不同然后用“生成→音调”生成一个方波频率还是440Hz——音高相同但音色立刻变了这就是谐波在起作用。第二个实验录一段你自己说话或弹琴的单音把波形放大看注意最前面那几十毫秒的幅度峰值那就是瞬态。然后选中开头一小段删除或把淡入调到500ms再播放听听音色是不是“钝”了很多。这就是包络对识别的决定性影响。第三个实验把一段音乐导入Audacity用频谱分析“分析→绘制频谱图”观察你会看到很多横条纹那就是各个谐波随时间变化的情况。看人声时能直接看到共振峰形成的颜色深浅条带看鼓的时候能看到极短的宽带能量爆发。这些条带就是音强、音调、音色、包络四个要素在同一张图上的综合体现。看熟这种图之后你对混音里频率冲突的理解会上一个台阶。我平时在棚里做听音训练也是用这种方法先看频谱预测听感再盲听验证时间长了耳朵会变得很“刁”。注意别用那种只显示平均频谱的静态图要看随时间滚动的声谱才能真正看到包络。6.3 用四要素来解释日常听感里的几个奇怪现象最后用这套框架解答几个常见困惑。为什么水滴声听起来“很高”水滴本身没有一个稳定的周期性振动它更像一个很短的噪声脉冲激发起气泡的共振峰这个共振峰频率通常比较高。它没有明确基频所以严格说“音高感”是共振峰频率加高频噪声共同给的主要信息都在包络和共振峰上。为什么耳机里已经很大声的底鼓用手机外放立刻像“放屁”手机喇叭的物理尺寸小低频响应本来就差再加上它会产生大量谐波失真而等响曲线在小音量下对中高频更敏感于是真实的低频丢了失真的高次谐波反而被凸显出来。这不是你听音能力的问题是音强、音色、包络三个要素被播放设备扭曲了。为什么同一个人说话在电话里“像换了一个人”电话带限300Hz-3.4kHz把所有共振峰和音色信息削掉了一部分同时低频缺失、高频刺耳。但音调信息因为谐波间隔还在而保持住包络在窄带下也基本不变所以你能听懂意思、听出是谁但总觉得“隔着”。我个人做任何音色调节第一件事不是开EQ也不是翻预置而是先在脑子里把这个声音的四要素过一遍音高在哪个范围响度动态大不大谐波结构偏亮还是偏暗起音和衰减是快是慢。把这四个问题想清楚剩下的操作基本上都是顺理成章的事。这套思路也分享给看到这里的朋友希望它也能成为你往后听声音、做声音时的默认坐标系。