混音指南

人声混音怎么做?rap 和 pop 的分步教程

Seimix 团队 · 约 12 分钟

一首歌里,听众第一时间抓住、也最容易挑刺的就是人声。不管 beat 做得多好,只要人声顶不出来、齿音刺耳,或者声音被埋在伴奏底下,整首歌就会显得很业余。好消息是:人声混音不是什么天赋异禀的魔法,而是一套有先后、有逻辑的流程。只要把正确的步骤按正确的顺序走一遍,哪怕是你在家里录的人声,也能拉到接近专业的水准。

这篇教程我会带你把一条人声从头到尾混完:从修音(tuning)开始,接着清理低频、切掉中频的浑浊、用压缩把人声推到前面、控制刺耳的 's' 齿音、加上明亮和空气感、用 reverb 和 delay 做出深度,最后用自动化把每一句都调平衡。rap 和 pop 人声我都会给出具体的频率和比例数值。目标不是让你死记硬背,而是让你真正明白自己在做什么。

开始混音前:干净的素材和正确的顺序

人声混音的一半,其实在你还没打开任何一个效果器之前就完成了。再好的插件也救不回一条烂录音。所以第一步是把素材本身修好:先确认录音没有爆掉(没有 clip),把录音电平的峰值控制在 -6 dB 左右,给后期处理留出足够的余量(headroom)。如果你录了好几条 take,就把每条里最好的句子拼在一起(comping),剪出一条干净完整的演唱。

接下来做粗清理:剪掉句子之间的静音,别把呼吸声全删掉、但压低 4-6 dB 让它柔和一些,有嘴部咂舌声(mouth click)和喷麦(pop)就清理掉。这个编辑阶段看着枯燥,却能让后面的混音轻松到难以想象。

顺序非常重要。整条链路大致这么走:修音 → 编辑/清理 → high-pass 和减法 EQ(切浑浊)→ 压缩 → de-esser → 加法 EQ(presence/air)→ 轻微饱和(saturation)→ reverb 和 delay → 自动化。这个顺序不是随便排的:先把声音清理干净、控制住,再去加颜色和深度。

  • 录音峰值控制在 -6 dB 左右,留出 headroom。
  • 做 comping:把多条 take 里最好的句子拼起来。
  • 别删呼吸声,压低 4-6 dB 驯服它,别丢了自然感。
  • 开效果器之前,先清掉 clip、喷麦和咂舌声。

音准与修音(Tuning):把音高校准

把修音放在整条链路的最前面,因为后面的每一步(尤其是压缩)都会把现有的声音原样放大;你要是不先把跑调的音修好,压缩只会把跑调也一起顶出来。修音有两种做法:实时的自动校正,或者一个音一个音地手动修。手动更自然,但费时间;自动更快,还能根据风格带来特定的味道。

在 rap 和 trap 人声里,很多时候用一个反应快、抓得狠(retune speed 短)的 autotune,就能做出那种标志性的“顺滑”效果。在旋律 rap 和现代 pop 里,这也是一种风格选择。而在传统 pop 和 R&B 里,目标应该是不让人听出效果、只把跑调修掉;把 retune 速度调慢一点,好让颤音(vibrato)和自然的滑音保留下来。

别忘了选对调(key)和音阶。选错 key,修音引擎会把音符往错误的音高上拉,人声反而更跑。如果你不知道歌的调性,就仔细听伴奏,或者从一个参考里找出来。

  • 修音永远放在压缩之前、链路的最前端。
  • rap/trap 用快 retune,自然 pop 用慢 retune。
  • 输对 key;key 错了修音会彻底崩掉。
  • 过度修音会变机器人味;不想要效果就修轻一点。

High-pass 与低频清理

人声里真正有用的信息,一般从 80-100 Hz 以上才开始。这以下的区域大多是房间噪声、麦架震动、空调的嗡嗡声和喷麦(plosive)的能量。开一个 high-pass(low-cut)滤波器把人声清干净:男声 80-100 Hz、女声 100-120 Hz 是不错的起点。

用耳朵调滤波器,别用眼睛。慢慢往上推;当你听到人声的“身体”变薄、“胸腔”感消失的那一刻,就往回退一点。目标是去掉多余的低频,而不是把人声的厚度也弄没了。rap 里通常希望人声贴得很近、很清晰,所以切得稍微高一点(100-120 Hz)很常见。

这一步在小音箱和手机上几乎听不出来,但对整个混音的影响大得惊人:给 kick 和 bass 腾出空间,减少整首歌的浑浊,还能避免压缩器去和多余的低频能量较劲。

  • 男声 80-100 Hz、女声 100-120 Hz 起做 low-cut。
  • 用耳朵调滤波器;身体变薄了就往回退一点。
  • rap 为了清晰可以切得再高一点。
  • 喷麦(plosive)会随着 high-pass 一起明显减轻。

切掉浑浊:200-500 Hz 与中频区

如果人声听起来“发闷”“像隔着纸板说话”,或者“很鼻音”,罪魁祸首通常在中低频。200-400 Hz 这一段给人声身体感,但过量就会产生浑浊(mud)。用一个较窄的 EQ 频段(Q 中等)在这一带扫一扫,找到最难受的那个点,切掉 2-4 dB。别切过头;免得人声变得单薄没底气。

500-800 Hz 附近是“箱声”(boxy)的来源;如果你在声学环境差的地方录音,在这里稍微切一点(1-3 dB)能把声音打开。1-4 kHz 之间则是刺耳和尖锐(harshness)的区域;有些人声在 2-3 kHz 会有一个很凶的共振,也可以用一个窄频段压掉几个 dB。

减法 EQ 的黄金法则:先减,再加。把难受的频率清理掉之后,人声本身就会清晰、专业很多;加明亮是接下来几步的事。

  • 200-400 Hz 把浑浊切掉 2-4 dB,但别把身体感弄没。
  • 箱声就在 500-800 Hz 试着切 1-3 dB。
  • 发刺就在 2-3 kHz 用窄频段压掉几个 dB。
  • 先减后加:干净的底子上加明亮更服帖。

压缩:把人声推到前面

压缩是把人声顶在 beat 前面的关键。一条生的演唱里,最大声和最小声的句子之间落差很大;所以有些字会消失,有些字在喊。压缩器把这个落差压小,让人声稳定地、贴在前面。起步可以试 3:1 的比例、中等的 attack(10-30 ms)和一个跟着音乐走的 release(60-120 ms)。增益衰减(gain reduction)表上,最响的句子峰值大概在 3-6 dB 上下摆动。

attack 时间决定性格:attack 压得太短,会把人声开头的瞬态(transient)削平、变得死板;留开一点,字头的力度就能保留,人声更“活”。rap 和 trap 里想要更狠的控制,这时把比例提到 4:1 甚至 6:1、attack 收短一点,能把人声牢牢贴在胸口上。

与其用一个压缩器压得死死的,不如用串联压缩(两个压缩器各自轻轻地前后接着来):每个只压 2-3 dB,总的控制量一样,但结果更透气、更自然。想让人声更靠前、更密,就用并联(New York)压缩:把一份压得很狠的拷贝,轻轻混到干净信号底下。

  • 起步:3:1 比例、10-30 ms attack、60-120 ms release。
  • 增益衰减在最响的句子里摆动 3-6 dB。
  • rap/trap 用 4:1-6:1 控制更狠。
  • 别用一个压狠,试试串联或并联压缩。

De-esser:驯服刺耳的齿音

随着你加压缩和加明亮,'s'、'sh'、'ch' 这类高频摩擦音(sibilance,齿音)会难受地被顶出来;扎耳朵,尤其在耳机和手机上特别刺。de-esser 就是干这个的:只在这些齿音出现的那一刻、压下它们所在的频率区域,其余时间对人声不碰。

de-esser 的频率对准 6-9 kHz 这一带。女声和音色偏薄的声音,齿音一般更靠上(7-9 kHz);厚实的男声则稍微靠下(5-7 kHz)。要找准点,就用 de-esser 的“试听/solo”模式:只听被压下去的那部分,瞄准你听到最多 'ssss' 的那个频率。

量别下猛了。目标不是把 's' 消掉,而是削掉它的尖;过度 de-essing 会让人声变得大舌头、像“喝醉了”一样说话。一般 3-6 dB 的衰减就够了。把 de-esser 放在压缩和明亮 EQ 之后,因为真正的齿音问题正是这些处理暴露出来的。

  • de-esser 对准 6-9 kHz;薄声往上、厚声往下。
  • 用 solo/试听模式找出 'ssss' 最重的频率。
  • 3-6 dB 衰减就够;别过头,人声会大舌头。
  • 顺序:压缩和 air EQ 之后再 de-ess。

Presence 与 Air:清晰度与光泽

把人声清理干净、控制住之后,接下来就是让它发光。有两个区域特别重要:presence(临场感)和 air(空气感)。3-5 kHz 是 presence 区;在这里做一个 2-4 dB 的宽频提升,能把人声推到 beat 前面,让字更清楚、更好懂。rap 里歌词能不能听清很关键,所以这一带尤其宝贵。

10-16 kHz 则是“air”区。用一个宽 shelf 在这里稍微提一点(1-3 dB),会给人声那种昂贵、通透、“会呼吸”的感觉;在 pop 和 R&B 里能把人声擦得像玻璃一样亮。但要注意:加 air 也会把 sibilance 一起放大,所以得用 de-esser 来平衡。

加法 EQ 用宽频段(低 Q);又窄又猛的提升会让声音变得假、变得硬。永远拿一首专业的参考歌来对比:你的人声跟它比,是发闷了,还是发尖了?这个判断别只靠耳朵凭空下,要靠对比来定。

  • 清晰度在 3-5 kHz 用宽频段提 2-4 dB presence。
  • 空气感在 10-16 kHz 用 shelf 加 1-3 dB。
  • 加 air 时 sibilance 会变大;用 de-esser 平衡。
  • 加法 EQ 用宽(低 Q)频段更自然。

用 Reverb 和 Delay 制造空间感

一条干(无效果)的人声,会死死贴在你脑袋正中间、又平又干。reverb 和 delay 把人声放进一个空间里,给它深度和维度。但最常见的业余错误,就是把这个加过头、让人声淹在一片雾里。原则是:你能感觉到效果,但不能把它的每一下都单独听出来。

reverb 先从短的、中等大小的空间(plate 或 room)试起;rap 里通常一个短而紧的 reverb,加上/或者一个 slap delay(80-160 ms 的单次回声),能让人声保持干爽又有维度。pop 里则常用更长、更宽的 reverb。想让 reverb 不糊,有两个招:给 reverb 的返送轨挂一个 high-pass(切掉 300 Hz 以下),别让浑浊堆积;再给 reverb 一个跟人声同步、贴着速度的 pre-delay 稍微延后一点,让主人声保持清晰。

delay 加的是深度和节奏。一个跟着速度走(比如 1/4 或者附点 1/8)的 delay,会在句尾留下漂亮的回声。delay 的返送也用 EQ 修薄(切掉低频和过高的高频),能把它和主人声分开、更干净。想让人声更“靠前”就把效果收小;想更“氛围”就开大。这完全是看风格的一种平衡。

  • rap 里短 reverb + slap delay(80-160 ms)保持干爽。
  • 给 reverb 返送挂 300 Hz high-pass,别让浑浊堆积。
  • delay 跟速度同步(1/4 或附点 1/8),再用 EQ 修薄。
  • 效果能感觉到,但别把它一下一下单独听出来。

自动化、手机检查与最后润色

压缩把电平粗调平了,但最后的细腻要靠自动化。一句一句地听人声:某个字还是会消失,就把那里的电平手动抬 1-2 dB;某句在喊,就压下去。副歌里把人声往前推一点,主歌里往后收。效果也能自动化:在一句的最后一个字上把 delay 打开、甩出一个“throw”回声,是很流行也很有效的一笔。

混音一定要在不同系统上检查。你的歌大部分会在手机、笔记本音箱和便宜耳机上被听到。小音箱几乎不出低频;在那里靠的是人声的身体感和清晰度。用手机音箱放一遍你的混音:人声会消失吗?高频扎耳朵吗?再切成单声道(mono)听一遍,因为很多系统是单声道播放,一部分立体声效果在那里会消失。

最后,拿参考对比,让耳朵休息。把一首你喜欢的专业歌拉到同样的音量,跟你的人声比一比:你的是更闷、更尖,还是更埋?耳朵 20 分钟就累了;歇一会儿,第二天用新鲜的耳朵再听一遍。上面这一整套步骤(修音、EQ、压缩、de-ess、presence、reverb、自动化)一项项手动去磨,会花掉好几个小时,还要靠经验。如果你想把这个过程加速,或者想一键达到专业参考的水准,可以把人声上传,交给 Seimix 自动混音;系统会用稳妥的数值替你把这些步骤走一遍,你再从结果出发做微调。

  • 一句一句用自动化手动把电平调平 1-2 dB。
  • 副歌把人声推前,主歌轻轻往后收。
  • 一定要用手机音箱和单声道检查。
  • 和参考歌等音量对比;让耳朵休息。

不想手动处理?

把你的音轨上传到 Seimix,选一个预设或直接说出你的需求——几分钟内拿到混音好的文件。7 天免费试用。

常见问题

混人声应该按什么顺序来?

整条链路大致是:先 pitch/tuning,然后编辑和清理,接着 high-pass 和切浑浊的减法 EQ,再是压缩、de-esser、加 presence/air 的 EQ、轻微饱和、reverb-delay,最后才是自动化。这个顺序能让你先把声音清理干净、控制住,再加颜色和深度。最关键的一条规则:tuning 和减法 EQ 一定要在压缩之前。

rap 人声和 pop 人声的混音有什么区别?

rap 里人声要干、要清晰、要贴在 beat 很前面;所以 high-pass 切得稍高(100-120 Hz),压缩更狠(4:1-6:1),reverb 短、常用 slap delay。为了让歌词听清,3-5 kHz 的 presence 非常宝贵。pop 里则更强调更长的 reverb、更多 air(10-16 kHz)、doubling 和氛围。基本步骤一样,只是用量和性格不同。

一定要用 autotune 吗?

不,不是必须的。autotune 有两个用途:作为风格效果(trap 和现代 pop 里那种顺滑的声音),或者只是用来修跑调。如果演唱本身就很干净,你完全可以不用,或者用得很轻。不想要效果,就把 retune 速度调慢,好让颤音和自然滑音保留下来。注意别选错 key,不然修音会把声音弄得更糟。

我的人声为什么在混音里被埋在 beat 底下?

最常见的三个原因:压缩不够(电平太起伏,有些字消失了)、200-500 Hz 的浑浊没切掉、以及 3-5 kHz 的 presence 太弱。解决办法:用 3:1 左右的压缩把电平稳住,把中低频的浑浊切掉几个 dB,再用宽频段把 presence 提 2-4 dB。之后一句一句用自动化,把消失的字手动抬起来。

de-esser 到底是干什么的,放在哪里?

de-esser 只在 's'、'sh'、'ch' 这类高频摩擦音(sibilance)出现的那一刻把它压下去,其余时间不碰人声。这样就能在不让人声变大舌头的前提下,去掉扎耳朵的尖锐。它对准 6-9 kHz 这一带,一般 3-6 dB 的衰减就够。在链路里它放在压缩和明亮/air EQ 之后,因为真正的齿音正是这些处理暴露出来的。

reverb 把我的人声弄糊了,该怎么办?

很可能是 reverb 太长、太大、又没做滤波。试三件事:给 reverb 返送挂一个 300 Hz 的 high-pass,别让低频堆积浑浊;把 reverb 时间缩短(rap 里 plate/room 更好);再把 reverb 稍微延后(pre-delay),让主人声保持清晰。如果你一听到效果就能把它的每一下单独分辨出来,说明你开太大了;把量收小。

人声该我自己混,还是用自动工具?

两条路都合理。想学、想要完全掌控,那就照这篇教程里的步骤手动做,最好不过;你的耳朵会练出来。但这个过程费时间、也要经验。想要又快、又稳定、又达到参考水准的结果,可以把人声上传到 Seimix、让它自动混,再从结果出发做微调。多数制作人会两者结合:一个快速的自动底子,再加上自己的个人润色。

本指南的其他语言版本

更多: 全部指南