地铁上录的采访噪音大到听不清人声,AI降噪后像在录音棚里录的
地铁上录的采访噪音大到听不清人声,AI降噪后像在录音棚里录的
上个周末整理硬盘,翻到一段去年录的采访音频。嘉宾是做非遗手工艺的阿姨,讲她怎么跟着师傅学编竹篮,内容特别好,就是录音环境太糟了——当时约在了一个临街的茶馆,窗外车流不断,隔壁桌有人在打牌,背景音里还混着茶馆厨房的炒菜声。我听了不到一分钟就关了,不是不想听,是听不清。
本来打算放弃了,后来想起最近不少人在讨论AI降噪,就拿这段音频试了一下。把文件拖进去,选了个"对话降噪"模式,等了大概十几秒,处理完成。点开播放——
窗外的车流声没了,打牌的喧哗变成了极淡的底噪,炒菜声完全消失了。阿姨的声音被单独提了出来,清晰得像在安静的房间里录的。虽然声调稍微有点发闷,但内容能听清了。
就这一下,我对AI降噪产生了兴趣。后面又拿了几段不同场景的录音反复测试,发现这东西比我想象的能打,但也有一些明确的边界。下面是我测出来的结果。
传统降噪搞不定的,AI降噪能搞定
音频降噪不是一个新需求。录音软件里的降噪插件、手机上的降噪功能、视频会议软件的背景音过滤,这些东西早就有了。但传统降噪有一个根本性的局限:它只能去掉"稳定的"噪音。
传统降噪的原理大致是:先采集一段纯噪音样本(比如空调的嗡嗡声),然后在整个音频里把跟这个噪音频率一致的成分减掉。这个思路对空调、风扇、电脑散热这类持续稳定的噪音效果不错,但遇到突发噪音——汽车鸣笛、键盘敲击、狗叫、杯子碰撞——就基本没用了。因为突发噪音的频率和出现时间无法预测,没法事先采集样本。
AI降噪换了一套逻辑。它不需要你采集噪音样本,而是用训练好的模型去"理解"音频里哪些声音是人声、哪些是噪音,然后把人声保留下来,把噪音剥离掉。这个能力来源于大量的训练数据——模型听过成千上万小时的"噪音+人声"混合音频,学会了从各种噪音中分离人声。
这个区别在复杂场景下体现得尤其明显。我拿了一段在咖啡馆录的对话测试,传统降噪只能去掉咖啡机的低频嗡嗡声,但对周围人的说话声和杯碟碰撞声完全无能为力。AI降噪不但去掉了咖啡机的声音,还把隔壁桌的聊天声压到了几乎听不见的程度,只保留了主要说话人的声音。
它处理的不只是"噪音",而是"所有非目标声音"。这个能力让它能处理一些传统降噪完全搞不定的场景——比如户外风噪、地铁报站广播、甚至雨声。
我拿六种噪音场景挨个测了一遍

为了搞清楚AI降噪到底哪些场景能打、哪些会翻车,我找了六种不同类型的噪音环境,用同一段人声分别混入噪音,然后逐个测试降噪效果。
稳定低频噪音(空调、风扇、电脑散热):效果非常好,基本能完全去除,人声几乎不受影响。这个场景下传统降噪也能做,但AI降噪处理后的人声更自然,没有传统降噪常见的"闷罐感"。
交通噪音(车流、地铁运行、鸣笛):整体效果不错。持续的车流声能去掉八九成,但突然的鸣笛声处理得不太干净——有时候会留下一个被压低了音量的"滴"声尾音,像有人把音量旋钮快速拧了一下。这个残留虽然不影响听清人声,但如果你追求完全干净的音频,可能需要手动再修一下那个尾音。
人声噪音(周围人说话、小孩哭闹、背景笑声):这是AI降噪的强项,也是传统降噪基本做不了的。AI能区分"主要说话人"和"背景说话人",把背景人声压得很低。但有一个前提——主要说话人的声音必须足够大,如果两个人音量差不多,AI可能会判断错误,把你想保留的人声也当成噪音处理了。另外小孩的声音比较特殊,频率高且变化大,AI有时候会漏掉,留一些尖锐的尾音。
风噪(户外大风、吹话筒):效果一般。风噪不是一种"声音",而是气流直接冲击麦克风振膜产生的物理干扰,它的频谱分布很宽,跟人声的频谱大量重叠。AI在处理风噪的时候容易把一些人声频率也一起削掉,导致处理后的声音发闷、发虚。强风场景下,物理防风罩比AI降噪更管用。
突发撞击声(关门、杯子碰撞、键盘敲击):处理结果不太稳定。有些撞击声能被完全去掉,有些会留下一个拖尾——撞击的瞬间被去掉了,但余音还在。原因是AI模型的降噪窗口有一个时间范围,如果撞击声的尾音超过了这个窗口,处理就不完整。键盘敲击声的去除效果尤其不稳定,有时候一把敲击全部消除,有时候漏掉几个。
混响和回声(空旷房间、浴室、走廊):效果看运气。轻度的混响AI能处理,重度混响——比如在空旷的大厅里录音——AI降噪之后声音会变得很奇怪,像被压缩过一样,有种"塑料感"。原因是混响不是独立的噪音,它是人声在空间里反射之后叠加在人声上的,AI很难把反射声和直达声完全分开。
几个主流AI降噪工具用下来的感受
测试过程中用了几款不同的工具,简单说下各自的定位。
Adobe Podcast Enhance是Adobe推出的免费在线工具,专门针对人声降噪优化。它把AI降噪做得比较"傻瓜"——上传音频,自动处理,下载。没有参数可调,不能控制降噪强度。优点是处理效果稳定,人声保真度高,处理后的声音听起来很自然,不会有明显的"电子音"感。缺点是加载有时候比较慢,而且对大文件(超过30分钟)的支持不太好。适合偶尔用一下、不想折腾的人。
Krisp是一款实时降噪软件,在通话过程中实时过滤背景噪音,支持Windows和Mac。它的定位跟前面那些离线工具不同——不是"录完之后再处理",而是"通话中实时降噪"。视频会议的时候开着它,对方听不到你这边敲键盘的声音、狗叫声、小孩哭闹声。延迟很低,大概在20毫秒以内,不影响通话流畅度。适合需要频繁开线上会议的人。
RNNoise是一个开源的实时降噪方案,由Mozilla开发,代码完全公开,可以集成到自己的项目里。降噪效果不如商业方案,但胜在轻量、免费、可自部署。如果你在做直播、在线教育、远程协作类的产品,想在软件里嵌入降噪功能,RNNoise是一个不错的起点。
国内的剪映在手机端内置了AI降噪功能,操作比较简单——导入视频或音频,一键降噪。效果中规中矩,处理日常拍摄素材够用,但对复杂噪音场景的处理不如Adobe Podcast Enhance。优势是方便,做短视频的人不需要在几个软件之间来回导。
还有一类工具走的是"付费专业"路线,比如iZotope RX系列。它不只是一个降噪工具,而是整套音频修复套件,能处理降噪、去混响、去齿音、去爆音、去削波等等。价格不便宜,但效果在专业领域认可度比较高,很多播客和视频后期团队在用。如果你只是偶尔处理一下录音,没必要买这个;如果你做音频内容,每周都要处理大量录音,iZotope RX值得考虑。
AI降噪不能做的事
测了一圈下来,AI降噪的能力边界也比较清楚了。有几个场景别抱太高期望:
多个人同时说话、每个人的音量差不多——AI会搞不清谁是"主要说话人",降噪结果可能是把所有人都压低了,或者只保留了一个人把其他人当噪音去掉了。这个场景目前没有特别好的解决方案,因为问题不在于"怎么去噪音",而在于"怎么选目标"。
背景音乐和人声混在一起——如果你录了一段在商场里说话的视频,背景飘着音乐,AI降噪处理之后,音乐可能被部分去掉、部分保留,导致背景音乐听起来断断续续、忽大忽小,比不去掉还难受。因为AI会把音乐当成噪音去处理,但音乐的频谱和人声高度重叠,剥离起来很难干净。
录音本身质量太差——如果原录音已经是严重失真、爆音、或者人声小到几乎听不见,AI降噪也救不回来。降噪是在"有信号"的基础上"去噪",如果信号本身已经丢失了,AI再聪明也没法凭空恢复。
还有一个容易被忽略的细节:AI降噪处理之后,人声有时候会显得"太干净"了。现实中的录音,即使是在安静的房间里,也会有一些极轻微的环境底噪。完全去掉这些底噪之后,人声会变得有点"悬浮",像是从虚空里冒出来的,听着反而不自然。很多音频工程师会在AI降噪之后,手动加一层极低的底噪回去,让声音"落地"。
有段录音一直没舍得删
测试完这些工具之后,我把硬盘里几段"因为噪音太大而放弃"的老录音都翻出来处理了一遍。大多数效果不错,能听清了。但有一件事让我停了一下。
那段茶馆采访的音频,AI降噪处理之后,阿姨的声音确实清晰了,但同时也去掉了一些东西——茶馆里那个打牌的喧闹声、炒菜锅铲碰撞的叮当声、窗外偶尔经过的自行车铃声。这些声音在听的时候是噪音,但去掉之后,录音突然变得有点"冷"了。少了那种"这座茶馆在某个下午是活着的"的感觉。
后来我把降噪后的版本和原始版本都保留了。降噪版用来整理文字稿,原始版留着偶尔翻出来听——不是为了听清内容,是为了听那个下午。
技术能把噪音去掉,但有些东西跟着噪音一起被拿走了。要不要去掉,取决于你拿这段录音来做什么。
