ClearerVoice 正式名称为 ClearerVoice-Studio,是阿里巴巴 通义实验室 研发并开源的一套语音处理工具包,把语音增强、语音分离、语音超分辨率和多模态目标说话人提取等任务整合在同一框架内,并附有预训练模型、训练脚本与质量评估工具[1]。其推理组件名为 ClearVoice,使用者既可以按脚本调用,也可以在网页演示页上直接上传音频试听效果[2]。该工具包于 2024 年 11 月开源,相关技术论文于 2025 年 6 月 24 日发布[3]。
定义
ClearerVoice 是一套面向语音信号处理的开源工具包,正式名称为 ClearerVoice-Studio,由阿里巴巴 通义实验室 研发并开源。它把语音增强、语音分离、语音超分辨率和多模态目标说话人提取等任务集中在一个框架内,同时提供预训练模型、训练与微调脚本以及配套的质量评估工具[3]。
整个工具包分为三个部分:ClearVoice 推理平台、Train 训练脚本和 SpeechScore 评估工具包。ClearVoice 封装了 FRCRN、MossFormer 等预训练模型供直接调用;SpeechScore 汇集了信噪比、语音质量感知评估(PESQ)、短时客观可懂度(STOI)、深度噪声抑制平均意见得分(DNSMOS)等多种指标,用来衡量处理前后的语音质量[4]。
各任务的工作采样率并不一致:语音增强覆盖 16 kHz 与 48 kHz,语音分离覆盖 8 kHz 与 16 kHz,语音超分辨率固定输出 48 kHz,音视频目标说话人提取为 16 kHz[5]。
原理
这套工具包的核心模型大多采用掩码估计的思路:先把波形变换到时频域,由神经网络预测一个掩码,再与带噪频谱相乘,得到估计的干净频谱。其训练目标可以写成最小化 $\lVert M_\theta(X)\cdot X - S\rVert^2$,其中 $X$ 表示输入频谱,$M_\theta$ 是模型预测的掩码,$S$ 是干净语音频谱。模型在复数域上同时处理幅度与相位信息,以降低处理后语音的失真[6]。
FRCRN 采用卷积编码器-解码器与循环结构相结合的设计,用复数卷积提取频谱的局部模式,用复数循环网络建模时间上的依赖关系。它的频率循环机制按频带依次处理,以捕捉更细的频谱细节,输出目标为复数理想比值掩码(eiRM)。该模型在 2022 年 IEEE/INTER Speech 语音增强挑战赛(DNS Challenge)中获得整体第二名[6][1]。
MossFormer2 以门控单头 Transformer 与卷积增强的联合自注意力为基础,并引入不含循环神经网络的循环模块。该模块用扩张机制扩大感受野、用密集连接增强信息流动,使模型能够同时建模较长范围的粗粒度依赖与较细粒度的循环模式[7]。
在超分辨率任务中,MossFormer2 与 HiFiGAN 组合成生成器,依据成对的低分辨率与高分辨率语音数据训练,重建丢失的高频频谱成分。多模态说话人提取则接受人脸、手势、参考语音甚至脑电信号等不同条件的输入,其中人脸条件下使用专门的 AV_MossFormer2_TSE_16K 模型[6]。
发展历程
2024 年 11 月,ClearerVoice-Studio 的代码仓库正式发布。同期公布的数据显示,其 FRCRN 降噪模型在魔搭平台上已被调用超过 300 万次,MossFormer 分离模型超过 250 万次。
2024 年 12 月,预训练模型上传至魔搭,用户可以从魔搭或 Hugging Face 下载;同月,媒体对该工具包的开源消息进行了报道[1]。
2025 年 1 月,工具包新增语音超分辨率功能,又称带宽扩展,可把有效采样率不低于 16 kHz 的音频转换为 48 kHz 输出,同时扩大了所支持的音频格式范围;ClearVoice 的在线演示也在 Hugging Face 与魔搭上线。
2025 年 4 月,ClearVoice 支持通过 pip 安装,并补充了语音超分辨率的训练脚本与语音增强的数据生成脚本。同年 5 月,SpeechScore 增加了 NISQA、DISTILL_MOS 等无需参考音频的评估指标;6 月又新增了直接以 NumPy 数组输入输出的接口。
2025 年 6 月 24 日,介绍该工具包的论文发布,文中称其在 GitHub 上已获得约 3000 个星标和 239 次复刻[3]。
应用
官方给出的使用方式包括命令行脚本与网页演示两种。命令行适合批量处理与模型训练,网页界面则允许使用者上传音频后直接试听和下载处理结果,不必自行部署模型[2][6]。
语音分离被用于自动转录、说话人日志和多方通信系统,把多人混叠的录音拆分为各自的说话人音轨;语音增强则用于在嘈杂环境中提升语音的可懂度[6]。
语音超分辨率适合修复降质或经过压缩的录音、改善通信音频,以及在带宽受限的场景中提高语音质量[6]。
在具体场景中,该工具包可用于会议录音整理、电话录音的降噪与分离、视频后期制作中的目标说话人提取,也可作为语音研究的实验平台[8]。
局限
官方文档指出,分离类模型虽然尽量覆盖各类噪声与混响场景,也加入了部分电话通道数据,但训练数据有限,无法囊括所有噪声、混响和电话通道情况,因此不能保证对所有混合数据都取得理想的分离效果[7]。
公开的预训练分离模型默认面向两个说话人的混合音频;超分辨率模型要求输入的有效采样率不低于 16 kHz,输出固定为 48 kHz,处理对象以语音为主[5]。
评估环节也存在条件限制:PESQ、STOI、SI-SDR 等属于需要干净参考音频的侵入式指标,只有 NISQA、DNSMOS、SRMR、DISTILL_MOS 等少数指标可以在没有参考信号的情况下给出评分。此外,处理 wav 以外的音频格式还需要另行安装 FFmpeg[9][2]。
参见
参考资料
- 去除背景噪声 阿里通义实验室开源语音处理技术ClearerVoice-Studio . chinaz.com [引用日期2026-09-29]
- README . github.com [引用日期2026-09-29]
- huggingface.co 上的网页 . huggingface.co [引用日期2026-09-29]
- README . github.com [引用日期2026-09-29]
- deepwiki.com 上的网页 . deepwiki.com [引用日期2026-09-29]
- cornell.edu 上的网页 . cornell.edu [引用日期2026-09-29]
- tasks: . modelscope.cn [引用日期2026-09-29]
- 开箱即用!语音处理黑科技来袭!阿里巴巴开源超强语音处理神器,语音分离、音视频说话人提取等功能一站式解决。 . juejin.cn [引用日期2026-09-29]
- deepwiki.com 上的网页 . deepwiki.com [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T09:00:17Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。