阿里最新又开源了两个AI语音增强模型,补齐了“背景噪声、回声、多人抢话”三类真实语音问题的最后一块
加上这两个新模型,阿里在AI语音增强上一共凑齐了7个,等于说把“AI听到的声音干不干净”这件事给了系统化解法
一个是,FLASepformer高效语音分离,拆抢话的另一个是,JAEC 16K可解释回声消除,消回声的
以前把两个人混在一起说话的录音拆开比较吃算力,计算量随音频长度平方级暴涨
FLASepformer用“线性注意力”把暴涨改成线性,速度快了1.5~2.3倍、显存只用原来的16%~32%
另外,传统回声消除是个黑盒,出了问题没法查,JAEC 16K把内部两步(先估出延迟有多久、再算出回声长什么样并抵消)做成了可观察的,在调试通话质量时能看到每一步干了什么,延迟只有22毫秒,实时通话完全够用
不过目前只处理线性回声,对喇叭破音这类非线性失真还不支持
另外5个分别是:ZipEnhancer 16k单麦语音降噪DFSMN ANS 48k48kHz实时降噪FRCRN 16k复杂噪声增强MossFormer2 8k语音分离DFSMN AEC 16k实时回声消除
如果做语音助手与识别,就用“降噪组合”、做实时通话与会议,就用“JAEC+降噪”、做多人会议与访谈,就用“分离 +VAD/ASR”等等
这7个模型你就可以按图索骥,想用到什么场景就使用对应的组合
权重:FLASepformer:网页链接
JAEC 16k:网页链接
AI语音AI语音增强模型
