1.这个模型能实时运行吗?我的意思是流式的方式,即逐帧运行 2.这个模型是否可以用来作为目标人语音提取的骨干网络?作者可有这方面的研究?即TSE(Target speaker extraction),你所说的look2hear,是做TSE使用的吗?
1.这个模型能实时运行吗?我的意思是流式的方式,即逐帧运行
2.这个模型是否可以用来作为目标人语音提取的骨干网络?作者可有这方面的研究?即TSE(Target speaker extraction),你所说的look2hear,是做TSE使用的吗?