摘要

非平行语料下的语音转换(Voice Conversion, VC)是指在非平行语音数据集的情况下改变源语音特征到目标语音特征的映射技术。由于非平行数据的缺陷,所以当前研究多集中于平行语料下的语音转换,而有关非平行语料的研究提出的模型架构存在局限性,在特定说话人下进行训练得到的模型无法适用于任意说话人下的语音转换,且转化效果有待提高。对此,借鉴两种生成式对抗网络(Generative Adversarial Network, GAN)的变体StyleGAN和CycleGAN的结构特点,对生成器网络的层重新设计,添加辅助特征提取神经网络,提出一种称为Style-CycleGAN-VC的新模型,实现了非平行语料下任意说话人之间的任意语音转换。实验表明,与CycleGAN-VC模型相比,该模型对训练的特定说话人的语音转换效果有所提高,对任意说话人的语音转换效果与其相近。