抖音上模仿多位明星声音唱歌的视频,核心是AI声音克隆(Voice Cloning) 技术。简单来说,就是先让AI“学习”某位明星的声音特点,生成一个专属的“声音模型”,再用这个模型去“演唱”任何歌曲。
这背后的关键技术是RVC(Retrieval-based Voice Conversion),一个开源的声音转换工具。它很强大,只需要几分钟的音频样本,就能训练出一个高度模仿目标声音的模型。而且,它模仿的不只是音高,还包括发音习惯、气息、颤音等细节,效果非常自然。
核心工具:RVC (Retrieval-based Voice Conversion)。
其他选择:
MegaTTS3:抖音团队参与研发的语音合成应用。
VocalMe / 唱醒 (SingUp):提供AI翻唱和音色克隆功能的App。
clone-voice:带网页界面的声音克隆工具。
现有模型:网上可以找到一些已训练好的声音模型(如“AI孙燕姿”),但直接使用他人训练的模型进行商业化同样存在版权争议
问的deepseek,原文有链接