腾讯开源语音生成与编辑模型 AuK

腾讯开源语音生成与编辑模型 AuK
腾讯开源语音生成与编辑模型 AuK

腾讯混元开源 15 亿参数语音生成与编辑模型 AuK,官方称其为「音频版 Nano Banana」。该模型将声音克隆、改词、换情绪、去口音、调整语速和音高、降噪、多人及音乐分离等能力整合在同一模型中,可通过自然语言控制。

AuK 可直接编辑已有录音。例如,说错几个字时,只需修改对应片段,无需整段重录;在内容不变的情况下,也能调整情绪、音色或口音。模型还支持改歌词、去除笑声和咳嗽声,以及将正常说话转换为耳语。声音克隆方面,无需先为参考录音配文字稿,只需提供一段声音和新的文本即可生成。

官方测试显示,AuK 在语音生成和通用语音编辑多项评测中表现领先。其中,SpeechEditBench 得分为 49.73,第二名 Ming-UniAudio 为 28.70。快速版 AuK-Flash 经过蒸馏后仅需 4 步推理,速度约提升 4.5 倍。

论文同时指出,AuK 目前尚不能稳定理解所有随意输入的自然语言指令,仍需依赖 Prompt Enhancer 先判断任务、整理参数并改写指令。代码和模型权重已公开,采用 MIT 许可证。

© 版权声明
THE END
喜欢就支持一下吧
点赞10 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容