
Google DeepMind 发布 Lyria 3.5 音乐生成模型
7 月 30 日,Google DeepMind 发布新一代音乐生成模型 Lyria 3.5。该模型重点提升音乐结构、歌词质量、指令遵循、人声表现及歌曲时长控制能力,可生成最长 3 分钟的完整歌曲,而非仅数十秒的音频片段。
据介绍,Lyria 3.5 延续 latent diffusion 架构,在时间音频 latent 空间进行扩散生成。其训练数据为带有不同粒度文本标注的音频,并通过监督微调(SFT),以及结合人类与 Critic 反馈的强化学习进行后训练。所有生成内容均嵌入 SynthID 水印。
Google 尚未披露训练数据的规模、来源及量化基准测试结果,仅表示与 Lyria 2 相比,新模型在音频清晰度和歌词指令遵循方面有所提升。
Lyria 3.5 首发集成至 Flow Music,支持对话式音乐创作、Stem 分轨、混音、音乐发布及播放列表生成,并可联动 Veo 生成音乐视频。此外,该平台还支持开发音频插件、音乐游戏及自定义数字音频工作站(DAW),进一步整合 Lyria、Veo 与 Gemini。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END











暂无评论内容