跳到主要内容

Google DeepMind发布Lyria 3.5音乐生成模型,支持生成最长3分钟完整歌曲

7月30日 01:36

7 月 30 日,Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,重点提升音乐结构、歌词质量、指令遵循、人声表现及歌曲时长控制能力,可直接生成最长 3 分钟的完整歌曲,而非仅数十秒音频。


据介绍,Lyria 3.5 仍采用 latent diffusion 架构,在时间音频 latent 空间进行扩散生成,训练数据为带有不同粒度文本标注的音频,并通过 SFT 及结合人类、Critic 反馈的强化学习进行后训练,所有生成内容均嵌入 SynthID 水印。不过,Google 未披露训练数据规模、来源及量化 Benchmark,仅表示相较 Lyria 2,在音频清晰度和歌词指令遵循方面取得显著提升。


此外,Lyria 3.5 首发集成至 Flow Music,后者支持对话式音乐创作、Stem 分轨、Remix、音乐发布、播放列表生成,并可联动 Veo 生成音乐视频,还支持开发音频插件、音乐游戏及自定义 DAW,进一步整合 Lyria、Veo 与 Gemini,构建覆盖音乐创作、编辑、发布和分发的完整生态。

来源