Google 将音乐生成推向迭代式编辑

Google 发布了 Lyria 3.5,这是其音乐生成模型的最新版本,并在 Flow Music 中配套推出了新的编辑控制功能。此次更新的重要性,与其说在于单次生成能力的提升,不如说在于它所体现的生成式音频工具发展方向:它们正从“一次成稿”转向类似软件的修改工作流。

据 Google 介绍,Lyria 3.5 能生成更自然的旋律、改进后的歌词,以及发音更清晰、更加逼真的人声。公司还表示,用户如今可以更细致地控制节奏和音轨长度,生成的作品时长可从 30 秒到 3 分钟不等。这些升级固然重要,但更关键的新增功能可能是名为 Selective Section Painting 的特性,它允许用户只修改音轨的某些部分,而不是从头重做整首作品。

这一变化回应了许多生成式媒体系统长期存在的一个弱点。它们往往能生成一个看似合理的初稿,但当用户想要非常具体的修正时,就不那么好用。如果副歌效果不错但主歌不行,或者节拍到位但人声措辞不准,重启整段创作就会很低效。一个允许用户在局部介入的系统,会更像创意生产工具,而不只是新奇内容生成器。

从提示词输出到可编辑作品

Selective Section Painting 表明 AI 音乐界面正在进入新阶段。模型不再把一首歌视为不可分割的单一输出,而是把它看作可以按区域编辑的内容。这与音乐人、制作人和声音设计师的实际工作方式很接近。他们很少因为某一段需要修改就直接丢弃完整草稿,而是会调整节奏、重写片段、重塑配器,只重做不合适的部分。

Google 表示,该系统还可以把短旋律扩展成更完整的歌曲,而不必彻底重来。实际使用中,这意味着用户可以先勾勒一个想法,再在保留已有成果的基础上有选择地扩展。结合对人声、鼓、贝斯及其他元素的节奏和时长进行更精确控制,此次更新指向的是创作者与模型之间更模块化的关系。

这种模块化在商业上很重要。生成式工具只有能够支持迭代,才更有可能真正嵌入实际创意工作流。只能输出成品的模型或许能在演示中吸引眼球,但能够支持局部修改、结构控制和元素级调整的模型,才更有机会进入生产环境。

为何这次更新对 AI 音频竞争很重要

生成式音乐领域正变得越来越拥挤,控制能力正在成为关键的差异化点。文本生成音乐系统已经证明,它们可以生成短片段和风格草图。更难的问题在于,如何让它们适用于可重复的创意工作。这意味着需要更好的结构、更可预测的节奏,以及能降低创意到修改之间摩擦的编辑工具。

Lyria 3.5 显然正是针对这一问题而来。最长 3 分钟的音轨长度让模型不再局限于非常短的片段。对旋律、歌词和人声真实感的改进,则瞄准了生成音乐与人们可能真正用于项目的素材之间常见的质量差距。但真正让这次发布具有战略意义的,是部分编辑工作流。它表明 Google 理解到,决定采用率的将不仅是新奇感,还有可控性。

这也与生成式 AI 的更广泛趋势一致。图像、视频和代码系统都在朝着局部编辑、结构化优化以及可重复的人机协作工作流演进。音乐之所以在某种程度上落后,是因为音频具有复杂的时间维度:某一段的小改动可能会影响其他部分的节奏、措辞和过渡。如果 Lyria 3.5 能让部分编辑在有限长度内真正可用,那就是一次重要的产品进步。

尚未解决的训练数据问题

这次发布也重新引出了生成式媒体系统中一个熟悉的问题:训练数据透明度。Google 在推出 Lyria 3 时表示,该模型是使用 YouTube 和 Google 在其条款、合作协议以及适用法律下获授权可使用的材料进行训练的。而在关于 Lyria 3.5 的报道中,Google 对新模型训练数据的相关提问并未立即提供更多细节。

这一空白很重要,因为生成式音乐仍然与授权、创作者同意和署名等争议交织在一起。即便模型在控制力和音频质量上有所提升,如果外界无法清楚判断其能力来源于哪些材料,依然会面临质疑。对于艺术家和权利持有人来说,工作流程上的改进并不能解决这些系统如何构建这一更大的问题。

与此同时,产品发布仍在持续推进。这在 AI 媒体领域形成了一个分裂的现实:企业一边竞相推出更好的工具,法律、伦理和商业标准却仍未定型。因此,评估 Lyria 3.5 的用户实际上是在同时判断两件事。一是这款软件的实际用途。二是围绕它的治理框架。

生成式音乐进入更实用的阶段

即便仍有这些未解问题,Lyria 3.5 也表明生成式音乐正从演示走向工作流。此次更新不仅承诺更好的输出,也承诺对输出如何被塑造拥有更强控制力。这比单纯的新奇感更能支持产品采用。

Flow Music 现在承担了这项策略的交付层。通过把 Lyria 3.5 嵌入一个允许用户更精确地调整片段、节奏和时长的产品中,Google 正把这个模型定位为创作流程的一部分,而不是一个孤立实验。这一区别很重要,因为 AI 音频未来的赢家,或许不是那些只能生成歌曲的模型,而是那些能让人更少摩擦地修改、指导并完成歌曲的模型。

就目前而言,这次发布标志着一种虽是渐进式但意义明确的转变。生成式音乐工具正越来越不只是“按下按钮并接受结果”,而是“引导草稿直到符合意图”。如果这一趋势持续下去,AI 音乐系统将越来越不是靠能否生成一首曲子来评价,而是看它们能否多好地帮助用户塑造一首曲子。

  • Lyria 3.5 加强了对节奏和音轨长度的控制。
  • 生成的音轨时长可从 30 秒到 3 分钟。
  • Selective Section Painting 可对歌曲的特定段落进行编辑。
  • 报道中提到,Google 未就 Lyria 3.5 的训练数据提供新的细节。

本文基于 The Decoder 的报道。阅读原文

Originally published on the-decoder.com