The Decoder 报道,以生成音乐闻名的 Suno 增加了一项叫 Speech 的功能。它把口播文字和配套的背景音乐一起做成同一条音轨。用户输入一个想法或一段写好的文字,并描述想要的声音和音乐风格,模型再同时生成人声和配乐。文章没有写价格,也没有写哪些地区可以使用。

[1]
靛蓝木版上有两条平行的白线,上面一条在右侧收成一个赭色圆点,下面一条更早停住。
同一块版上有两条白线,一条收到圆点,另一条更短。对应口播和配乐放在同一条作品里,长度并不一样。这是插画,不是音频波形。, AI 生成插画,不是新闻照片

Suno 产品负责人 Jack Brody 说,公司用一个小组把 Speech 试了一个月。Suno 说,这个功能可以用来做诗、冥想和睡前故事。测试版仍有错误。文章举的例子是,英式口音有时会听起来像澳大利亚口音。

[1]

Suno 没有说明这个模型是怎么训练的。文章把这一点放在音乐生成产品面临的版权批评旁边:主要唱片公司已经起诉 Suno;慕尼黑一家法院最近作出不利于这家公司的裁定,拒绝把合理使用当作使用受版权保护数据的理由。这些是文章给出的背景,不是 Speech 这次发布里新公布的训练细节。来源标注为 Suno,这篇是 The Decoder 的短讯。另一家媒体写的是同一项功能,这里不另投。

[1]

要点

  • Speech 把口播和配套背景音乐生成在同一条音轨上。用户描述声音和音乐风格。
  • Jack Brody 说,一个小组试了一个月。用途包括诗、冥想和睡前故事。英式口音有时会像澳大利亚口音。
  • Suno 没有说明训练方式。唱片公司的诉讼和慕尼黑法院拒绝合理使用,是文章给出的背景。