The Decoder 报道,以生成音乐闻名的 Suno 增加了一项叫 Speech 的功能。它把口播文字和配套的背景音乐一起做成同一条音轨。用户输入一个想法或一段写好的文字,并描述想要的声音和音乐风格,模型再同时生成人声和配乐。文章没有写价格,也没有写哪些地区可以使用。
[1]
Suno 产品负责人 Jack Brody 说,公司用一个小组把 Speech 试了一个月。Suno 说,这个功能可以用来做诗、冥想和睡前故事。测试版仍有错误。文章举的例子是,英式口音有时会听起来像澳大利亚口音。
[1]Suno 没有说明这个模型是怎么训练的。文章把这一点放在音乐生成产品面临的版权批评旁边:主要唱片公司已经起诉 Suno;慕尼黑一家法院最近作出不利于这家公司的裁定,拒绝把合理使用当作使用受版权保护数据的理由。这些是文章给出的背景,不是 Speech 这次发布里新公布的训练细节。来源标注为 Suno,这篇是 The Decoder 的短讯。另一家媒体写的是同一项功能,这里不另投。
[1]要点
- Speech 把口播和配套背景音乐生成在同一条音轨上。用户描述声音和音乐风格。
- Jack Brody 说,一个小组试了一个月。用途包括诗、冥想和睡前故事。英式口音有时会像澳大利亚口音。
- Suno 没有说明训练方式。唱片公司的诉讼和慕尼黑法院拒绝合理使用,是文章给出的背景。