Rohan Paul@rohanpaul_ai2026年9月30日 13:06StepFun 发布了 StepAudio 3 Music,这是一种将文本描述和歌词转化为成品歌曲的模型。 有趣的工程结果是,更好的音频重建并不一定会产生更好的音乐。 该技术报告比较了单码本和残差矢量量化方法。最终的标记生成器使用一个 50 Hz 的标记流,包含 65,536 个条目,后面跟着一个流匹配的 DiT 渲染器。 为什么这很重要:表示必须保留声音并为自回归模型提供可以可靠预测的序列。单独优化编解码器可能会忽略这种权衡。 (在评论中,您将找到一些音频示例来为该架构提供一些背景信息)打开原帖#511482