9 月 23 日,阿里千问发布 Qwen-Audio-3.1 系列语音大模型:语音识别(ASR)、语音合成(TTS)与实时语音交互(Realtime)三类模型全面升级,并同时推出两个全新音频创作模型 Qwen-Audio-3.1-TTS-Next 与 Qwen-Audio-3.1-ASR-Next,五款模型的 API 均已上架千问 AI 平台。同一时间,Qwen-Audio 全线语音模型价格下调:TTS 降约 70%、Realtime 降约 85%、ASR 降幅达 95%。

[1][2]

nut graf:把五款模型和一个"全线降价"放在同一天发布,阿里要表达的意思很明确——音频不再是大模型的附属功能,而是一条独立的、按"理解—生成—交互—创作"铺开的完整能力栈,而这条栈的竞争方式正在复制文本模型的路径:先降价,把价格砍到开发者随便用的程度,再靠生态量取胜。ASR 降 95% 之后,语音识别几乎变成免费资源,这等于把过去"识别很贵"的定价前提整个掀掉了。

具体数字看更直观。按新浪财经转引的官方定价:Qwen-Audio-3.1-ASR-Flash 输入 0.8 元、输出 2.7 元每百万 tokens;TTS-Flash 输入 1.5 元、输出 12 元每百万 tokens。官方口径是 TTS 降价约 70%、Realtime 约 85%、ASR 达 95%。两个"Next"创作模型是这轮的新面孔:它们把音频生成从"念稿子"推到"做内容"——文字、人声、音效、环境声一段到位,指向有声书、播客、短视频配音这类内容生产场景。对开发者的实质变化是:过去做一个会开口的产品,识别、合成、交互要分别选型、分别计费,现在一套 Qwen-Audio-3.1 栈可以一次选齐,价格还降了。

口径上需要区分:降价幅度与具体单价均为厂商发布数据,未见第三方对比测算;"音频创作模型"的能力边界(多轨混音、音效可控性、版权相关处理)官方未在发布信息中给出测试细则。放回行业语境,这轮发布和同日讯飞 Spark-ASR-2.0 形成对照:一边是国内语音老牌厂商在识别端做"成文化"升级,一边是云厂商把整个音频栈打包降价——语音赛道的竞争已经从"谁的识别准"切换到"谁让声音更便宜、更好做成产品"。对中小开发者来说,这可能是第一次,"让产品开口说话"的成本低到可以不计。

[1][2]
下午的声音工作室,一名录音师背影坐在五通道调音台前,面前的大屏上显示五条不同颜色的声波轨道并排铺开,其中几条波形平滑规律、一条波形带细密光点,环绕声场里立着几只监听音箱;录音师一手扶监听耳机、一手在调音台上调节一个推杆,墙上吸音棉,窗外是下午城市。画面无任何文字与数字。
五条轨道,一个声音栈, AI 生成插画,非新闻照片