Qwen
@Alibaba_Qwen
⚡ 认识 Qwen-Audio-3.1! ASR、TTS 和 Realtime 全面升级,加入了两个新模型:用于音频创建的 TTS-Next 和用于音频理解的 ASR-Next。
五种模型,一个完整的音频堆栈:理解、生成、交互和创作。
此外,整个产品系列均大幅降价:TTS 约 70% 折扣,Realtime 约 85% 折扣,ASR 高达 95% 折扣。
亮点:🥳
- ASR:更强的多语言和方言识别能力,加上自动删除填充物和重复内容的本地优化,以实现更清晰、更合乎逻辑的转录。
- ASR-Next:支持带有说话者标签、时间戳和对齐文字记录的多说话者 ASR,并理解情感、环境声音和机器声音,以实现声音字幕、事件定位、音频 QA 和推理。
- TTS:多语言和方言合成,具有自然的跨语言语音传输; 通过简单的指令控制情绪、速度和风格。
- TTS-Next:统一的 LM + 扩散框架,一次性为有声读物、播客、游戏和广告生成语音、音效和背景音频。
- 实时:即讲即听,随时中断,就像真正的通话一样; 当它感觉到情绪低落时,它甚至会放慢速度并做出同理心的反应。
释放 Qwen-Audio-3.1 的全部潜力! 👇
- 博客:https://t.co/e0M8wvj8Kg
- Qwen-Audio-3.1-ASR:
https://t.co/88lPQTPxyz
- Qwen-Audio-3.1-实时:
https://t.co/Y63sdtK2AC
- 更多 API:即将推出@qwen_cloud