Qwen

@Alibaba_Qwen

⚡ 认识 Qwen-Audio-3.1! ASR、TTS 和 Realtime 全面升级,加入了两个新模型:用于音频创建的 TTS-Next 和用于音频理解的 ASR-Next。 五种模型,一个完整的音频堆栈:理解、生成、交互和创作。 此外,整个产品系列均大幅降价:TTS 约 70% 折扣,Realtime 约 85% 折扣,ASR 高达 95% 折扣。 亮点:🥳 - ASR:更强的多语言和方言识别能力,加上自动删除填充物和重复内容的本地优化,以实现更清晰、更合乎逻辑的转录。 - ASR-Next:支持带有说话者标签、时间戳和对齐文字记录的多说话者 ASR,并理解情感、环境声音和机器声音,以实现声音字幕、事件定位、音频 QA 和推理。 - TTS:多语言和方言合成,具有自然的跨语言语音传输; 通过简单的指令控制情绪、速度和风格。 - TTS-Next:统一的 LM + 扩散框架,一次性为有声读物、播客、游戏和广告生成语音、音效和背景音频。 - 实时:即讲即听,随时中断,就像真正的通话一样; 当它感觉到情绪低落时,它甚至会放慢速度并做出同理心的反应。 释放 Qwen-Audio-3.1 的全部潜力! 👇 - 博客:https://t.co/e0M8wvj8Kg - Qwen-Audio-3.1-ASR: https://t.co/88lPQTPxyz - Qwen-Audio-3.1-实时: https://t.co/Y63sdtK2AC - 更多 API:即将推出@qwen_cloud
打开原帖#511482
  1. 前沿

    成立两个月、估值 5 亿美元:华为大模型“双子星”下场做物理 AI
  2. 前沿

    重复采样是在原地打转:把“想什么”训练成搜索策略
  3. 前沿

    声音的价格被砍到地板:阿里千问发布 Qwen-Audio-3.1 五款语音模型,全线降价最高 95%