Rohan Paul

@rohanpaul_ai

低资源 ASR(自动语音识别)通常被视为模型问题。 VoiceArena 刚刚推出 Monsoon,并表明这是一个数据收集问题。 Monsoon 是一个包含 50 种语言的语音数据集,由 23 个国家/地区的即兴对话构建而成。 现成的 Whisper Medium 在 IndicVoices Telugu 上的语义 WER 得分为 92.7%。 VoiceArena 在 Monsoon 上对相同的 769M 检查点进行了微调,获得了 16.1%,在自己的测试中以微弱优势领先于 MAI-Transcribe-2 和 Gemini 3.1 Pro。 没有架构变化,也没有更大的模型。 76.6 分的下降完全来自模型在微调过程中听到的声音。 大多数语音数据管道都会滤除噪音。季风故意把它留在里面。 短片段、嘈杂的房间和困难的声学条件都保留在训练分布中,并且混音不会随意进行。 VoiceArena 通过 DNSMOS 对分段进行分层。这使得降级音频的份额成为数据的受控属性
打开原帖#511482
  1. 产业

    Alexandr Wang:S代表超级智能😎
  2. 产业

    Alexandr Wang:Muse 的非常棒的用例——清理邻居
  3. 产业

    Yoshua Bengio:越来越多的人工智能研发自动化可能会导致人工智能的进步在风险很大、不受控制的…