Rohan Paul
@rohanpaul_ai
低资源 ASR(自动语音识别)通常被视为模型问题。
VoiceArena 刚刚推出 Monsoon,并表明这是一个数据收集问题。
Monsoon 是一个包含 50 种语言的语音数据集,由 23 个国家/地区的即兴对话构建而成。
现成的 Whisper Medium 在 IndicVoices Telugu 上的语义 WER 得分为 92.7%。 VoiceArena 在 Monsoon 上对相同的 769M 检查点进行了微调,获得了 16.1%,在自己的测试中以微弱优势领先于 MAI-Transcribe-2 和 Gemini 3.1 Pro。
没有架构变化,也没有更大的模型。 76.6 分的下降完全来自模型在微调过程中听到的声音。
大多数语音数据管道都会滤除噪音。季风故意把它留在里面。
短片段、嘈杂的房间和困难的声学条件都保留在训练分布中,并且混音不会随意进行。 VoiceArena 通过 DNSMOS 对分段进行分层。这使得降级音频的份额成为数据的受控属性