Rohan Paul
@rohanpaul_ai
祝贺 @smallest_AI 在 @voicearena_ai 的说话人分离 + 语音识别(ASR)榜单上拿下第一。
这是一个非常有效的贴近真实世界的基准测试:
> 模型听到的是远场房间音频(即麦克风与说话的人有一定距离),但评分依据的是每位说话人身上都配有麦克风所生成的标注。
> 真实的输入,准确的标注。这种组合很少见。
很多说话人分离基准要么使用干净的音频,要么标注很混乱。
@voicearena_ai 避开了这两个问题:模型拿到的是真实线下对话的远场录音,而标注来自每位说话人各自的麦克风。第一名确实意义重大。
祝贺 @smallest_AI。