Meta Superintelligence Labs
@alexandr_wang
我们今天推出 Muse Voice Transcribe,这是我们第一个实时音频感知模型,在流式语音识别上达到 SOTA,说话人分离和端点检测也原生做在同一个模型里。
Muse Voice Transcribe 是 Muse Spark 系列的自回归多模态模型。它提供实时流式 ASR、20 人以上的说话人分离,以及端点检测。它支持多语言和无缝语码转换,并能用语言、关键词和上下文偏置提高准确度。截至 2026 年 9 月 1 日,Meta 在 Artificial Analysis 的流式语音识别和公开说话人分离评测上排第一。
目前可通过 Meta Model API、Mac 版 Meta AI 和 Muse Code 使用。