开放式会议室里多人交谈,桌前方笔记本滚动中英混杂的实时转写,说话人头顶悬挂 SPEAKER A/B 名牌
配图:流式转写与说话人分离挤进同一次推理(AI 生成,非新闻照片), AI-generated illustration, not a news photograph

语音赛道这几年不缺「又快又准」的海报。Meta 9 月 1 日丢出的 Muse Voice Transcribe,更像把三件一直分家的活——流式转写、说话人分离、说话端点——焊回同一条自回归 token 流。

官方技术叙事很硬核。模型来自 Muse Spark 家族,音频按 80 毫秒一块(12.5 Hz)变成 soft token;每一步要么继续听(<|next_audio|>),要么吐字。流结束后插入 <|empty_audio|>,把剩余文本倒干净。延迟不再是固定旋钮,而是按词难度用强化学习在 WER 与 delay 之间做乘法权衡的「adaptive delay」。说话人切换用 <|start_of_turn|>,身份用 <|speaker_A|> 一类标签挂在块尾;onset / endpoint 另有专用符号。一小时以上长音频、20+ 说话人,官方称不需要后处理流水线。

榜单与价格决定它会不会进采购单。Meta 称在 Artificial Analysis 流式语音转写榜与公开 diarization 基准上排第一(截至 2026-09-01)。VentureBeat 援引同一套 AA 表:最终转写 WER 约 3.1%,压过 Cartesia Ink-2(3.4%)、ElevenLabs Scribe v2 Realtime(3.6%)、GPT Live Transcribe 与 Grok Speech(约 3.9%)等。标价更刺眼:每小时音频 0.18 美元,流式与非流式同价;对比表里 OpenAI 流式档折算价高出一个数量级。语言覆盖训练超 70 种、首发重点验证 25 种,并强调句内/句间 code-switching 与关键词、上下文偏置。入口是 Meta Model API、Mac 版 Meta AI,以及 Muse Code 的按住 Fn 听写。

判断:这不是「又一个 ASR」,而是把会议/客服/语音代理真正卡住的两件事——谁在说、话说完没有——从插件升格成与转写同训的主任务。0.18 美元/小时会逼厂商重写报价页;但并发流与每小时启动次数的限额(开发者文档草稿里出现过 8 路并发、每小时 1000 次启动一类数字)会决定它能不能撑住呼叫中心。企业该盯三件事:方言与嘈杂会议室的真实 WER、说话人标签在串音下的稳定性,以及 ZDR 档是否真与标准价持平。语音代理栈正在从「先转写再编排」变成「感知层自带回合制」——Meta 这次是把价格刀跟架构刀一起拍下来。

[1][2]