
九月三日,Microsoft AI 推出 MAI-Transcribe-2,标题几乎不留余地:自称全球最快、最准、最便宜的语音识别模型。发布稿给出的硬数字是——FLEURS 60 语平均词错误率 5.2% 居首;在 Artificial Analysis 上卡住准确率—延迟帕累托前沿,WER 榜单第二;相对 GPT-Transcribe、ElevenLabs Scribe v2、Gemini 3.5 Transcribe,批量吞吐据称约 10× / 7× / 5×;上市价 每小时音频 0.10 美元,写明限时到年底。
TradePoint 把价格史摊开:五个月前同线首版约 0.36 美元/小时,这一刀大约砍掉 72%。十万小时呼叫中心音频,账单示意从三万六降到一万——采购会上没人再为转写吵架。
[1][2]打进基价的能力包
官方能力清单读起来像专科厂商的加价菜单被一次性清空:说话人分离、词级时间戳、关键词偏置、verbatim/clean 两种风格、Hinglish/Spanglish 一类语码转换、自动语种识别、噪声场景,外加 60 种语言。TradePoint 记录的节奏同样刺耳——四月 25 语、六月 43 语、九月 60 语,五个月三版,每版把竞品常拆出来卖的功能焊回基价。
可用性落在 Microsoft Foundry、MAI Playground 与 Open Router。微软点名的对手是前沿实验室阵营:GPT-Transcribe、Gemini 3.5 Transcribe、Whisper V3-Large、Scribe v2。Deepgram、AssemblyAI、Speechmatics、Rev 这些十年老兵,在发布稿里连名字都没有——但 0.10 美元的地板价会直接砸进他们的高量合同。
[1][2]数字该怎么读
FLEURS 均值要从覆盖面读:1.5 曾报过约 3.7% 的平均 WER,2.0 的 5.2% 更可能是语言表拉长、低资源语种拉高均值,而不是单纯退步——买方该要分语言明细,而不是吃一张总分。Artificial Analysis 的独立 API 实测是微软引用的第二块招牌:1.5 曾排 WER 第三,升至第二意味着据报道已压过 ElevenLabs;帕累托前沿的含义更狠——没有对手能在不牺牲速度时更准,或在不牺牲准确率时更快。
真正未写进大字标题的限制也在周边报道里:公开材料偏重批处理吞吐,实时流式能力并未被写成同等硬承诺;0.10 美元是限时促销,年底后的常驻价仍是空格。
[1][2]少付租金的战略读法
TradePoint 把 MAI 放进更大语境:微软在反复修订与 OpenAI 的合作条款后,正用自研模型降低对外模型租金。转写天然长在 Teams、Nuance 临床文书、Azure 语音这些内生流量上——这不是又一个演示玩具,而是把自己管道里的流量从别人的价目表上撬下来。
[2]评论
我把这看成 ASR 市场的地板价战争,而不是又一次“SOTA 发布会”。若年底促销收回、常驻价回到接近 0.36,故事会缩成一次营销脉冲;若地板价守住,专科厂商要么把 diarization 与合规工作流卖成差异化,要么去打微软没点名的垂直深水区。
买家眼下最该做的不是转发“全球最便宜”,而是用自己的呼叫中心噪音样本跑分语言 WER,并在合同里把促销截止日写成硬条款。
[1][2]