The Decoder 10 月 2 日报道,微软除了转录,还发布了两颗文字转语音的模型。MAI-Voice-2.1 要用同一个声音说 23 种语言,并且每种语言带本地口音。微软称,MAI-Voice-2.1-Flash 的延迟是 150 毫秒,价格是每百万字符 15 美元,而不是 22 美元。这些数字是微软说的,报道没有给出独立测量。
[1]
两颗语音模型都可以用仅仅几秒的参考音频去克隆一个声音。报道写,内置的防护是为了防止滥用。这里只保留这两句。不写怎样提供那段音频,也不写怎样绕过防护。模型可以通过 Microsoft Foundry 和 MAI Playground 使用,两颗语音模型也放在 OpenRouter 上。一项测试里,大约 4000 名参与者中的一半认为这些声音属于一个真人。报道没有写明测的是哪一颗模型、哪种语言、参与者听到的是什么任务。
[1]同一篇还写了实时转录模型 MAI-Transcribe-2-Streaming。微软说它在 Artificial Analysis 的准确率上排第一,能转写 60 种语言,第一批部分结果略多于 100 毫秒就出来。微软说,这样语音智能体可以在对方一句话还没说完时就开始回应。到今年年底,入门价格是每小时音频 0.54 美元。第一名、60 种语言和 100 毫秒都是微软的口径。这篇是 The Decoder 对微软发布的转述,不是微软博客原文。
[1]要点
- MAI-Voice-2.1 用同一个声音说 23 种语言。Flash 延迟 150 毫秒,每百万字符 15 美元,标价 22 美元。
- 两颗语音模型可用几秒参考音频克隆声音,并带有防止滥用的防护。做法没有写。
- 约 4000 人的测试里,大约一半把声音当成真人。测的是哪一颗,这篇没写。
- 流式转录是同一篇里的另一颗模型:微软称 60 种语言、首段略多于 100 毫秒、年底前每小时 0.54 美元。