9 月 23 日,科大讯飞正式发布最新一代语音识别大模型 Spark-ASR-2.0。官方称,该模型在保持高识别准确率的基础上,重点优化了文本的流畅性与规范性,实现了从"还原内容"到"流畅成文"的跨越;将从明天开始逐步上线讯飞输入法,并通过讯飞开放平台提供 API 服务,随后陆续落地到讯飞 AI 眼镜、智能办公本、讯飞听见等产品。

[1][2]

nut graf:语音识别是中文 AI 市场里少有的"护城河型"赛道,而这次发布的技术路线值得注意——Spark-ASR-2.0 不是简单堆参数,而是用"非自回归与 LLM 增强自回归协同"把识别的两个目标拆开处理:非自回归负责快、LLM 增强负责懂。它的卖点也从"字准"挪到了"成文",加上推理成本仅增约 10%(媒体转引官方口径),这套组合更像是在为"语音进入每个设备"的规模化铺路,而不是再打一轮准确率榜单。

落到产品上,发布节奏相当密:明天起逐步上线讯飞输入法,开放平台 API 同步提供,之后 AI 眼镜、智能办公本、讯飞听见等硬件与 SaaS 业务陆续接入。这意味着 Spark-ASR-2.0 从第一天就是多端产品矩阵的底座,而不是单一 demo。技术面,它延续了 Spark-Audio-1.0-Preview 语音基座大模型的能力,关键技术点包括中英文混合文本与声学联合增强、动态上下文注入,覆盖通用识别(中英混合、方言、专业术语)与复杂声学场景(高噪声等)两条主线。对开发者而言更实质的变化是 API 与 SDK 通道:讯飞开放平台的语音听写、语音识别大模型服务一直是中文生态最常用的转写通道之一,新模型的"流畅成文"能力如果稳定,最直接的受益者是会议转写、字幕生成、客服质检这类下游应用。

口径上要区分两层:识别准确率的具体数字、推理成本"仅增 10%"均来自厂商发布口径,尚未见独立第三方在统一语料上复测;"流畅成文"是主观质量的提升,其评估标准(人工评分还是自动指标)官方未在发布信息中给出细则。把视角放回行业:过去两年语音识别被大模型的"端到端"叙事盖过,但中文场景的方言、术语、噪声、口语化问题始终是准确率的真实战场。Spark-ASR-2.0 的价值不在于它又刷新了某个榜单,而在于它证明了"识别"和"理解"可以在一条模型链上分层协作——这可能是语音交互从"能用"走向"好用"的又一步。

[1][2]
上午的语音实验室,一名工程师背影戴着监听耳机坐在调音台前,面前大屏上显示一条声波波形正在被梳理成一条平滑的曲线,波形边缘有细密的光点,隔音墙板上挂着吸音棉;工程师一手扶耳机、一手在混音台上推一个推杆,台灯与屏幕冷光混合,窗外是上午的城市。画面无任何文字与字符。
把声音理顺成文, AI 生成插画,非新闻照片