StepFun@StepFun_ai2026年9月16日 01:40推出 StepAudio 3,我们的新型五款音频模型家族,适用于实时语音、语音识别、语音生成、音频生成和音乐。 Realtime 在人工分析中在对话动态(98.9%)和语音推理(99.7%)方面均排名第一。ASR 的字错误率达到 1.7%,与排行榜上的最佳结果相匹配。 构建能够处理打断、在讲话时进行推理并调用工具的语音代理。转录语音,生成富有表现力的声音,并创建完整的音频场景和音乐。 现已开通: 语音 AI 实验室: https://t.co/9lQaKPc5AF 博客: https://t.co/cU0cQvI7zM打开原帖#511482