9 月 18 日,阿里巴巴千问团队发布 Qwen3.8-Omni-Flash,一款原生全模态模型:在同一个 1M token 上下文窗口内接收文本、图像、音频与视频输入,输出文本。官方博客称这是千问首个以智能体能力为核心构建的全模态模型,定位从理解多模态内容,推进到规划任务、调用工具、完成创作。模型已在千问 AI 平台与阿里云百炼上线,仅通过 API 提供,未开放权重。
[1][2]这场发布的核心不是多模态能力本身——同类模型并不少见——而是成本结构。官方称,与 Qwen3.5-Omni-Plus 相比,音频输入每小时价格下降超过 98%,音视频输入下降超过 93%;按 token 计,音频输入低至每百万 token 0.8 元。如果这些数字成立,听懂一小时会议将从昂贵的实验变成可批量采购的 API 调用,这也直接冲击以音视频理解为卖点的海外竞品定价。
性能方面,千问给出的数据是:29 项评测平均分较 Qwen3.5-Omni-Plus 提升超 25%,WildClawBench-MM 提升 36.5 分,UniClawBench 得分 69.6,AgenticVBench 提升 22.3 分。在 OmniVideoBench 上,官方提出一种智能体式感知路径——先粗扫全片、再聚焦关键片段——把准确率从 63.4 提升到 67.8,同时 token 消耗下降 45.7%。需要强调:以上全部是厂商自报口径,截至发稿没有独立复现结果。
产品形态上有几个值得注意的细节。模型只输出文本、不生成语音,官方把它定位为智能体的大脑而非嘴;思考模式默认开启,可用 reasoning_effort 从 low 调到 xhigh。支持 2 通道与 4 通道空间音频、113 种语言输入,视频文件最长 2 小时、2 GB。配套开源了 Qwen-MM-Plugins(Apache-2.0)与 Qwen-Live Harness:前者以 Skill 加可选 MCP 服务器形式让 Claude Code、Codex、Gemini CLI 等纯文本智能体框架接入音视频输入,能力包括把教程视频转成带截图要点的 PDF、为长视频构建视听记忆;后者面向实时交互。另有超低延迟版本 Qwen3.8-Omni-Flash-Realtime,官方称 20 秒音频响应约 981 毫秒,走 WebSocket 或 WebRTC。模型在六个区域上线:北京、新加坡、香港、东京、法兰克福、弗吉尼亚。
竞争语境值得说一句:官方称音视频能力接近 Gemini 3.8 Flash,同时把价格压到上一代的数十分之一。这是中国厂商在多模态与智能体交叉点上的一次直接定价进攻。真正的检验不在发布会,而在独立评测与真实工作流——但在价格这一点上,千问已经把牌摆到了桌面上。
[1][2]