
阿里这次没有先扔旗舰名,而是把下一世代的骨架公开拆开。
Qwen 团队开源 Qwen3.8-Flash-Next:多模态 MoE,主模型约 125B 参数、每 token 激活约 6B,另挂 51B N-gram Embedding;官方称它是 Qwen4 架构的早期预览,像当年 Qwen3-Next 之于 3.5 系。四条改动:GDN 压缩历史 + QSA 按微块稀疏检索;门控残差把残差流扩成四路;N-gram 表可放 Host Memory 异步预取;Muon 优化器重拟合 scaling law,并丢掉 batch-size warmup(自称因此少走约 18.8% 的优化步)。对比自家 Qwen3.7-Plus(约 397B / 17B 激活),激活算力大约砍到三分之一;训练成本自称约为其 1/9。原生上下文 262K,YaRN 可扩到 1M。
TNW 点出刺耳的一句:为“显存不够的加速器”设计,听起来像出口管制下的工程现实主义。许可证是 qwen-community,未必吃得到欧盟 AI Act 对开源的豁免——欧洲买家要自担合规。
判断: 真正的产品是提前公开的架构合同:推理栈(vLLM 等)有几个月改内核,社区有几个月找洞。分数仍是自家 harness,别当榜单圣经;但“把贵的部分挪出 GPU”若站得住,比再发一个 400B 全激活宣传页更改变谁能本地跑代理。
[1][2]