重大
阿里千问发布 Qwen3.8-Flash-Next:Qwen4 架构预览版,125B 总参/6B 激活,训练成本仅前代 1/9(补充条目 08-26 晚)
阿里通义千问 8-26 晚正式发布 Qwen3.8-Flash(Next):Qwen4 架构的技术预览版(同 Qwen3-Next 之于 Qwen3.5 的角色),多模态 MoE——主模型 125B + 51B N-gram Embedding,每 token 仅激活 6B。架构四大升级:GDN+QSA 混合注意力(1M 上下文,Prefill/Decode 最高 7.6×/4.9× 加速)、Gated Residual 四分支残差流(FP8 存储)、N-gram Embedding(可卸载主机内存异步预取)、Muon Optimizer + 新 Scaling Law。训练成本约为 Qwen3.7-Plus 的 1/9;Base 在 14 个 benchmark 中 8 个最优。权重已开源(HF + ModelScope,含 FP8/NVFP4 版),SGLang Day-0 支持(Qwen/NVIDIA/AMD 合作,B200 540 tok/s)。API 定价输入 1 元/输出 3 元每百万 token。 格局信号:Qwen4 架构路线提前公开 + 超低训练成本 + 超低定价——