❯ 阿里开源 Qwen3.8-Flash-Next,125B 模型每 token 只激活 60 亿参数
模型发布阿里通义千问团队 8 月 26 日开源 Qwen3.8-Flash-Next,定位为下一代 Qwen4 架构的预览版。参数构成很特别:125B 主干之外挂了一张 510 亿参数的 N-gram 嵌入表和 40 亿参数的多 token 预测模块,但每个 token 实际只激活 60 亿参数。彭博社报道称,随后上线的生产版 Qwen3.8-Flash 性能对标 Claude Opus 4.6 与 DeepSeek V4-Flash。
省在哪里官方口径是训练开销约为此前的 Qwen3.7-Plus 的九分之一,而编程与办公任务能力反超。四项改动堆在一起:每四层里三层用门控增量网络、第四层用微块粒度的稀疏注意力;两千万条二元与三元词组做查表式嵌入,还支持在英伟达设备上卸载到主机内存;加宽残差流配门控;Muon 与 AdamW 双优化器并用。原生上下文 26.2 万 token,可外推到 100 万。
几个容易写错的点许可证是 qwen-community-1.0 而非 Apache 2.0,商用前得先看条款。权重体积也不轻,FP8 检查点 172.78 GiB,社区实测需要多卡而非单台工作站。生产版 API 报价为每百万 token 输入 0.16 美元、输出 0.47 美元。同一周里智谱对标 Opus 4.8、阿里对标 Opus 4.6,两家把参照系都换成了同一个闭源对手。对海外开发者来说,选型时要比的已经不是能不能跑通,而是每百万 token 的账单差多少。
▪ SIGNAL训练开销砍到九分之一这个数字,比任何一项跑分都更能说明下一代 Qwen 想赢的是哪场仗。