阿里开源 Qwen3.8-Flash:125B MoE 架构将训练成本压至前代 1/9,Next 版本剑指 Qwen4

阿里通义千问团队开源 Qwen3.8-Flash 系列,采用 125B MoE 架构并引入 51B N-gram Embedding,官方称训练成本降至前代约 1/9。Next 版本默认支持 1M 上下文,被视为 Qwen4 系列的架构雏形。

8 月 26 日,阿里通义千问团队正式发布并开源 Qwen3.8-Flash 系列模型。此次发布包含 Qwen3.8-Flash 与 Qwen3.8-Flash-Next 两个版本,其中 Next 版本采用了新架构,被官方定位为全新一代 Qwen4 系列模型的雏形。

从公开信息看,这次发布的重点不只是模型规模扩大,而是在 MoE 结构、长上下文注意力机制、Embedding 设计和优化器层面进行了系统调整。官方称,相比 Qwen3.7-Plus,Qwen3.8-Flash 的训练成本约为前者的九分之一,同时在编码和办公任务上能力更强。

125B 参数 MoE,每 token 激活 6B

Qwen3.8-Flash 是一个多模态 MoE 模型。官方给出的结构信息显示,其主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。模型原生支持 262,144 tokens 上下文,并可通过 YaRN 扩展至 1M tokens。

这种设计意味着模型总参数规模较大,但单次推理实际调用的参数比例较低。对于 MoE 模型而言,激活参数数量往往更直接地影响推理成本和部署门槛。Qwen3.8-Flash 在保持较大参数池的同时,将每 token 激活参数控制在 6B,是兼顾能力与效率的一种方案。

长上下文与 N-gram Embedding 是核心变化

官方介绍中,Qwen3.8-Flash 的系统升级主要集中在四个方向:Attention、Residual、Embedding 和 Optimization。

  • Attention 部分采用 GDN(Gated DeltaNet)与 QSA(Qwen Sparse Attention)混合架构。GDN 用于高效压缩历史信息,QSA 则通过轻量级 Indexer 在 micro-block 粒度上筛选重要上下文,以降低长序列 Attention 开销。官方称,在 1M token 超长上下文场景下,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6 倍和 4.9 倍加速。
  • Residual 部分引入 Gated Residual(GR)机制,将残差流扩展为 4 条并行分支,并通过动态 Gate 控制信息读写。官方表示,残差状态支持 FP8 存储,可降低访存开销。
  • Embedding 部分引入 51B 参数的 N-gram Embedding,利用局部上下文查表扩展模型容量。相关参数可卸载至 Host Memory,并通过异步 Prefetch 与模型计算重叠,避免长期占用 GPU 显存。
  • Optimization 部分采用 Muon Optimizer,并针对正交化精度、参数分工及融合矩阵拆分等策略进行优化。官方称,团队还针对新架构重新拟合了 Scaling Law。

这些调整共同指向两个目标:一是降低长上下文处理成本,二是提高参数利用效率。尤其是 N-gram Embedding 的引入,并不等同于传统意义上增加主干网络深度,而是通过局部上下文查表的方式扩展模型容量。这种设计也反映出当前大模型架构优化正在从单纯扩大参数规模,转向更精细地分配计算与存储资源。

训练成本降至前代约 1/9,Next 版本承担 Qwen4 探路角色

官方数据显示,相比 Qwen3.7-Plus,Qwen3.8-Flash 的训练成本仅约为前者的九分之一,但在编码和办公任务上具备更强能力。对于行业而言,这类表述的意义在于:大模型竞争正在从单纯追求更大参数规模,转向在训练效率、推理成本和实际任务表现之间寻找更优平衡。

在 Base 模型表现方面,官方称,在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得最优结果,涵盖 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMU 等测试。

值得关注的是,Qwen3.8-Flash-Next 被官方描述为下一代 Qwen4 系列模型的雏形。这意味着该版本不仅是 Flash 产品线的一次更新,也可能承担架构验证和技术路线测试的角色。对于开发者和企业用户来说,Next 版本的开源权重可以作为观察阿里下一代模型架构方向的参考样本。

开源与 API 定价同步公布

发布节奏上,Qwen3.8-Flash 将上线千问 AI 平台,对外提供 API 服务。官方给出的定价为每百万 Tokens 输入 1 元、输出 3 元。

开源方面,模型权重已于北京时间 8 月 26 日 23:00 在 Hugging Face 与 ModelScope 平台开放,同步发布 FP8 量化版本。Qwen3.8-Flash-Next 默认支持 1M 上下文,并内置官方工具。

从本次发布看,阿里通义正在将更低训练成本、更高长上下文效率和更开放的权重策略放在同一代产品中推进。对于需要私有化部署或二次开发的企业和开发者,Qwen3.8-Flash-Next 的开源版本提供了更直接的接入入口;对于 API 用户,其定价和长上下文支持则可能影响其在长文档处理、代码生成和多模态任务中的选型判断。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/a-li-kai-yuan-qwen3-8flash-125b-moe-jia-gou-jiang-xun-lian

Like (0)
点点的头像点点
Previous 16小时前
Next 3小时前

相关推荐