资讯
阿里通义 Qwen3.8-Flash 发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9
📌 概要
<p>IT之家 8 月 26 日消息,阿里通义千问团队今晚正式发布了 Qwen3.8-Flash。通义团队同时发布了 Qwen3.8-Flash-Next 的开源权重,Next 新架构将是全新一代 Qwen4 系列模型的雏形。</p><p>这是一个多模态 MoE 模型,主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。它原生支持 2
<p>IT之家 8 月 26 日消息,阿里通义千问团队今晚正式发布了 Qwen3.8-Flash。通义团队同时发布了 Qwen3.8-Flash-Next 的开源权重,Next 新架构将是全新一代 Qwen4 系列模型的雏形。</p><p>这是一个多模态 MoE 模型,主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。它原生支持 262,144 tokens 上下文,并可通过 YaRN 扩展至 1M tokens。</p><p style="text-align: center;"><img class="no-alt-img" src="https://img.ithome.com/newsuploadfiles/2026/8/b9918d75-2049-4b99-aae9-1c44ec0c5471.png?x-bce-process=image/format,f_auto" /></p><p>据介绍,Qwen3.8-Flash 围绕四个方向进行了系统升级:</p><p>在 Attention 方面,采用 GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构。GDN 负责高效压缩历史信息,QSA 则通过轻量级 Indexer 在 micro-block 粒度上筛选重要上下文,显著降低长序列 Attention 开销。面对 1M token 的超长上下文,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6 倍和 4.9 倍的加速。</p><p>在 Residual 方面,引入 Gated Residual(GR)机制,将残差流扩展为 4 条并行分支,通过动态 Gate 控制信息读写。残差状态支持 FP8 存储,大幅降低访存开销。</p><p>在 Embedding 方面,引入 51B 参数的 N-gram Embedding,利用局部上下文查表扩展模型容量。这些参数可卸载至 Host Memory,通过异步 Prefetch 与模型计算重叠,不长期占用 GPU 显存。</p><p>在 Optimization 方面,采用 Muon Optimizer,并针对正交化精度、参数分工及融合矩阵拆分等策略进行优化。针对新架构重新拟合了 Scaling Law。</p><h3>性能与成本</h3><p>相比 Qwen3.7-Plus,Qwen3.8-Flash 的训练成本仅约为前者的九分之一,但在编码和办公任务上具备更强能力。</p><p>在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得最优结果,包括 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMU。</p><h3>模型表现</h3><p>纯文本:</p><p style="text-align: center;"><img class="no-alt-img" src="https://img.ithome.com/newsuploadfiles/2026/8/63c78b2d-746d-4db6-ab5c-b76e985c5caf.png" /></p><p>多模态:</p><p style="text-align: center;"><img class="no-alt-img" src="https://img.ithome.com/newsuploadfiles/2026/8/87a70cbe-710e-421c-9715-dca0a60b4790.png" /></p><p>模型结构:</p><p style="text-align: center;"><img class="no-alt-img" src="https://img.ithome.com/newsuploadfiles/2026/8/0352bc9b-9ae5-41d6-8421-6c037cbd491f.png" /></p><p>Base 模型表现:</p><p style="text-align: center;"><img class="no-alt-img" src="https://img.ithome.com/newsuploadfiles/2026/8/dd586fe7-1586-46cb-a878-1297336b8482.png" /></p><h3>可用性与定价</h3><p>IT之家从官方获悉,Qwen3.8-Flash 即将上线千问 AI 平台,对外提供 API 服务,定价为每百万 Tokens 输入 1 元、输出 3 元。</p><p>模型权重已于北京时间 8 月 26 日 23:00 在 Hugging Face 与 ModelScope 平台开源,同步发布 FP8 量化版本。Qwen3.8-Flash-Next 默认支持 1M 上下文并内置官方工具。</p><p><span class="referenceTitle ">参考资料:</span></p><ul class="custom_reference list-paddingleft-1"><li class="list-undefined list-reference-paddingleft"><p>技术报告:<span class="link-text-start-with-http">https://github.com/</span> QwenLM / Qwen3.8-Flash-Next / blob / main / <span class="link-text-start-with-http">tech_report.pdf</span></p></li><li class="list-undefined list-reference-paddingleft"><p>技术博客:<span class="link-text-start-with-http">https://qwen.ai/</span> blog?id=qwen3.8-flash-next</p></li><li class="list-undefined list-reference-paddingleft"><p style="text-align: left;"><strong>Hugging Face:</strong><span class="link-text-start-with-http">https://huggingface.co/Qwen/Qwen3.8-Flash-Next</span>?spm=<span class="link-text-start-with-http">a2ty_o06.30285417.0.0.1d73c921FsyOPe&amp</span>;amp;amp;file=Qwen3.8-Flash-Next</p></li><li class="list-undefined list-reference-paddingleft"><p style="text-align: left;"><strong>ModelScope:</strong><span class="link-text-start-with-http">https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next</span>?spm=<span class="link-text-start-with-http">a2ty_o06.30285417.0.0.1d73c921XAP2dV&amp</span>;amp;amp;file=Qwen3.8-Flash-Next</p></li></ul>