如何看待8月26日阿里通义千问发布的Qwen3.8-Flash-Next模型?怎么回事?
2026年8月26日,Qwen团队发布Qwen3.8-Flash-Next的开源权重与架构技术报告。该模型是一个稀疏混合专家模型,总参数量125B,每token激活6B参数,另有51B的n-gram嵌入表参数存放在加速器之外。团队将其定位为Qwen4的架构先导预览——与此前Qwen3-Next对Qwen3.5的角色一致。 与上一代旗舰Qwen3.7-Plus(397B总参/17B激活)相比,Qwen3.8-Flash-Next在14项预训练基准中8项取得领先,其余6项差距不超过2.6分,而训练所消耗的浮点运算量仅为前者的约九分之一。这一效率来自三个维度的同步缩减:激活参数量约为前者的1/3,训练token数约为1/3,二者相乘即得到训练算力的大幅压缩。 架构层面的变化集中在四个方向。注意力机制采用Gated DeltaNet与全局注意力的逐层混合,每四层中三层使用Gated DeltaNet将上下文压缩到固定大小的循环状态中,剩余一层保留全局注意力用于精确检索。在持续预训练阶段,全局注意力层被替换为团队提出的Qwen Sparse Attention(QSA),它在微块粒度上对上下文打分并筛选最相关区域,将索引本身的计算成本从O(n²)降至O(n²/r)。在100万token上下文长度下,QSA在预填充和解码阶段的注意力模块分别实现7.6倍和4.9倍的核级加速。 残差路径方面,团队提出Gated Residual(GR),将残差流从单一向量扩展为四条并行分支,通过逐元素的sigmoid门控动态决定每条分支的读取权重。这一设计在几乎不增加计算量的前提下为信息流提供了更多传递通道——分析显示,训练后的模型会自发地让其中一条分支承载长距离路径,将第一层的输出保留至十余层之后的全局注意力层。GR同时充当了训练稳定器的角色:在4倍最优学习率的压力测试中,配合Muon优化器的GR组合全程无损失尖峰,而前代架构搭配AdamW时平均每万步出现183次损失尖峰。 容量扩展依赖一层n-gram嵌入表。与仅凭单个token查表的传统嵌入不同,n-gram嵌入以当前token与前几个token组成的短序列为键进行查询,为常见短语和局部模式提供额外表示。由于查询地址可提前确定,51B参数的嵌入表可存放在主机内存中异步预取,几乎不占用加速器的计算预算。技术报告中一项值得关注的发现是:扩大n-gram词表能持续降低训练损失,但下游任务准确率会饱和——损失与实际性能并不总是同向变动。 后训练模型在编程和智能体任务上表现突出。在DeepSWE 1.1上得分58.7,SWE-bench Pro上得分62.5,长周期办公智能体基准CoWorkBench上得分73.9,均为同期对比模型中的最高水平。模型原生支持262,144 token上下文,可通过YaRN扩展至100万token。
为什么受到关注?
该关键词近期出现在知乎热榜,历史最高排名第 15 位。热榜排名只能反映平台内一段时间的关注程度,不等同于事件重要程度或事实结论。
已确认的信息
- 来源平台:知乎
- 首次收录:2026-08-27 11:47:21 UTC
- 最近更新:2026-08-27 14:02:34 UTC
- 最近热度:69 万热度
榜单趋势
最近 10 次榜单快照的排名走势(排名越低越靠前),每格为一次采集记录。