首页 / 资讯 / AI智讯 / 千问深夜开源Qwen3.8-Flash-Next,25B新架构提前剧透Qwen4

千问深夜开源Qwen3.8-Flash-Next,25B新架构提前剧透Qwen4

时间:2026-08-29 09:35:56 来源:51DNS.COM
分享:

2026年8月26日晚,阿里通义千问团队正式发布多模态MoE模型Qwen3.8-Flash,并同步开源了基于下一代Qwen4架构打造的先导预览版Qwen3.8-Flash-Next全部权重。官方明确表示,该模型是全新一代Qwen4系列模型的雏形,此次提前释出架构改动,旨在让全球开发者率先检验,为完整版Qwen4的落地铺路。目前权重已在HuggingFace、魔搭社区全面开源。

千问

一、核心参数:125B总参,每Token仅激活6B

Qwen3.8-Flash-Next采用多模态MoE架构:主模型参数量125B,额外配备51B的N-gramEmbedding,总计约176B,但每个Token仅激活6B参数。模型包含48层网络结构,MoE层集成512个专家,通过top-10路由分配。上下文方面,原生支持262144Token(256K),借助YaRN技术可进一步扩展至1M。如此轻量激活意味着推理成本大幅下降,甚至可在不量化的前提下于单张RTX4090上运行,本地部署门槛显著降低。

 

二、四大创新,提前剧透Qwen4架构

此次开源最受关注的当属架构层面的四大创新:

1、混合注意力机制:融合GatedDeltaNet与QwenSparseAttention稀疏注意力,兼顾长文本处理效率与信息检索精度。

2、N-gramEmbedding:将常见词组作为独立词条存入"短语词典",可放置在系统内存而非GPU上,以较低成本增强短语级语义理解。

3、门控残差与多超连接流:优化深层网络的梯度流动与信息传递,支撑更深的模型结构。

4、Muon优化器:新一代训练优化方案,显著提升训练效率并压缩成本。

 

三、极致成本:训练费用降至九分之一

据官方数据,Qwen3.8-Flash-Next的训练成本约为Qwen3.7-Plus的九分之一,推理价格同样极具竞争力。其姊妹模型Qwen3.8-Flash已上线千问AI平台提供API服务,每百万Tokens输入仅1元、输出3元,并同步放出FP8量化版,进一步降低本地部署门槛,被业界视为对DeepSeek价格优势的直接回应。

 

四、开源生态:全球社区共同打磨Qwen4

如同Qwen3-Next当年为Qwen3.5验证的GDN+GatedAttention方案,如今已贯穿Qwen3.5至Qwen3.8全系列,Qwen3.8-Flash-Next的开源同样承载着同样的使命——让全球开发者提前评估新架构的部署性能与适用场景。

对关注本地化部署与算力成本的中小团队而言,"先开源、后发旗舰"的策略提供了更低的试错门槛,也让生态社区深度参与Qwen4的打磨。

 

五、结语

Qwen3.8-Flash-Next的发布,不仅是又一次模型迭代,更是阿里千问对未来技术路线的公开表态:在模型能力与推理成本之间寻找极致平衡。随着完整版Qwen4的临近,国产大模型的竞争正从"参数竞赛"转向"效率与生态之争"。

关键词:

联系我们