2026-08-27 · AI 资讯
阿里千问发布Qwen3.8-Flash,探索轻量化高效能架构范式

阿里千问团队近日正式推出多模态MoE模型Qwen3.8-Flash,并同步开源其核心底层架构Qwen3.8-Flash-Next。该架构不仅是Qwen4系列研发的先声,更在轻量化与高性能之间取得了精妙平衡,每Token激活参数仅为6B。
架构方面,Qwen3.8-Flash引入了GDN+QSA混合注意力机制,在处理百万级Token上下文时,实现了推理速度的数倍提升。此外,通过引入N-gram Embedding技术,模型在不增加额外计算开销的前提下大幅扩展了信息承载量。训练上,团队结合Muon与AdamW优化策略,显著提升了模型训练的稳定性和效率。
该模型在多项基准测试中表现优异,尤其在代码编写和智能体任务中优势明显。目前,模型权重已在Hugging Face和ModelScope同步开源。千问团队表示,提前开放底层架构旨在与开源社区共创,通过不断迭代验证创新方案,为即将到来的Qwen4系列奠定技术底座。
