首页 > 新闻中心 > 财汇

全新架构,极致性价比!阿里千问Qwen3.8-Flash发布并开源

来源: 紫牛新闻

2026-08-26 21:35:00

8月26日晚,阿里发布并同步开源千问最新模型 Qwen3.8-Flash。该模型采用全新下一代架构,千亿总参数仅激活60亿(6B)即可获得超越Claude Opus4.6的前沿性能,创下模型效率的全球新基准。得益于架构和训练的全面革新,Qwen3.8-Flash训练成本较Qwen3.7-Plus骤降近90%,推理成本同样大幅下降,每百万Tokens输入仅1元,输出3元,价格最低至DeepSeek-V4-Flash的1/3,将全球模型性价比“斩杀”至极致新水平。Qwen3.8-Flash今晚将首发上线“千问办公”,开发者和企业也可通过千问AI平台获取新模型API服务。

Qwen3.8-Flash是一个多模态混合专家(MoE)模型,采用了下一代(Next)模型架构,Transformer参数125B仅激活6B,性能表现超越Opus4.6、接近Opus4.8。仅完成预训练的Qwen3.8-Flash基座(Base)模型,在通用(SuperGPQA)、数学推理(GSM8K)、编程(SWEBench-Pretrain)等基础能力上超过了3倍其大小的Qwen3.7-Plus基座模型。经后训练后,Qwen3.8-Flash性能实现跃迁:在考验智能体编程的SWE-bench Pro评测中领先Opus4.6多达9.1分;在长程专业任务CoWorkBench、真实工具调用Toolathlon Verified等智能体任务中均超越了DeepSeek-V4-Flash,在专业工作任务JobBench智能体评测中超出Opus4.6近20分;多模态能力方面,在模拟手机操作的移动端智能体AndroidWorld评测中,Qwen3.8-Flash比Opus4.6高出22.5分,在以视觉推理解决数学问题的MathVision任务中超出25.1分,具身智能ERQA任务领先31.5分,Qwen3.8-Flash的整体多模态能力显著更强。

Qwen3.8-Flash出色的模型能力得益于其革新的模型架构和训练方案。模型采用了与此前所有千问大模型完全不同的全新架构:在注意力方面,引入独特的QSA(Qwen Sparse Attention)机制,形成与GDN高效融合的混合注意力架构,可显著降低计算开销,在高缓存命中的1M Tokens长上下文实际场景中可提速8倍以上,又准又快;在模型内部信息传递方面,引入自研的 Gated Residual 方法,将传统Transformer的1条信息主通道拆分并拓展为4条,让模型可根据需求动态决定读写信息,信息传递更高效,训练也更稳定;在模型参数扩展方面,引入51B的N-gram Embedding参数,为模型Transformer参数提供更高效的查表寻址,在每次token计算时该参数无需参与,以极少的资源消耗“外挂”了一个大规模的 “记忆指南手册”,模型参数扩展效率更高;在模型优化方面,模型结构和训练优化协同进行,收敛效率和训练吞吐大幅提升。

Qwen3.8系列技术创新,直接带来了训练和推理的成本大幅下降。Qwen3.8-Flash性能与上一代Qwen3.7-Plus接近,但仅用九分之一的资源便完成了训练,训练成本大降90%;推理时,Qwen3.8-Flash每百万Tokens输入低至1元,输出3元,是Claude Opus4.6的3%,是DeepSeek-V4-Flash闲时价格的2/3、忙时价格的1/3。Qwen3.8-Flash擅长处理智能体编程、专业办公、长程任务等,同时Qwen团队和“千问办公”团队对模型和Harness框架协同联合优化,Agentic能力进一步提升。现在,千问办公“标准模式”内置了Qwen3.8-Flash,可完成95%的日常办公任务。

据了解,Next新架构将是全新一代千问大模型Qwen4的雏形,Qwen3.8-Flash-Next模型权重已在Hugging Face、魔搭社区全面开源,交由全球AI开源社区检验,以更好打造Qwen4模型。截至目前,Qwen3.8已开源发布2.4T参数量的Qwen3.8-Max、Qwen3.8-27B及Qwen3.8-Flash三大尺寸模型,Qwen模型全球下载量突破30亿次,衍生模型数超30万个,全尺寸、全模态的全面开源正在全球掀起新一轮中国模型浪潮。

校对 陶善工