Qwen3.8 正式开放 2.4 万亿参数权重:最大模型首先是一道部署题
作者:林岚|OC 开发者生态编辑
作者:林岚|OC 开发者生态编辑
Qwen 团队已经在 Hugging Face 发布 Qwen3.8-2.4T-A95B 的模型权重和配置,兼容 vLLM、SGLang 与 TokenSpeed。模型总参数量为 2.4 万亿,每次推理激活约 950 亿参数,原生上下文为 262,144 token,并可扩展到约 101 万 token。
一句话结论:此前值得问的是 Qwen 会不会真的开放这批权重,现在答案已经明确;接下来的问题是,有多少团队拥有足够的显存、网络和工程能力,把一个 2.4 万亿参数的开放模型运行成可负担的服务。
OC 此前在《Qwen3.8 宣布 2.4 万亿参数开放权重》中报道,Qwen 当时只公布模型规模并承诺即将开放,判断是“最大不等于最强”。此次权重真正上线,构成了可以续写的新事实。它让研究者和企业能够检查、量化、微调和部署模型,不必只能调用 Qwen Cloud 的黑盒 API。
但“开放”不等于“轻量”。MoE 架构让每个 token 只激活 10 个路由专家和 1 个共享专家,因此计算量远低于同时运行 2.4 万亿参数;完整权重仍要被存储并跨设备调度。95B 激活参数也已经超过多数团队能用几张消费级显卡承受的范围,网络带宽、专家并行和 KV cache 会成为真实瓶颈。

还要区分开放权重版与云端 Qwen3.8-Max。开放模型目前是纯文本、必须启用思考模式,原生上下文为 256K 级别;官方托管的 Max 服务另外提供视觉输入、非思考模式、内置工具和默认 1M 上下文。把云端产品的全部能力直接算到开放权重上,会高估本地部署得到的功能。
官方基准显示,Qwen3.8-Max 在 PaperBench、WideSearch 和多项法律、金融任务上进步明显,但其中不少测试由 Qwen 自行运行,部分还是内部基准。开发者更应该关注具体 harness、超时、采样参数和硬件配置,而不是把几十张表格压缩成一个“超过某模型”的结论。
关键事实
- 来源:Qwen 官方 Hugging Face 仓库
- 模型结构:MoE;总参数 2.4T;每次激活 95B
- 上下文:原生 262,144 token,可扩展至 1,010,000 token
- 开放版本边界:纯文本、强制思考;不等同于云端 Qwen3.8-Max
OC 判断
Qwen3.8 的开放价值首先在可控制和可研究,而不是人人都能在本地跑。它可能更适合云厂商、大型企业和高校集群,普通团队则会等待量化版、蒸馏版或托管服务。开放权重打破的是供应商锁定,不会自动消除基础设施门槛。
为什么重要
- 对开发者:可以检查和定制 Max 级模型,但部署复杂度远高于普通开源模型。
- 对企业:多了一个可私有控制的前沿候选,也需要承担算力、运维和安全责任。
- 对行业:中国开放权重模型继续用可部署性争夺全球开发者,而不只竞争聊天产品流量。
评论
围绕这篇文章补充信息、提出问题或分享观察。