2.4T Parameters: Qwen 3.8 Model Open-Sourced, Signaling Convergence in Domestic Ultra-Large Model Architectures

华尔街见闻
2026.08.13 12:29

8 月 13 日,阿里开源 Qwen3.8-2.4T 模型权重,这是 Qwen 系列首个开放权重的 Max 规模模型。该模型拥有 92 层、2.4 万亿参数,采用混合架构,包含 69 层线性注意力和 23 层传统注意力,与 Kimi K3 架构趋同。此次开源仅公布架构、后训练及推理 Infra 信息,未提供对应 API 或应用。

Kimi K3 开源半个月后,8 月 13 日,阿里 Qwen 也正式开放了 Qwen3.8-2.4T 的模型权重。

除去是 2.4T 的大参数模型,这次开源对于阿里而言还有另外的意义。

虽然之前 Qwen 曾经多次开源旗舰模型,但 Qwen 很早就形成了两条线。一边是开放权重模型,一边是更大的闭源 Max 模型。2024 年 Qwen 自己介绍第一代产品时就明确区分了 “大型开源模型 Qwen-72B” 和 “大型闭源模型”;后来 Qwen-Max-0428 也是只通过 Qwen Chat 和 DashScope API 提供,并没有释放权重。Qwen2.5-Max 到 2025 年依然如此,只开放 API,而同时拿 Qwen2.5-72B 作为自己的开放权重对照。

而这,是 Qwen 第一个开放权重的 Max 规模模型。

Qwen3.8 本次的开源暂时没有对应的模型,只有简单的架构、后训练、推理 Infra,以及开源规则。但从中我们已经可以获得不少信息了。

架构

Qwen3.8 共有 92 层(K3 96 层),总参数 2.4T,每个 Token 激活 95B。它使用 512 个专家(K3 896 个),每次选择 10 个路由专家,同时还有 1 个共享专家。相比 Kimi K3,每个专家更大,但总激活量稍小(Kimi K3 为 16 专家,103B)。

注意力机制上,Qwen3.8 继承了 Qwen3.5 的混合架构。92 层实际上由 23 组相同结构组成,每组包含 3 层 Gated DeltaNet(门控 Delta 网络)和 1 层 Gated Attention(门控全注意力),也就是 69 层线性注意力加 23 层传统注意力,比例正好接近 3:1。

这和 Kimi K3 非常像。K3 的 93 层里有 69 层 Kimi Delta Attention(KDA,Kimi Delta 注意力)和 24 层 Gated MLA(门控多头潜在注意力),也是大约 3:1。两者甚至属于相近的技术谱系,KDA 可以看作对 Gated DeltaNet 遗忘机制进一步细粒度化的版本。

不过 K3 在层间信息流上还多做了一步。它引入 AttnRes(Attention Residuals,注意力残差),允许模型重新组合多个历史层的输出。从 config.json 中看,Qwen3.8 沿用了 Qwen3.5 的实现。目前 Qwen 3.5 公开代码里仍然是比较传统的 Pre-Norm 残差结构,每个子层完成以后,只和进入该子层之前的 residual 直接相加。

Qwen3.8 原生上下文为 262,144 Token,并可以扩展到 1,010,000 Token,同时进行了多步 MTP(Multi-Token Prediction,多 Token 预测)训练。

Infra

这里首先要区分两种 Infra。Training Infra(训练基础设施)回答的是 “这个模型怎么训出来”,例如优化器、并行训练、通信、显存管理、Checkpoint 和容错。Inference Infra(推理基础设施)回答的是 “权重已经训完以后,怎么把它真正部署起来,并让每个 Token 足够快、足够便宜地吐出来”。

Qwen 目前并没有像 Kimi K3 技术报告那样系统披露训练 Infra,因此不能从这次发布判断它具体如何完成 2.4T 规模的训练。但推理侧的信息相对丰富。

首先是量化。Qwen 官方提供 BF16 和 FP8 checkpoint,Inferact 进一步提供 NVFP4 和 MXFP4 量化版本。BF16/FP8 完整版本至少需要两台 NVIDIA B300 或 AMD MI355X 节点,而 FP4 之后可以压缩到单节点部署。

第二则是并行。Qwen3.8 在推理阶段采用 TP(张量并行)、DP(数据并行)和 EP(专家并行)的组合。Attention 部分更依赖 TP,把矩阵计算拆开,MoE 部分则依靠 EP,把不同专家分布到不同 GPU。与此同时,推理框架还需要通过融合通信、专用 MoE Kernel(算子)以及高速互联网络,尽量降低专家调度带来的通信开销。

Kimi K3 面临的是同一个问题。在训练 2.8T 参数、896 专家的 Stable LatentMoE 时,Moonshot 并没有简单扩大传统 EP,而是提出 MoonEP,让热门专家根据当前负载动态复制到更多 GPU 上。

最后还有 MTP。Qwen3.8 训练了 Multi-Token Prediction 能力,示例配置一次预测 3 个候选 Token。如果候选被主模型接受,相当于一次前向传播推进多个 Token,从而减少自回归逐 Token 生成带来的串行延迟。值得注意的是,DeepSeek V4 在技术报告中也明确用了 MTP。

后训练

相比架构,Qwen 这次对后训练具体技术披露得更少,因为 config 文档里也没这些。

但它的后训练目标非常清楚。

Qwen 在模型卡里直接把 Agent Execution 列为核心升级方向,强调更强的 autonomous planning(自主规划)、对 environment feedback(环境反馈)的处理能力,以及更可靠的 end-to-end task completion(端到端任务完成)。

但基本上现在所有的后训练都会强调这些点。

官方公布的成绩也能看到这种倾斜。在 Qwen 自己的对照中,从 Qwen3.7-Max 到 3.8-Max,Terminal Bench 2.1 从 74.5 升至 86.6,PaperBench 从 64.8 升至 93.0,JobBench 从 31.3 升至 53.4,Toolathlon Verified 从 49.7 升至 72.5。

相比之下,GPQA Diamond 只是从 92.4 变为 92.6,HLE 从 41.4 升到 43.6。至少从官方评测呈现方式看,这一代最大的增量明显更多发生在 Coding Agent、General Agent 和专业工作,而不是传统单轮知识与推理 Benchmark。

另外,Qwen3.8 默认开启 preserve_thinking,把之前轮次中的推理上下文继续保留下来。这样 Agent 在一次工具调用之后,不必只拿着最终答案和工具结果重新开始,而可以继续利用此前已经形成的推理状态。

Kimi K3 也采取了几乎相同的方向。官方明确表示其后训练保留了推理历史。多轮交互和工具调用时,需要把此前的 reasoning content 和 tool calls 完整送回模型。

两家同时走到这里,说明 “保留推理状态” 正在从 Harness 的职责,逐渐转入旗舰 Agent 模型本身的训练与接口范式。

开源规则

这次开源的 Qwen3.8-2.4T-A95B 并不完全等同于云端 Qwen3.8-Max。开放版本目前是 text-only(纯文本),只能运行 thinking mode,原生上下文为 262K。而官方 Qwen3.8-Max 则建立在这一模型之上,额外提供视觉输入、non-thinking 模式、默认 1M 上下文以及官方内置工具。

拆开增强版放云,这已经是一个目前开源模型的常见模式了,这样开源也可以保有部分商业能力。比如 Minimax H3 的开源,就把影响成片质量的素材理解、2K 重生成和稀疏注意力实现留在云端。

许可证同样发生了变化。Qwen3 时代大量模型使用 Apache 2.0,而 Qwen3.8 改成了专门的 Qwen3.8-Max License。许可证仍允许使用、复制、修改、分发、微调、部署、托管甚至出售衍生产品,但如果商业产品超过 1 亿月活或月收入超过 2000 万美元,需要在界面显著展示模型名称。如果企业从事 Model-as-a-Service 或 AI Work Assistant 业务,并且连续 12 个月集团收入超过 5000 万美元,则商业使用前需要另外取得 Qwen 许可。

这和 Kimi K3 也非常类似。K3 同样采用自己的 Kimi K3 License,而不是 Apache 2.0;同样允许广泛使用和修改,也设置了超大规模商业产品的署名要求以及 MaaS 业务的额外授权门槛。区别主要在具体阈值和覆盖业务范围。

换句话说,到了 3T 级旗舰模型,两家公司选择的都是 open-weight(开放权重)+ 自定义商业许可,而不是过去小模型时代更加宽松的 Apache 式开放。

如果把 Qwen3.8 和 Kimi K3 放在一起看,反而可以看到 2026 年旗舰模型开始出现一种相当明显的收敛。

总参数都进入 2—3T,激活参数都控制在 100B 左右。Attention 不再全部采用传统 Transformer,而是用大约四分之三的递归/线性状态层配合四分之一的全局 Attention,上下文目标开始稳定在百万 Token。后训练重点转向 Coding、Research 和长程 Agent。最终能不能部署,则越来越依赖 FP4/FP8、融合 kernel、Expert Parallelism 和机架级高速互联。

Kimi K3 在模型架构上走得更激进一些,它同时引入 KDA、AttnRes 和 Stable LatentMoE;Qwen3.8 则更像一次把已经在 Qwen3.5 验证过的混合注意力架构直接 Scale 到 Max 级别,并围绕长程 Agent 和生产推理把整个生态补齐。

但无论如何,他们的架构选择都只是小优化差异,而非大区别了。infra 方面反而可能不同更大,但各种并行之间的调剂依然是最重要的问题。

配方的底子已经开始收敛,下一个谁能打破这个底子做点新意,就更值得期待了。

风险提示及免责条款

市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。