# 阿里首次把 Qwen-Max 级别的模型权重放出来了，总参数 2.4 万亿，每次只激活 950 亿

> 原标题：阿里开放 Qwen3.8-2.4T-A95B 模型权重：2.4T MoE、激活 95B、原生 256K 上下文

- 来源：AI HOT 精选
- 发布时间：2026-08-12T16:10:01.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50281
- 原文：https://www.ithome.com/0/989/001.htm

## 摘要

阿里 Qwen 团队开源了 Qwen3.8-2.4T-A95B，这是他们第一次把云端最强模型级别的权重直接公开。模型用了混合专家架构，总共 2.4 万亿参数，但每次计算只激活其中的 950 亿，所以跑起来比同体量的稠密模型省算力。它原生支持 26 万多 token 的上下文，能一口气处理整本小说，还能扩展到 101 万 token。训练时加入了多 to...

## 推荐理由

阿里第一次把云端旗舰模型完整开源，2.4T MoE、激活95B、原生256K上下文，这几个指标放在一起分量很重。三个维度都踩中了：头部大厂罕见动作、技术上有具体新东西、对国内开发者生态有直接拉动。没给更高分是因为目前只有公告，还没看到第三方实测跑分和实际部署反馈，我会先打个折，等社区验证了再往上调。

## 锐评

阿里这次把Qwen-Max级别的模型权重放出来，是实打实的动作。模型用混合专家架构，总共2.4万亿参数，每次计算只激活950亿，相当于一个超大团队里每次只叫10个专家加1个常驻顾问干活，比同样体量的稠密模型省不少算力。原生支持26万token上下文，能一口气吞下整本小说，还能扩展到101万token，处理长文档和长周期任务有天然优势。

官方说训练时加了多token预测，让模型一次能猜后面好几个词，推理速度有提升空间。后训练部分提到用组合环境扩展、统一奖励系统和在线数据均衡器来降低训练波动，思路是让模型在更杂更真的任务里练手，而不是靠人工一个个定制场景。跑分上和Opus 4.8、GPT 5.6 Sol互有胜负，在PaperBench这类偏学术写作的指标上拿了所列模型里的高分。

不过这篇公告缺了两个关键信息：一是没写开源协议是什么，商用是否受限完全不清楚；二是没给推理需要的硬件配置，2.4T的模型权重全加载需要多少显存、最低用什么卡能跑，这些都没提。想在生产环境用的团队得自己踩坑验证。另外，云端版Qwen3.8-Max说加了更多生产环境能力，但具体加了什么、和开源版差多少，也没展开说。
