阿里巴巴发布Qwen3.8-Max 2.4万亿参数MoE模型 成本与多模态能力引领行业
•0 阅读•5分钟•前沿
大模型MoE多模态AlibabaQwen3.8-Max
•0 阅读•5分钟•前沿

重大发布
阿里巴巴的千问团队在今日的官方博客中宣布,Qwen3.8-Max 已从预览版升级为正式版,并将在下周同步发布开放权重。与此同时,规模稍小的 Qwen3.8-27B 也将同步开放,面向更广泛的本地部署需求。
技术规格
- 模型规模:2.4 万亿参数的 Mixture‑of‑Experts(MoE)架构,激活参数数未披露。
- 多模态输入:支持文本、图像、视频三模态,输出统一为文本。
- 上下文窗口:最大 1M token,实际可输入 991K token(启用思考模式时降至 983K),最大输出 131K token。
- 推理预算:最高 262K token 的思考预算。
- 兼容性:API 完全兼容 OpenAI 与阿里云 DashScope,调用方式仅需更换 Base‑URL 与模型 ID。
价格与部署
| 项目 | 费用(美元/1M token) | 备注 |
|---|---|---|
| 输入 | $2.00 | 原始输入费用 |
| 输出 | $6.00 | 生成文本费用 |
| 缓存读取 | $0.25 | 读取已缓存的输入 |
| 缓存创建 | $2.50 | 首次缓存费用 |
| 缓存读取(显式) | $0.17 | 对显式缓存的读取 |
- 限流:每分钟 2M token,最多 15K 次请求。
- 部署形态:托管 API 已对所有企业开放;开放权重的 2.4T 版本需多节点数据中心环境,实际落地更适合大型云服务商;27B 版本可在单机多卡 GPU 环境部署。
基准表现
阿里巴巴公布了完整的评测表,核心指标如下:
- Terminal‑Bench 2.1:86.6,领先 Claude Opus(84.6),略低于 GPT‑5.6(88.8)。
- SWE‑bench Pro:67.7,低于 Fable‑5(80.0)。
- FrontierSWE:73.5,亦低于 Fable‑5(88.8)。
- PaperBench:93.0,领先同类模型。
- IFBench:82.8。
- GPQA‑Diamond:92.6,轻微提升自 Qwen3.7‑Max(92.4)。
在视觉与多模态任务上表现尤为突出:
- OSWorld‑Verified:86.1
- Parametric CAD Bench:91.5
- OmniDocBench:92.1
- DeepSWE、FrontierSWE、JobBench 等指标均实现两位数以上的跃升。
注意:多模态评测基准使用的是 Qwen3.7‑Plus,而非 Qwen3.7‑Max,可能导致代际提升被高估。
行业落地
官方将功能划分为四大垂直场景:
- 软件工程:仓库级代码助手、自动化审查。
- 法律/金融文档审阅:长文本抽取与合规审查。
- 媒体与电商运营:长视频索引、结构化数据抽取。
- 设计创作:图像‑视频‑文本联动的创意生成。
模型内置五大工具(Responses API):
- code_interpreter
- web_search
- web_extractor
- t2i_search(文本到图像检索)
- i2i_search(图像到图像检索)
这些工具为企业构建端到端的智能工作流提供了即插即用的能力。
前景与挑战
Qwen3.8‑Max 的发布标志着国产大模型在参数规模、跨模态能力以及商业化计费模型上的一次重要跃迁。
- 成本优势:缓存机制使得同等输入成本降低约 8 倍,有助于控制长文本或长视频的推理费用。
- 部署门槛:2.4T MoE 仍需高性能集群,短期内主要服务于云服务商;27B 版本则是更实际的本地化落地路径。
- 性能瓶颈:在代码与推理密集的任务上仍落后于同类顶级模型,后续的 RL‑Scaling 与专家路由优化将是关键。
总体来看,Qwen3.8‑Max 为阿里巴巴在大模型生态链上提供了核心底座,也为国内外企业在多模态 AI 应用上提供了更具竞争力的选择。随着开放权重的正式发布,社区生态的迭代和第三方创新将进一步检验其长期价值。
本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。