阿里巴巴发布Qwen3.8-Max 2.4万亿参数MoE模型 成本与多模态能力引领行业

0 阅读5分钟前沿
阿里巴巴发布Qwen3.8-Max 2.4万亿参数MoE模型 成本与多模态能力引领行业

重大发布

阿里巴巴的千问团队在今日的官方博客中宣布,Qwen3.8-Max 已从预览版升级为正式版,并将在下周同步发布开放权重。与此同时,规模稍小的 Qwen3.8-27B 也将同步开放,面向更广泛的本地部署需求。

技术规格

  • 模型规模:2.4 万亿参数的 Mixture‑of‑Experts(MoE)架构,激活参数数未披露。
  • 多模态输入:支持文本、图像、视频三模态,输出统一为文本。
  • 上下文窗口:最大 1M token,实际可输入 991K token(启用思考模式时降至 983K),最大输出 131K token。
  • 推理预算:最高 262K token 的思考预算。
  • 兼容性:API 完全兼容 OpenAI 与阿里云 DashScope,调用方式仅需更换 Base‑URL 与模型 ID。

价格与部署

项目费用(美元/1M token)备注
输入$2.00原始输入费用
输出$6.00生成文本费用
缓存读取$0.25读取已缓存的输入
缓存创建$2.50首次缓存费用
缓存读取(显式)$0.17对显式缓存的读取
  • 限流:每分钟 2M token,最多 15K 次请求。
  • 部署形态:托管 API 已对所有企业开放;开放权重的 2.4T 版本需多节点数据中心环境,实际落地更适合大型云服务商;27B 版本可在单机多卡 GPU 环境部署。

基准表现

阿里巴巴公布了完整的评测表,核心指标如下:

  • Terminal‑Bench 2.1:86.6,领先 Claude Opus(84.6),略低于 GPT‑5.6(88.8)。
  • SWE‑bench Pro:67.7,低于 Fable‑5(80.0)。
  • FrontierSWE:73.5,亦低于 Fable‑5(88.8)。
  • PaperBench:93.0,领先同类模型。
  • IFBench:82.8。
  • GPQA‑Diamond:92.6,轻微提升自 Qwen3.7‑Max(92.4)。

在视觉与多模态任务上表现尤为突出:

  • OSWorld‑Verified:86.1
  • Parametric CAD Bench:91.5
  • OmniDocBench:92.1
  • DeepSWE、FrontierSWE、JobBench 等指标均实现两位数以上的跃升。

注意:多模态评测基准使用的是 Qwen3.7‑Plus,而非 Qwen3.7‑Max,可能导致代际提升被高估。

行业落地

官方将功能划分为四大垂直场景:

  1. 软件工程:仓库级代码助手、自动化审查。
  2. 法律/金融文档审阅:长文本抽取与合规审查。
  3. 媒体与电商运营:长视频索引、结构化数据抽取。
  4. 设计创作:图像‑视频‑文本联动的创意生成。

模型内置五大工具(Responses API):

  • code_interpreter
  • web_search
  • web_extractor
  • t2i_search(文本到图像检索)
  • i2i_search(图像到图像检索)

这些工具为企业构建端到端的智能工作流提供了即插即用的能力。

前景与挑战

Qwen3.8‑Max 的发布标志着国产大模型在参数规模、跨模态能力以及商业化计费模型上的一次重要跃迁。

  • 成本优势:缓存机制使得同等输入成本降低约 8 倍,有助于控制长文本或长视频的推理费用。
  • 部署门槛:2.4T MoE 仍需高性能集群,短期内主要服务于云服务商;27B 版本则是更实际的本地化落地路径。
  • 性能瓶颈:在代码与推理密集的任务上仍落后于同类顶级模型,后续的 RL‑Scaling 与专家路由优化将是关键。

总体来看,Qwen3.8‑Max 为阿里巴巴在大模型生态链上提供了核心底座,也为国内外企业在多模态 AI 应用上提供了更具竞争力的选择。随着开放权重的正式发布,社区生态的迭代和第三方创新将进一步检验其长期价值。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。