NVIDIA发布Alpamayo 2 Super 34B视觉语言动作模型,开放商用许可加速自动驾驶

0 阅读4分钟前沿

关键亮点

  • 模型规模:34B 参数,核心为 32B Cosmos 3 Super Reasoner 骨干 + 2.3B 扩散动作解码器。
  • 开放许可:权重采用 Linux 基金会 OpenMDW-1.1 许可,源码 Apache 2.0,明确支持微调、衍生模型以及商业再分发,无需额外授权。
  • 多模态输出:单次全景摄像头视频推理即可生成轨迹、因果解释(Chain‑of‑Causation)、元动作、自动标注以及带 2D 定位的视觉问答。
  • 基准成绩:LingoQA Lingo‑Judge 79.2 分居榜首;AlpaSim 闭环评分 1.50±0.13;PhysicalAI‑AV 开环 minADE₆(6.4 s)0.911 m,全面领先 Qwen2.5‑VL、Gemini 2.5 Pro 与 GPT‑4o 等竞争模型。

架构与技术细节

Alpamayo 2 Super 采用 Vision‑Language‑Action(VLA) 框架。首先,Cosmos 3 Super Reasoner 通过 32 B 参数的多模态 Transformer 对六路全景 RGB 视频、文本指令以及历史位姿数据进行统一编码;随后,基于扩散模型的 2.3 B 动作解码器在同一次前向传播中预测 64 条 0.1 s 步长的轨迹点、对应的 3×3 旋转矩阵以及因果解释。模型在 115 k 小时、约 1 万亿帧的真实道路视频上进行预训练,并辅以 3.7 M 条因果链路标注,确保对稀有多车交互情形的鲁棒性。

开放许可与生态布局

OpenMDW‑1.1 是 Linux 基金会面向大模型的宽松许可证,兼容商业化部署。NVIDIA 将该许可证覆盖至整个 Alpamayo 系列,意味着从研发版到生产版均可直接商用,无需额外协议。源码通过 Apache 2.0 公开在 GitHub,模型权重已同步至 Hugging Face,方便开发者在 H100、A100 等云端 GPU 上快速 fine‑tune,亦可在车载 NPU 上进行 1×H100 80 GB 的 72 GB 峰值显存推理实验。

训练数据与评测

  • 数据规模:约 115 000 小时多摄像头驾驶视频,累计超过 1 十亿张图像;
  • 标注类型:轨迹、位姿、3D 旋转、Chain‑of‑Causation(约 3.7 M 条)以及视觉问答对。
  • 基准对比:在 LingoQA 上领先 17.0‑23.2 分;AlpaSim 场景覆盖 910 条真实道路突发情形;PhysicalAI‑AV 开环评测显示 0.911 m 的定位误差,显著优于业界主流模型。

运营价值与行业影响

Alpamayo 2 Super 的“一次推理多输出”特性,使得自动驾驶系统能够同步获取 决策轨迹可解释因果链,大幅降低后端标注成本。NVIDIA 称,使用该模型对内部车队数据进行自动标注,可将原本数月的人工标注周期压缩至数天。其因果解释模块还可直接对接 ISO/PAS 8800 安全验证工作流,提升安全合规性。

从生态角度看,开放的商业许可将吸引第三方车企、机器人出租车平台以及自动驾驶仿真公司在模型之上快速构建定制化方案,进一步推动 视觉语言动作(VLA)技术在真实道路场景的落地。

展望

随着算力成本继续下降以及多模态大模型的持续迭代,Alpamayo 2 Super 代表了面向 自动驾驶 的生成式 AI 的新标杆。业界期待后续的模型压缩、边缘化部署以及跨模态协同优化,以实现更低延迟、更高安全性的车载 AI 系统。

“从研发到商业化的闭环,只要遵循 OpenMDW‑1.1,任何企业都可以直接上手。” — NVIDIA 官方博客

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。