NVIDIA推出Cosmos 3 Edge 实现边缘设备实时世界建模与机器人决策

5 阅读3分钟前沿
NVIDIA推出Cosmos 3 Edge 实现边缘设备实时世界建模与机器人决策

核心特性

  • 4 B 参数、开放权重:首个面向边缘的开放世界模型,支持在资源受限设备上运行。
  • 双塔架构:自回归塔负责视觉‑文本推理,扩散塔处理视觉‑音频‑动作生成,实现统一的多模态注意力。
  • 实时推理:在Jetson Thor上实现 15 Hz 控制,单次推理可生成 32 条动作,满足机器人控制需求。
  • 边缘兼容:支持 RTX PRO、GeForce RTX、Jetson T2000/T3000 等 NVIDIA 硬件,提供高吞吐、低内存占用。

技术解析

Cosmos 3 Edge 通过两座 Transformer 塔共享多模态注意力层,实现视觉、文本、音频与动作的统一表示。自回归塔采用因果注意力,专注于序列理解;扩散塔则使用宽泛的注意力模式,支持视频与动作的生成与预测。两塔的归一化层和前馈网络独立,使得不同模态在训练时保持专属性,同时共享的注意力层确保跨模态信息对齐。

模型的动作表示采用紧凑的几何向量,统一了车辆、摄像头、机械臂等不同物理系统的动作编码,实现了从像素变化到控制指令的直接映射。该设计让模型不仅能够预测视觉后果,还能逆向推断导致特定视觉变化的动作,从而支持策略学习与因果推断两大场景。

在同规模(4 B)模型中,Cosmos 3 Edge 在 VANTAGE‑Bench 视觉分析基准上排名第一,并在机器人策略学习任务中刷新了 SOTA 成绩,展示了其在智能基础设施和机器人领域的竞争力。

应用与生态

  • 机器人操作:提供“pick‑and‑place”策略模型(Cosmos 3 Edge Policy DROID),可直接在边缘设备上进行动作生成与仿真。
  • 智能监控:在工厂、医院等场景实时理解环境变化,预测潜在风险。
  • 定制化微调:用户可利用少量 H100 或 DGX Station 集群微调模型,以适配特定行业数据。

NVIDIA 同时公布了后训练脚本与 4 步蒸馏检查点(Cosmos 3 Super),将扩散过程从 35‑50 步压缩至 4 步,提升约 25 倍推理速度,为图像‑视频生成提供高效参考实现。

展望

NVIDIA 表示,后续将继续深化 Cosmos 3 系列在交互式世界生成、自动驾驶场景仿真以及更高效的后训练优化方面的能力,并通过 vLLM 等开源推理框架进一步降低部署成本。该模型的发布为边缘物理 AI 的落地提供了完整的技术栈,预示着从云到端的 AI 计算格局正在加速重塑。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。