返回信息流
新闻事件
C归档48
NVIDIA Developer Blog
1 个来源

NVIDIA 发布 Alpamayo 2 Super:统一自动驾驶开发的开源推理视觉模型

NVIDIA 发布了 Alpamayo 2 Super,这是一个开源的 340 亿参数推理视觉模型,旨在统一自动驾驶开发中的轨迹生成、意图预测、场景理解和数据标注等任务。该模型通过单一架构简化了工作流程,提高了可比较性和可重用性。

SynthePulse Insight · AI 深度解读

NVIDIA Alpamayo 2 Super:一个模型统一自动驾驶开发全流程

版本 1 · 1 个来源

NVIDIA 发布 34B 参数开放推理视觉-语言-动作模型 Alpamayo 2 Super,将轨迹生成、推理、元动作预测、VQA 与自动标注统一于单一基础模型,并在多个基准上刷新纪录。

  • Alpamayo 2 Super 是 34B 参数开放模型,由 32B Cosmos 3 Super Reasoner 与 2B Action Expert 组成,经强化学习后训练。
  • 支持最多七摄像头 360° 感知,输出轨迹、Chain-of-Causation 推理、元动作、带 2D 定位的 VQA 答案及自动标注。
  • 在轨迹预测(minADE_6 0.911m)、AV 推理(0.433)、LingoQA(79.2)等基准上达到 SOTA,LingoQA 领先 37 个模型。
  • 模型权重在 Hugging Face 发布,推理笔记本在 GitHub,采用 OpenMDW-1.1 许可,允许商用再分发。
  • 同一模型可充当离线策略教师、评估批评者、数据引擎或任务定制起点,替代多模型分离工作流。
展开章节目录统一模型:解决 AV 开发中的模型分离问题

统一模型:解决 AV 开发中的模型分离问题

传统自动驾驶开发依赖多个独立模型分别处理轨迹生成、意图预测、场景理解和数据标注。这种分离使得比较相关输出、调查模型行为以及跨工作流复用表示变得困难。NVIDIA Alpamayo 2 Super 的发布正是针对这一痛点,将多种能力整合进一个 34B 参数的开放推理视觉-语言-动作(VLA)模型。

该模型由 32B 参数的 Cosmos 3 Super Reasoner 和 2B 参数的扩散式 Action Expert 组成,并通过强化学习进行后训练。Reasoner 负责解释多摄像头视频、语言上下文和先前运动历史,Action Expert 则将内部表示转换为未来的自车轨迹。这种设计使得模型能够同时输出轨迹、推理链、元动作、场景问答和自动标注,为 AV 开发提供统一基础。

多任务能力与工作流应用

Alpamayo 2 Super 的感知范围覆盖最多七个摄像头的 360° 视角,并返回多种互补输出:未来轨迹、Chain-of-Causation(CoC)推理轨迹、高层元动作、场景问题答案以及带 2D 定位的推理自动标签。这些输出支持四种工作流:生成轨迹与 CoC 推理、预测元动作(如让行、变道、停车)、多摄像头场景的自然语言问答,以及生成带 2D 定位的 CoC 自动标签。

这种多任务设计使同一基础模型能够在开发流程的不同阶段复用,例如作为离线策略教师、评估批评者、数据引擎或新任务定制的起点,从而避免为每个阶段维护单独模型。

基准测试:多项 SOTA 成绩

在开放环路评估中,Alpamayo 2 Super 在 1,434 个挑战性样本上实现了 6.4 秒 minADE_6 为 0.911 米,在 Physical AI AV Reasoning Benchmark 上得分 0.433,LingoQA 得分 79.2,在 37 个评估模型中排名第一。

在 LingoQA 上,它领先 Qwen2.5-VL (72B) 17.0 分,Qwen3-VL (32B) 7.0 分,Gemini 2.5 Pro 15.1 分,GPT-4o 23.2 分。此外,元动作 IoU(横向 74.59,纵向 61.91,车道 73.55)、VQA 答案相似度 0.652、2D 定位 IoU 0.71,以及闭环 AlpaSim Score 1.50 ± 0.13,均优于先前模型。

评估方法的局限与闭环模拟

开放环路指标的主要挑战在于,它们针对固定的预录未来进行评估,无法捕捉模型首次动作后场景的变化。例如,如果自车变道,开放环路回放可能继续沿记录轨迹移动相邻车辆,而不考虑其对自车的反应。

闭环模拟则执行每个预测动作,并在包含反应式行为模型时捕捉周围智能体的反应。NVIDIA AlpaSim 通过反复渲染观测来实现这一点,从而提供更全面的评估。

开放许可与可用性

模型权重已在 Hugging Face 上发布,推理笔记本在 GitHub 上提供。模型采用 OpenMDW-1.1 许可,这是 Linux 基金会针对开放模型分发的宽松许可,涵盖微调、衍生模型和商业再分发。蒸馏模型可无需 NVIDIA 进一步许可进行商业部署,模型输出不附带许可条件。

可信度边界

本文信息主要来自 NVIDIA 官方开发者博客,属于厂商发布内容,基准数据为厂商自报,未经独立验证。部分性能对比(如 LingoQA 领先分数)为厂商声明,需谨慎对待。

核心结论

Alpamayo 2 Super 通过单一模型整合多项 AV 开发任务,并在多个基准上取得领先,但其实际效果和通用性仍需独立验证。

主报道

NVIDIA Developer Blog

主报道来源