返回信息流
新闻事件
机器之心
1 个来源

英伟达 Vera Rubin 首秀:Agent 工作负载下吞吐提升 30 倍

NVIDIA 首次公布了基于真实芯片的 Vera Rubin 性能测试结果,在 Agent 工作负载下,相比上一代 GB300 NVL72,每兆瓦吞吐量最高提升 30 倍,token 成本最高降低 35 倍。测试采用 SemiAnalysis 的 AgentX 基准,使用 DeepSeek V4 Pro 模型。同时,SpaceXAI 宣布将部署 NVIDIA Vera CPU,并计划基于 Vera Rubin 架构扩展支撑 Grok 的 AI 基础设施。

SynthePulse Insight · AI 深度解读会员精读

英伟达Vera Rubin首秀:Agent时代的基础设施竞赛

版本 1 · 1 个来源

英伟达首次公布基于真实芯片的Vera Rubin性能测试,针对Agent工作负载实现每兆瓦吞吐提升30倍、token成本降低35倍,并宣布SpaceXAI部署Vera CPU。这标志着AI竞争从模型能力转向支撑Agent持续行动的计算基础设施。

  • 英伟达首次公布基于真实芯片的Vera Rubin性能测试,针对Agent工作负载,相比GB300 NVL72最高实现每兆瓦吞吐提升30倍,token成本最高降低35倍。
  • 测试采用SemiAnalysis的AgentX工作负载,使用DeepSeek V4 Pro模型,在每位用户160 tokens/s交互目标下进行。
  • Vera Rubin NVL72是rack-scale系统结果,协同设计Rubin GPU、HBM4、NVLink 6及新推理软件栈,关键机制包括Prefill/Decode分离、Distributed KV Cache等。
展开章节目录Agent工作负载的新测试标准

Agent工作负载的新测试标准

英伟达首次公布基于真实芯片的Vera Rubin性能测试结果,针对Agent工作负载,相比上一代GB300 NVL72最高实现每兆瓦吞吐提升30倍,并将token成本最高降低35倍。测试采用SemiAnalysis的AgentX工作负载,该基准通过回放真实生产风格的Agent会话,评估系统处理真实Agent请求的能力。

与传统聊天任务不同,Agent会话具有长链路特征,上下文长度动态变化。NVIDIA展示的真实Agent轨迹中,主Agent上下文可从约6万token增长到接近40万token,并穿插多个子Agent请求。NVIDIA将指标定义为AI工厂级的'每兆瓦吞吐量',同时关注端到端延迟、首token时间等。

测试使用DeepSeek V4 Pro模型,在每位用户160 tokens/s交互目标下,Vera Rubin NVL72相比GB300 NVL72实现30倍更高的每兆瓦吞吐量。这反映了Agent基础设施评估从固定Prompt测试转向接近真实生产环境的工作负载。

限时免费

继续阅读完整分析

还有 4 节深入分析和完整结论

加载中

可信度边界

本文信息主要来源于机器之心对NVIDIA官方发布的报道,属于二手转述。性能数据(30倍、35倍等)为NVIDIA官方声称,未经独立验证。第三方机构Artificial Analysis的测试数据为来源转述,未提供原始报告。轨道计算计划来自马斯克透露,属于计划性声明,存在不确定性。

主报道

机器之心

主报道来源