返回信息流
新闻事件
NVIDIA AI (X)
1 个来源

NVIDIA将DeepSeek-V4 Pro启动时间从8分钟缩短至2分钟以内

NVIDIA利用GPU到GPU的RDMA和NVIDIA ModelExpress(MX)服务,将DeepSeek-V4 Pro的启动时间从8分钟缩短至不到2分钟。该方法通过重用内核缓存并避免集中广播,同时加速推理和强化学习后训练。

SynthePulse Insight · AI 深度解读

NVIDIA 将 DeepSeek-V4 Pro 启动时间从 8 分钟压缩至 2 分钟以内:GPU 直连 RDMA 如何重塑权重分发路径

版本 1 · 1 个来源

NVIDIA 宣布通过 GPU 间 RDMA 直连权重传输,将 DeepSeek-V4 Pro 的启动时间从 8 分钟降至 2 分钟以内。这一优化不仅限于推理,同样适用于强化学习后训练,揭示了 AI 基础设施从“计算瓶颈”向“架构瓶颈”转变的关键趋势。

  • NVIDIA AI 官方宣布,通过 GPU 到 GPU 的 RDMA 直连权重传输,将 DeepSeek-V4 Pro 的启动时间从 8 分钟缩短至 2 分钟以内。
  • 该优化依赖 NVIDIA ModelExpress (MX) 服务——Dynamo 系统中的权重分发与缓存管理组件,它复用内核缓存,并让推理节点直接从其他 GPU 获取更新权重,避免集中广播。
  • 同一方法同样加速推理和强化学习后训练,表明权重移动路径优化是通用性能提升手段。
  • NVIDIA 强调“将权重移动从关键路径中移除”,暗示传统集中式权重分发是启动延迟的主要来源。
  • 社区评论指出,这标志着 AI 性能优化正从“计算问题”转向“架构问题”,权重移动、内存路径和缓存复用成为新焦点。
展开章节目录启动时间优化:从 8 分钟到 2 分钟

启动时间优化:从 8 分钟到 2 分钟

NVIDIA AI 于 2026 年 7 月 24 日通过 X 平台宣布,已将 DeepSeek-V4 Pro 的启动时间从 8 分钟缩短至 2 分钟以内。实现方式是将权重通过“最快路径”传输到 GPU 内存,即 GPU 到 GPU 的 RDMA(远程直接内存访问)。

这一改进并非孤立优化,而是基于 NVIDIA ModelExpress (MX) 服务——Dynamo 系统中的权重分发与缓存管理组件。MX 复用内核缓存,同时推理节点通过 NIXL 直接从其他 GPU 获取更新权重,从而避免集中广播,并将权重移动从关键路径中移除。

NVIDIA 明确表示,同一方法同样加速推理和强化学习后训练,表明该优化具有通用性,而非仅针对启动场景。

技术架构:ModelExpress 与 GPU 直连

ModelExpress (MX) 是 NVIDIA Dynamo 系统中的权重分发和缓存管理服务。其核心创新在于:推理节点不再依赖中央服务器广播权重,而是通过 NIXL 直接从其他 GPU 获取更新权重。这种 GPU 到 GPU 的 RDMA 路径避免了集中式广播的瓶颈,同时 MX 复用内核缓存,进一步减少重复加载。

NVIDIA 强调“将权重移动从关键路径中移除”,这意味着传统启动流程中,权重从存储加载到 GPU 的过程是延迟的主要来源。通过 GPU 直连 RDMA,权重传输与计算可以部分重叠,从而显著缩短启动时间。

该架构不仅适用于启动,也适用于推理和强化学习后训练,说明权重移动路径优化是跨场景的通用性能提升手段。

行业意义:从计算瓶颈到架构瓶颈

社区评论(如用户 Symbioza2025)指出,将启动时间从 8 分钟降至 2 分钟“不仅仅是优化细节”,而是表明“未来 AI 性能正成为架构问题,而不仅仅是计算问题”。权重移动、内存路径、缓存复用和 GPU 到 GPU 通信成为新的关键优化维度。

这一观点与 NVIDIA 的技术路线一致:通过架构创新(如 GPU 直连 RDMA)而非单纯增加算力来提升性能。对于大规模模型部署,启动时间直接影响服务可用性和资源利用率,2 分钟以内的启动时间使得动态扩缩容和快速故障恢复成为可能。

可信度边界

本报告主要依赖 NVIDIA AI 官方 X 账号的声明,属于第一方来源,但未提供独立第三方验证。社区评论作为背景观点引用,不构成事实确认。所有性能数据(8 分钟、2 分钟)均来自 NVIDIA 官方声明,置信度较高。

核心结论

NVIDIA 通过 GPU 直连 RDMA 和 ModelExpress 服务,将 DeepSeek-V4 Pro 启动时间压缩 75% 以上,并证明该架构同样适用于推理和训练。这标志着 AI 基础设施优化正从“计算”转向“架构”,权重移动路径成为关键性能杠杆。

主报道

NVIDIA AI (X)

主报道来源