NVIDIA将DeepSeek-V4 Pro启动时间从8分钟缩短至2分钟以内
NVIDIA利用GPU到GPU的RDMA和NVIDIA ModelExpress(MX)服务,将DeepSeek-V4 Pro的启动时间从8分钟缩短至不到2分钟。该方法通过重用内核缓存并避免集中广播,同时加速推理和强化学习后训练。
NVIDIA利用GPU到GPU的RDMA和NVIDIA ModelExpress(MX)服务,将DeepSeek-V4 Pro的启动时间从8分钟缩短至不到2分钟。该方法通过重用内核缓存并避免集中广播,同时加速推理和强化学习后训练。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
NVIDIA 宣布通过 GPU 间 RDMA 直连权重传输,将 DeepSeek-V4 Pro 的启动时间从 8 分钟降至 2 分钟以内。这一优化不仅限于推理,同样适用于强化学习后训练,揭示了 AI 基础设施从“计算瓶颈”向“架构瓶颈”转变的关键趋势。
NVIDIA AI 于 2026 年 7 月 24 日通过 X 平台宣布,已将 DeepSeek-V4 Pro 的启动时间从 8 分钟缩短至 2 分钟以内。实现方式是将权重通过“最快路径”传输到 GPU 内存,即 GPU 到 GPU 的 RDMA(远程直接内存访问)。
这一改进并非孤立优化,而是基于 NVIDIA ModelExpress (MX) 服务——Dynamo 系统中的权重分发与缓存管理组件。MX 复用内核缓存,同时推理节点通过 NIXL 直接从其他 GPU 获取更新权重,从而避免集中广播,并将权重移动从关键路径中移除。
NVIDIA 明确表示,同一方法同样加速推理和强化学习后训练,表明该优化具有通用性,而非仅针对启动场景。
ModelExpress (MX) 是 NVIDIA Dynamo 系统中的权重分发和缓存管理服务。其核心创新在于:推理节点不再依赖中央服务器广播权重,而是通过 NIXL 直接从其他 GPU 获取更新权重。这种 GPU 到 GPU 的 RDMA 路径避免了集中式广播的瓶颈,同时 MX 复用内核缓存,进一步减少重复加载。
NVIDIA 强调“将权重移动从关键路径中移除”,这意味着传统启动流程中,权重从存储加载到 GPU 的过程是延迟的主要来源。通过 GPU 直连 RDMA,权重传输与计算可以部分重叠,从而显著缩短启动时间。
该架构不仅适用于启动,也适用于推理和强化学习后训练,说明权重移动路径优化是跨场景的通用性能提升手段。
社区评论(如用户 Symbioza2025)指出,将启动时间从 8 分钟降至 2 分钟“不仅仅是优化细节”,而是表明“未来 AI 性能正成为架构问题,而不仅仅是计算问题”。权重移动、内存路径、缓存复用和 GPU 到 GPU 通信成为新的关键优化维度。
这一观点与 NVIDIA 的技术路线一致:通过架构创新(如 GPU 直连 RDMA)而非单纯增加算力来提升性能。对于大规模模型部署,启动时间直接影响服务可用性和资源利用率,2 分钟以内的启动时间使得动态扩缩容和快速故障恢复成为可能。
本报告主要依赖 NVIDIA AI 官方 X 账号的声明,属于第一方来源,但未提供独立第三方验证。社区评论作为背景观点引用,不构成事实确认。所有性能数据(8 分钟、2 分钟)均来自 NVIDIA 官方声明,置信度较高。
NVIDIA 通过 GPU 直连 RDMA 和 ModelExpress 服务,将 DeepSeek-V4 Pro 启动时间压缩 75% 以上,并证明该架构同样适用于推理和训练。这标志着 AI 基础设施优化正从“计算”转向“架构”,权重移动路径成为关键性能杠杆。
主报道
主报道来源