ModelExpress:以光速分发模型工件
ModelExpress 是一个旨在高效分发大型模型工件(检查点)的系统,解决了在集群中移动数百GB甚至TB数据的成本问题。它优化了AI训练和部署中的冷启动、自动扩展和滚动更新等常见操作。
ModelExpress 是一个旨在高效分发大型模型工件(检查点)的系统,解决了在集群中移动数百GB甚至TB数据的成本问题。它优化了AI训练和部署中的冷启动、自动扩展和滚动更新等常见操作。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
NVIDIA 推出的 ModelExpress 旨在解决大模型部署中权重传输的瓶颈问题,通过智能路径选择和 GPU 直连传输,将冷启动时间从 8 分钟缩短至 1 分 44 秒。
ModelExpress 的核心设计理念是:在加载模型前,先查询集群中是否已有兼容的权重副本。如果存在正在服务的副本,则通过 GPU 间 P2P RDMA(借助 NVIDIA Inference Xfer Library, NIXL)直接传输,绕过对象存储、本地磁盘和主机内存。如果无可用副本,则从最快的支持路径启动,例如从对象存储流式加载而不落盘,或通过 GPUDirect Storage 直接从本地存储读入 GPU。
这种设计将每个新副本的启动从独立的冷启动转变为 GPU 间的扇出传输。随着更多副本加入,源池不断扩大,后续副本的加载速度也随之提升。
对于第一个工作节点(无可用副本),ModelExpress 提供多种从存储加载的优化路径。从远程对象存储加载时,Model Streamer 使用多线程张量读取器并发拉取 safetensors,通过可复用的 CPU 暂存缓冲区直接送入 GPU,避免数据落盘。在张量并行部署中,参与节点分工读取并共享结果,而非每个节点独立下载完整检查点。
当集群维护共享磁盘缓存层时,ModelExpress 的原子分布式缓存确保仅一次外部下载:元数据存储中的原子声明选择一个下载者,其余副本跟踪进度并复用缓存。对于本地存储,若支持 GPUDirect Storage,则通过 NIXL 的多线程后端直接从存储读入 GPU,绕过主机内存;否则通过 ModelStreamer 流水线化本地读取,重叠磁盘 I/O 与 GPU 放置。
一旦集群中存在正在服务的副本,ModelExpress 将其视为实时权重源。控制平面负责发现兼容副本、交换传输元数据并跟踪源就绪状态,但绝不处理权重字节本身。数据平面默认使用 NIXL,其可插拔后端支持 InfiniBand、RoCE 等多种网络,实现 GPU 到 GPU 的直接传输。
测试表明,对于 DeepSeek-V4 Pro 模型(806 GiB),ModelExpress 将权重和 JIT 内核缓存从服务副本传输到新副本的时间控制在 10 秒内,总启动时间从 8 分钟降至 1 分 44 秒。新副本加载完成后即加入源池,为后续副本提供更多传输来源。
ModelExpress 不仅支持冷启动和弹性伸缩,还适用于强化学习后训练场景:接收驱动的 RL 权重更新工作流中,训练器产生的更新权重可直接通过 GPU 间传输分发到 rollout 工作节点。
ModelExpress 已与 vLLM、SGLang、Dynamo 和 llm-d 等推理框架集成,并包含 VMM arena 注册等优化,显著减少生产 LLM 部署中的启动和注册开销。
本文信息来源于 NVIDIA 官方技术博客,属于第一方技术公告。所有性能数据(如 8 分钟降至 1 分 44 秒、10 秒传输时间)均为 NVIDIA 团队在特定测试环境下的声明,实际效果可能因集群配置、网络条件等因素而异。
ModelExpress 通过智能路径选择和 GPU 直连传输,将大模型权重加载从分钟级压缩到秒级,为大规模 LLM 部署的冷启动、弹性伸缩和 RL 训练提供了关键基础设施。
主报道
主报道来源