返回信息流
新闻事件
Hugging Face Blog
2 个来源

NVIDIA NeMo Automodel 与 Hugging Face Diffusers 集成,实现大规模视频和图像模型微调

NVIDIA 宣布将 NeMo Automodel 与 Hugging Face Diffusers 集成,支持大规模微调视频和图像模型。此次合作旨在简化和加速企业的生成式 AI 模型定制。

SynthePulse Insight · AI 深度解读

NVIDIA与Hugging Face联手:扩散模型微调进入规模化时代

版本 1 · 1 个来源

NVIDIA NeMo Automodel与Hugging Face Diffusers的深度集成,让任意Diffusers格式模型无需转换即可进行分布式微调,覆盖从单卡到数百GPU的规模。

  • NVIDIA NeMo Automodel与Hugging Face Diffusers集成,支持直接使用Hub上的Diffusers模型进行分布式训练,无需检查点转换。
  • 支持全参数微调和LoRA参数高效微调,覆盖Wan 2.1、FLUX.1-dev、HunyuanVideo等主流扩散模型。
  • 提供FSDP2、张量并行、上下文并行等多种并行策略,通过配置切换而非代码重写。
  • 预编码数据集(VAE潜变量和文本嵌入)加速训练,支持多分辨率分桶数据加载。
  • 新模型支持只需添加数据处理和模型适配器,其余训练栈可复用。
  • 所有代码和配置均以Apache 2.0开源,推荐使用NVIDIA Docker容器部署。
展开章节目录集成核心:无需转换,即插即用

集成核心:无需转换,即插即用

NVIDIA NeMo Automodel是一个开源PyTorch DTensor原生训练库,与Hugging Face Diffusers深度集成。用户只需将pretrained_model_name_or_path指向Hub上的任意Diffusers模型ID,即可开始训练。检查点可直接加载到DiffusionPipeline进行推理,或上传回Hub共享,下游工具(量化、编译、LoRA适配器、自定义采样器)均保持兼容。

该集成支持流匹配(flow-matching)模型,在潜空间进行训练,并通过预编码VAE输出和多分辨率分桶数据加载提升吞吐量。目前支持的模型包括Wan 2.1 T2V(1.3B/14B)、Wan 2.2 T2V A14B(27B总参数,14B活跃)、FLUX.1-dev(12B)、FLUX.2-dev(32B)、HunyuanVideo 1.5(13B)和Qwen-Image(20B),均提供现成的微调配方。

规模化训练能力:从单卡到集群

NeMo Automodel的设计原则是“一个程序,任意规模”。并行策略(FSDP2、张量并行、专家并行、上下文并行、流水线并行)通过配置声明即可切换,无需重写模型代码。这使得训练FLUX.1-dev(12B)和HunyuanVideo(13B)等大型模型成为可能。

训练工作流包括数据集预编码、使用现有YAML配置启动训练、以及从微调检查点生成。以FLUX.1-dev在78张Rider-Waite塔罗牌数据集上的全Transformer微调为例,用户可直接复用已检入的YAML配置,通过命令行覆盖指定路径和设置。预编码步骤将图像和文本嵌入缓存为.pt文件,避免每步重复编码。

新模型支持与未来路线图

当新的扩散模型登陆Diffusers时,在NeMo Automodel中启用它只需添加数据处理处理器和模型适配器,而非编写完整的自定义训练脚本。其余配方栈(FSDP2、分桶数据加载、检查点、生成)保持不变,同一YAML驱动的工作流即可适用。

未来计划包括推出Pythonic配方API,进一步简化使用。当前多节点编排支持SLURM,Kubernetes支持即将到来。所有代码和配置均以Apache 2.0许可证开源,推荐使用NVIDIA Docker容器(nvcr.io/nvidia/nemo-automodel:26.06)部署,也可通过pip3 install nemo-automodel或从源码安装。

可信度边界

本文信息来源于NVIDIA和Hugging Face联合发布的官方博客,属于第一方来源。所有技术细节和性能声明均来自该博客,未引入外部知识。

核心结论

NVIDIA与Hugging Face的集成大幅降低了扩散模型微调的门槛,通过标准化接口和可扩展的并行策略,使研究人员和开发者能够高效地在任意规模下训练最新模型。

主报道

Hugging Face Blog

主报道来源

同一事件报道

另有 1 个来源报道