Black Forest Labs 发布并开源 Flux 3 视频生成模型
Black Forest Labs 正式发布了 Flux 3 视频生成模型并计划开源。该模型功能强大,支持文生视频、图生视频、视频参考生成、音频延长、关键帧控制、多语言对话、智能剪辑、文字动画和图像输出等。目前需申请早期访问,未来几周将开放 API 和开源版本。
Black Forest Labs 正式发布了 Flux 3 视频生成模型并计划开源。该模型功能强大,支持文生视频、图生视频、视频参考生成、音频延长、关键帧控制、多语言对话、智能剪辑、文字动画和图像输出等。目前需申请早期访问,未来几周将开放 API 和开源版本。
SynthePulse Insight · AI 深度解读
版本 1 · 2 个来源
Black Forest Labs 发布 Flux 3,首次实现视频原生音频生成,并计划开源模型权重。
Black Forest Labs 于 2026 年 7 月 23 日发布 Flux 3,这是一个多模态基础模型,同时学习图像、视频和音频。Flux 3 首次支持生成带有原生音频的视频,最长 20 秒。BFL 认为,单一模态无法完整捕捉现实,三者联合训练可相互填补信息空白。
Flux 3 支持文本到视频、图像到视频、视频到视频、关键帧转换、多语言对话以及智能剪辑(将片段串联为多镜头序列)。BFL 称模型擅长人类面部表情和声音与物理事件的匹配。
模型基于 Self-Flow 方法,使用多模态 Transformer,通过专用编码器和解码器将图像、视频、音频和动作转换为共享内部表示,再转换回输出。动作组件为机器人应用提供基础。
BFL 在早期评估中使用 10 秒 720p 视频进行用户偏好测试。Flux 3 相对于 Luma Ray 3.2 偏好率为 93%,相对于 Runway Gen-4.5 为 77%,相对于 Grok Imagine Video 为 69%。
面对更强竞品时优势缩小:相对于 Kling v3 Pro 为 60%,Happy Horse v1 为 59%,Happy Horse 1.1 为 57%,Seedance 2.0 和 Gemini Omni Flash 均为 52%。BFL 称结果初步,尚无独立测试。
BFL 计划分阶段发布:Flux 3 Video 已可用,Flux 3 Image 将在数周内进入早期访问,动作预测功能初期仅限合作伙伴。
BFL 将发布开源权重版本 Flux 3 Dev,但当前仅可通过申请早期访问。未来几周将开放 API,随后开放开源版本。
BFL 与 Mimic Robotics 合作开发了 Flux-mimic,一个视频动作模型,已在 Audi 生产任务中测试。这体现了 Flux 3 统一学习框架在机器人领域的扩展潜力。
本文主要基于 BFL 官方博客和公司声明,性能数据为内部测试结果,未经独立验证。开源计划为 BFL 单方面宣布,实际时间可能变化。
Flux 3 在视频生成中首次集成原生音频,并计划开源,但性能优势有限,且缺乏独立验证。
主报道
主报道来源
另有 1 个来源报道