FLUX 3:Black Forest Labs 的多模态视频、音频与图像模型
Black Forest Labs 推出 FLUX 3,这是一个统一的多模态基础模型,可生成长达 20 秒的视频,自带原生音频,并支持图像生成与机器人动作预测。
Black Forest Labs 宣布推出 FLUX 3,这是一个新的多模态基础模型,在统一架构中联合训练图像、视频和音频。该模型可生成带原生音频的 20 秒视频片段,合成并编辑多种风格的图像,并扩展至机器人应用的动作预测。
FLUX 3 演示:带原生音频的多模态视频生成(来源:BFL 博客)
FLUX 3 的工作原理
FLUX 3 基于 BFL 的 Self-Flow 方法,该方法在同一个底层架构中对齐多模态生成与理解。模型不是将每种媒体类型视为独立任务,而是同时学习图像、视频和音频——声音必须与冲击匹配,运动必须遵循物理规律,未来必须遵循过去的趋势。
视频能力
FLUX 3 Video 可根据文本提示、图像或现有视频生成带原生音频、长达 20 秒的视频片段。核心能力包括:
- 文生视频生成(带原生音频)
- 图生视频——从起始帧开始动画,或使用图像作为视觉参考
- 视频转视频——将源片段中的核心元素带入新场景
- 从输入视频和音频进行生成式延续
- 关键帧到视频——在定义的时刻之间实现可控过渡
- 多语言对话生成
- 智能体链式组合——将单个片段串联为更长的多镜头序列
- 强大的排版生成与动画设计
在初步评估中,FLUX 3 Video 在与 Grok Imagine Video 的比较中获得了高达 69% 的偏好率,Kling v3 Pro 为 60%,Runway Gen-4.5 为 77%,Luma Ray 3.2 为 93%。该模型在捕捉人类面部表情、将声音与物理事件关联以及多语言能力方面尤为突出。
图像能力
FLUX 3 可生成和编辑多种风格、宽高比和分辨率的图像。早期评估表明,在处理复杂提示和多语言文本渲染方面,其性能较之前的 FLUX 版本有明显提升。FLUX 3 Image 的早期访问预计在未来几周内开放。
动作预测
FLUX 3 对世界的理解延伸到了动作预测。BFL 已与 mimic robotics 合作开发了 FLUX-mimic,将 FLUX 3 视频骨干网络与机器人学习相结合,用于灵巧操作。奥迪正在测试该系统用于生产任务,其中一些任务仅使用 30 分钟的机器人数据即可完成微调。
可用性
FLUX 3 Video 和 FLUX 3 Action 可通过 Early Access 获取。Black Forest Labs 计划在今年晚些时候发布 API 访问权限、私有模型权重以及开源权重的 FLUX 3 Dev 版本。
截至本文撰写时,FLUX 3 尚未提供原生 ComfyUI 支持,它需要官方的 BFL API 或早期访问计划。
评论
使用 GitHub 登录后即可参与讨论。