FLUX 3:多模态流模型 — 视频、图像、音频与动作预测

ComfyUI Wiki

FLUX 3 是 Black Forest Labs 首个多模态基础模型,基于 Self-Flow 在统一流匹配架构中联合训练视频、图像、音频和动作预测。

F

FLUX 3

多模态视频生成音频生成文生图动作预测

Black Forest Labs 的首个多模态基础模型 — 在统一架构中联合学习图像、视频、音频和动作预测。基于 Self-Flow 方法实现高效多模态对齐。支持带原生音频的文生视频、图生视频、视频转视频、生成式音频续写以及高质量文生图。

开发者Black Forest Labs
发布日期2026-07-23
架构多模态流匹配(Self-Flow)
状态Early Access(视频),即将推出(图像、Dev)
能力视频 + 音频、图像生成、动作预测
核心技术Self-Flow

What is FLUX 3?

FLUX 3 是 Black Forest Labs 的下一代多模态模型,在统一的架构中联合学习图像、视频和音频。与之前仅专注于图像生成的 FLUX 模型不同,FLUX 3 构建了一个关于物理世界的共享表征:物体如何保持结构、事物如何运动、事件如何发声。

没有任何单一模态能完整描述现实。图像捕获某一时刻的空间结构,视频恢复时间动态,音频揭示因果声学关系,语言则将感知与指令连接起来。FLUX 3 同时从所有模态中学习,利用模态间的相互约束生成更连贯、物理基础更扎实的输出。

基于 Self-Flow 方法高效对齐多模态生成与理解,FLUX 3 在视频、图像和音频上大幅扩展了计算和数据资源进行联合训练。

FLUX 3 能做什么?

视频 + 音频(FLUX 3 Video — Early Access 现已开放)

FLUX 3 Video 可生成最长 20 秒、720p 分辨率的多样化视频片段,并带有原生音频:

  • 文生视频,带同步音频
  • 图生视频(从起始帧生成动画或使用图像作为视觉参考)
  • 视频转视频,将源视频的核心元素(如相同角色)带入新场景
  • 生成式视频音频续写,基于输入视频和音频
  • 关键帧生成视频,在定义的时间点之间进行受控过渡
  • 多语言对话生成
  • 代理链式拼接,将单个片段组合成更长的多镜头序列
  • 广泛的视觉风格和宽高比,远超传统电影级输出
  • 强大人脸表情表现、物理因果关联的音效以及多语言能力

图像(FLUX 3 Image — Early Access 即将推出)

FLUX 3 Image 将提供文生图合成和图像编辑,覆盖多种风格、宽高比和分辨率。初步评估显示,在复杂提示处理和文字生成准确度上相比早期 FLUX 版本有显著提升,包括多语言高精度文字渲染。

动作预测(FLUX 3 Action / FLUX-mimic — 合作伙伴访问)

FLUX 3 的世界理解能力延伸至动作预测,通过原生集成(基于 Self-Flow)以及将预训练视频主干微调为动力学感知基础来实现。与 mimic robotics 合作开发的 FLUX-mimic 视频-动作模型正在奥迪的真实生产任务中进行灵巧操作测试。

发布计划

能力访问方式状态
FLUX 3 VideoAPI + 私有权重访问Early Access 现已开放
FLUX 3 ImageAPI + 私有权重访问Early Access 即将推出
FLUX 3 Action研究及商业合作伙伴(mimic)合作伙伴现已可用
FLUX 3 Dev开放权重多模态主干即将推出

早期评估

在 10 秒、720p 文生视频片段(含音频)的初步人类偏好评估中:

对比偏好率
vs Runway Gen-4.577% 偏好 FLUX 3
vs Grok Imagine Video69% 偏好 FLUX 3
vs Kling v3 Pro60% 偏好 FLUX 3
vs Happy Horse v159% 偏好 FLUX 3
vs Happy Horse 1.157% 偏好 FLUX 3
vs Seedance 2.052% 偏好 FLUX 3
vs Luma Ray 3.293% 偏好 FLUX 3

这些结果为初步数据,团队预计在 Early Access 阶段会有进一步提升。来源:Black Forest Labs — FLUX 3 博客文章

链接

Guides and workflows related to this model series.

No articles found.

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…