FLUX 3: 비디오, 이미지, 오디오 및 동작 예측을 위한 멀티모달 플로우 모델

ComfyUI Wiki

FLUX 3는 Black Forest Labs의 첫 번째 멀티모달 기반 모델로, Self-Flow 기반의 통합 플로우 매칭 아키텍처 내에서 비디오, 이미지, 오디오 및 동작 예측을 공동 학습합니다.

F

FLUX 3

멀티모달비디오 생성오디오 생성텍스트 기반 이미지 생성동작 예측

Black Forest Labs의 첫 번째 멀티모달 기반 모델 — 이미지, 비디오, 오디오 및 동작 예측을 통합 아키텍처에서 공동 학습합니다. 효율적인 멀티모달 정렬을 위한 Self-Flow 접근 방식을 기반으로 구축되었습니다. 네이티브 오디오를 포함한 텍스트 기반 비디오 생성, 이미지 기반 비디오 생성, 비디오 기반 비디오 생성, 생성적 오디오 연속, 그리고 고품질 텍스트 기반 이미지 생성이 가능합니다.

개발사Black Forest Labs
발표일2026-07-23
아키텍처멀티모달 플로우 매칭 (Self-Flow)
상태얼리 액세스 (비디오), 곧 출시 예정 (이미지, Dev)
기능비디오 + 오디오, 이미지 생성, 동작 예측
핵심 연구Self-Flow

FLUX 3란 무엇인가?

FLUX 3는 Black Forest Labs의 차세대 멀티모달 모델로, 이미지, 비디오 및 오디오를 단일 통합 아키텍처에서 공동 학습합니다. 이전 FLUX 모델이 이미지 생성에만 집중했던 것과 달리, FLUX 3는 물리적 세계의 공유 표현을 구축합니다. 즉, 객체가 어떻게 결합되는지, 사물이 어떻게 움직이는지, 그리고 이벤트가 어떻게 들리는지를 학습합니다.

단일 양식(모달리티)만으로는 현실에 대한 완전한 설명을 제공할 수 없습니다. 이미지는 특정 시점의 공간 구조를 캡처하고, 비디오는 시간적 역학을 복원하며, 오디오는 인과적 음향 관계를 드러내고, 언어는 지각을 지시와 연결합니다. FLUX 3는 이 모든 것을 동시에 학습하며, 양식 간 상호 제약을 활용하여 더 일관되고 물리적으로 근거 있는 출력을 생성합니다.

멀티모달 생성과 이해를 효율적으로 정렬하기 위해 Self-Flow 접근 방식을 기반으로 구축된 FLUX 3는 비디오, 이미지 및 오디오를 동시에 학습하기 위해 컴퓨팅 및 데이터 리소스를 대폭 확장했습니다.

FLUX 3가 할 수 있는 것

비디오 + 오디오 (FLUX 3 비디오: 현재 얼리 액세스 중)

FLUX 3 비디오는 단일 생성에서 720p 해상도로 최대 20초 길이의 고도로 다양한 비디오 클립을 네이티브 오디오와 함께 생성합니다:

  • 동기화된 오디오가 포함된 텍스트 기반 비디오 생성
  • 이미지 기반 비디오 생성 (시작 프레임 또는 시각적 참조로부터 애니메이션)
  • 중심 요소(예: 동일한 캐릭터)를 새로운 장면으로 전달하는 비디오 기반 비디오 생성
  • 입력 비디오 및 오디오로부터의 생성적 비디오-오디오 연속
  • 정의된 순간 간의 제어된 전환을 위한 키프레임 기반 비디오
  • 다국어 대화 생성
  • 개별 클립을 더 긴 멀티샷 시퀀스로 연결하는 에이전틱 체이닝
  • 기존 영화적 출력을 넘어서는 다양한 시각적 스타일 및 종횡비
  • 강력한 인간 얼굴 표정, 물리적으로 근거한 사운드-이벤트 연관, 그리고 다국어 기능

이미지 (FLUX 3 이미지: 곧 얼리 액세스 출시 예정)

FLUX 3 이미지는 다양한 스타일, 종횡비 및 해상도에 걸쳐 텍스트 기반 이미지 생성 및 이미지 편집을 제공할 예정입니다. 예비 평가에서는 복잡한 프롬프트 처리 및 텍스트 생성 정확도(여러 언어의 고정밀 텍스트 렌더링 포함)에 있어 이전 FLUX 버전보다 크게 개선된 것으로 나타났습니다.

동작 예측 (FLUX 3 동작 / FLUX-mimic: 파트너 액세스)

FLUX 3의 세계 이해는 네이티브 통합(Self-Flow 기반)과 사전 학습된 비디오 백본을 동역학 인식 기반 모델로 미세 조정하는 방식으로 동작 예측으로 확장됩니다. mimic 로보틱스와의 파트너십을 통해 FLUX-mimic 비디오-동작 모델은 Audi의 실제 생산 작업에서 정밀 조작 및 생산 배치를 위해 테스트되고 있습니다.

출시 계획

기능액세스상태
FLUX 3 비디오API + 비공개 가중치 액세스현재 얼리 액세스 중
FLUX 3 이미지API + 비공개 가중치 액세스몇 주 내 얼리 액세스 출시 예정
FLUX 3 동작연구 및 상업 파트너 (mimic)현재 파트너 대상
FLUX 3 개발 전용오픈 가중치 멀티모달 백본나중에 출시 예정

예비 평가

720p 해상도 오디오 포함 10초 텍스트 기반 비디오 클립에 대한 예비 인간 선호도 평가 결과:

비교선호도
vs Runway Gen-4.5FLUX 3 선호도 77%
vs Grok Imagine VideoFLUX 3 선호도 69%
vs Kling v3 ProFLUX 3 선호도 60%
vs Happy Horse v1FLUX 3 선호도 59%
vs Happy Horse 1.1FLUX 3 선호도 57%
vs Seedance 2.0FLUX 3 선호도 52%
vs Luma Ray 3.2FLUX 3 선호도 93%

|> 이 결과는 예비 단계이며, 얼리 액세스 기간 동안 팀은 추가 개선을 기대하고 있습니다. 출처: Black Forest Labs: FLUX 3 블로그 게시물.

링크

Guides and workflows related to this model series.

No articles found.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…