FLUX 3: Black Forest Labs의 멀티모달 비디오, 오디오 및 이미지 모델

news

Black Forest Labs가 FLUX 3를 공개했습니다. 통합 멀티모달 기반 모델로, 네이티브 오디오가 포함된 20초 비디오, 이미지 생성, 그리고 로봇 공학을 위한 동작 예측을 수행합니다.

Black Forest Labs가 FLUX 3를 발표했습니다. 이는 이미지, 비디오, 오디오를 통합 아키텍처에서 공동으로 학습한 새로운 멀티모달 기반 모델입니다. 이 모델은 네이티브 오디오가 포함된 20초 비디오 클립을 생성하고, 다양한 스타일의 이미지를 합성 및 편집하며, 로봇 공학을 위한 액션 예측까지 확장됩니다.

FLUX 3 데모: 네이티브 오디오를 갖춘 멀티모달 비디오 생성 (출처: BFL 블로그)

FLUX 3 작동 방식

FLUX 3는 BFL의 Self-Flow 접근 방식을 기반으로 구축되었으며, 동일한 기본 아키텍처 내에서 멀티모달 생성과 이해를 정렬합니다. 각 미디어 유형을 별도의 작업으로 취급하는 대신, 이미지, 비디오, 오디오를 동시에 학습합니다. 즉, 소리가 충격과 일치해야 하고, 움직임이 물리 법칙을 따라야 하며, 미래가 과거로부터 이어져야 합니다.

FLUX 3 아키텍처 개요

비디오 기능

FLUX 3 Video는 텍스트 프롬프트, 이미지 또는 기존 비디오로부터 최대 20초 길이의 네이티브 오디오가 포함된 클립을 생성할 수 있습니다. 핵심 기능은 다음과 같습니다.

  • 네이티브 오디오가 포함된 텍스트 기반 비디오 생성
  • 이미지 기반 비디오 생성 — 시작 프레임에서 애니메이션화하거나 이미지를 시각적 참조로 사용
  • 비디오 기반 비디오 생성 — 소스 클립의 중심 요소를 새 장면으로 전환
  • 입력 비디오 및 오디오로부터의 생성적 연속(Generative continuation)
  • 키프레임 기반 비디오 생성 — 정의된 순간 간의 제어된 전환
  • 다국어 대화 생성
  • 개별 클립을 더 긴 멀티샷 시퀀스로 연결하는 에이전트 체이닝(Agentic chaining)
  • 강력한 타이포그래피 생성 및 애니메이션 디자인

예비 평가에서 FLUX 3 Video는 Grok Imagine Video 대비 최대 69%, Kling v3 Pro 대비 60%, Runway Gen-4.5 대비 77%, Luma Ray 3.2 대비 93%의 비교에서 선호되었습니다. 이 모델은 특히 인간의 얼굴 표정 포착, 소리와 물리적 이벤트 연관, 다국어 기능에서 강점을 보입니다.

이미지 기능

FLUX 3는 다양한 스타일, 화면비 및 해상도에 걸쳐 이미지를 생성하고 편집할 수 있습니다. 초기 평가에서는 복잡한 프롬프트 처리 및 다국어 텍스트 렌더링에서 이전 FLUX 버전에 비해 상당한 개선이 나타났습니다. FLUX 3 Image 얼리 액세스는 앞으로 몇 주 내에 제공될 예정입니다.

동작 예측

FLUX 3의 세계 이해는 동작 예측까지 확장됩니다. BFL은 mimic robotics와 함께 FLUX-mimic을 개발하여 FLUX 3 비디오 백본과 로봇 학습을 결합해 정교한 조작을 구현했습니다. Audi는 생산 작업을 위해 이 시스템을 테스트하고 있으며, 일부 작업은 로봇 데이터 30분만으로 미세 조정되었습니다.

사용 가능성

FLUX 3 Video와 FLUX 3 Action은 얼리 액세스를 통해 사용할 수 있습니다. Black Forest Labs는 올해 나중에 API 액세스, 비공개 모델 가중치 및 오픈 가중치 FLUX 3 Dev 버전을 출시할 계획입니다.

FLUX 3 얼리 액세스 요청

현재 작성 시점에서 FLUX 3에 대한 네이티브 ComfyUI 지원은 아직 없습니다. 공식 BFL API 또는 얼리 액세스 프로그램이 필요합니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
FLUX 3: Black Forest Labs의 멀티모달 비디오, 오디오 및 이미지 모델 | ComfyUI Wiki