Bernini-Diffusers-v2: 바이트댄스(ByteDance), 전체 비디오 파이프라인을 오픈소스로 공개

ComfyUI Wikinews

바이트댄스(ByteDance)가 Bernini-Diffusers-v2를 공개했습니다: diffusers 형식의 전체 의미 계획 기반 비디오 생성 및 편집 파이프라인으로, 더 강력해진 레퍼런스 기반 편집과 OpenS2V를 지원합니다.

Bernini-Diffusers-v2 (HuggingFace | GitHub | 프로젝트 페이지)는 바이트댄스(ByteDance)의 새로운 릴리스입니다. 전체 Bernini 비디오 생성 및 편집 파이프라인을 독립형 diffusers 형식 디렉터리로 패키징하며, MLLM 의미 플래너, Bernini 플래닝 가중치, Wan2.2 diffusion 구성 요소를 하나의 checkpoint에 번들로 포함합니다.

개요

Bernini는 MLLM 기반 의미 플래너와 DiT 기반 렌더러를 결합한 바이트댄스(ByteDance)의 통합 비디오 생성 및 편집 프레임워크입니다. 프레임을 직접 생성하는 대신, 복잡한 지시를 먼저 명시적인 의미 계획(semantic plan)으로 분해한 다음, Wan2.2 기반 diffusion 디코더로 결과를 렌더링합니다. 이러한 '잠재 의미 계획(latent semantic planning)' 방식은 복잡한 생성 및 편집 요청에 대해 강력한 지시 수행 능력을 제공합니다.

Bernini-Diffusers-v2는 전체 파이프라인을 하나의 독립형 diffusers 디렉터리에 패키징합니다: Qwen2.5-VL 플래너, Bernini 플래닝 가중치, 그리고 Wan2.2 diffusion 구성 요소(텍스트 인코더, VAE, scheduler, 이중 transformer 설정)가 포함됩니다. 렌더러 전용 Bernini-R 릴리스와 비교할 때, 다단계 의미 계획이 필요하거나 복잡한 요청을 더 잘 처리해야 하는 경우에 권장됩니다. 첫 번째 Bernini-Diffusers 릴리스(2026년 6월)와 비교하여 v2는 공동 학습(co-training) 전에 커넥터를 수천 단계 동안 워밍업하는 학습 레시피를 사용하여 레퍼런스 기반 비디오 편집OpenS2V 성능을 개선합니다.

Bernini 프레임워크: MLLM 의미 플래너 + Wan2.2 DiT 렌더러

Bernini 프레임워크: MLLM 기반 의미 플래너가 지시를 계획으로 분해하면 Wan2.2 DiT 렌더러가 이를 비디오로 변환합니다. 소스: Bernini 프로젝트 페이지

지원 작업

Bernini-Diffusers-v2는 Bernini 저장소의 즉시 실행 가능한 런처를 통해 여섯 가지 작업을 지원합니다:

작업설명
t2i / i2i텍스트 기반 이미지 생성 및 이미지 기반 이미지 생성
t2v텍스트 기반 비디오 생성
v2v비디오 기반 비디오 편집
rv2v레퍼런스 기반 비디오 편집(레퍼런스 + 소스 비디오)
r2v레퍼런스 기반 비디오 생성(OpenS2V, 단일 이미지 또는 레퍼런스에서 비디오로)

벤치마크

모델EditVerseOpenVEOpenS2VVBenchBernini-v2v (OS)Bernini-rv2v (OS)
Bernini-v2 7+14B8.023.9663.8384.463.493.55

비디오 편집 부문에서 Bernini는 블라인드 인간 쌍체 비교(blind human pairwise comparisons)를 기반으로 한 바이트댄스(ByteDance) 내부 아레나 평가에서 주요 비공개 상용 모델 중 최상위권에 도달했습니다.

패키지 구조

이 릴리스는 독립형 diffusers 형식 디렉터리입니다. 다운로드한 디렉터리를 --config에 직접 전달하세요:

Bernini-Diffusers-v2/
  bernini/          # Bernini planning checkpoint
  mllm/             # Qwen2.5-VL planner assets
  scheduler/        # base diffusion modules
  t5_text_encoder/
  t5_tokenizer/
  vae/
  config.json
  transformer_config.json
  transformer_2_config.json   # Wan2.2 diffusion decoder components

ComfyUI 지원

Bernini-R 렌더러는 Comfy-Org의 공식 ComfyUI 지원을 받으며, docs.comfy.org에 텍스트 기반 비디오 생성, 이미지 기반 비디오 생성, 비디오 편집 워크플로를 다루는 전용 튜토리얼이 있습니다. 또한 이 릴리스의 diffusers 형식 디렉터리는 ComfyUI의 표준 확산 모델 로드(Load Diffusion Model) 노드를 사용하여 로드할 수 있습니다.

전체 의미 계획 파이프라인(플래너 + 렌더러)의 경우, 공식 Bernini 저장소에서 Python 추론 코드를 제공합니다. 여기에는 단일 GPU 및 다중 GPU(torchrun --ulysses 8) Gradio 데모와 scripts/bernini_v2/ 아래의 작업별 실행 스크립트(run_t2i.sh, run_i2i.sh, run_t2v.sh, run_v2v.sh, run_rv2v.sh, run_r2v.sh)가 포함됩니다.

다운로드

hf CLI로 모델을 다운로드하세요:

pip install -U "huggingface_hub"
hf download ByteDance/Bernini-Diffusers-v2 --local-dir pretrained_models/Bernini-Diffusers-v2

그런 다음 디렉터리를 --config로 전달하여 추론을 실행하세요:

git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
python infer_single_gpu.py --config pretrained_models/Bernini-Diffusers-v2 \
    --case assets/testcases/i2i/i2i.json --num_frames 1

논문은 arXiv:2605.22344에서 확인할 수 있습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Bernini-Diffusers-v2: 바이트댄스(ByteDance), 전체 비디오 파이프라인을 오픈소스로 공개 | ComfyUI Wiki