Bernini-Diffusers-v2: 바이트댄스(ByteDance), 전체 비디오 파이프라인을 오픈소스로 공개
바이트댄스(ByteDance)가 Bernini-Diffusers-v2를 공개했습니다: diffusers 형식의 전체 의미 계획 기반 비디오 생성 및 편집 파이프라인으로, 더 강력해진 레퍼런스 기반 편집과 OpenS2V를 지원합니다.
개요
Bernini는 MLLM 기반 의미 플래너와 DiT 기반 렌더러를 결합한 바이트댄스(ByteDance)의 통합 비디오 생성 및 편집 프레임워크입니다. 프레임을 직접 생성하는 대신, 복잡한 지시를 먼저 명시적인 의미 계획(semantic plan)으로 분해한 다음, Wan2.2 기반 diffusion 디코더로 결과를 렌더링합니다. 이러한 '잠재 의미 계획(latent semantic planning)' 방식은 복잡한 생성 및 편집 요청에 대해 강력한 지시 수행 능력을 제공합니다.
Bernini-Diffusers-v2는 전체 파이프라인을 하나의 독립형 diffusers 디렉터리에 패키징합니다: Qwen2.5-VL 플래너, Bernini 플래닝 가중치, 그리고 Wan2.2 diffusion 구성 요소(텍스트 인코더, VAE, scheduler, 이중 transformer 설정)가 포함됩니다. 렌더러 전용 Bernini-R 릴리스와 비교할 때, 다단계 의미 계획이 필요하거나 복잡한 요청을 더 잘 처리해야 하는 경우에 권장됩니다. 첫 번째 Bernini-Diffusers 릴리스(2026년 6월)와 비교하여 v2는 공동 학습(co-training) 전에 커넥터를 수천 단계 동안 워밍업하는 학습 레시피를 사용하여 레퍼런스 기반 비디오 편집 및 OpenS2V 성능을 개선합니다.
Bernini 프레임워크: MLLM 기반 의미 플래너가 지시를 계획으로 분해하면 Wan2.2 DiT 렌더러가 이를 비디오로 변환합니다. 소스: Bernini 프로젝트 페이지
지원 작업
Bernini-Diffusers-v2는 Bernini 저장소의 즉시 실행 가능한 런처를 통해 여섯 가지 작업을 지원합니다:
| 작업 | 설명 |
|---|---|
t2i / i2i | 텍스트 기반 이미지 생성 및 이미지 기반 이미지 생성 |
t2v | 텍스트 기반 비디오 생성 |
v2v | 비디오 기반 비디오 편집 |
rv2v | 레퍼런스 기반 비디오 편집(레퍼런스 + 소스 비디오) |
r2v | 레퍼런스 기반 비디오 생성(OpenS2V, 단일 이미지 또는 레퍼런스에서 비디오로) |
벤치마크
| 모델 | EditVerse | OpenVE | OpenS2V | VBench | Bernini-v2v (OS) | Bernini-rv2v (OS) |
|---|---|---|---|---|---|---|
| Bernini-v2 7+14B | 8.02 | 3.96 | 63.83 | 84.46 | 3.49 | 3.55 |
비디오 편집 부문에서 Bernini는 블라인드 인간 쌍체 비교(blind human pairwise comparisons)를 기반으로 한 바이트댄스(ByteDance) 내부 아레나 평가에서 주요 비공개 상용 모델 중 최상위권에 도달했습니다.
패키지 구조
이 릴리스는 독립형 diffusers 형식 디렉터리입니다. 다운로드한 디렉터리를 --config에 직접 전달하세요:
Bernini-Diffusers-v2/
bernini/ # Bernini planning checkpoint
mllm/ # Qwen2.5-VL planner assets
scheduler/ # base diffusion modules
t5_text_encoder/
t5_tokenizer/
vae/
config.json
transformer_config.json
transformer_2_config.json # Wan2.2 diffusion decoder componentsComfyUI 지원
Bernini-R 렌더러는 Comfy-Org의 공식 ComfyUI 지원을 받으며, docs.comfy.org에 텍스트 기반 비디오 생성, 이미지 기반 비디오 생성, 비디오 편집 워크플로를 다루는 전용 튜토리얼이 있습니다. 또한 이 릴리스의 diffusers 형식 디렉터리는 ComfyUI의 표준 확산 모델 로드(Load Diffusion Model) 노드를 사용하여 로드할 수 있습니다.
전체 의미 계획 파이프라인(플래너 + 렌더러)의 경우, 공식 Bernini 저장소에서 Python 추론 코드를 제공합니다. 여기에는 단일 GPU 및 다중 GPU(torchrun --ulysses 8) Gradio 데모와 scripts/bernini_v2/ 아래의 작업별 실행 스크립트(run_t2i.sh, run_i2i.sh, run_t2v.sh, run_v2v.sh, run_rv2v.sh, run_r2v.sh)가 포함됩니다.
다운로드
hf CLI로 모델을 다운로드하세요:
pip install -U "huggingface_hub"
hf download ByteDance/Bernini-Diffusers-v2 --local-dir pretrained_models/Bernini-Diffusers-v2그런 다음 디렉터리를 --config로 전달하여 추론을 실행하세요:
git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
python infer_single_gpu.py --config pretrained_models/Bernini-Diffusers-v2 \
--case assets/testcases/i2i/i2i.json --num_frames 1논문은 arXiv:2605.22344에서 확인할 수 있습니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.