Bernini: ByteDance의 시맨틱 플래닝 비디오 생성 프레임워크
ComfyUI Wiki
Bernini는 ByteDance의 오픈 비디오 생성 및 편집 프레임워크입니다. 언어 모델 기반 시맨틱 플래너와 Wan2.2 기반 비디오 렌더러로 구성되며 Apache-2.0으로 공개되었습니다.
B
Bernini by ByteDance
Video GenerationVideo EditingDiTByteDanceBernini는 ByteDance의 오픈 비디오 생성 및 편집 프레임워크입니다. 멀티모달 언어 모델이 샷 계획을 작성하는 시맨틱 플래너 역할을 하고, diffusion transformer 렌더러가 그 계획을 비디오로 변환합니다. 동일한 파이프라인이 텍스트 기반 비디오 생성, 레퍼런스 기반 비디오 생성, 비디오 편집, 미적 스타일 전이를 모두 처리하며, ComfyUI용 diffusers 형식으로 제공됩니다.
| 개발사 | ByteDance |
| 아키텍처 | 시맨틱 플래너(멀티모달 LLM) + Wan2.1/2.2 백본 기반 DiT 비디오 렌더러 |
| 라이선스 | Apache-2.0 |
| 생성 모드 | 텍스트 기반 비디오 생성, 레퍼런스 기반 비디오 생성, 비디오 편집, 미적 스타일 전이 |
| 정밀도 | fp16, fp8, int8, MXFP8, NVFP4 (릴리스 및 ComfyUI 팩에 따라 다름) |
변형
| 변형 | 설명 | 라이선스 | 출시 |
|---|---|---|---|
| Bernini-R | DiT 비디오 렌더러 구성 요소: MLLM 시맨틱 플래너와 생성 및 편집을 위한 Wan2.1/2.2 렌더러 | Apache-2.0 | 2026-06 |
| Bernini v2 | diffusers 형식의 완전한 시맨틱 플래닝 파이프라인: Qwen2.5-VL 플래너, Wan2.2 듀얼 DiT 렌더러, 더 강력해진 레퍼런스 기반 편집 | Apache-2.0 | 2026-08 |
위에서 변형을 선택하면 엄선된 가중치 다운로드, 튜토리얼, 관련 정보를 확인할 수 있습니다.
Bernini의 기능
- 시맨틱 플래닝: 멀티모달 언어 모델이 렌더링 전에 프롬프트와 참조 이미지를 명시적인 샷 계획으로 변환하므로, 다중 피사체 장면과 편집이 의도한 대상에 정확히 맞춰집니다.
- 하나의 파이프라인, 다양한 작업: 텍스트 기반 비디오 생성, 레퍼런스 기반 비디오 생성, 비디오 기반 비디오 생성 편집, 레퍼런스 기반 편집, 미적 스타일 전이가 모두 동일한 플래너와 렌더러를 통해 실행됩니다.
- diffusers 우선 릴리스: ByteDance가 파이프라인을 diffusers 형식으로 배포하므로 표준 도구로 로드할 수 있으며, 커뮤니티에서 ComfyUI용으로 재패키징합니다.
ComfyUI 지원
Bernini는 자체 노드 팩이 아니라 커뮤니티 재패키징을 통해 ComfyUI에서 사용할 수 있습니다. Bernini-v2-ComfyUI 팩은 FP8 및 NVFP4 가중치와 지원되는 6가지 작업을 모두 포괄하는 단일 워크플로를 제공합니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.