ComfyUI 커스텀 노드로 Bernini v2 워크플로 다운로드 및 사용 가이드
rzgar 가 ByteDance 의 Bernini-Diffusers-v2 의미 계획기 및 Wan2.2 렌더러를 ComfyUI 커스텀 노드로 패키징했으며, FP8 및 NVFP4 웨이트와 6 가지 작업용 단일 워크플로를 제공합니다.
개요
전체 Bernini v2 파이프라인은 이전에는 ByteDance 의 공식 diffusers 코드를 통해서만 실행 가능했습니다. ComfyUI 팩은 이를 노드 기반 워크플로로 변환합니다: 커넥터와 MaskGIT 스타일 ViT 디코더가 있는 미세 조정된 Qwen2.5-VL 계획기는 텍스트와 소스 비주얼을 의미 계획 토큰으로 변환한 후, 두 개의 공동 훈련된 Wan2.2 DiT(고노이즈 및 저노이즈, 0.875 에서 전환) 는 컨텍스트 latent 와 함께 소스 미디어를 렌더링합니다.
Bernini v2 계획 및 렌더링 파이프라인이 ComfyUI 커스텀 노드로 실행 중입니다. 출처: rzgar/Bernini-v2-ComfyUI
6 가지 작업, 단일 워크플로
작업 선택은 연결된 미디어 입력에 따라 자동으로 결정됩니다:
| Connected inputs | Task |
|---|---|
| None | 텍스트 기반 비디오 생성 (t2v) |
| Reference images only | 레퍼런스 기반 비디오 생성 (r2v) |
| Source video | 비디오 기반 비디오 생성 편집 (v2v) |
| Source video + reference images | 레퍼런스 가이드 편집 (rv2v) |
| Source video + reference video | 미적 방향 전달 (ads2v) |
권장 설정: CFG 3, 16~50 스텝, UniPC / DPMPP_2M / EULER 샘플러.
모델 파일
팩에는 양 DiT 의 FP8 스케일링 및 NVFP4 양자화가 포함되며, models/text_encoders/ 아래에 배치되는 계획기 에셋 (MLLM, 커넥터, ViT 디코더, 마스크 토큰) 도 포함됩니다. 계획기 tokenizer 및 프로세서 구성은 저장소의 별도 zip 으로 제공됩니다. 모든 구성 요소는 모델 페이지 에 나열되어 있습니다.
배경: Bernini v2
ByteDance 는 2026 년 6 월 전체 Bernini 프레임워크를 오픈소스로 공개하고 8 월 13 일 Bernini-Diffusers-v2 로 패키징했습니다. v2 학습 레시피는 공동 훈련 전에 수천 단계 동안 커넥터를 워밍업하여 첫 번째 diffusers 릴리스보다 레퍼런스 가이드 편집 및 OpenS2V 점수 (63.83) 를 개선했습니다. ByteDance 의 내부 블라인드 아레나에서 Bernini 는 폐쇄형 상업용 모델 중 비디오 편집 최상위 등급에 랭크됩니다.
Bernini 프레임워크: MLLM 의미 계획기가 지시문을 분해하고, Wan2.2 DiT 렌더러가 비디오를 생성합니다. 출처: Bernini 프로젝트 페이지
댓글
GitHub로 로그인하고 토론에 참여하세요.