Bernini v2 llega a ComfyUI mediante Nodos Personalizados

ComfyUI Wikinews

rzgar empaqueta el planificador semántico Bernini-Diffusers-v2 de ByteDance y el renderizador Wan2.2 como nodos de ComfyUI, con pesos FP8 y NVFP4.

El desarrollador de la Comunidad rzgar ha empaquetado el pipeline completo Bernini-Diffusers-v2 de ByteDance en un Paquete de Nodos personalizado de ComfyUI: rzgar/Bernini-v2-ComfyUI. El lanzamiento agrupa el planificador semántico, el renderizador dual DiT Wan2.2 y un único Flujo de trabajo que infiere la Tarea según las Entradas conectadas. Fuente: README del repositorio HF, Banodoco #ltx_chatter.

Descripción General

El pipeline completo Bernini v2 anteriormente solo era ejecutable a través del código oficial diffusers de ByteDance. El paquete de ComfyUI lo convierte en un Flujo de trabajo basado en nodos: un planificador Qwen2.5-VL afinado con un conector y un decodificador ViT estilo MaskGIT convierten el texto más los visuales de fuente en tokens de plan semántico, luego dos DiTs Wan2.2 co-entrenados (alto-ruido y bajo-ruido, cambiados en 0.875) generan el vídeo con medios de fuente inyectados como latentes de contexto.

Flujo de trabajo de Nodos Personalizados de Bernini v2 en ComfyUI

El pipeline de planificación y renderizado Bernini v2 ejecutándose como Nodos personalizados de ComfyUI. Fuente: rzgar/Bernini-v2-ComfyUI

Seis Tareas, Un Flujo de trabajo

La selección de Tareas es automática según qué entradas multimedia estén conectadas:

Entradas conectadasTarea
NingunaTexto-a-vídeo (t2v)
Solo Imágenes de referenciaReferencia-a-vídeo (r2v)
Vídeo de fuenteEdición de vídeo-a-vídeo (v2v)
Vídeo de fuente + Imágenes de referenciaEdición guiada por referencia (rv2v)
Vídeo de fuente + Vídeo de referenciaTransferencia de dirección estética (ads2v)

Configuraciones RECOMENDADAS: CFG 3, 16 a 50 pasos, muestreadores UniPC / DPMPP_2M / EULER.

Archivos de Modelo

El paquete incluye cuantizaciones escaladas FP8 y NVFP4 de ambos DiTs, además de los recursos del planificador (MLLM, conector, decodificador ViT, tokens de máscara) que van debajo de models/text_encoders/. Las configuraciones de tokenizador y procesador del planificador se proporcionan como un zip separado en el repositorio. Todos los componentes se listan en la página del modelo.

Fondo: Bernini v2

ByteDance abrió como código fuente el marco Bernini completo en junio de 2026 y lo empaquetó como Bernini-Diffusers-v2 el 13 de agosto. La receta de entrenamiento v2 calienta el conector durante miles de pasos antes del co-entrenamiento, lo que mejoró la edición guiada por referencia y las puntuaciones OpenS2V (63.83) respecto al primer lanzamiento de diffusers. En la arena ciega interna de ByteDance, Bernini ocupa el primer nivel de edición de vídeo entre modelos comerciales de código cerrado.

Diagrama del marco Bernini

El marco Bernini: el planificador semántico MLLM descompone las instrucciones, el renderizador Wan2.2 DiT produce el vídeo. Fuente: página del proyecto Bernini

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Bernini v2 llega a ComfyUI mediante Nodos Personalizados | ComfyUI Wiki