Bernini v2 llega a ComfyUI mediante Nodos Personalizados
rzgar empaqueta el planificador semántico Bernini-Diffusers-v2 de ByteDance y el renderizador Wan2.2 como nodos de ComfyUI, con pesos FP8 y NVFP4.
Descripción General
El pipeline completo Bernini v2 anteriormente solo era ejecutable a través del código oficial diffusers de ByteDance. El paquete de ComfyUI lo convierte en un Flujo de trabajo basado en nodos: un planificador Qwen2.5-VL afinado con un conector y un decodificador ViT estilo MaskGIT convierten el texto más los visuales de fuente en tokens de plan semántico, luego dos DiTs Wan2.2 co-entrenados (alto-ruido y bajo-ruido, cambiados en 0.875) generan el vídeo con medios de fuente inyectados como latentes de contexto.
El pipeline de planificación y renderizado Bernini v2 ejecutándose como Nodos personalizados de ComfyUI. Fuente: rzgar/Bernini-v2-ComfyUI
Seis Tareas, Un Flujo de trabajo
La selección de Tareas es automática según qué entradas multimedia estén conectadas:
| Entradas conectadas | Tarea |
|---|---|
| Ninguna | Texto-a-vídeo (t2v) |
| Solo Imágenes de referencia | Referencia-a-vídeo (r2v) |
| Vídeo de fuente | Edición de vídeo-a-vídeo (v2v) |
| Vídeo de fuente + Imágenes de referencia | Edición guiada por referencia (rv2v) |
| Vídeo de fuente + Vídeo de referencia | Transferencia de dirección estética (ads2v) |
Configuraciones RECOMENDADAS: CFG 3, 16 a 50 pasos, muestreadores UniPC / DPMPP_2M / EULER.
Archivos de Modelo
El paquete incluye cuantizaciones escaladas FP8 y NVFP4 de ambos DiTs, además de los recursos del planificador (MLLM, conector, decodificador ViT, tokens de máscara) que van debajo de models/text_encoders/. Las configuraciones de tokenizador y procesador del planificador se proporcionan como un zip separado en el repositorio. Todos los componentes se listan en la página del modelo.
Fondo: Bernini v2
ByteDance abrió como código fuente el marco Bernini completo en junio de 2026 y lo empaquetó como Bernini-Diffusers-v2 el 13 de agosto. La receta de entrenamiento v2 calienta el conector durante miles de pasos antes del co-entrenamiento, lo que mejoró la edición guiada por referencia y las puntuaciones OpenS2V (63.83) respecto al primer lanzamiento de diffusers. En la arena ciega interna de ByteDance, Bernini ocupa el primer nivel de edición de vídeo entre modelos comerciales de código cerrado.
El marco Bernini: el planificador semántico MLLM descompone las instrucciones, el renderizador Wan2.2 DiT produce el vídeo. Fuente: página del proyecto Bernini
Comentarios
Inicia sesión con GitHub para unirte a la conversación.