Bernini-Diffusers-v2: ByteDance libera el pipeline de vídeo completo

ComfyUI Wikinews

ByteDance lanza Bernini-Diffusers-v2: el pipeline de generación y edición de vídeo con planificación semántica en formato diffusers, con edición por referencia robusta y OpenS2V.

Bernini-Diffusers-v2 (HuggingFace | GitHub | Página del Proyecto) es el nuevo lanzamiento de ByteDance: el pipeline completo de generación y edición de vídeo de Bernini, empaquetado como un directorio autocontenido en formato diffusers que incluye el planificador semántico MLLM, los pesos de planificación de Bernini y los componentes de diffusion de Wan2.2 en un solo checkpoint.

Resumen

Bernini es el framework unificado de ByteDance para la generación y edición de vídeo que combina un planificador semántico basado en MLLM con un renderizador basado en DiT. En lugar de generar fotogramas directamente, primero descompone las instrucciones complejas en planes semánticos explícitos y después renderiza el resultado con un decodificador de diffusion basado en Wan2.2. Esta "planificación semántica latente" le confiere una gran capacidad de seguir instrucciones para solicitudes complejas de generación y edición.

Bernini-Diffusers-v2 empaqueta el pipeline completo en un único directorio autocontenido en formato diffusers: un planificador Qwen2.5-VL, los pesos de planificación de Bernini y los componentes de diffusion de Wan2.2 (codificador de texto, VAE, scheduler, configuraciones duales de transformer). En comparación con las versiones Bernini-R solo con renderizador, se recomienda cuando necesitas planificación semántica en varios pasos y un mejor manejo de solicitudes complejas. En comparación con el primer lanzamiento de Bernini-Diffusers (junio de 2026), la v2 utiliza una receta de entrenamiento que precalienta el conector durante miles de pasos antes del co-entrenamiento, lo que mejora la edición de vídeo guiada por referencia y el rendimiento de OpenS2V.

Framework Bernini: planificador semántico MLLM + renderizador DiT Wan2.2

El framework Bernini: un planificador semántico basado en MLLM descompone las instrucciones en planes que el renderizador DiT Wan2.2 convierte en vídeo. Fuente: página del proyecto Bernini

Tareas Soportadas

Bernini-Diffusers-v2 cubre seis tareas mediante lanzadores listos para usar en el repositorio de Bernini:

TareaDescripción
t2i / i2iTexto a imagen e imagen a imagen
t2vTexto a vídeo
v2vEdición de vídeo a vídeo
rv2vEdición de vídeo guiada por referencia (referencia + vídeo de origen)
r2vReferencia a vídeo (OpenS2V, imagen única o referencia a vídeo)

Benchmark

ModeloEditVerseOpenVEOpenS2VVBenchBernini-v2v (OS)Bernini-rv2v (OS)
Bernini-v2 7+14B8.023.9663.8384.463.493.55

En edición de vídeo, Bernini alcanza el primer nivel entre los principales modelos comerciales de código cerrado en la evaluación de arena interna de ByteDance, basada en comparaciones ciegas por pares realizadas por humanos.

Estructura del Paquete

La versión es un directorio autocontenido en formato diffusers. Pasa el directorio descargado directamente a --config:

Bernini-Diffusers-v2/
  bernini/          # Bernini planning checkpoint
  mllm/             # Qwen2.5-VL planner assets
  scheduler/        # base diffusion modules
  t5_text_encoder/
  t5_tokenizer/
  vae/
  config.json
  transformer_config.json
  transformer_2_config.json   # Wan2.2 diffusion decoder components

Soporte de ComfyUI

El renderizador Bernini-R cuenta con soporte oficial de ComfyUI de Comfy-Org, con un tutorial dedicado en docs.comfy.org que cubre flujos de trabajo de texto a vídeo, imagen a vídeo y edición de vídeo. El directorio en formato diffusers de esta versión también se puede cargar con el nodo Cargar Modelo de Difusión estándar de ComfyUI.

Para el pipeline completo de planificación semántica (planificador + renderizador), el repositorio oficial de Bernini proporciona código de inferencia en Python, incluyendo demos de Gradio para una GPU y para múltiples GPUs (torchrun --ulysses 8) y scripts de ejecución por tarea en scripts/bernini_v2/ (run_t2i.sh, run_i2i.sh, run_t2v.sh, run_v2v.sh, run_rv2v.sh, run_r2v.sh).

Disponibilidad

Descarga el modelo con la CLI hf:

pip install -U "huggingface_hub"
hf download ByteDance/Bernini-Diffusers-v2 --local-dir pretrained_models/Bernini-Diffusers-v2

Luego ejecuta la inferencia pasando el directorio como --config:

git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
python infer_single_gpu.py --config pretrained_models/Bernini-Diffusers-v2 \
    --case assets/testcases/i2i/i2i.json --num_frames 1

El artículo está disponible en arXiv:2605.22344.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Bernini-Diffusers-v2: ByteDance libera el pipeline de vídeo completo | ComfyUI Wiki