Bernini-Diffusers-v2: ByteDance libera el pipeline de vídeo completo
ByteDance lanza Bernini-Diffusers-v2: el pipeline de generación y edición de vídeo con planificación semántica en formato diffusers, con edición por referencia robusta y OpenS2V.
Resumen
Bernini es el framework unificado de ByteDance para la generación y edición de vídeo que combina un planificador semántico basado en MLLM con un renderizador basado en DiT. En lugar de generar fotogramas directamente, primero descompone las instrucciones complejas en planes semánticos explícitos y después renderiza el resultado con un decodificador de diffusion basado en Wan2.2. Esta "planificación semántica latente" le confiere una gran capacidad de seguir instrucciones para solicitudes complejas de generación y edición.
Bernini-Diffusers-v2 empaqueta el pipeline completo en un único directorio autocontenido en formato diffusers: un planificador Qwen2.5-VL, los pesos de planificación de Bernini y los componentes de diffusion de Wan2.2 (codificador de texto, VAE, scheduler, configuraciones duales de transformer). En comparación con las versiones Bernini-R solo con renderizador, se recomienda cuando necesitas planificación semántica en varios pasos y un mejor manejo de solicitudes complejas. En comparación con el primer lanzamiento de Bernini-Diffusers (junio de 2026), la v2 utiliza una receta de entrenamiento que precalienta el conector durante miles de pasos antes del co-entrenamiento, lo que mejora la edición de vídeo guiada por referencia y el rendimiento de OpenS2V.
El framework Bernini: un planificador semántico basado en MLLM descompone las instrucciones en planes que el renderizador DiT Wan2.2 convierte en vídeo. Fuente: página del proyecto Bernini
Tareas Soportadas
Bernini-Diffusers-v2 cubre seis tareas mediante lanzadores listos para usar en el repositorio de Bernini:
| Tarea | Descripción |
|---|---|
t2i / i2i | Texto a imagen e imagen a imagen |
t2v | Texto a vídeo |
v2v | Edición de vídeo a vídeo |
rv2v | Edición de vídeo guiada por referencia (referencia + vídeo de origen) |
r2v | Referencia a vídeo (OpenS2V, imagen única o referencia a vídeo) |
Benchmark
| Modelo | EditVerse | OpenVE | OpenS2V | VBench | Bernini-v2v (OS) | Bernini-rv2v (OS) |
|---|---|---|---|---|---|---|
| Bernini-v2 7+14B | 8.02 | 3.96 | 63.83 | 84.46 | 3.49 | 3.55 |
En edición de vídeo, Bernini alcanza el primer nivel entre los principales modelos comerciales de código cerrado en la evaluación de arena interna de ByteDance, basada en comparaciones ciegas por pares realizadas por humanos.
Estructura del Paquete
La versión es un directorio autocontenido en formato diffusers. Pasa el directorio descargado directamente a --config:
Bernini-Diffusers-v2/
bernini/ # Bernini planning checkpoint
mllm/ # Qwen2.5-VL planner assets
scheduler/ # base diffusion modules
t5_text_encoder/
t5_tokenizer/
vae/
config.json
transformer_config.json
transformer_2_config.json # Wan2.2 diffusion decoder componentsSoporte de ComfyUI
El renderizador Bernini-R cuenta con soporte oficial de ComfyUI de Comfy-Org, con un tutorial dedicado en docs.comfy.org que cubre flujos de trabajo de texto a vídeo, imagen a vídeo y edición de vídeo. El directorio en formato diffusers de esta versión también se puede cargar con el nodo Cargar Modelo de Difusión estándar de ComfyUI.
Para el pipeline completo de planificación semántica (planificador + renderizador), el repositorio oficial de Bernini proporciona código de inferencia en Python, incluyendo demos de Gradio para una GPU y para múltiples GPUs (torchrun --ulysses 8) y scripts de ejecución por tarea en scripts/bernini_v2/ (run_t2i.sh, run_i2i.sh, run_t2v.sh, run_v2v.sh, run_rv2v.sh, run_r2v.sh).
Disponibilidad
Descarga el modelo con la CLI hf:
pip install -U "huggingface_hub"
hf download ByteDance/Bernini-Diffusers-v2 --local-dir pretrained_models/Bernini-Diffusers-v2Luego ejecuta la inferencia pasando el directorio como --config:
git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
python infer_single_gpu.py --config pretrained_models/Bernini-Diffusers-v2 \
--case assets/testcases/i2i/i2i.json --num_frames 1El artículo está disponible en arXiv:2605.22344.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.