Bernini-Diffusers-v2 : ByteDance publie le pipeline vidéo complet

ComfyUI Wikinews

ByteDance publie Bernini-Diffusers-v2 : le pipeline de génération et d'édition vidéo à planification sémantique au format diffusers, avec édition guidée par référence et OpenS2V.

Bernini-Diffusers-v2 (HuggingFace | GitHub | Page du projet) est la nouvelle publication de ByteDance : le pipeline complet de génération et d'édition vidéo Bernini, empaqueté sous la forme d'un répertoire autonome au format diffusers qui regroupe le planificateur sémantique MLLM, les poids de planification Bernini et les composants de diffusion Wan2.2 dans un seul checkpoint.

Vue d'ensemble

Bernini est le framework unifié de ByteDance pour la génération et l'édition vidéo, combinant un planificateur sémantique basé sur MLLM avec un moteur de rendu basé sur DiT. Au lieu de générer directement les images, il décompose d'abord les instructions complexes en plans sémantiques explicites, puis restitue le résultat à l'aide d'un décodeur de diffusion basé sur Wan2.2. Cette « planification sémantique latente » lui confère un excellent suivi des instructions pour les demandes complexes de génération et d'édition.

Bernini-Diffusers-v2 empaquette l'intégralité du pipeline dans un répertoire diffusers autonome : un planificateur Qwen2.5-VL, les poids de planification Bernini et les composants de diffusion Wan2.2 (encodeur de texte, VAE, scheduler, double configuration du transformer). Par rapport aux versions Bernini-R limitées au moteur de rendu, il est recommandé lorsque vous avez besoin d'une planification sémantique en plusieurs étapes et d'une meilleure gestion des demandes complexes. Par rapport à la première version de Bernini-Diffusers (juin 2026), la v2 utilise une recette d'entraînement qui préchauffe le connecteur pendant des milliers d'étapes avant le co-entraînement, améliorant ainsi les performances de l'édition vidéo guidée par référence et d'OpenS2V.

Framework Bernini : planificateur sémantique MLLM + moteur de rendu DiT Wan2.2

Le framework Bernini : un planificateur sémantique basé sur MLLM décompose les instructions en plans, que le moteur de rendu DiT Wan2.2 transforme en vidéo. Source : page du projet Bernini

Tâches prises en charge

Bernini-Diffusers-v2 couvre six tâches grâce à des lanceurs prêts à l'emploi dans le référentiel Bernini :

TâcheDescription
t2i / i2iTexte vers image et image vers image
t2vTexte vers vidéo
v2vÉdition vidéo vers vidéo
rv2vÉdition vidéo guidée par référence (référence + vidéo source)
r2vRéférence vers vidéo (OpenS2V, image unique ou référence vers vidéo)

Benchmark

ModèleEditVerseOpenVEOpenS2VVBenchBernini-v2v (OS)Bernini-rv2v (OS)
Bernini-v2 7+14B8.023.9663.8384.463.493.55

En matière d'édition vidéo, Bernini atteint le premier rang parmi les principaux modèles commerciaux à code source fermé lors de l'évaluation interne en arène de ByteDance, basée sur des comparaisons par paires en aveugle réalisées par des humains.

Structure du package

Cette publication est un répertoire autonome au format diffusers. Transmettez le répertoire téléchargé directement à --config :

Bernini-Diffusers-v2/
  bernini/          # Bernini planning checkpoint
  mllm/             # Qwen2.5-VL planner assets
  scheduler/        # base diffusion modules
  t5_text_encoder/
  t5_tokenizer/
  vae/
  config.json
  transformer_config.json
  transformer_2_config.json   # Wan2.2 diffusion decoder components

Prise en charge de ComfyUI

Le moteur de rendu Bernini-R bénéficie d'un support officiel de ComfyUI de la part de Comfy-Org, avec un tutoriel dédié sur docs.comfy.org couvrant les flux de travail de texte vers vidéo, d'image vers vidéo et d'édition vidéo. Le répertoire au format diffusers de cette publication peut également être chargé avec le nœud Charger Modèle Diffusion standard de ComfyUI.

Pour le pipeline complet de planification sémantique (planificateur + moteur de rendu), le référentiel Bernini officiel fournit du code d'inférence Python, notamment des démos Gradio mono-GPU et multi-GPU (torchrun --ulysses 8) ainsi que des scripts d'exécution par tâche dans scripts/bernini_v2/ (run_t2i.sh, run_i2i.sh, run_t2v.sh, run_v2v.sh, run_rv2v.sh, run_r2v.sh).

Disponibilité

Téléchargez le modèle avec la CLI hf :

pip install -U "huggingface_hub"
hf download ByteDance/Bernini-Diffusers-v2 --local-dir pretrained_models/Bernini-Diffusers-v2

Exécutez ensuite l'inférence en transmettant le répertoire en tant que --config :

git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
python infer_single_gpu.py --config pretrained_models/Bernini-Diffusers-v2 \
    --case assets/testcases/i2i/i2i.json --num_frames 1

L'article est disponible sur arXiv:2605.22344.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…