Bernini-Diffusers-v2 : ByteDance publie le pipeline vidéo complet
ByteDance publie Bernini-Diffusers-v2 : le pipeline de génération et d'édition vidéo à planification sémantique au format diffusers, avec édition guidée par référence et OpenS2V.
Vue d'ensemble
Bernini est le framework unifié de ByteDance pour la génération et l'édition vidéo, combinant un planificateur sémantique basé sur MLLM avec un moteur de rendu basé sur DiT. Au lieu de générer directement les images, il décompose d'abord les instructions complexes en plans sémantiques explicites, puis restitue le résultat à l'aide d'un décodeur de diffusion basé sur Wan2.2. Cette « planification sémantique latente » lui confère un excellent suivi des instructions pour les demandes complexes de génération et d'édition.
Bernini-Diffusers-v2 empaquette l'intégralité du pipeline dans un répertoire diffusers autonome : un planificateur Qwen2.5-VL, les poids de planification Bernini et les composants de diffusion Wan2.2 (encodeur de texte, VAE, scheduler, double configuration du transformer). Par rapport aux versions Bernini-R limitées au moteur de rendu, il est recommandé lorsque vous avez besoin d'une planification sémantique en plusieurs étapes et d'une meilleure gestion des demandes complexes. Par rapport à la première version de Bernini-Diffusers (juin 2026), la v2 utilise une recette d'entraînement qui préchauffe le connecteur pendant des milliers d'étapes avant le co-entraînement, améliorant ainsi les performances de l'édition vidéo guidée par référence et d'OpenS2V.
Le framework Bernini : un planificateur sémantique basé sur MLLM décompose les instructions en plans, que le moteur de rendu DiT Wan2.2 transforme en vidéo. Source : page du projet Bernini
Tâches prises en charge
Bernini-Diffusers-v2 couvre six tâches grâce à des lanceurs prêts à l'emploi dans le référentiel Bernini :
| Tâche | Description |
|---|---|
t2i / i2i | Texte vers image et image vers image |
t2v | Texte vers vidéo |
v2v | Édition vidéo vers vidéo |
rv2v | Édition vidéo guidée par référence (référence + vidéo source) |
r2v | Référence vers vidéo (OpenS2V, image unique ou référence vers vidéo) |
Benchmark
| Modèle | EditVerse | OpenVE | OpenS2V | VBench | Bernini-v2v (OS) | Bernini-rv2v (OS) |
|---|---|---|---|---|---|---|
| Bernini-v2 7+14B | 8.02 | 3.96 | 63.83 | 84.46 | 3.49 | 3.55 |
En matière d'édition vidéo, Bernini atteint le premier rang parmi les principaux modèles commerciaux à code source fermé lors de l'évaluation interne en arène de ByteDance, basée sur des comparaisons par paires en aveugle réalisées par des humains.
Structure du package
Cette publication est un répertoire autonome au format diffusers. Transmettez le répertoire téléchargé directement à --config :
Bernini-Diffusers-v2/
bernini/ # Bernini planning checkpoint
mllm/ # Qwen2.5-VL planner assets
scheduler/ # base diffusion modules
t5_text_encoder/
t5_tokenizer/
vae/
config.json
transformer_config.json
transformer_2_config.json # Wan2.2 diffusion decoder componentsPrise en charge de ComfyUI
Le moteur de rendu Bernini-R bénéficie d'un support officiel de ComfyUI de la part de Comfy-Org, avec un tutoriel dédié sur docs.comfy.org couvrant les flux de travail de texte vers vidéo, d'image vers vidéo et d'édition vidéo. Le répertoire au format diffusers de cette publication peut également être chargé avec le nœud Charger Modèle Diffusion standard de ComfyUI.
Pour le pipeline complet de planification sémantique (planificateur + moteur de rendu), le référentiel Bernini officiel fournit du code d'inférence Python, notamment des démos Gradio mono-GPU et multi-GPU (torchrun --ulysses 8) ainsi que des scripts d'exécution par tâche dans scripts/bernini_v2/ (run_t2i.sh, run_i2i.sh, run_t2v.sh, run_v2v.sh, run_rv2v.sh, run_r2v.sh).
Disponibilité
Téléchargez le modèle avec la CLI hf :
pip install -U "huggingface_hub"
hf download ByteDance/Bernini-Diffusers-v2 --local-dir pretrained_models/Bernini-Diffusers-v2Exécutez ensuite l'inférence en transmettant le répertoire en tant que --config :
git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
pip install -r requirements.txt
python infer_single_gpu.py --config pretrained_models/Bernini-Diffusers-v2 \
--case assets/testcases/i2i/i2i.json --num_frames 1L'article est disponible sur arXiv:2605.22344.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.