Bernini v2 Disponible sur ComfyUI avec des Nœuds Personnalisés
rzgar intègre le planificateur sémantique Bernini-Diffusers-v2 de ByteDance et le rendu Wan2.2 dans des nœuds ComfyUI, avec des poids FP8 et NVFP4.
Aperçu
Le pipeline complet Bernini v2 était précédemment exécutable uniquement via le code diffusers officiel de ByteDance. Le pack ComfyUI le convertit en un flux de travail basé sur des nœuds : un planificateur Qwen2.5-VL affiné avec un connecteur et un décodeur ViT style MaskGIT transforment le texte et les visuels sources en jetons de plan sémantique, puis deux DiTs Wan2.2 co-entraînés (bruit élevé et bruit faible, basculés à 0.875) rendent la vidéo avec les médias sources injectés comme latents contextuels.
Le pipeline de planification et de rendu Bernini v2 fonctionnant comme des nœuds personnalisés ComfyUI. Source : rzgar/Bernini-v2-ComfyUI
Six Tâches, Un Flux de Travail
La sélection de tâche est automatique selon les entrées multimédias connectées :
| Entrées connectées | Tâche |
|---|---|
| Aucune | Texte-vers-Vidéo (t2v) |
| Images de référence uniquement | Référence-vers-Vidéo (r2v) |
| Vidéo source | Édition de Vidéo-vers-Vidéo (v2v) |
| Vidéo source + images de référence | Édition guidée par référence (rv2v) |
| Vidéo source + vidéo de référence | Transfert de direction esthétique (ads2v) |
Paramètres RECOMMANDÉS : CFG 3, 16 à 50 étapes, échantillonneurs UniPC / DPMPP_2M / EULER.
Fichiers de Modèles
Le pack inclut les quantifications FP8-scaled et NVFP4 des deux DiTs, ainsi que les ressources du planificateur (MLLM, connecteur, décodeur ViT, jetons de masque) qui se placent sous models/text_encoders/. Les configurations de tokenizer et de processeur du planificateur sont fournies sous forme d'un zip séparé dans le dépôt. Tous les composants sont répertoriés sur la page du modèle.
Arrière-plan : Bernini v2
ByteDance a ouvert le cadre complet Bernini en juin 2026 et l'a emballé sous forme de Bernini-Diffusers-v2 le 13 août. La recette d'entraînement v2 met en chauffe le connecteur pendant des milliers d'étapes avant l'entraînement conjoint, ce qui a amélioré l'édition guidée par référence et les scores OpenS2V (63,83) par rapport à la première version diffusers. Dans l'arène interne aveugle de ByteDance, Bernini se classe dans le premier niveau de l'édition vidéo parmi les modèles commerciaux à source fermée.
Le cadre Bernini : le planificateur sémantique MLLM décompose les instructions, le moteur de rendu Wan2.2 DiT produit la vidéo. Source : Page du projet Bernini
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.