Bernini v2 Disponible sur ComfyUI avec des Nœuds Personnalisés

ComfyUI Wikinews

rzgar intègre le planificateur sémantique Bernini-Diffusers-v2 de ByteDance et le rendu Wan2.2 dans des nœuds ComfyUI, avec des poids FP8 et NVFP4.

Le développeur de la Communauté rzgar a emballé le pipeline complet Bernini-Diffusers-v2 de ByteDance dans un Pack de Nœuds ComfyUI personnalisé : rzgar/Bernini-v2-ComfyUI. La version regroupe le planificateur sémantique, le moteur de rendu Wan2.2 Dual DiT, et un seul flux de travail qui déduit la tâche en fonction des entrées connectées. Source : README du dépôt HF, Banodoco #ltx_chatter.

Aperçu

Le pipeline complet Bernini v2 était précédemment exécutable uniquement via le code diffusers officiel de ByteDance. Le pack ComfyUI le convertit en un flux de travail basé sur des nœuds : un planificateur Qwen2.5-VL affiné avec un connecteur et un décodeur ViT style MaskGIT transforment le texte et les visuels sources en jetons de plan sémantique, puis deux DiTs Wan2.2 co-entraînés (bruit élevé et bruit faible, basculés à 0.875) rendent la vidéo avec les médias sources injectés comme latents contextuels.

Flux de travail de nœud personnalisé Bernini v2 dans ComfyUI

Le pipeline de planification et de rendu Bernini v2 fonctionnant comme des nœuds personnalisés ComfyUI. Source : rzgar/Bernini-v2-ComfyUI

Six Tâches, Un Flux de Travail

La sélection de tâche est automatique selon les entrées multimédias connectées :

Entrées connectéesTâche
AucuneTexte-vers-Vidéo (t2v)
Images de référence uniquementRéférence-vers-Vidéo (r2v)
Vidéo sourceÉdition de Vidéo-vers-Vidéo (v2v)
Vidéo source + images de référenceÉdition guidée par référence (rv2v)
Vidéo source + vidéo de référenceTransfert de direction esthétique (ads2v)

Paramètres RECOMMANDÉS : CFG 3, 16 à 50 étapes, échantillonneurs UniPC / DPMPP_2M / EULER.

Fichiers de Modèles

Le pack inclut les quantifications FP8-scaled et NVFP4 des deux DiTs, ainsi que les ressources du planificateur (MLLM, connecteur, décodeur ViT, jetons de masque) qui se placent sous models/text_encoders/. Les configurations de tokenizer et de processeur du planificateur sont fournies sous forme d'un zip séparé dans le dépôt. Tous les composants sont répertoriés sur la page du modèle.

Arrière-plan : Bernini v2

ByteDance a ouvert le cadre complet Bernini en juin 2026 et l'a emballé sous forme de Bernini-Diffusers-v2 le 13 août. La recette d'entraînement v2 met en chauffe le connecteur pendant des milliers d'étapes avant l'entraînement conjoint, ce qui a amélioré l'édition guidée par référence et les scores OpenS2V (63,83) par rapport à la première version diffusers. Dans l'arène interne aveugle de ByteDance, Bernini se classe dans le premier niveau de l'édition vidéo parmi les modèles commerciaux à source fermée.

Diagramme du cadre Bernini

Le cadre Bernini : le planificateur sémantique MLLM décompose les instructions, le moteur de rendu Wan2.2 DiT produit la vidéo. Source : Page du projet Bernini

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Bernini v2 Disponible sur ComfyUI avec des Nœuds Personnalisés | ComfyUI Wiki