ID-V2V : Un modèle de vidéo préservant l'identité obtient le support ComfyUI via Kijai

ComfyUI Wikinews

Eyeline-Labs ID-V2V, un modèle de vidéo-à-vidéo préservant l'identité présenté à SIGGRAPH Asia 2026, dispose désormais d'un support ComfyUI grâce aux poids int8 convrot de Kijai et d'une PR principale.

ID-V2V est désormais accessible dans ComfyUI grâce à une PR principale de Kijai (Comfy-Org/ComfyUI #15139), ajoutant le support VACE + I2V et une entrée d'image de référence encadrée. Les poids int8 convrot sont disponibles sur Hugging Face.

Qu'est-ce que ID-V2V ?

ID-V2V (Génération de vidéo-à-vidéo préservant l'identité) est un modèle de recherche accepté à SIGGRAPH Asia 2026, développé par Eyeline-Labs en collaboration avec Netflix. Il restyle la scène, l'éclairage et le style d'une vidéo tout en préservant l'identité, les expressions, le regard et le mouvement des personnages d'origine : un flux de travail tourner d'abord, restyler plus tard.

Étant donné une vidéo source et une image clé stylisée (plus des images clés supplémentaires facultatives et une invite textuelle), ID-V2V génère une nouvelle vidéo dont l'arrière-plan et l'esthétique suivent l'image clé, tandis que l'identité et la performance des sujets restent intactes.

Détails clés :

Implication de Paul Debevec

Le projet inclut Paul Debevec : un chercheur pionnier en infographie qui détient un Oscar scientifique et technique, un Emmy pour l'ensemble de sa carrière et une bourse VES. Debevec a inventé l'imagerie HDR, l'éclairage basé sur l'image et le système de capture faciale Light Stage utilisé dans des films à succès de Spider-Man à Avatar.

Pour ID-V2V, l'expertise de Debevec en rééclairage est cruciale : garder l'identité d'un personnage intacte tout en l'éclairant correctement dans une scène entièrement régénérée est le défi le plus difficile du projet, et cela repose directement sur ses travaux antérieurs (Lux Post Facto à CVPR 2025, DifFRelight à SIGGRAPH Asia 2024).

Intégration ComfyUI

Le 29 juillet, Kijai a soumis la PR #15139 au référentiel principal de ComfyUI, ajoutant l'infrastructure nécessaire pour supporter ID-V2V. Les changements incluent :

  1. Support de base VACE + I2V — le modèle utilise Wan 2.1 I2V comme base avec des calques de contrôle VACE, une combinaison auparavant non supportée nativement dans ComfyUI
  2. Entrée d'image de référence encadrée — une nouvelle entrée pour le nœud I2V pour l'image clé stylisée que ID-V2V utilise comme cible de style
  3. Poids int8 convrot — disponibles sur Kijai/Wan_ID_V2V_comfy pour une inférence efficace en VRAM

Kijai a décrit l'intégration comme relativement simple (« seulement +17 lignes de code »), et la PR inclut un JSON de flux de travail prêt à l'emploi. Le membre de la communauté T2 a également construit indépendamment un nœud wrapper pour le modèle.

Points de contrôle

ID-V2V propose deux points de contrôle sur Hugging Face :

VarianteConditions de contrôleCas d'utilisation
idv2v.pth (par défaut)1 — pixels avant-plan sur fond gris (sujet segmenté par SAM3)Restylisation générale — préserve le sujet segmenté et régénère le reste
idv2v_with_normal_depth.pth3 — avant-plan + normales de surface (DAViD) + profondeur (DepthAnything-V2)Contrôle géométrique plus serré sur les régions régénérées

Démo

La page du projet présente plusieurs démos incluant le remplacement d'arrière-plan, la stylisation d'images clés non alignées et le rééclairage :

Démo de remplacement d'arrière-plan depuis la page du projet ID-V2V.

Remarque : ID-V2V est un artefact de recherche publié à des fins de démonstration et d'inspiration. Il nécessite une VRAM importante (~16 Go+) et convient mieux aux utilisateurs familiers avec l'exécution de modèles Wan 2.1 I2V et VACE dans ComfyUI.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
ID-V2V : Un modèle de vidéo préservant l'identité obtient le support ComfyUI via Kijai | ComfyUI Wiki