H3 Person Remover LoRA : supprimer une personne d'une vidéo

ComfyUI Wikinews

Le LoRA Person Remover d'Akatz Labs suit une personne avec SAM 3.1, remplit le masque en vert et reconstruit l'arrière-plan par fenêtres superposées, avec un flux ComfyUI prêt.

MiniMax-H3-Person-Remover-LoRA supprime une personne sélectionnée d'une vidéo et reconstruit l'arrière-plan derrière elle avec MiniMax H3 Ref2VA. Le flux de travail ComfyUI associé suit la personne avec SAM 3.1, peint le masque en vert et régénère les images dans des fenêtres qui se chevauchent, dont les limites sont réutilisées comme référence de la fenêtre suivante. Akatz Labs a publié l'adaptateur, le flux de travail et l'intégralité du journal d'entraînement le 8 octobre 2026.
Une image de la comparaison de démonstration 1080p de l'auteur

Extrait de la démonstration en huit exemples : clip original, masque vert, arrière-plan reconstruit.

La démonstration avant/après de l'auteur, réencodée en 1280 pixels de large.

Ce que fait l'adaptateur, et ce qu'il ne fait pas

Le LoRA ne segmente pas les personnes et n'invente pas l'arrière-plan propre de lui-même. SAM 3.1 fournit le masque de suivi à partir d'une description textuelle telle que man in gray shirt, et vous devez toujours fournir une version propre de la première image de la vidéo avec la personne déjà absente, soit depuis un éditeur d'images, soit depuis un modèle d'édition d'images. Ensuite, le flux de travail de relance par fenêtres fait le reste : les images masquées en vert entrent, H3 régénère la région couverte, et l'image de limite reconstruite porte la continuation dans la fenêtre suivante.

Invite de suppression par défaut :

Supprimez la personne masquée en vert et reconstruisez l'arrière-plan. Préservez le reste de la vidéo, y compris son mouvement de caméra et sa cadence d'images.

La relance par fenêtres, en chiffres

Le flux de travail est réglé précisément plutôt que générique, et les paramètres enregistrés valent la peine d'être copiés :

ParamètreValeur
Schedulerbeta / simple
CFG1
Décalage sigma vidéo / audio12 / 3
Expansion du masque5 pixels
Fréquence d'images24 fps
Graine904234

Aucun LoRA Turbo ou VFX n'est requis. Le flux de travail utilise des longueurs de séquence H3 de la forme 17n + 5 (22, 39, 56, 73 ...) et recommande de commencer à 22 images, car une fenêtre plus longue coûte plus de mémoire sans améliorer automatiquement le résultat. Chaque continuation utilise l'image de limite générée comme référence suivante et transporte 18 images d'historique vidéo et audio généré, puis le relais supprime le chevauchement et recadre le résultat au nombre d'images de la source. La sortie est silencieuse par défaut ; vous connectez l'audio d'origine depuis le nœud Obtenir les composants vidéo au nœud Créer une vidéo final pour conserver la bande sonore.

Les exigences d'entrée sont précises : une vidéo à 24 fps, une largeur et une hauteur divisibles par 32, et idéalement un plan continu court d'environ cinq secondes.

Journal d'entraînement

V1 est un adaptateur de rang 16 sur le modèle Ref2VA élagué, entraîné pendant 2 000 mises à jour de l'optimiseur, après 250 mises à jour initiales sur des paires statiques de cinq images et une régularisation de préservation.

ParamètreValeur enregistrée
Architectureminimax_h3_ref2va, élagué
Rang / alpha16 / 16, en excluant adaln_proj
TenseursBF16, 416 tenseurs répartis sur 208 cibles d'adaptateur
Optimiseur / taux d'apprentissageAdamW8bit / 5e-5
Encodeur de texteNVFP4 Qwen3VL
Résolution de tâche / de régularisation1152 / 256, compartiments de ratio d'aspect
Longueurs de séquence de tâche5, 56, 73, 90, 124 à 24 fps
Longueur de régularisation107 images à 24 fps, avec audio
Environnement d'exécutionAI Toolkit 0.13.23 plus un correctif aligned-video-guide enregistré

Le pool d'entraînement de la phase mixte contient 128 paires statiques, 80 extraits de masque en mouvement issus de 20 scènes, et six clips de préservation. La fiche du jeu de données documente la construction, la répartition et le statut de révision, et training/ contient les configurations, les planifications, les hachages de modèle et le correctif d'environnement d'exécution.

Limitations

Akatz Labs est direct sur ce qui échoue encore :

  • H3 régénère toute la scène, donc les zones non masquées ne sont pas verrouillées au pixel près sur l'original, même si les paires d'entraînement préservent les pixels en dehors de leurs masques.
  • Une main manquée, un bord de cheveux, une ombre, un reflet ou une partie du corps occultée peuvent subsister, et un masque plus grand demande au modèle d'inventer davantage d'arrière-plan.
  • Une première image propre de mauvaise qualité se propage dans les fenêtres suivantes, et un fort mouvement de caméra ou des coupes franches peuvent briser la continuité.
  • Relancer une fenêtre modifie sa continuation, le suffixe reconstruit doit donc aussi être inspecté.
  • L'indicateur d'acceptation du jeu de données enregistré reste faux : réussir les contrôles techniques n'équivaut pas à une approbation humaine de chaque exemple.

Disponibilité

Le flux de travail nécessite une version en cours de ComfyUI avec prise en charge native de MiniMax H3 et SAM 3.1, plus H3-Person-Remover-V1.safetensors dans models/loras/. Le flux de travail publié épingle le transformer H3 ref2va pruned INT8 ConvRot, l'encodeur de texte NVFP4 Qwen3VL, les VAE vidéo et audio H3, et SAM 3.1 multiplex ; la validation précédente a tourné sur une RTX 4090 avec ComfyUI 0.37.0, que l'auteur décrit comme une configuration testée plutôt qu'une spécification minimale. H3 Relay fournit l'aperçu de fenêtre et les contrôles de relance qu'utilise le flux de travail.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
H3 Person Remover LoRA : supprimer une personne d'une vidéo | ComfyUI Wiki