LoRA H3 Person Remover: удаление человека из видео в ComfyUI

ComfyUI Wikinews

LoRA Person Remover от Akatz Labs отслеживает человека с помощью SAM 3.1, заливает маску зелёным и восстанавливает фон в перекрывающихся окнах. Есть workflow ComfyUI.

MiniMax-H3-Person-Remover-LoRA удаляет выбранного человека из видео и восстанавливает фон за ним с помощью MiniMax H3 Ref2VA. Сопутствующий рабочий процесс ComfyUI отслеживает человека с помощью SAM 3.1, закрашивает маску зелёным и перегенерирует видео в перекрывающихся окнах, границы которых используются как ссылка для следующего окна. Akatz Labs опубликовала адаптер, рабочий процесс и полную запись обучения 8 октября 2026 года.
Кадр из авторского сравнения в 1080p

Из демонстрации с восемью примерами: оригинальный клип, зелёная маска, восстановленный фон.

Демонстрация ДО/ПОСЛЕ от автора, перекодированная в ширину 1280 пикселей.

Что делает адаптер, а что нет

LoRA не сегментирует людей и не придумывает чистый фон сама по себе. SAM 3.1 поставляет маску отслеживания из текстового описания, например man in gray shirt, а вам всё ещё нужно предоставить чистую версию первого кадра видео, где человек уже удалён: либо из графического редактора, либо из модели редактирования изображений. Дальше остальное делает рабочий процесс перегенерации окон (window reroll): на вход подаются кадры с зелёной маской, H3 перегенерирует закрытую область, а восстановленный граничный кадр переносит продолжение в следующее окно.

Промпт удаления по умолчанию:

Remove the green-masked person and reconstruct the background. Preserve the rest of the video, including its camera motion and frame timing.

Перегенерация окон в цифрах

Рабочий процесс настроен под конкретную задачу, а не универсально, и записанные настройки стоит скопировать:

НастройкаЗначение
Schedulerbeta / simple
CFG1
Сдвиг сигмы видео / аудио12 / 3
Расширение маски5 пикселей
Частота кадров24 fps
Seed904234

Ни Turbo, ни VFX LoRA не требуются. Рабочий процесс использует длину кадров H3 вида 17n + 5 (22, 39, 56, 73 ...) и рекомендует начинать с 22 кадров, поскольку более длинное окно расходует больше памяти, не улучшая автоматически результат. Каждое продолжение использует сгенерированный граничный кадр как следующую ссылку и переносит 18 кадров истории сгенерированного видео и аудио, а relay удаляет перекрытие и обрезает результат до исходного количества кадров. По умолчанию выход без звука; чтобы сохранить звуковую дорожку, подключите оригинальное аудио из узла Извлечь компоненты видео к финальному узлу Создать видео.

Требования к входным данным конкретны: видео 24 fps, ширина и высота, делящиеся на 32, и в идеале короткий непрерывный план длительностью около пяти секунд.

Запись обучения

V1 это адаптер ранга 16 на урезанной (pruned) модели Ref2VA, обученный за 2000 обновлений оптимизатора после начальных 250 обновлений на статических парах из пяти кадров и регуляризации сохранения.

НастройкаЗаписанное значение
Архитектураminimax_h3_ref2va, pruned
Ранг / альфа16 / 16, без adaln_proj
ТензорыBF16, 416 тензоров по 208 целям адаптера
Оптимизатор / скорость обученияAdamW8bit / 5e-5
Текстовый энкодерNVFP4 Qwen3VL
Разрешение задачи / регуляризации1152 / 256, buckets по соотношению сторон
Длина кадров задачи5, 56, 73, 90, 124 при 24 fps
Длина регуляризации107 кадров при 24 fps, со звуком
Среда выполненияAI Toolkit 0.13.23 плюс записанный патч aligned-video-guide

Пул обучения смешанной фазы содержит 128 статических пар, 80 фрагментов с движущейся маской из 20 сцен и шесть клипов для сохранения. Карточка датасета документирует сборку, разделение и статус проверки, а в training/ находятся конфиги, расписания, хеши моделей и патч среды выполнения.

Ограничения

Akatz Labs прямо говорит о том, что всё ещё не работает:

  • H3 перегенерирует всю сцену, поэтому области вне маски не зафиксированы попиксельно относительно оригинала, хотя обучающие пары сохраняют пиксели за пределами своих масок.
  • Пропущенная рука, край волос, тень, отражение или перекрытая часть тела могут сохраниться, а более крупная маска заставляет модель придумывать больше фона.
  • Плохой чистый первый кадр распространяется на последующие окна, а сильное движение камеры или жёсткие склейки могут нарушить непрерывность.
  • Перегенерация окна меняет его продолжение, поэтому пересобранный фрагмент в конце тоже нужно проверять.
  • Записанный флаг приёмки датасета остаётся false: прохождение технических проверок не равно одобрению каждого примера человеком.

Доступность

Для рабочего процесса нужен актуальный ComfyUI с нативной поддержкой MiniMax H3 и SAM 3.1, а также файл H3-Person-Remover-V1.safetensors в models/loras/. Опубликованный рабочий процесс фиксирует трансформер H3 ref2va pruned INT8 ConvRot, текстовый энкодер NVFP4 Qwen3VL, видео- и аудио-VAE H3 и SAM 3.1 multiplex; предыдущая валидация проводилась на RTX 4090 с ComfyUI 0.37.0, что автор описывает как протестированную конфигурацию, а не минимальные требования. H3 Relay предоставляет элементы управления предпросмотром и перегенерацией окон, которые использует рабочий процесс.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
LoRA H3 Person Remover: удаление человека из видео в ComfyUI | ComfyUI Wiki