LoRA H3 Person Remover: удаление человека из видео в ComfyUI
LoRA Person Remover от Akatz Labs отслеживает человека с помощью SAM 3.1, заливает маску зелёным и восстанавливает фон в перекрывающихся окнах. Есть workflow ComfyUI.
Из демонстрации с восемью примерами: оригинальный клип, зелёная маска, восстановленный фон.
Демонстрация ДО/ПОСЛЕ от автора, перекодированная в ширину 1280 пикселей.
Что делает адаптер, а что нет
LoRA не сегментирует людей и не придумывает чистый фон сама по себе. SAM 3.1 поставляет маску отслеживания из текстового описания, например man in gray shirt, а вам всё ещё нужно предоставить чистую версию первого кадра видео, где человек уже удалён: либо из графического редактора, либо из модели редактирования изображений. Дальше остальное делает рабочий процесс перегенерации окон (window reroll): на вход подаются кадры с зелёной маской, H3 перегенерирует закрытую область, а восстановленный граничный кадр переносит продолжение в следующее окно.
Промпт удаления по умолчанию:
Remove the green-masked person and reconstruct the background. Preserve the rest of the video, including its camera motion and frame timing.
Перегенерация окон в цифрах
Рабочий процесс настроен под конкретную задачу, а не универсально, и записанные настройки стоит скопировать:
| Настройка | Значение |
|---|---|
| Scheduler | beta / simple |
| CFG | 1 |
| Сдвиг сигмы видео / аудио | 12 / 3 |
| Расширение маски | 5 пикселей |
| Частота кадров | 24 fps |
| Seed | 904234 |
Ни Turbo, ни VFX LoRA не требуются. Рабочий процесс использует длину кадров H3 вида 17n + 5 (22, 39, 56, 73 ...) и рекомендует начинать с 22 кадров, поскольку более длинное окно расходует больше памяти, не улучшая автоматически результат. Каждое продолжение использует сгенерированный граничный кадр как следующую ссылку и переносит 18 кадров истории сгенерированного видео и аудио, а relay удаляет перекрытие и обрезает результат до исходного количества кадров. По умолчанию выход без звука; чтобы сохранить звуковую дорожку, подключите оригинальное аудио из узла Извлечь компоненты видео к финальному узлу Создать видео.
Требования к входным данным конкретны: видео 24 fps, ширина и высота, делящиеся на 32, и в идеале короткий непрерывный план длительностью около пяти секунд.
Запись обучения
V1 это адаптер ранга 16 на урезанной (pruned) модели Ref2VA, обученный за 2000 обновлений оптимизатора после начальных 250 обновлений на статических парах из пяти кадров и регуляризации сохранения.
| Настройка | Записанное значение |
|---|---|
| Архитектура | minimax_h3_ref2va, pruned |
| Ранг / альфа | 16 / 16, без adaln_proj |
| Тензоры | BF16, 416 тензоров по 208 целям адаптера |
| Оптимизатор / скорость обучения | AdamW8bit / 5e-5 |
| Текстовый энкодер | NVFP4 Qwen3VL |
| Разрешение задачи / регуляризации | 1152 / 256, buckets по соотношению сторон |
| Длина кадров задачи | 5, 56, 73, 90, 124 при 24 fps |
| Длина регуляризации | 107 кадров при 24 fps, со звуком |
| Среда выполнения | AI Toolkit 0.13.23 плюс записанный патч aligned-video-guide |
Пул обучения смешанной фазы содержит 128 статических пар, 80 фрагментов с движущейся маской из 20 сцен и шесть клипов для сохранения. Карточка датасета документирует сборку, разделение и статус проверки, а в training/ находятся конфиги, расписания, хеши моделей и патч среды выполнения.
Ограничения
Akatz Labs прямо говорит о том, что всё ещё не работает:
- H3 перегенерирует всю сцену, поэтому области вне маски не зафиксированы попиксельно относительно оригинала, хотя обучающие пары сохраняют пиксели за пределами своих масок.
- Пропущенная рука, край волос, тень, отражение или перекрытая часть тела могут сохраниться, а более крупная маска заставляет модель придумывать больше фона.
- Плохой чистый первый кадр распространяется на последующие окна, а сильное движение камеры или жёсткие склейки могут нарушить непрерывность.
- Перегенерация окна меняет его продолжение, поэтому пересобранный фрагмент в конце тоже нужно проверять.
- Записанный флаг приёмки датасета остаётся false: прохождение технических проверок не равно одобрению каждого примера человеком.
Доступность
Для рабочего процесса нужен актуальный ComfyUI с нативной поддержкой MiniMax H3 и SAM 3.1, а также файл H3-Person-Remover-V1.safetensors в models/loras/. Опубликованный рабочий процесс фиксирует трансформер H3 ref2va pruned INT8 ConvRot, текстовый энкодер NVFP4 Qwen3VL, видео- и аудио-VAE H3 и SAM 3.1 multiplex; предыдущая валидация проводилась на RTX 4090 с ComfyUI 0.37.0, что автор описывает как протестированную конфигурацию, а не минимальные требования. H3 Relay предоставляет элементы управления предпросмотром и перегенерацией окон, которые использует рабочий процесс.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.