ComfyUI v0.36.0: нативная поддержка Marigold V2 и объединение видео

ComfyUI Wikinews

ComfyUI v0.36.0 добавляет нативную оценку глубины, нормалей и альбедо Marigold V2, три официальных процесса, узел объединения видео, FastH3, YuE2 и новые партнёрские узлы.

ComfyUI v0.36.0 доступен. В ядро добавлено плотное предсказание Marigold V2 (глубина, нормали поверхности и альбедо) с тремя официальными рабочими процессами, новый узел Video Concatenate, нативная поддержка FastVideo FastH3 и YuE2, универсальные узлы циклов, а также набор обновлений и исправлений партнёрских узлов.
Тизер Marigold V2

Marigold V2 считывает геометрию напрямую из одного изображения: глубину, нормали поверхности и альбедо из одного семейства чекпойнтов (тизер из репозитория проекта).

Marigold V2: глубина, нормали поверхности и альбедо

Marigold V2 создан в HUAWEI Bayer Lab совместно с EPFL и Болонским университетом и представлен на SIGGRAPH Asia 2026 (arXiv:2609.08084). Вместо обучения новой diffusion-модели с нуля он дообучает Qwen-Image-Edit-2509 с LoRA-весами под каждую задачу и дообученными VAE-декодерами, а затем считывает предсказание из латента за один шаг выборки.

Поддержка в ядре добавлена в Comfy-Org/ComfyUI#16232 (CORE-431), а официальные шаблоны поставляются с перепакованными весами Comfy-Org в Comfy-Org/marigold-v2-0. Покрыты три задачи:

  • Глубина: аффинно-инвариантная логарифмическая глубина из стандартного чекпойнта статьи depth/Log-stage2, обученного на Hypersim и Virtual KITTI 2 (около 74 тыс. изображений).
  • Нормали поверхности: единичные нормали в пространстве камеры.
  • Альбедо: линейное альбедо RGB в диапазоне [0, 1].

В апстрим-релизе также есть чекпойнты прозрачной (многослойной) глубины, которые предсказывают геометрию за стеклом, вместе с абляциями по равномерной глубине и диспаритету. Пакет ComfyUI включает три основные модальности.

Обзор метода Marigold V2

Обзор метода из репозитория проекта: единый бэкбон Qwen-Image-Edit-2509 адаптируется под каждую задачу плотного предсказания.

Внутри рабочих процессов Marigold V2

Каждый шаблон построен как подграф. Он загружает базу int8 ConvRot Qwen-Image-Edit-2509 qwen_image_edit_2509_int8_convrot.safetensors, применяет LoRA задачи, загружает предварительно вычисленный embedding условия и VAE задачи, а затем выполняет выборку с euler по сигмам 0.5 -> 0, то есть за один шаг. Текстовый энкодер не требуется: embedding промпта поставляются в виде файлов *_conditioning.safetensors, загружаемых через ConditioningLoader.

Новый узел Marigold V2 Post-Process (MarigoldV2PostProcess, категория image/geometry estimation) преобразует декодированное предсказание в просматриваемое изображение, с переключателем prediction для depth (нормализованная, ближний план ярче), normals (единичные нормали) или albedo (sRGB).

Файлы, ожидаемые шаблонами:

📂 ComfyUI/
└── 📂 models/
    ├── 📂 diffusion_models/
    │   └── qwen_image_edit_2509_int8_convrot.safetensors
    ├── 📂 loras/
    │   ├── marigold_v2_depth_log_stage2.safetensors
    │   ├── marigold_v2_normals.safetensors
    │   └── marigold_v2_albedo.safetensors
    ├── 📂 embeddings/
    │   ├── marigold_v2_depth_conditioning.safetensors
    │   ├── marigold_v2_normals_conditioning.safetensors
    │   └── marigold_v2_albedo_conditioning.safetensors
    └── 📂 vae/
        ├── marigold_v2_depth_log_stage2_vae.safetensors
        ├── marigold_v2_normals_vae.safetensors
        └── marigold_v2_albedo_vae.safetensors

Опубликованные показатели zero-shot для модели: по глубине AbsRel / δ1 3.6 / 98.0 на NYUv2, 5.4 / 97.4 на KITTI, 2.8 / 99.2 на ETH3D, 3.7 / 97.9 на ScanNet и 5.2 / 97.1 на DIODE; по нормалям поверхности средняя угловая ошибка 16.6° на NYUv2; по альбедо PSNR 20.78 и SSIM 0.811 на тестовом сплите Hypersim.

Узел объединения видео

В v0.36.0 добавлен узел Concatenate Video (ConcatenateVideo, категория video) для соединения клипов подряд прямо в графе:

  • Входы автоматически расширяются как video1, video2 и так далее, до 100 сегментов, и присоединяются в порядке входов.
  • Если сегменты уже закодированы совместимым кодеком, они объединяются без декодирования.
  • codec по умолчанию равен auto (H.264), а уже закодированные видео остаются без изменений.
  • Необязательный вход complete_audio переопределяет аудио, содержащееся в сегментах, что полезно, когда клипы получены отдельными генерациями.

Поддержка FastVideo FastH3 и YuE2

Релиз также переводит в ядро две ранее вышедшие модели:

  • FastVideo FastH3: 8-шаговый дистиллированный MiniMax H3 для text-to-video и image-to-video с нативным аудио. Чекпойнты и настройки внимания VSA, на которые опираются шаблоны, см. в материале FastH3 8-Step V2 Gets Native ComfyUI Templates.
  • YuE2: генерация музыки по промптам стиля и текстам песен, с последующими исправлениями для систем AMD, увеличенной максимальной длительностью песни и дополнительными настройками узла генерации. Ранее: YuE2.

Прочие изменения узлов и ядра

  • Универсальные циклы: в том же релизе появились Start Loop и End Loop для перебора списков внутри графа, вместе с Create List и Get Item From List.
  • Convert Image Color Space получил целевое пространство linear (линейное Rec.709) вдобавок к существующим пространствам sRGB, HDR и HDR PQ.
  • Текстовый узел Gemini: добавлен GeminiNodeV3, а узел V2 объявлен устаревшим.
  • MiniMax H3: потребление памяти видео-VAE дополнительно снижено поверх работы над int8 ConvRot VAE.
  • AMD в Windows: квота виртуальных адресов увеличена до 4 ТБ (CORE-409), а неработающая проверка архитектуры ROCm triton удалена из операций квантизации.

Обновления партнёрских узлов

  • Tripo P2: узлы генерации 3D-модели из текста, изображения и многовьюсовых данных.
  • Pruna P-Video-2: text-to-video и image-to-video в 720p/1080p с черновым режимом.
  • BFL: узел Flux Video Edit, который редактирует исходный клип по текстовой инструкции.
  • Bria: новые узлы редактирования изображений плюс узел Video Eraser.
  • OpenRouter: модели Microsoft mai-image-2.6 и автоматическое соотношение сторон в узле изображения.
  • Client: прогресс партнёрских узлов теперь использует заголовки с оценкой длительности для отображения прогресса.

Исправления и прочие изменения

  • Исправлен H3 Fun ControlNet при включённом компиляторе ComfyUI.
  • Узел ImageAddNoise больше не добавляет шум в альфа-канал.
  • Исправлены проблемы Yue2 на AMD, а в узел ABC генерации добавлено больше настроек.
  • RoPE теперь применяется с быстрыми ядрами на большем числе моделей на основе llama, что охватывает текстовые энкодеры, используемые моделями класса Qwen-Image-Edit.
  • comfy-kitchen обновлён до 0.2.34, comfyui-frontend-package до 1.52.7, а шаблоны рабочих процессов до v0.11.62.
  • Записи ассетов отделены от содержимого за флагом --enable-assets.

Как получить v0.36.0

Обновите ComfyUI через Менеджер или выбранный вами лаунчер. Рабочие процессы Marigold V2 и узел объединения видео требуют v0.36.0 или новее, а сборки Desktop и Cloud следуют за стабильными релизами.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
ComfyUI v0.36.0: нативная поддержка Marigold V2 и объединение видео | ComfyUI Wiki