ComfyUI v0.37.0: поддержка Qwen-Image 2.1 и MoGe 3
ComfyUI v0.37.0 добавляет нативную поддержку Qwen-Image 2.1 с тремя официальными шаблонами, оценку геометрии MoGe 3, ускоренные энкодеры Qwen3.8 и быструю загрузку с диска.
MoGe 3 уточняет грубую карту точек на разреженной воксельной оболочке, сохраняя тонкие структуры, которые размывают декодеры в пространстве изображения (сравнение из Comfy-Org/ComfyUI#16381).
Qwen-Image 2.1 в ядре
Qwen-Image 2.1 попал в ядро через Comfy-Org/ComfyUI#16400 (CORE-423) и поставляется как нативная реализация: 7B однопоточный диффузионный трансформер находится в comfy/ldm/qwen_image21, текстовый энкодер Qwen3-VL-8B считывается из последнего скрытого состояния, а слоты референсных изображений вставляет сам DiT.
Два новых узла реализуют сторону редактирования модели:
- Text Encode Qwen Image 2.1 (
TextEncodeQwenImage21, категорияmodel/conditioning/qwen image) принимает динамический список референсных изображений вместо фиксированного входа, изменяет их размер с помощью виджетаresolution(по умолчанию 1024, кратно 32,0сохраняет размер каждого референса) и вставляет их в последовательность как латенты VAE. Он выдаёт позитивное и негативное условие, а также пустой латент с размером первого референсного изображения, что и сохраняет выравнивание при редактировании. - Qwen Image 2.1 Cache (
QwenImage21Cache) задаёт, где хранится префиксный KV-кэш и как именно:deviceможет бытьauto,gpu,cpuилиoff, аdtypeпринимаетdefault,int8илиint4. Значениеcpuпредзагружает кэш из RAM параллельно с вычислениями, тогда какoffпересчитывает префикс на каждом шаге: это медленнее, но исключает кэш при отладке.
Вместе с релизом поставляются три официальных шаблона: текст в изображение, редактирование изображения и удаление фона. Все три требуют v0.37.0 или новее.
Результат работы официального шаблона редактирования изображений Qwen Image 2.1 из репозитория workflow_templates.
Упакованные веса опубликованы как Comfy-Org/Qwen-Image-2.1.
MoGe 3: детальная оценка геометрии
MoGe 3 это третье поколение монокулярной модели геометрии от Microsoft Research, выпущенное вместе со статьёй MoGe-3: Fine-Detail Monocular Geometry Estimation with Self-Guided Sparse Volumetric Refinement. Вместо декодирования карты точек напрямую в пространстве изображения она поднимает грубое предсказание на разреженную воксельную оболочку и прогоняет по ней разреженный 3D UNet, что и сохраняет резкость тонких структур и разрывов глубины.
Поддержка в ядре появилась в Comfy-Org/ComfyUI#16381 (CORE-443) для обоих чекпойнтов, ViT-L и ViT-G. Порт ComfyUI строит уточняющую модель на разреженных ядрах FlexGEMM, которые проект уже поставляет для Trellis 2 (comfy/ldm/trellis2/flexgemm.py), поэтому на обычной конфигурации с CUDA ничего дополнительно устанавливать не нужно.
Тизер со страницы проекта MoGe 3.
Официальный шаблон utility_moge3_geometry_estimation принимает одно изображение и выдаёт карту глубины и карту нормалей поверхности. По умолчанию он загружает moge_3_vitg_fp16.safetensors, а файл ViT-L можно выбрать в том же выпадающем списке. Новый виджет refine_steps на узлах MoGe инференс и MoGe инференс панорамы напрямую управляет уточняющей моделью MoGe-3: по умолчанию 3, максимум 8, а 0 отключает её. Он не влияет на чекпойнты MoGe 1 или MoGe 2, которые узлы по-прежнему загружают.
Шаблон работает с одного изображения (входной ресурс из репозитория workflow_templates).
Шаблон ожидает упакованные веса из Comfy-Org/MoGe:
📂 ComfyUI/
└── 📂 models/
└── 📂 geometry_estimation/
├── moge_1_vitl_fp16.safetensors
├── moge_2_vitl_normal_fp16.safetensors
├── moge_3_vitg_fp16.safetensors
└── moge_3_vitl_fp16.safetensorsЭто же семейство узлов сохраняет прежний инструментарий: панорамный вывод, который разбивает эквиректангулярное изображение на двенадцать перспективных видов и обратно объединяет глубину, преобразование карты точек в меш и вывод FoV для согласования камеры.
Ускоренные текстовые энкодеры Qwen
Comfy-Org/ComfyUI#15623 (CORE-390) ускоряет декодирование текстовых энкодеров Qwen3.5 и Qwen3.8, которые важны для переписывания промптов Qwen-Image и для узлов генерации текста:
- Спекулятивное декодирование: голова предсказания нескольких токенов чекпойнта предлагает от 2 до 5 токенов, и один пакетный проход проверки принимает их. Черновая голова выполняется как захваченный граф CUDA, а проход проверки идёт под компилятором памяти.
- FixedKVBias: кэш внимания полной ёмкости с позицией записи на стороне устройства, благодаря чему шаги декодирования остаются воспроизводимыми через граф в
llama.pyиqwen35.py. - Объединённые ядра декодирования DeltaNet из comfy-kitchen с eager-фолбэком, а также штрафы за повторения и присутствие, применяемые через маску словаря фиксированного размера вместо выделения памяти на каждом шаге.
Узел Text Generate открывает это через новый виджет mtp с вариантами auto, off и от 2 до 5. Значение auto адаптирует глубину черновика, а заданные значения фиксируют её. Он не влияет на чекпойнты без весов MTP, и всплывающая подсказка отмечает, что выборочный вывод остаётся корректно распределённым, но отличается от вывода без MTP для того же seed. Этот же релиз добавляет поддержку W4A8 GEMV для этих энкодеров, что сочетается с переупаковками int8 и W4A8, которые публикует Comfy-Org.
Быстрый диск и память
v0.37.0 обновляется до comfy-aimdo 0.5.5, который включает нативную реализацию детекции быстрого диска в Windows на C. Теперь ComfyUI сам определяет быстрый диск и автоматически включает динамическую загрузку и выгрузку с опорой на диск, для каждой модели отдельно, если накопитель это PCIe 4 NVMe или лучше: веса пропускают буфер RAM и этап прогрева регистрации pin. В смешанных конфигурациях приоритет RAM отдаётся более медленным дискам, поэтому библиотека моделей, разделённая между NVMe и механическим диском, продолжает использовать кэш там, где это помогает. --fast-disk по-прежнему принудительно включает такое поведение, а новый --disable-fast-disk отключает его, переопределяя --fast-disk.
В том же релизе есть ещё два изменения, связанных с памятью. Текстовый энкодер теперь остаётся на GPU, когда включена динамическая VRAM, вместо постоянного перемещения туда и обратно, а пиковое потребление VRAM у моделей Wan снижается при использовании внимания comfy-kitchen.
Прочие изменения
- Пустое латентное изображение теперь по умолчанию 1024 x 1024 вместо 512 x 512, так что новый узел соответствует разрешениям обучения современных моделей.
- Музыка MiniMax 3 больше не выдаёт шум, когда включены графы компилятора ComfyUI: авторегрессивный текстовый энкодер теперь использует закреплённые буферы декодирования, как YuE2 и общий путь генерации.
- Декодирование VAE в ACE-Step больше не падает на GPU, которые не работают с bf16.
- Узел YuE2 Генерация музыки получил управление CFG, а точность позиционных эмбеддингов SheetSage2 приведена в соответствие с upstream.
- Имена и категории узлов были приведены в порядок по всему графу.
- Партнёрские узлы: Meshy 7.1, прозрачный фон для GPT Image 2, защита, из-за которой запуск Tripo P2 отклоняется, если связанный с ним вывод GLB или FBX оказался бы пустым, а также Idempotency-Key в вызовах партнёрского прокси, чтобы повторы не оплачивались дважды.
- comfyui-frontend-package обновлён до 1.53.6, шаблоны рабочих процессов до v0.11.66, встроенные документы до 0.5.12, а comfy-kitchen до 0.2.35.
Как получить v0.37.0
Обновить ComfyUI через Менеджер или любой удобный лаунчер. Узлы Qwen-Image 2.1 и MoGe 3 и их шаблоны требуют v0.37.0 или новее, тогда как сборки Desktop и Cloud следуют за стабильными релизами.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.