ComfyUI v0.38.0: поддержка Ming-Image, ID-V2V и ускоренный SeedVR2
В ComfyUI v0.38.0 добавлена нативная поддержка Ming-Image с официальным шаблоном, Wan ID-V2V, квантизация w6a8 и цветовые пространства HDR LogC3 и ACEScct, ускорены SeedVR2 и YuE2.
Дизайнерская композиция, сгенерированная официальным шаблоном Ming-Image 0.1 Design, который записывает выход RGBA с прозрачностью (материал из репозитория workflow_templates).
Поддержка Ming-Image в ядре ComfyUI
Ming-Image 0.1 Design теперь работает нативно. Поддержка в ядре появилась в Comfy-Org/ComfyUI#16482 вместе с последующим исправлением детекции в #16514, после того как это же изменение уже было включено в патч v0.37.3 и снова откачено в v0.37.4. Если в стабильной ветке модель у вас сначала появлялась, а потом исчезала, то в v0.38.0 она остаётся.
Порт добавляет отдельную ноду условия Text Encode Ming Image Edit (TextEncodeMingImageEdit, категория model/conditioning/ming image). Она токенизирует промпт вместе с максимум восемью референсными изображениями (от image_1 до image_8) в текстовый энкодер Ming, при этом вход VAE опционален: без него изображения влияют только через vision-башню, а с ним каждый референс добавляется к латентной последовательности как чистый кадр. Более поздние референсы масштабируются до первого, и сэмплированный латент должен совпадать по размеру с первым изображением.
Со стороны модели Ming-Image представляет собой 30-слойный DiT поверх латентного пространства с 16 каналами и собственным латентным форматом MingImage, и он работает со сдвигом 3.16 в бакете 1024. Текстовый энкодер это встроенная языковая модель Ling-Mini-2.0, 20-слойная MoE с 256 экспертами, в паре с vision-башней в стиле Qwen для референсных изображений. С одним и тем же графом узлов работают два чекпойнта: модель Design и её собрат Design Layer, который разбирает завершённый дизайн на редактируемые прозрачные слои.
Перепакованные веса опубликованы как Comfy-Org/Ming-Image в вариантах bf16 и int8_convrot:
📂 ComfyUI/
└── 📂 models/
├── 📂 diffusion_models/
│ ├── ming_image_0.1_design_bf16.safetensors
│ ├── ming_image_0.1_design_int8_convrot.safetensors
│ ├── ming_image_0.1_design_layer_bf16.safetensors
│ └── ming_image_0.1_design_layer_int8_convrot.safetensors
├── 📂 text_encoders/
│ ├── ming_image_0.1_ling_mini_2.0_bf16.safetensors
│ └── ming_image_0.1_ling_mini_2.0_int8_convrot.safetensors
└── 📂 vae/
└── ming_image_vae_bf16.safetensorsОфициальный шаблон image_ming_image_01_design_t2i собирает весь пайплайн, включая этап улучшения промпта: текстовый энкодер Qwen3.8-27B (поставляется как qwen3.8_27b_w4a8.safetensors) переписывает короткий запрос в структурированное JSON-описание дизайна в стиле Figma, и именно это описание получает текстовый энкодер Ming. Выборка: 12 шагов Euler с ModelSamplingFlux при латенте 1024x2048.
Обновления Qwen-Image 2.1 и ControlNet
Направление Qwen-Image 2.1 продолжает получать доработки:
- Union Fun ControlNet теперь поддерживается (#16519) для alibaba-pai/Qwen-Image-2.1-Fun-Controlnet-Union, единого ControlNet, который охватывает отдельные типы Fun ControlNet. Соответствующая поддержка H3 Fun-ControlNet-Union 2.0 из #16471 также входит в этот релиз.
- Поддержка Tiny VAE (#16552) добавляет
taeqi2_1_decoderиtaeqi2_1_encoderиз taesd от madebyollin, благодаря чему Qwen-Image 2.1 получает быстрые латентные превью и недорогой полный проход TAESD. Поместите файлы вmodels/vae_approx/. Это 16x-модели с 64 латентными каналами и 4-канальной стороной изображения RGBA, с поканальными масштабом и сдвигом вместо скалярных, которые использовали более старые варианты TAESD. - Размещение префиксного KV-кэша (#16429) теперь определяется с учётом подсчёта свободной памяти патчера модели, поэтому кэш может оставаться в VRAM при динамической VRAM и умном управлении памятью вместо перехода к полному пересчёту. Компиляция блоков Transformer (#16430) добавляет поддержку memory compiler, что в основном помогает, когда узким местом становится пропускная способность offload.
- Ограничение активаций fp16 (#16608) исправляет выделение памяти на месте, которое ломало memory compiler, а предобработка изображений Qwen VL больше не падает при 4-канальном входе RGBA (#16548).
Wan ID-V2V: поддержка ID-V2V в ComfyUI
PR с поддержкой ID-V2V, Comfy-Org/ComfyUI#15139, наконец был смержен 2026-09-27 и входит в этот релиз. ID-V2V меняет стиль видео, сохраняя идентичность, и построен на базе Wan 2.1 image-to-video с управлением VACE: комбинация, которую ComfyUI ранее не мог загрузить.
Работают два изменения. Детекция модели распознаёт архитектуру, когда модель VACE несёт проекцию img_emb базы I2V, а Image to Video теперь принимает необязательный вход ref_pad_image. Этот вход заполняет кадры паддинга условия изображения референсным изображением вместо плоского серого, а это и есть тот анти-дрейфовый паддинг, на котором обучалась модель. ref_pad_image необязателен, поэтому существующие рабочие процессы I2V не затронуты.
Тестовые веса остаются на Hugging Face: Kijai/Wan_ID_V2V_comfy публикует wan_2.1_idv2v_int8_convrot.safetensors и вариант с обычным контролем глубины, а в PR включён готовый JSON рабочего процесса.
Квантование: w6a8
ComfyUI теперь поддерживает загрузку чекпойнтов w6a8 (#16483, реализовано в comfy-kitchen): 6-битные веса с 8-битными активациями, поэтому файл меньше, чем у вариантов с int8 и fp8. Урезанные веса H3 уже опубликованы в новом формате на Comfy-Org/MiniMax-H3 как minimax_h3_fl2va_pruned_w6a8.safetensors и minimax_h3_ref2va_pruned_w6a8.safetensors, рядом с существующими файлами bf16, fp8_scaled и int8_convrot.
Ускорение SeedVR2 и YuE2
SeedVR2 (#16530) это существенная переработка VAE апскейлера. Там, где это позволяет модель, VAE теперь обрабатывает видео по одному кадру за раз, хранит кэши причинной свёртки квантованными в int8 в закреплённой памяти хоста и подгружает их обратно по мере необходимости. Поэтому объём используемой видеопамяти определяется рабочим набором одного кадра, а не всего клипа, что важно для длинного видео или видео высокого разрешения. Требуются ядра comfy-kitchen из того же релиза.
Выход официального шаблона апскейла изображений SeedVR2 (ассет из репозитория workflow_templates).
Два аудиопути тоже стали быстрее:
- YuE2 (#16626) теперь пакетно передаёт токены с GPU обратно на CPU и запускает свой СЭМПЛЕР под CUDA graphs.
- ACE-Step 1.5 (#16461) получает CUDA graphs и компилятор памяти для своей авторегрессивной модели.
Заодно включены два исправления для MiniMax H3: VAE теперь смешивает плиточные декодирования с уже скомпонованными соседними плитками (#16436), а также исправлена ошибка выравнивания, из-за которой VAE H3 падал при выгрузке qk_norm_scale (#16485). Масштабировать изображение (с использованием модели) больше не падает на RGBA-изображениях (#16500).
Цветовые пространства HDR
Преобразовать цветовое пространство изображения (ImageColorSpace) получил две логарифмические кодировки (#16541): HDR LogC3 (кривая EI 800 с первичными цветами Rec.709) и HDR ACEScct (первичные цвета AP1 и белая точка D60, адаптированные к D65 с помощью хроматической адаптации Брэдфорда). Вместе с уже существующими целевыми пространствами sRGB, линейным Rec.709, HDR HLG и HDR PQ рабочий процесс теперь может переходить между цветовыми пространствами, которых ожидает конвейер VFX или EXR. Последующее исправление (#16565) обрабатывает отрицательные значения в пути вывода HDR.
Память, внимание и загрузчики
- Файлы моделей теперь могут указывать, какую реализацию внимания должен использовать каждый блок (#16419), что позволяет одному репаку смешивать различные бэкенды внимания внутри одной модели.
- Поддержка comfy_attention и
AttentionTensorContainerраспространяется на семейство Lumina (#16515), ещё на несколько семейств моделей (#16595) и, с меньшим потреблением памяти, на семейство Flux (#16488). - Детекция быстрого диска, добавленная для динамической загрузки в v0.37.0, теперь охватывает все загрузчики моделей (#16425), а в список архитектур добавлены AMD RDNA2 и более старые архитектуры (#16537).
- Устройства Ascend NPU получают асинхронные потоки выгрузки весов (#16057).
- Система ассетов получила круг работ по повышению надёжности и производительности: блокировка записи SQLite захватывается заранее, а чтение файлов вынесено за пределы транзакций записи (#16480, #16486), повторное сканирование выходных папок перечисляет папки вместо проверки каждого файла и приостанавливает свои циклы, чтобы интерфейс оставался отзывчивым (#16543, #16546), а ComfyUI запускается даже при отсутствии пакетов ассетов, сообщая, что требуется для
--enable-assets(#16580).
Прочие изменения
- Text Generate принимает необязательный вход
system_promptи возвращает блок размышлений (thinking block) на отдельном выходе (#16442). - Зависимость torchaudio была удалена, так как upstream прекратил выпуск стабильных сборок cu132 (#16457).
- Включена поддержка MiniMax H3 Fun-ControlNet-Union 2.0 из #16471, а создание ABC в SheetSage2 приведено в соответствие с upstream-кодом YuE (#16569).
- Партнёрские узлы: Hunyuan Image 3.5 text-to-image и edit (Tencent, #16462), Arrow 2 с reasoning effort в SVG-узлах (Quiver, #16478), Claude Opus 5.5 (#16479), Recraft V4.1 Flash (#16501), GPT-6 Sol and Luna (OpenAI, #16520), Seedream 5.0 Flash (#16522) и Seedance 2.5 Draft mode (#16529). Устаревшие узлы Sora были удалены (#16609). Некоторые из этих партнёрских дополнений уже вошли в патч-релизы v0.37.x.
- Шаблоны рабочих процессов находятся на версии v0.11.70, comfy-kitchen на 0.2.36, а встроенная документация на 0.5.13.
Как получить v0.38.0
Обновитесь через ComfyUI Manager или ваш лаунчер. Поддержка Qwen-Image 2.1 ControlNet и tiny VAE, новые цветовые пространства и ID-V2V требуют версии v0.38.0 или новее. За Ming-Image стоит следить в линии патчей: узлы присутствовали в v0.37.3 и снова были откачены в v0.37.4, поэтому поддержка закрепляется именно в v0.38.0.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.