ComfyUI v0.32.0: новый встроенный бэкенд внимания и поддержка LTX 2.5
ComfyUI v0.32.0 добавляет встроенный бэкенд внимания уровня SageAttention, поддержку LTX 2.5 с STG и двойным CFG, исправления VAE и памяти MiniMax H3 и партнёрские узлы.
Новый встроенный бэкенд внимания
v0.32.0 реализует comfy kitchen attention, нативный бэкенд внимания, поставляемый вместе с ComfyUI. Новая нода ModelAttentionBackend позволяет выбрать реализацию внимания для каждой модели прямо внутри рабочего процесса и в настоящее время предлагает внимание PyTorch или comfy kitchen attention. Для пользователей, которые хотят использовать его везде, аргумент запуска --use-ck-attention включает его в качестве бэкенда по умолчанию для всех моделей (с оговоркой, что он может нарушить работу некоторых из них).
Ранние бенчмарки сообщества показали, что он находится на одном уровне с SageAttention. На MiniMax H3 он повторил результат SageAttention Auto, а в тесте Z-Image Turbo 2048x2048 @ 9 шагов новый бэкенд показал 14,55 с, против 14,24 с у SageAttention (Auto) и 23,16 с у внимания PyTorch по умолчанию:
| Бэкенд внимания | Z-Image Turbo 2048x2048 @ 9 шагов (среднее из 3 запусков) |
|---|---|
| Comfy Kitchen Attention | 14,55 с |
| SageAttention (Auto) | 14,24 с |
| PyTorch Attention (по умолчанию) | 23,16 с |
Для пользователей, у которых возникают проблемы с установкой SageAttention, это полностью устраняет данное препятствие, поскольку бэкенд встроен в ComfyUI.
Нативная поддержка LTX 2.5
LTX 2.5 теперь нативно поддерживается в ComfyUI с пространственно-временным направлением (STG), двойным CFG и предсказанием длительности. Этот релиз также добавляет новые узлы LTXV:
- LTXV Spatio-Temporal Guidance: STG-направление для генерации видео LTX
- LTXV Modality Guidance: направление сопряжения аудио/видео для LTX
- LTXV Dual CFG Guider: двойной CFG Гид для рабочих процессов LTX
- LTXV Duration Predictor: предсказывает естественную длительность кадра по токенам подписи
Оптимизации MiniMax H3
Несколько изменений в v0.32.0 нацелены на экосистему MiniMax H3:
- Оптимизированный VAE MiniMax-H3 для более быстрого кодирования и декодирования
- Исправлена проблема пиковой памяти при генерации с MiniMax H3
- Исправлен сбой VAEDecodeTiled на латентах NestedTensor (MiniMax H3)
Обновления партнёрских узлов
- Qwen Image 3.0: добавлены узлы Qwen-Image 3.0 и 3.0 Pro для генерации изображений по тексту и их редактирования
- LTX 2.5: добавлены партнёрские узлы LTX 2.5 Text/Image/Audio to Video
- Grok Imagine Image 2.0: добавлена поддержка модели grok-imagine-image-2.0
Производительность и стабильность
- PyTorch 2.7 теперь является минимальной официально поддерживаемой версией PyTorch
- Масштабатор шума ER-SDE расширен за счёт масштабирования h(t)
- Токенизаторы Mistral и Llama больше не зависят от transformers
- Исправлена ошибка, из-за которой модели upscale выходили из строя в режиме нединамической низкой видеопамяти
- Исправлено неработавшее плиточное декодирование аудио
- Исправлена регрессия CLIP Vision
- Улучшена обнаруживаемость узла «Создать многослойное изображение» благодаря более понятным флагам
Полный список изменений см. в официальном релизе на GitHub или в журнале изменений документации ComfyUI.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.