Новости ComfyUI и релизы открытого ИИ

Новости экосистемы ComfyUI: релизы открытых моделей, пользовательские ноды, рабочие процессы и инструменты для генерации изображений, видео и аудио.

Текст → изображение
LoRA
M87 (ранний предварительный просмотр) v1: Cinematic Aesthetic Enhancement LoRA для Krea 2 Turbo

M87 — это ранняя предварительная версия эстетического LoRA для Krea 2 Turbo, которая улучшает композицию, освещение, атмосферу и визуальную текстуру — делает генерации более кинематографичными и художественно направленными, не привязываясь к конкретному стилю.

Редактирование изображений
LoRA
AI Toolkit добавляет обучение Krea 2 по референсным изображениям: обучайте концепции редактирования так же быстро, как и выделенные модели редактирования

Ostris добавил в AI Toolkit поддержку обучения моделей Krea 2 с референсными изображениями, что позволяет обучать LoRA для редактирования, осваивая такие концепции, как «сделать циклопом», всего за 1750 шагов.

MIT

Текст → изображение
LoRA
Выпущен Krea 2 Depth ControlNet: генерация с управлением по глубине с поддержкой ComfyUI

Tanmay Patil выпустил Krea 2 Depth ControlNet-LoRA, добавив генерацию изображений с управлением по глубине в Krea 2. Работает как с Krea 2 Raw, так и с Turbo, достигая согласованности глубины 0,99 по корреляции Пирсона.

Krea-2-Community

Текст → изображение
Fine-tune
Flux2-Klein-9B-True-V2: Сообщественная тонкая настройка FLUX.2-klein-9B достигает почти реалистичности Nano-Banana

Flux2-Klein-9B-True-V2 — это последняя полная тонкая настройка от wikeeyang на основе FLUX.2-klein-9B, обеспечивающая значительные улучшения в фотореализме, точности следования промпту, совместимости с LoRA и качестве редактирования изображений.

FLUX-1-dev-non-commercial

Экосистема
Инструмент
Meituan открывает исходный код LongCat 2.0: модель MoE с 1,6 триллиона параметров, обученная на AI ASIC

Meituan выпускает LongCat 2.0, языковую модель MoE с 1,6 триллиона параметров и окном контекста в 1 миллион токенов, полностью обученную на оборудовании AI ASIC. Веса модели скоро будут доступны под лицензией MIT.

Редактирование видео
LoRA
Edit Anything: Экспериментальные LoRA для редактирования видео LTX-2.3 для ComfyUI

Alissonerdx выпускает Edit Anything — Apache-2.0 открытый LoRA для редактирования видео на LTX-2.3, с функциями передачи движения, многозадачного редактирования без эталонного изображения и преобразования видео по эталону — всё через ComfyUI BFSnodes.

Экосистема

Comfy MCP: Превратите вашего ИИ-агента в креативного технолога

Экосистема
Инструмент
Comfy MCP: Превратите вашего ИИ-агента в креативного технолога

Comfy Org запускает Comfy MCP, соединяя ИИ-агентов с ComfyUI через протокол Model Context Protocol. Теперь агенты могут искать модели, выполнять рабочие процессы и генерировать изображения, видео и 3D-контент на естественном языке.

Мультимодальные
Исследования
Kandinsky Lab открывает исходный код KVAE-Audio: высококачественный аудиоавтоэнкодер с частотой 48 кГц

Kandinsky Lab (Сбер) выпускает KVAE-Audio — непрерывный аудиоавтоэнкодер с 166,9 млн параметров, обеспечивающий реконструкцию высочайшего качества для речи, музыки и общих звуков на полной полосе 48 кГц.

Текст → изображение

ilkerzgi выпускает более 1500 стилевых LoRA для Krea 2: массивная библиотека стилей с открытым исходным кодом

Текст → изображение
LoRA
ilkerzgi выпускает более 1500 стилевых LoRA для Krea 2: массивная библиотека стилей с открытым исходным кодом

ilkerzgi выпустил более 1500 стилевых LoRA для Krea 2 на Hugging Face, охватывающих 7 категорий от иллюстраций до фотографий. Каждая LoRA готова к использованию в ComfyUI.

Редактирование видео
LoRA
LTX-2.3 3DREAL LoRA: превратите 3D-рендеры в фотореалистичное видео

fal.ai выпустила LTX-2.3 3DREAL IC-LoRA — контекстную LoRA для LTX-Video, которая преобразует черновые 3D-заготовки и CG-рендеры в фотореалистичное, кинематографичное видео, сохраняя исходную композицию и движение камеры.

Open-Weights

Мультимодальные
Базовая модель
NVIDIA выпускает LocateAnything-3B — модель привязки визуального языка с открытым исходным кодом и параллельным декодированием боксов

NVIDIA открывает исходный код LocateAnything-3B, модели визуально-языковой привязки с Parallel Box Decoding (PBD) для быстрой и точной локализации объектов, поддерживающей обнаружение объектов, привязку элементов GUI, локализацию OCR и точечную привязку в различных областях

Open-Weights

Редактирование видео
Инструмент
LTX Director 2.0 кардинально обновляет видеомонтаж в ComfyUI с IC-LoRA, аудиоинпейнтингом и режимом повторной съемки

WhatDreamsCost выпускает LTX Director 2.0 — масштабное обновление бесплатного инструмента для видеомонтажа ComfyUI с открытым исходным кодом, добавляющее полную поддержку видео, интеграцию IC-LoRA, аудиоинпейнтинг, режим повторной съемки для выборочной регенерации и полное обновление интерфейса.

Текст → видео
LoRA
LTX-2.3 Foley LoRA: реалистичные звуковые эффекты «видео-в-аудио» для видеомодели Lightricks

FuzzPuppy выпускает LTX-2.3 Foley LoRA — LoRA-адаптер «видео-в-аудио», который добавляет реалистичные, синхронизированные с изображением звуковые эффекты к видео, сгенерированным LTX-2.3, без наложения фоновой музыки.

Изображение → видео
Fine-tune
DomainShuttle: HKUST публикует с открытым исходным кодом 14B модель управляемого субъектом создания видео из текста на базе Wan2.2

Лаборатория C4G HKUST выпускает DomainShuttle — модель генерации видео с открытой предметной областью под лицензией Apache 2.0, построенную на базе Wan2.2-T2V-14B. Она включает Domain-MoT, Video-Reference DualRoPE и Cross-Pair Consistent Loss для гибкого сохранения достоверности в пределах домена и переноса стиля между доменами.

Apache-2.0

Текст → изображение
Базовая модель
Krea 2 Open Source: 12B Diffusion Transformer с нативной поддержкой ComfyUI

Krea.ai выпустила Krea 2 Raw и Turbo — открытую весовую модель Diffusion Transformer с 12,9 млрд параметров для генерации текста в изображение. ComfyUI поддерживает её нативно с готовыми рабочими процессами.

Krea-2-Community

Редактирование изображений
Базовая модель
Boogu-Image-0.1-Edit: Открытое унифицированное редактирование изображений под лицензией Apache 2.0

Boogu-Image-0.1-Edit: это модель редактирования изображений под лицензией Apache 2.0 из семейства Boogu-Image, предлагающая редактирование по инструкциям с единой мультимодальной архитектурой понимания и генерации.

Apache-2.0

Синтез речи
Базовая модель
Higgs TTS 3: Многоязычная модель речи от Boson AI с 4 млрд параметров и поддержкой более 100 языков

Higgs TTS 3: это модель преобразования текста в речь с 4 млрд параметров, поддерживающая более 100 языков, с клонированием голоса без обучения, выразительным контролем эмоций и встроенными эффектами просодии и звуков для голосовых агентов.

Open-Weights

Текст → видео
Fine-tune
Sulphur 2: модель генерации видео на 9B параметров на основе LTX 2.3

Sulphur 2 — это созданная сообществом доработка LTX 2.3, предлагающая генерацию видео из текста и изображения со встроенным улучшателем промптов и дистиллированной LoRA, обученная на 125K+ отобранных клипов.

Open-Weights

Мультимодальные

OpenMOSS выпускает MOVA - модель синхронизированной генерации видео и аудио с открытым исходным кодом

Мультимодальные
Базовая модель
OpenMOSS выпускает MOVA - модель синхронизированной генерации видео и аудио с открытым исходным кодом

Команда OpenMOSS выпускает MOVA (MOSS Video and Audio) - фундаментальную модель сквозной синхронизированной генерации видео и аудио, которая генерирует видео и аудио за один проход вывода, обеспечивая точную синхронизацию губ и осознанные окружением звуковые эффекты, полностью открывая веса модели, код обучения и вывода

Open-Weights