Новости ComfyUI и релизы открытого ИИ

Новости экосистемы ComfyUI: релизы открытых моделей, пользовательские ноды, рабочие процессы и инструменты для генерации изображений, видео и аудио.

Текст → изображение
Базовая модель
Национальный университет Сингапура выпускает OmniConsistency - достижение согласованности стилизации изображений с низкими затратами

Команда NUS представляет проект OmniConsistency, достигающий уровня согласованности стилизации изображений GPT-4o всего с 2600 парами изображений и 500 часами обучения на GPU, теперь поддерживает узлы ComfyUI

Open-Weights

Редактирование изображений

Black Forest Labs выпускает FLUX.1 Kontext: набор моделей для контекстно-осведомленного редактирования изображений

Редактирование изображений
Базовая модель
Black Forest Labs выпускает FLUX.1 Kontext: набор моделей для контекстно-осведомленного редактирования изображений

Black Forest Labs запускает серию моделей FLUX.1 Kontext, первые, достигшие контекстно-осведомленного редактирования на основе текстовых и изображений входов, поддерживающие сохранение согласованности персонажей и функции локализованного редактирования

Open-Weights

Текст → изображение
Базовая модель
ID-Patch: новый метод для генерации персонализированных групповых фотографий с множественной идентичностью

ByteDance и Университет штата Мичиган совместно предлагают метод ID-Patch, достигая генерации персонализированных изображений с множественной идентичностью с улучшенным сохранением идентичности и эффективностью генерации, подходящий для групповых фотографий, рекламы и других многоперсональных сценариев.

Open-Weights

Анимация персонажей
Базовая модель
Tencent открывает исходный код модели цифрового человека с речевым управлением HunyuanVideo-Avatar: генерация естественных видео цифрового человека из одного изображения и аудио

Tencent выпускает HunyuanVideo-Avatar, обеспечивая высококачественные, эмоционально контролируемые видео цифрового человека из изображений и аудио, подходящие для коротких видео, рекламы электронной коммерции и многого другого.

Open-Weights

Текст → изображение
Базовая модель
Pixel-Reasoner: выпущена модель визуального рассуждения на пиксельном уровне с открытым исходным кодом

Pixel-Reasoner, основанная на Qwen2, предлагает глобальное и локальное пиксельное визуальное понимание и рассуждение, поддерживает детальный анализ с увеличением и продвигает визуальные языковые модели.

MIT

Синтез речи

Выпуск IndexTTS 1.5: высококачественная модель преобразования текста в речь для китайского и английского языков

Синтез речи
Базовая модель
Выпуск IndexTTS 1.5: высококачественная модель преобразования текста в речь для китайского и английского языков

IndexTTS выпускает версию 1.5 со значительно улучшенной стабильностью модели и производительностью английского языка, поддерживая исправление произношения пиньинь и управляемые пунктуацией паузы, превосходя основные TTS системы в множественных тестах

Open-Weights

Изображение → 3D
Инструмент
StepFun открывает исходный код Step1X-3D - высококачественная структура генерации 3D-активов

StepFun выпускает структуру Step1X-3D с открытым исходным кодом, которая генерирует высококачественную 3D-геометрию и текстуры из одиночных изображений, включая 2M высококачественный набор данных, полный код обучения и веса модели

Open-Weights

Мультимодальные
Базовая модель
BAGEL: ByteDance открывает исходный код унифицированной мультимодальной базовой модели для понимания и генерации текста, изображений и видео

ByteDance выпускает BAGEL, мультимодальную базовую модель с открытым исходным кодом с 7B активными параметрами, поддерживающую понимание и генерацию текста, изображений и видео, и достигающую сильных результатов на публичных бенчмарках.

Open-Weights

Текст → изображение
Базовая модель
Уведомление об обновлении: пользовательские узлы, влияющие на фронтенд ComfyUI

После недавних обновлений ComfyUI некоторые пользовательские узлы могут вызывать проблемы с фронтендом. Эта статья суммирует затронутые плагины и решения, рекомендуя своевременные обновления или удаление соответствующих плагинов.

Open-Weights

Изображение → 3D

Step1X-3D выпускает высококачественную генерацию 3D-активов и план открытого исходного кода

Изображение → 3D
Базовая модель
Step1X-3D выпускает высококачественную генерацию 3D-активов и план открытого исходного кода

Команда Step1X-3D выпустила решение генерации высококачественных 3D-активов, сделав модели, наборы данных и код открытым исходным кодом, поддерживая различные задачи генерации 3D-активов и текстур.

Open-Weights

Мультимодальные
Инструмент
Tencent выпускает мультимодальную систему генерации видео HunyuanCustom

Tencent представляет HunyuanCustom, мультимодальный фреймворк кастомизации видео, который поддерживает текстовые, изображения, аудио и видео условия, обеспечивая высокосогласованную генерацию видео в множественных сценариях

Open-Weights

Редактирование изображений
Инструмент
Insert Anything: фреймворк с открытым исходным кодом для бесшовной вставки изображений

Insert Anything - это унифицированный фреймворк с открытым исходным кодом, который может бесшовно вставлять элементы, такие как люди, объекты и одежда из референсных изображений в целевые сцены, поддерживая различные сценарии применения

Open-Weights

Текст → видео
Исследования
FlexiAct: Гибкий контроль действий в гетерогенных сценариях

FlexiAct, совместно разработанный Университетом Цинхуа и Tencent ARC Lab, может переносить действия из референсного видео на любое целевое изображение, сохраняя согласованность идентичности

Open-Weights

Мультимодальные
Инструмент
Step1X-Edit: Фреймворк редактирования изображений ИИ с открытым исходным кодом

Step1X-Edit - это мощный фреймворк редактирования изображений с открытым исходным кодом, который поддерживает редактирование изображений через инструкции на естественном языке, предлагая возможности, подобные GPT-4o и Gemini2 Flash。

Open-Weights

Инпейнтинг
Базовая модель
Flex.2-preview: Выпущена модель генерации изображений ИИ с открытым исходным кодом

Flex.2-preview - это модель диффузии текст-в-изображение с открытым исходным кодом с универсальным контролем и встроенными возможностями инпейнтинга, предоставляющая создателям более мощные инструменты генерации изображений

Open-Weights

Изображение → видео
Базовая модель
Sand AI выпускает MAGI-1: авторегрессивная генерация видео в масштабе

Sand AI открыл исходный код MAGI-1, авторегрессивной модели, которая генерирует видео по частям, предлагая версии с 24B и 4.5B параметрами и поддерживая множественные режимы генерации видео

Open-Weights

Изображение → видео
Инструмент
Выпущен SkyReels-V2: Модель с открытым исходным кодом, поддерживающая генерацию видео бесконечной длины

SkyworkAI выпускает новую модель генерации видео с открытым исходным кодом SkyReels-V2, поддерживающую видео бесконечной длины с возможностями текст-в-видео и изображение-в-видео

Open-Weights

Синтез речи
Базовая модель
Nari Labs выпускает модель Dia 1.6B для преобразования текста в диалоговую речь

Nari Labs представляет модель преобразования текста в речь с открытым исходным кодом Dia 1.6B, способную генерировать многохарактерные диалоги напрямую из текста с эмоциями и невербальной коммуникацией

Open-Weights

Мультимодальные
Инструмент
Kunlun Wanwei выпускает SkyReels-V2 - модель генерации фильмов бесконечной длины

Команда SkyReels Kunlun Wanwei выпускает и открывает исходный код SkyReels-V2, первой в мире модели генерации фильмов бесконечной длины, использующей фреймворк Diffusion Forcing, способной производить высококачественный, длительный видеоконтент

Open-Weights