Команда NUS представляет проект OmniConsistency, достигающий уровня согласованности стилизации изображений GPT-4o всего с 2600 парами изображений и 500 часами обучения на GPU, теперь поддерживает узлы ComfyUI
Open-Weights
Новости экосистемы ComfyUI: релизы открытых моделей, пользовательские ноды, рабочие процессы и инструменты для генерации изображений, видео и аудио.
Команда NUS представляет проект OmniConsistency, достигающий уровня согласованности стилизации изображений GPT-4o всего с 2600 парами изображений и 500 часами обучения на GPU, теперь поддерживает узлы ComfyUI
Open-Weights
Black Forest Labs запускает серию моделей FLUX.1 Kontext, первые, достигшие контекстно-осведомленного редактирования на основе текстовых и изображений входов, поддерживающие сохранение согласованности персонажей и функции локализованного редактирования
Open-Weights
Текст → изображениеByteDance и Университет штата Мичиган совместно предлагают метод ID-Patch, достигая генерации персонализированных изображений с множественной идентичностью с улучшенным сохранением идентичности и эффективностью генерации, подходящий для групповых фотографий, рекламы и других многоперсональных сценариев.
Open-Weights
Анимация персонажейTencent выпускает HunyuanVideo-Avatar, обеспечивая высококачественные, эмоционально контролируемые видео цифрового человека из изображений и аудио, подходящие для коротких видео, рекламы электронной коммерции и многого другого.
Open-Weights
Pixel-Reasoner, основанная на Qwen2, предлагает глобальное и локальное пиксельное визуальное понимание и рассуждение, поддерживает детальный анализ с увеличением и продвигает визуальные языковые модели.
MIT
IndexTTS выпускает версию 1.5 со значительно улучшенной стабильностью модели и производительностью английского языка, поддерживая исправление произношения пиньинь и управляемые пунктуацией паузы, превосходя основные TTS системы в множественных тестах
Open-Weights
Изображение → 3DStepFun выпускает структуру Step1X-3D с открытым исходным кодом, которая генерирует высококачественную 3D-геометрию и текстуры из одиночных изображений, включая 2M высококачественный набор данных, полный код обучения и веса модели
Open-Weights
МультимодальныеByteDance выпускает BAGEL, мультимодальную базовую модель с открытым исходным кодом с 7B активными параметрами, поддерживающую понимание и генерацию текста, изображений и видео, и достигающую сильных результатов на публичных бенчмарках.
Open-Weights
Текст → изображениеПосле недавних обновлений ComfyUI некоторые пользовательские узлы могут вызывать проблемы с фронтендом. Эта статья суммирует затронутые плагины и решения, рекомендуя своевременные обновления или удаление соответствующих плагинов.
Open-Weights
Команда Step1X-3D выпустила решение генерации высококачественных 3D-активов, сделав модели, наборы данных и код открытым исходным кодом, поддерживая различные задачи генерации 3D-активов и текстур.
Open-Weights
МультимодальныеTencent представляет HunyuanCustom, мультимодальный фреймворк кастомизации видео, который поддерживает текстовые, изображения, аудио и видео условия, обеспечивая высокосогласованную генерацию видео в множественных сценариях
Open-Weights
Редактирование изображенийInsert Anything - это унифицированный фреймворк с открытым исходным кодом, который может бесшовно вставлять элементы, такие как люди, объекты и одежда из референсных изображений в целевые сцены, поддерживая различные сценарии применения
Open-Weights
Текст → видеоFlexiAct, совместно разработанный Университетом Цинхуа и Tencent ARC Lab, может переносить действия из референсного видео на любое целевое изображение, сохраняя согласованность идентичности
Open-Weights
МультимодальныеStep1X-Edit - это мощный фреймворк редактирования изображений с открытым исходным кодом, который поддерживает редактирование изображений через инструкции на естественном языке, предлагая возможности, подобные GPT-4o и Gemini2 Flash。
Open-Weights
ИнпейнтингFlex.2-preview - это модель диффузии текст-в-изображение с открытым исходным кодом с универсальным контролем и встроенными возможностями инпейнтинга, предоставляющая создателям более мощные инструменты генерации изображений
Open-Weights
Изображение → видеоSand AI открыл исходный код MAGI-1, авторегрессивной модели, которая генерирует видео по частям, предлагая версии с 24B и 4.5B параметрами и поддерживая множественные режимы генерации видео
Open-Weights
Изображение → видеоSkyworkAI выпускает новую модель генерации видео с открытым исходным кодом SkyReels-V2, поддерживающую видео бесконечной длины с возможностями текст-в-видео и изображение-в-видео
Open-Weights
Синтез речиNari Labs представляет модель преобразования текста в речь с открытым исходным кодом Dia 1.6B, способную генерировать многохарактерные диалоги напрямую из текста с эмоциями и невербальной коммуникацией
Open-Weights
МультимодальныеКоманда SkyReels Kunlun Wanwei выпускает и открывает исходный код SkyReels-V2, первой в мире модели генерации фильмов бесконечной длины, использующей фреймворк Diffusion Forcing, способной производить высококачественный, длительный видеоконтент
Open-Weights
Текст → изображениеShakker Labs запускает новую модель FLUX.1-dev-ControlNet-Union-Pro-2.0 с оптимизированными эффектами контроля, поддержкой множественных режимов контроля и меньшим размером модели
Open-Weights