Новости ComfyUI и релизы открытого ИИ

Новости экосистемы ComfyUI: релизы открытых моделей, пользовательские ноды, рабочие процессы и инструменты для генерации изображений, видео и аудио.

Изображение → 3D
Базовая модель
Tencent выпускает Hunyuan3D 2.0 - инновационная система генерации 3D активов

Tencent запускает систему Hunyuan3D 2.0 с двухэтапным процессом для генерации высококачественных 3D моделей, включая несколько серий моделей с открытым исходным кодом, которые поддерживают создание высокоразрешающих 3D активов из текста и изображений

Open-Weights

Текст → видео

Kuaishou запускает технологию ReCamMaster для перекадрирования моноскопического видео

Текст → видео
Базовая модель
Kuaishou запускает технологию ReCamMaster для перекадрирования моноскопического видео

Kuaishou Technology запустила ReCamMaster, технологию генеративного видео, которая позволяет пользователям создавать новые перспективы камеры и пути движения из одного видео.

Open-Weights

Текст → видео
Базовая модель
Выпущен Open-Sora 2.0: коммерческая генерация видео по низкой цене

LuChen Technology выпускает Open-Sora 2.0, модель генерации видео с открытым исходным кодом, достигая производительности, близкой к топовым коммерческим моделям, всего за $200,000 в затратах на обучение

Open-Weights

Текст → видео

Лаборатория Ali Tongyi выпускает VACE: универсальная модель для создания и редактирования видео

Текст → видео
Инструмент
Лаборатория Ali Tongyi выпускает VACE: универсальная модель для создания и редактирования видео

Лаборатория Ali Tongyi запускает многофункциональную модель создания и редактирования видео VACE, интегрирующую различные задачи обработки видео в единую платформу для снижения порога видеотворчества

Open-Weights

Текст → изображение

Microsoft выпускает технологию ART для генерации многослойных прозрачных изображений

Текст → изображение
Исследования
Microsoft выпускает технологию ART для генерации многослойных прозрачных изображений

Microsoft Research представляет интеллектуальную многослойную генерацию на основе глобальных текстовых подсказок, поддерживающую создание прозрачных изображений с 50+ независимыми слоями

Open-Weights

Изображение → видео
LoRA
Tencent открывает исходный код модели HunyuanVideo-I2V для преобразования изображений в видео

Команда Hunyuan Tencent выпускает модель с открытым исходным кодом для генерации 5-секундных видео из одиночных изображений, с интеллектуальной генерацией движения и пользовательскими эффектами

Open-Weights

Мультимодальные
Базовая модель
Alibaba открывает исходный код ViDoRAG - интеллектуального инструмента анализа документов

Alibaba представляет систему анализа документов, способную понимать как текст, так и изображения, улучшая эффективность обработки сложных документов более чем на 10%

Open-Weights

Текст → изображение
Базовая модель
THUDM открывает исходный код CogView4 — DiT-модель генерации изображений с поддержкой китайского языка

THUDM выпускает модель генерации изображений CogView4 с открытым исходным кодом и нативной поддержкой китайского языка, лидирующую в нескольких бенчмарках

Open-Weights

Текст → видео

Модель генерации видео Wan2.1 от Alibaba официально открыта

Текст → видео
Базовая модель
Модель генерации видео Wan2.1 от Alibaba официально открыта

Alibaba официально открыла исходный код своей последней модели генерации видео Wan2.1, которая может работать всего с 8GB видеопамяти, поддерживая генерацию видео высокой четкости, динамические субтитры и многоязычное дублирование, превосходя модели как Sora с общим баллом 86.22% в таблице лидеров VBench

Open-Weights

Текст → изображение

Alibaba выпускает ComfyUI Copilot: ИИ-управляемый интеллектуальный помощник рабочих процессов

Текст → изображение
Инструмент
Alibaba выпускает ComfyUI Copilot: ИИ-управляемый интеллектуальный помощник рабочих процессов

Группа международной цифровой коммерции Alibaba (AIDC-AI) выпускает плагин ComfyUI Copilot, упрощающий пользовательский опыт ComfyUI через естественное языковое взаимодействие и ИИ-управляемую функциональность, поддерживая китайское взаимодействие и предлагая интеллектуальные рекомендации узлов и другие функции

Open-Weights

Текст → видео

Модель генерации видео WanX 2.1 от Alibaba будет открыта

Текст → видео
Базовая модель
Модель генерации видео WanX 2.1 от Alibaba будет открыта

Alibaba объявила, что ее последняя модель генерации видео WanX 2.1 будет открыта во втором квартале 2025 года, поддерживая генерацию видео высокой четкости, динамические субтитры и многоязычное дублирование, занимая первое место в таблице лидеров VBench с общим баллом 84.7%

Open-Weights

Мультимодальные
Базовая модель
Google выпускает PaliGemma 2 Mix: открытая визуально-языковая модель с поддержкой множества задач

Google представляет новую модель PaliGemma 2 mix, поддерживающую различные визуальные задачи, включая описание изображений, OCR, детекцию объектов, с версиями на 3B, 10B и 28B параметров

Open-Weights

Изображение → видео

Skywork открывает исходный код SkyReels-V1: модель генерации видео для создания ИИ-короткометражек

Изображение → видео
Базовая модель
Skywork открывает исходный код SkyReels-V1: модель генерации видео для создания ИИ-короткометражек

Skywork открыл исходный код своей последней модели генерации видео SkyReels-V1, которая поддерживает генерацию из текста в видео и из изображения в видео, с кинематографическими эффектами освещения и естественным представлением движения, и теперь доступна для коммерческого использования.

Open-Weights

Редактирование видео

Light-A-Video - технология переосвещения видео без обучения

Редактирование видео
Исследования
Light-A-Video - технология переосвещения видео без обучения

Исследователи предложили новый метод переосвещения видео Light-A-Video, который достигает временно плавных эффектов переосвещения видео через Consistent Light Attention (CLA) и Progressive Light Fusion (PLF).

Open-Weights

Текст → видео

StepFun выпускает Step-Video-T2V: модель генерации видео из текста с 300 миллиардами параметров

Текст → видео
Turbo
StepFun выпускает Step-Video-T2V: модель генерации видео из текста с 300 миллиардами параметров

StepFun выпустил модель генерации видео из текста Step-Video-T2V с открытым исходным кодом, которая имеет 300 миллиардов параметров, поддерживает генерацию высококачественных видео до 204 кадров и предоставляет платформу для онлайн-опыта

Open-Weights

Экосистема

Alibaba открывает исходный код InspireMusic: инновационная платформа для генерации музыки, песен и аудио

Экосистема
Инструмент
Alibaba открывает исходный код InspireMusic: инновационная платформа для генерации музыки, песен и аудио

Последний проект Alibaba с открытым исходным кодом — InspireMusic, единая платформа для генерации аудио на базе FunAudioLLM, поддерживающая создание музыки, песен и различные задачи синтеза звука.

Open-Weights

Текст → изображение
Исследования
Alibaba открывает исходный код ACE++: генерация изображений с согласованными персонажами без обучения

Исследовательский институт Alibaba открывает исходный код инструмента генерации изображений ACE++, поддерживающего генерацию изображений с согласованными персонажами из одного входного изображения благодаря технологии контекстно-осознанного заполнения, предлагая онлайн-демо и три специализированные модели.

Open-Weights

Текст → видео

ByteDance выпускает OmniHuman: фреймворк анимации человека следующего поколения

Текст → видео
Инструмент
ByteDance выпускает OmniHuman: фреймворк анимации человека следующего поколения

Исследовательская команда ByteDance выпускает фреймворк анимации человека OmniHuman-1, способный генерировать высококачественные анимации человека из одного изображения и сигналов движения.

Open-Weights