Новости ComfyUI и релизы открытого ИИ

Новости экосистемы ComfyUI: релизы открытых моделей, пользовательские ноды, рабочие процессы и инструменты для генерации изображений, видео и аудио.

Синтез речи
Базовая модель
Higgs TTS 3: Многоязычная модель речи от Boson AI с 4 млрд параметров и поддержкой более 100 языков

Higgs TTS 3: это модель преобразования текста в речь с 4 млрд параметров, поддерживающая более 100 языков, с клонированием голоса без обучения, выразительным контролем эмоций и встроенными эффектами просодии и звуков для голосовых агентов.

Open-Weights

Текст → видео
Fine-tune
Sulphur 2: модель генерации видео на 9B параметров на основе LTX 2.3

Sulphur 2 — это созданная сообществом доработка LTX 2.3, предлагающая генерацию видео из текста и изображения со встроенным улучшателем промптов и дистиллированной LoRA, обученная на 125K+ отобранных клипов.

Open-Weights

Мультимодальные

OpenMOSS выпускает MOVA - модель синхронизированной генерации видео и аудио с открытым исходным кодом

Мультимодальные
Базовая модель
OpenMOSS выпускает MOVA - модель синхронизированной генерации видео и аудио с открытым исходным кодом

Команда OpenMOSS выпускает MOVA (MOSS Video and Audio) - фундаментальную модель сквозной синхронизированной генерации видео и аудио, которая генерирует видео и аудио за один проход вывода, обеспечивая точную синхронизацию губ и осознанные окружением звуковые эффекты, полностью открывая веса модели, код обучения и вывода

Open-Weights

Текст → изображение

Alibaba Tongyi Lab Выпускает Z-Image-Base - Недистиллированная Высококачественная Модель Генерации Изображений

Текст → изображение
Базовая модель
Alibaba Tongyi Lab Выпускает Z-Image-Base - Недистиллированная Высококачественная Модель Генерации Изображений

Alibaba Tongyi Lab выпускает Z-Image-Base, недистиллированную базовую модель серии Z-Image, сохраняющую полный генеративный потенциал и предоставляющую идеальную основу для тонкой настройки сообществом и индивидуальной разработки

Open-Weights

Мультимодальные

DeepSeek выпускает DeepSeek-OCR-2 - модель понимания документов с визуальным причинным потоком

Мультимодальные
Базовая модель
DeepSeek выпускает DeepSeek-OCR-2 - модель понимания документов с визуальным причинным потоком

DeepSeek публикует в открытом доступе DeepSeek-OCR-2, представляя новый визуальный кодировщик DeepEncoder V2, который имитирует логику человеческого чтения через механизм визуального причинного потока, достигая точности 91.09% на OmniDocBench v1.5

Open-Weights

Мультимодальные

Moonshot AI выпускает Kimi K2.5 - нативную мультимодальную агентную модель с 1T параметрами

Мультимодальные
Базовая модель
Moonshot AI выпускает Kimi K2.5 - нативную мультимодальную агентную модель с 1T параметрами

Moonshot AI официально выпускает Kimi K2.5, нативную мультимодальную агентную модель с 1T параметрами, предварительно обученную на примерно 15 триллионах смешанных визуальных и текстовых токенов, поддерживающую понимание изображений и видео с механизмом автономной совместной работы Agent Swarm

Open-Weights

Синтез речи

Alibaba Qwen выпускает Qwen3-TTS - модель синтеза речи со сверхнизкой задержкой 97мс

Синтез речи
Базовая модель
Alibaba Qwen выпускает Qwen3-TTS - модель синтеза речи со сверхнизкой задержкой 97мс

Alibaba Qwen публикует в открытом доступе серию моделей генерации голоса Qwen3-TTS, достигая сверхнизкой задержки 97мс через моделирование Dual-Track, поддерживая клонирование голоса за 3 секунды и дизайн голоса на естественном языке, охватывая 10 основных языков

Open-Weights

Распознавание речи

Microsoft выпускает VibeVoice-ASR - модель распознавания речи с поддержкой обработки 60-минутного длинного аудио за один проход

Распознавание речи
Базовая модель
Microsoft выпускает VibeVoice-ASR - модель распознавания речи с поддержкой обработки 60-минутного длинного аудио за один проход

Microsoft публикует в открытом доступе VibeVoice-ASR, унифицированную модель распознавания речи с 9B параметрами, способную обрабатывать до 60 минут аудио за один проход, совместно завершая распознавание, диаризацию говорящих и генерацию временных меток в одном процессе вывода

Open-Weights

Мультимодальные

NVIDIA выпускает PersonaPlex-7B-v1 - модель полнодуплексного голосового диалога

Мультимодальные
Базовая модель
NVIDIA выпускает PersonaPlex-7B-v1 - модель полнодуплексного голосового диалога

NVIDIA публикует в открытом доступе PersonaPlex-7B-v1, модель полнодуплексного голосового диалога с 7 миллиардами параметров на основе архитектуры Moshi, поддерживающую одновременное прослушивание и речь, естественные прерывания и настройку ролей с задержкой ответа на прерывания всего 240 миллисекунд

Open-Weights

Текст → видео
LoRA
SVI 2.0 Pro Выпущен - Генерация Видео Бесконечной Длительности с Поддержкой Wan 2.2

Stable Video Infinity 2.0 Pro официально выпущен, добавлена поддержка базовой модели Wan 2.2, предоставляются версии HIGH и LOW моделей LoRA для генерации видеоконтента бесконечной длины в ComfyUI

Редактирование изображений
Базовая модель
Выпущен Qwen-Image-Layered - Модель генерации изображений с поддержкой редактирования по слоям

Qwen-Image-Layered может разлагать изображения на несколько RGBA слоев, каждый слой можно редактировать независимо, не затрагивая другой контент, поддерживая операции перекрашивания, замены, удаления, изменения размера и перемещения

Open-Weights

Изображение → 3D
Базовая модель
Microsoft Выпускает TRELLIS.2 - Модель Генерации Изображения в 3D с 4 Миллиардами Параметров

Microsoft представляет TRELLIS.2, большую генеративную 3D модель с 4 миллиардами параметров, которая преобразует изображения в высококачественные 3D-ресурсы за секунды, с полными PBR материалами и поддержкой сложных топологий

Open-Weights

Текст → видео

TurboDiffusion выпускает фреймворк ускорения генерации видео

Текст → видео
Инструмент
TurboDiffusion выпускает фреймворк ускорения генерации видео

Команда Университета Цинхуа выпускает в открытый доступ TurboDiffusion, фреймворк ускорения генерации видео, который достигает 100-205x ускорения сквозной генерации диффузии на одной RTX 5090 при сохранении качества видео

Текст → изображение

Alibaba Cloud PAI выпускает Z-Image-Turbo-Fun-Controlnet-Union - Модель ControlNet с множественными условиями

Текст → изображение
ControlNet
Alibaba Cloud PAI выпускает Z-Image-Turbo-Fun-Controlnet-Union - Модель ControlNet с множественными условиями

Команда Alibaba Cloud PAI выпускает Z-Image-Turbo-Fun-Controlnet-Union, модель ControlNet с поддержкой нескольких условий управления, включая Canny, HED, Depth, Pose и MLSD, обученная на разрешении 1328

Open-Weights

Текст → изображение
Базовая модель
Alibaba AIDC-AI выпускает Ovis-Image — модель генерации изображений 7B, оптимизированную для рендеринга текста

Команда AIDC-AI от Alibaba выпустила Ovis-Image — модель преобразования текста в изображение с 7B параметрами, специализирующуюся на высококачественном рендеринге текста и показывающую отличные результаты на нескольких бенчмарках

Open-Weights

Текст → изображение

Alibaba Tongyi Lab выпустила Z-Image-Turbo — эффективную модель генерации изображений с 6B параметрами

Текст → изображение
Turbo
Alibaba Tongyi Lab выпустила Z-Image-Turbo — эффективную модель генерации изображений с 6B параметрами

Alibaba Tongyi Lab выпустила Z-Image-Turbo — эффективную модель генерации изображений с 6B параметрами, которая создаёт качественные изображения всего за 8 шагов сэмплирования и работает на потребительских GPU с 16 ГБ видеопамяти

Open-Weights

Мультимодальные
Базовая модель
ByteDance представляет Sa2VA: Первую универсальную модель понимания изображений и видео

ByteDance представляет мультимодельную модель Sa2VA, объединяющую технологии SAM2 и LLaVA для достижения плотной сегментации и визуального ответа на вопросы как для изображений, так и для видео, достигая наилучших результатов в нескольких основных тестах

Open-Weights

Текст → изображение

Tencent открывает исходный код Hunyuan Image 3.0 - крупнейшая в мире модель генерации изображений из текста с открытым исходным кодом

Текст → изображение
Базовая модель
Tencent открывает исходный код Hunyuan Image 3.0 - крупнейшая в мире модель генерации изображений из текста с открытым исходным кодом

Tencent выпускает Hunyuan Image 3.0, первую коммерчески применимую нативную мультимодальную модель генерации изображений с открытым исходным кодом с общим количеством 80 млрд. параметров, обладающую возможностями рассуждения на основе мировых знаний и поддерживающую сложное понимание смысла на тысячах символов

Open-Weights

Экосистема

Nunchaku выпускает 4-битную модель Qwen-Image-Edit-2509 Lightning

Экосистема
Инструмент
Nunchaku выпускает 4-битную модель Qwen-Image-Edit-2509 Lightning

Команда Nunchaku выпускает оптимизированную версию 4-битной модели Qwen-Image-Edit-2509 Lightning, поддерживающую быструю инференцию за 4/8 шагов, плавно работающую в среде с 8 ГБ видеопамяти

Анимация персонажей

Alibaba выпустила модель Wan-Animate - Единая технология анимации и замены персонажей

Анимация персонажей
Инструмент
Alibaba выпустила модель Wan-Animate - Единая технология анимации и замены персонажей

Лаборатория Tongyi от Alibaba запускает Wan-Animate, единый фреймворк анимации персонажей на базе Wan2.2, поддерживающий генерацию анимации персонажей и замену персонажей в видео, с открытыми весами модели и кодом вывода

Open-Weights