SenseNova-U1.5: генерация и редактирование изображений 4K от SenseTime

ComfyUI Wikinews

SenseNova-U1.5-8B-MoT-Preview от SenseTime дает генерацию изображений 4K по тексту и более мощное редактирование в одной модели, с поддержкой ComfyUI через ноды SenseNova_U1

SenseTime выпустила в открытый доступ SenseNova-U1.5-8B-MoT (Preview). Это последняя модель в ее U-серии нативно унифицированных мультимодальных моделей. Построенная на архитектуре NEO-unify, предварительная версия сосредоточена на генерации и редактировании изображений: она может генерировать по тексту изображения вплоть до нативного разрешения 4K и следовать детальным инструкциям по редактированию одного или нескольких референсных изображений.

Обзорный тизер SenseNova-U1.5

Обзор технических улучшений в SenseNova-U1.5 (Preview)

Релиз продолжает оригинальную серию SenseNova-U1 и поставляется вместе с открытым лаунчером предварительного обучения и файлами конфигурации. Веса доступны на Hugging Face и ModelScope.

Улучшения в U1.5

От попатчевого предсказания к совместной реконструкции патчей

Оригинальная U1 реконструирует каждый RGB-патч независимо с помощью MLP-головы, из-за чего границы токенов могут проявляться в виде сетчатого паттерна при высоком разрешении. В U1.5 применяется прогрессивная пространственная реконструкция через ConvDecoder: визуальные токены преобразуются в 2D-сетку признаков и проходят апскейл через несколько стадий Pixel Shuffle, а промежуточные свертки 3x3 позволяют соседним патчам взаимодействовать и сливаться в непрерывное изображение. Это существенно подавляет сетчатые артефакты и повышает устойчивость при последующем дообучении (fine-tuning).

От следования инструкциям к сохранению визуальной информации

U1.5 тщательно очищает, фильтрует и синтезирует свой корпус данных для редактирования изображений, улучшая баланс между китайским и английским языками и расширяя охват сценариев как с одним, так и с несколькими референсными изображениями. Архитектура без энкодера обеспечивает уверенное следование инструкциям, а также сохранение идентичности объекта и структуры, используя только одну последовательность токенов референсных изображений.

От привязки к формату к обобщению между задачами

Хотя корпуса генерации и редактирования содержат только простые промпты в формате JSON, U1.5 хорошо обобщается на длинные и структурированные инструкции: это признак того, что нативное унифицированное мультимодальное моделирование способно переносить навыки понимания и визуального планирования между задачами без специального обучения на промпт-шаблонах.

Демонстрация: генерация изображений по тексту

Винтажная реклама колы, сгенерированная в высоком разрешении

Детализированный ретро-постер, сгенерированный SenseNova-U1.5: плотный рендеринг текста и сложное управление компоновкой

Сцена с морскими черепахами под водой

Фотореалистичная подводная сцена с тонкой проработкой текстур и освещения

Демонстрация: редактирование изображений

Пример редактирования почтового отправления Пример редактирования изображения с океанской волной

Примеры редактирования: перенос стиля, сохранение идентичности объекта и изменения с контролем по областям

Основные результаты бенчмарков

На бенчмарке Qwen-Image Bench U1.5-Preview превосходит оригинальную U1 во всех категориях, с наибольшим приростом в эстетике и согласованности. С включенным Prompt Enhance (PE) предварительная версия набирает 55.17 (EN) / 55.22 (ZH) в общем зачете, что близко к результату Qwen Image 2 в той же оценке.

В редактировании изображений U1.5-Preview достигает 4.37 в общем зачете ImgEdit-Bench (против 3.90 у U1) и 6.852 в среднем на WeEdit, превосходя Qwen-Image-2, FireRed-Image-Edit и LongCat-Image-Edit в опубликованном сравнении.

Поддержка ComfyUI

Разработчик из сообщества smthemex добавил поддержку U1.5 в пакет пользовательских нод ComfyUI_SenseNova_U1, охватывающий форматы весов GGUF, INT8 и FP8 (см. smthem/SenseNova-U1-8B-MoT-Merger-gguf). Пакет также поддерживает MoE-варианты A3B-MoT, 8-шаговую LoRA и чекпойнты Infographic-V3.

Предпросмотр рабочего процесса SenseNova-U1.5 в ComfyUI

Нажмите, чтобы увеличить. Пакет пользовательских нод поставляется с готовыми к запуску примерами рабочих процессов для text-to-image и image-to-image.

Чтобы запустить его локально, установите пользовательскую ноду и поместите квантованные веса в ComfyUI/models/gguf/ или ComfyUI/models/diffusion_models/:

cd ComfyUI/custom_nodes
git clone https://github.com/smthemex/ComfyUI_SenseNova_U1
pip install -r ComfyUI_SenseNova_U1/requirements.txt

Доступность

Для официального инференса на Python используйте cfg_scale=4.0, timestep_shift=3.0 и num_steps=50 с референсной реализацией. SenseNova также предоставляет опциональные инструменты Prompt Enhance (PE) и поиска референсных изображений, позволяющие еще больше повысить качество генерации.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
SenseNova-U1.5: генерация и редактирование изображений 4K от SenseTime | ComfyUI Wiki