SenseNova-U1.5: генерация и редактирование изображений 4K от SenseTime
SenseNova-U1.5-8B-MoT-Preview от SenseTime дает генерацию изображений 4K по тексту и более мощное редактирование в одной модели, с поддержкой ComfyUI через ноды SenseNova_U1
SenseTime выпустила в открытый доступ SenseNova-U1.5-8B-MoT (Preview). Это последняя модель в ее U-серии нативно унифицированных мультимодальных моделей. Построенная на архитектуре NEO-unify, предварительная версия сосредоточена на генерации и редактировании изображений: она может генерировать по тексту изображения вплоть до нативного разрешения 4K и следовать детальным инструкциям по редактированию одного или нескольких референсных изображений.
Обзор технических улучшений в SenseNova-U1.5 (Preview)
Релиз продолжает оригинальную серию SenseNova-U1 и поставляется вместе с открытым лаунчером предварительного обучения и файлами конфигурации. Веса доступны на Hugging Face и ModelScope.
Улучшения в U1.5
От попатчевого предсказания к совместной реконструкции патчей
Оригинальная U1 реконструирует каждый RGB-патч независимо с помощью MLP-головы, из-за чего границы токенов могут проявляться в виде сетчатого паттерна при высоком разрешении. В U1.5 применяется прогрессивная пространственная реконструкция через ConvDecoder: визуальные токены преобразуются в 2D-сетку признаков и проходят апскейл через несколько стадий Pixel Shuffle, а промежуточные свертки 3x3 позволяют соседним патчам взаимодействовать и сливаться в непрерывное изображение. Это существенно подавляет сетчатые артефакты и повышает устойчивость при последующем дообучении (fine-tuning).
От следования инструкциям к сохранению визуальной информации
U1.5 тщательно очищает, фильтрует и синтезирует свой корпус данных для редактирования изображений, улучшая баланс между китайским и английским языками и расширяя охват сценариев как с одним, так и с несколькими референсными изображениями. Архитектура без энкодера обеспечивает уверенное следование инструкциям, а также сохранение идентичности объекта и структуры, используя только одну последовательность токенов референсных изображений.
От привязки к формату к обобщению между задачами
Хотя корпуса генерации и редактирования содержат только простые промпты в формате JSON, U1.5 хорошо обобщается на длинные и структурированные инструкции: это признак того, что нативное унифицированное мультимодальное моделирование способно переносить навыки понимания и визуального планирования между задачами без специального обучения на промпт-шаблонах.
Демонстрация: генерация изображений по тексту
Детализированный ретро-постер, сгенерированный SenseNova-U1.5: плотный рендеринг текста и сложное управление компоновкой
Фотореалистичная подводная сцена с тонкой проработкой текстур и освещения
Демонстрация: редактирование изображений
Примеры редактирования: перенос стиля, сохранение идентичности объекта и изменения с контролем по областям
Основные результаты бенчмарков
На бенчмарке Qwen-Image Bench U1.5-Preview превосходит оригинальную U1 во всех категориях, с наибольшим приростом в эстетике и согласованности. С включенным Prompt Enhance (PE) предварительная версия набирает 55.17 (EN) / 55.22 (ZH) в общем зачете, что близко к результату Qwen Image 2 в той же оценке.
В редактировании изображений U1.5-Preview достигает 4.37 в общем зачете ImgEdit-Bench (против 3.90 у U1) и 6.852 в среднем на WeEdit, превосходя Qwen-Image-2, FireRed-Image-Edit и LongCat-Image-Edit в опубликованном сравнении.
Поддержка ComfyUI
Разработчик из сообщества smthemex добавил поддержку U1.5 в пакет пользовательских нод ComfyUI_SenseNova_U1, охватывающий форматы весов GGUF, INT8 и FP8 (см. smthem/SenseNova-U1-8B-MoT-Merger-gguf). Пакет также поддерживает MoE-варианты A3B-MoT, 8-шаговую LoRA и чекпойнты Infographic-V3.
Нажмите, чтобы увеличить. Пакет пользовательских нод поставляется с готовыми к запуску примерами рабочих процессов для text-to-image и image-to-image.
Чтобы запустить его локально, установите пользовательскую ноду и поместите квантованные веса в ComfyUI/models/gguf/ или ComfyUI/models/diffusion_models/:
cd ComfyUI/custom_nodes
git clone https://github.com/smthemex/ComfyUI_SenseNova_U1
pip install -r ComfyUI_SenseNova_U1/requirements.txtДоступность
- Веса модели: sensenova/SenseNova-U1.5-8B-MoT-Preview на Hugging Face и SenseNova-U1.5-8B-MoT-Preview на ModelScope
- Код: OpenSenseNova/SenseNova-U1 (инференс, обучение и инструменты PE)
- Статья: arXiv 2605.12500
- Нода ComfyUI: smthemex/ComfyUI_SenseNova_U1
Для официального инференса на Python используйте cfg_scale=4.0, timestep_shift=3.0 и num_steps=50 с референсной реализацией. SenseNova также предоставляет опциональные инструменты Prompt Enhance (PE) и поиска референсных изображений, позволяющие еще больше повысить качество генерации.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.