SenseNova-U1.5: generación y edición de imágenes 4K de SenseTime

ComfyUI Wikinews

El SenseNova-U1.5-8B-MoT-Preview de SenseTime ofrece generación de imagen 4K por texto y edición más sólida en un modelo unificado, con soporte ComfyUI vía el nodo SenseNova_U1.

SenseTime ha publicado como código abierto SenseNova-U1.5-8B-MoT (Vista Previa), el último modelo de su serie U de modelos multimodales nativamente unificados. Construido sobre la arquitectura NEO-unify, la vista previa se centra en la generación y edición de imágenes: puede generar hasta imágenes nativas en 4K a partir de texto y seguir instrucciones de edición detalladas sobre una o múltiples imágenes de referencia.

Vista general de SenseNova-U1.5

Resumen de los avances técnicos de SenseNova-U1.5 (Vista Previa)

La publicación sigue a la serie original SenseNova-U1 y se distribuye junto con el lanzador de preentrenamiento de código abierto y los archivos de configuración. Los pesos están disponibles en Hugging Face y ModelScope.

Lo que mejora U1.5

De la predicción por parches a la reconstrucción conjunta de parches

El U1 original reconstruye cada parche RGB de forma independiente con una cabeza MLP, lo que puede exponer los límites de los tokens como patrones de cuadrícula en alta resolución. U1.5 adopta una reconstrucción espacial progresiva mediante un ConvDecoder: los tokens visuales se reforman en una cuadrícula de características 2D y se sobremuestrean a través de múltiples etapas de Pixel Shuffle, con convoluciones intermedias de 3x3 que permiten que los parches vecinos interactúen y se fusionen en una imagen continua. Esto suprime sustancialmente los artefactos similares a cuadrículas y mejora la robustez durante el ajuste fino posterior.

Del seguimiento de instrucciones a la preservación visual

U1.5 limpia, filtra y sintetiza exhaustivamente su corpus de edición de imágenes, mejorando el equilibrio entre chino e inglés y ampliando la cobertura tanto de configuraciones de referencia de imagen única como de múltiples imágenes. La arquitectura sin codificador logra un fuerte seguimiento de instrucciones junto con la preservación de la identidad del sujeto y de la estructura utilizando solo una secuencia única de tokens de imagen de referencia.

De la exposición al formato a la generalización entre tareas

Aunque los corpus de generación y edición contienen solo indicaciones simples con formato JSON, U1.5 se generaliza bien a instrucciones largas y estructuradas, una señal de que el modelado multimodal unificado nativo puede transferir habilidades de comprensión y planificación visual entre tareas sin un entrenamiento dedicado de plantillas de indicaciones.

Demostración: Generación de Texto a Imagen

Anuncio vintage de cola generado en alta resolución

Un detallado cartel publicitario retro generado por SenseNova-U1.5, que muestra renderizado denso de texto y control complejo del diseño

Escena submarina de tortugas marinas

Una escena submarina fotorrealista con textura fina y detalles de iluminación

Demostración: Edición de Imágenes

Ejemplo de edición de correo postal Ejemplo de edición de personaje en ola oceánica

Ejemplos de edición que cubren transferencia de estilo, preservación de la identidad del sujeto y cambios controlables por región

Aspectos Destacados de los Benchmarks

En Qwen-Image Bench, U1.5-Preview mejora con respecto al U1 original en todas las categorías, con las mayores ganancias en estética y alineación. Con Prompt Enhance (PE) habilitado, la vista previa obtiene 55.17 (EN) / 55.22 (ZH) en general, cerca de Qwen Image 2 en la misma evaluación.

En la edición de imágenes, U1.5-Preview alcanza 4.37 en ImgEdit-Bench en general (frente a 3.90 para U1) y un promedio de 6.852 en WeEdit, superando a Qwen-Image-2, FireRed-Image-Edit y LongCat-Image-Edit en la comparación reportada.

Soporte de ComfyUI

El desarrollador de la comunidad smthemex ha añadido soporte para U1.5 al paquete de nodos personalizado ComfyUI_SenseNova_U1, que cubre los formatos de pesos GGUF, INT8 y FP8 (consulta smthem/SenseNova-U1-8B-MoT-Merger-gguf). El paquete también es compatible con las variantes MoE A3B-MoT, el LoRA de 8 pasos y los checkpoints Infographic-V3.

Vista previa del flujo de trabajo de SenseNova-U1.5 en ComfyUI

Haz clic para ampliar. El paquete de nodos personalizado incluye flujos de trabajo de ejemplo listos para usar para generación de texto a imagen y de imagen a imagen.

Para ejecutarlo localmente, instala el nodo personalizado y coloca los pesos cuantizados en ComfyUI/models/gguf/ o ComfyUI/models/diffusion_models/:

cd ComfyUI/custom_nodes
git clone https://github.com/smthemex/ComfyUI_SenseNova_U1
pip install -r ComfyUI_SenseNova_U1/requirements.txt

Disponibilidad

Para la inferencia oficial en Python, usa cfg_scale=4.0, timestep_shift=3.0 y num_steps=50 con la implementación de referencia. SenseNova también proporciona herramientas opcionales de Prompt Enhance (PE) y recuperación de imágenes de referencia para llevar la calidad de generación aún más lejos.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
SenseNova-U1.5: generación y edición de imágenes 4K de SenseTime | ComfyUI Wiki