SenseNova-U1.5: generación y edición de imágenes 4K de SenseTime
El SenseNova-U1.5-8B-MoT-Preview de SenseTime ofrece generación de imagen 4K por texto y edición más sólida en un modelo unificado, con soporte ComfyUI vía el nodo SenseNova_U1.
SenseTime ha publicado como código abierto SenseNova-U1.5-8B-MoT (Vista Previa), el último modelo de su serie U de modelos multimodales nativamente unificados. Construido sobre la arquitectura NEO-unify, la vista previa se centra en la generación y edición de imágenes: puede generar hasta imágenes nativas en 4K a partir de texto y seguir instrucciones de edición detalladas sobre una o múltiples imágenes de referencia.
Resumen de los avances técnicos de SenseNova-U1.5 (Vista Previa)
La publicación sigue a la serie original SenseNova-U1 y se distribuye junto con el lanzador de preentrenamiento de código abierto y los archivos de configuración. Los pesos están disponibles en Hugging Face y ModelScope.
Lo que mejora U1.5
De la predicción por parches a la reconstrucción conjunta de parches
El U1 original reconstruye cada parche RGB de forma independiente con una cabeza MLP, lo que puede exponer los límites de los tokens como patrones de cuadrícula en alta resolución. U1.5 adopta una reconstrucción espacial progresiva mediante un ConvDecoder: los tokens visuales se reforman en una cuadrícula de características 2D y se sobremuestrean a través de múltiples etapas de Pixel Shuffle, con convoluciones intermedias de 3x3 que permiten que los parches vecinos interactúen y se fusionen en una imagen continua. Esto suprime sustancialmente los artefactos similares a cuadrículas y mejora la robustez durante el ajuste fino posterior.
Del seguimiento de instrucciones a la preservación visual
U1.5 limpia, filtra y sintetiza exhaustivamente su corpus de edición de imágenes, mejorando el equilibrio entre chino e inglés y ampliando la cobertura tanto de configuraciones de referencia de imagen única como de múltiples imágenes. La arquitectura sin codificador logra un fuerte seguimiento de instrucciones junto con la preservación de la identidad del sujeto y de la estructura utilizando solo una secuencia única de tokens de imagen de referencia.
De la exposición al formato a la generalización entre tareas
Aunque los corpus de generación y edición contienen solo indicaciones simples con formato JSON, U1.5 se generaliza bien a instrucciones largas y estructuradas, una señal de que el modelado multimodal unificado nativo puede transferir habilidades de comprensión y planificación visual entre tareas sin un entrenamiento dedicado de plantillas de indicaciones.
Demostración: Generación de Texto a Imagen
Un detallado cartel publicitario retro generado por SenseNova-U1.5, que muestra renderizado denso de texto y control complejo del diseño
Una escena submarina fotorrealista con textura fina y detalles de iluminación
Demostración: Edición de Imágenes
Ejemplos de edición que cubren transferencia de estilo, preservación de la identidad del sujeto y cambios controlables por región
Aspectos Destacados de los Benchmarks
En Qwen-Image Bench, U1.5-Preview mejora con respecto al U1 original en todas las categorías, con las mayores ganancias en estética y alineación. Con Prompt Enhance (PE) habilitado, la vista previa obtiene 55.17 (EN) / 55.22 (ZH) en general, cerca de Qwen Image 2 en la misma evaluación.
En la edición de imágenes, U1.5-Preview alcanza 4.37 en ImgEdit-Bench en general (frente a 3.90 para U1) y un promedio de 6.852 en WeEdit, superando a Qwen-Image-2, FireRed-Image-Edit y LongCat-Image-Edit en la comparación reportada.
Soporte de ComfyUI
El desarrollador de la comunidad smthemex ha añadido soporte para U1.5 al paquete de nodos personalizado ComfyUI_SenseNova_U1, que cubre los formatos de pesos GGUF, INT8 y FP8 (consulta smthem/SenseNova-U1-8B-MoT-Merger-gguf). El paquete también es compatible con las variantes MoE A3B-MoT, el LoRA de 8 pasos y los checkpoints Infographic-V3.
Haz clic para ampliar. El paquete de nodos personalizado incluye flujos de trabajo de ejemplo listos para usar para generación de texto a imagen y de imagen a imagen.
Para ejecutarlo localmente, instala el nodo personalizado y coloca los pesos cuantizados en ComfyUI/models/gguf/ o ComfyUI/models/diffusion_models/:
cd ComfyUI/custom_nodes
git clone https://github.com/smthemex/ComfyUI_SenseNova_U1
pip install -r ComfyUI_SenseNova_U1/requirements.txtDisponibilidad
- Pesos del modelo: sensenova/SenseNova-U1.5-8B-MoT-Preview en Hugging Face y SenseNova-U1.5-8B-MoT-Preview en ModelScope
- Código: OpenSenseNova/SenseNova-U1 (inferencia, entrenamiento y herramientas de PE)
- Paper: arXiv 2605.12500
- Nodo de ComfyUI: smthemex/ComfyUI_SenseNova_U1
Para la inferencia oficial en Python, usa cfg_scale=4.0, timestep_shift=3.0 y num_steps=50 con la implementación de referencia. SenseNova también proporciona herramientas opcionales de Prompt Enhance (PE) y recuperación de imágenes de referencia para llevar la calidad de generación aún más lejos.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.