SenseNova-U1.5 : génération et édition d'images 4K par SenseTime
Le SenseNova-U1.5-8B-MoT-Preview de SenseTime propose la génération texte-image 4K et une édition renforcée dans un modèle unifié, avec support ComfyUI via le nœud SenseNova_U1.
SenseTime a publié en open source SenseNova-U1.5-8B-MoT (Preview), le dernier modèle de sa série U de modèles multimodaux nativement unifiés. Conçu sur l'architecture NEO-unify, cet aperçu se concentre sur la génération et l'édition d'images : il peut générer jusqu'à des images 4K natives à partir de texte et suivre des instructions d'édition détaillées sur une ou plusieurs images de référence.
Vue d'ensemble des avancées techniques de SenseNova-U1.5 (Preview)
Cette version fait suite à la série originale SenseNova-U1 et est fournie avec un lanceur de pré-entraînement open source et des fichiers de configuration. Les poids sont disponibles sur Hugging Face et ModelScope.
Ce que U1.5 améliore
De la prédiction par patchs à la reconstruction conjointe de patchs
Le U1 d'origine reconstruit chaque patch RVB indépendamment avec une tête MLP, ce qui peut exposer les limites des tokens sous forme de motifs en grille à haute résolution. U1.5 adopte une reconstruction spatiale progressive via un ConvDecoder : les tokens visuels sont remodelés en une grille de caractéristiques 2D et suréchantillonnés à travers plusieurs étapes de Pixel Shuffle, avec des convolutions 3x3 intermédiaires permettant aux patchs voisins d'interagir et de fusionner en une image continue. Cela supprime considérablement les artefacts de type grille et améliore la robustesse lors du fine-tuning en aval.
Du suivi d'instructions à la préservation visuelle
U1.5 nettoie, filtre et synthétise en profondeur son corpus d'édition d'images, améliorant l'équilibre chinois-anglais et élargissant la couverture des contextes de référence à image unique et multi-images. L'architecture sans encodeur atteint un fort suivi d'instructions ainsi qu'une préservation de l'identité du sujet et de la structure, en utilisant uniquement une seule séquence de tokens d'images de référence.
De l'exposition au format à la généralisation inter-tâches
Bien que les corpus de génération et d'édition ne contiennent que des prompts simples au format JSON, U1.5 se généralise bien aux instructions longues et structurées, un signe que la modélisation multimodale unifiée native peut transférer des compétences de compréhension et de planification visuelle entre les tâches, sans entraînement dédié sur des gabarits de prompts.
Démonstration : Texte vers image
Une affiche publicitaire rétro détaillée générée par SenseNova-U1.5, montrant un rendu de texte dense et un contrôle de mise en page complexe.
Une scène sous-marine photoréaliste avec des détails fins de texture et d'éclairage.
Démonstration : Édition d'images
Exemples d'édition couvrant le transfert de style, la préservation de l'identité du sujet et les modifications contrôlables par région.
Points clés des benchmarks
Sur le Qwen-Image Bench, U1.5-Preview améliore le U1 original dans toutes les catégories, avec les gains les plus importants en esthétique et en alignement. Avec Prompt Enhance (PE) activé, la version d'aperçu obtient un score global de 55.17 (EN) / 55.22 (ZH), proche de Qwen Image 2 dans la même évaluation.
En matière d'édition d'images, U1.5-Preview atteint 4.37 sur ImgEdit-Bench au total (contre 3.90 pour U1) et une moyenne de 6.852 sur WeEdit, surpassant Qwen-Image-2, FireRed-Image-Edit et LongCat-Image-Edit dans la comparaison rapportée.
Prise en charge de ComfyUI
Le développeur de la communauté smthemex a ajouté la prise en charge de U1.5 au pack de nœuds personnalisé ComfyUI_SenseNova_U1, couvrant les formats de poids GGUF, INT8 et FP8 (voir smthem/SenseNova-U1-8B-MoT-Merger-gguf). Le pack prend également en charge les variantes MoE A3B-MoT, la LoRA en 8 étapes et les checkpoints Infographic-V3.
Cliquez pour agrandir. Le pack de nœuds personnalisé est livré avec des exemples de flux de travail prêts à exécuter pour la génération texte vers image et image vers image.
Pour l'exécuter localement, installez le nœud personnalisé et placez les poids quantifiés dans ComfyUI/models/gguf/ ou ComfyUI/models/diffusion_models/ :
cd ComfyUI/custom_nodes
git clone https://github.com/smthemex/ComfyUI_SenseNova_U1
pip install -r ComfyUI_SenseNova_U1/requirements.txtDisponibilité
- Poids du modèle : sensenova/SenseNova-U1.5-8B-MoT-Preview sur Hugging Face et SenseNova-U1.5-8B-MoT-Preview sur ModelScope
- Code : OpenSenseNova/SenseNova-U1 (inférence, entraînement et outils PE)
- Article : arXiv 2605.12500
- Nœud ComfyUI : smthemex/ComfyUI_SenseNova_U1
Pour l'inférence Python officielle, utilisez cfg_scale=4.0, timestep_shift=3.0 et num_steps=50 avec l'implémentation de référence. SenseNova fournit également des outils optionnels de Prompt Enhance (PE) et de récupération d'images de référence pour pousser encore plus loin la qualité de génération.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.