SenseNova-U1.5 미리보기: SenseTime의 4K 이미지 생성 및 편집
SenseTime의 SenseNova-U1.5-8B-MoT-Preview는 하나의 통합 모델에서 4K 텍스트 기반 이미지 생성과 더 강력한 이미지 편집을 제공하며, SenseNova_U1 커스텀 노드 팩을 통해 ComfyUI를 지원합니다.
SenseTime이 **SenseNova-U1.5-8B-MoT(미리보기)**를 오픈소스로 공개했습니다. 이 모델은 네이티브 통합 멀티모달 모델 시리즈인 U-시리즈의 최신 모델입니다. NEO-unify 아키텍처를 기반으로 하는 이 미리보기 버전은 이미지 생성과 편집에 중점을 둡니다. 텍스트에서 최대 네이티브 4K 이미지를 생성할 수 있고, 단일 또는 여러 참조 이미지에 대한 세부 편집 지침을 따를 수 있습니다.
SenseNova-U1.5(미리보기)의 기술적 발전 개요
이번 릴리스는 원본 SenseNova-U1 시리즈의 뒤를 잇는 것으로, 오픈소스화된 사전 학습 런처 및 구성 파일과 함께 제공됩니다. 가중치는 Hugging Face와 ModelScope에서 다운로드할 수 있습니다.
U1.5의 개선 사항
패치 단위 예측에서 패치 결합 재구성으로
원본 U1은 MLP 헤드를 사용하여 각 RGB 패치를 독립적으로 재구성하는데, 이로 인해 고해상도에서 토큰 경계가 그리드 패턴으로 드러날 수 있습니다. U1.5는 ConvDecoder를 통한 점진적 공간 재구성을 채택합니다. 시각 토큰이 2D 피처 그리드로 재구성되고 여러 Pixel Shuffle 단계를 거쳐 업샘플링되며, 중간 3x3 컨볼루션을 통해 인접한 패치가 서로 상호작용하여 연속적인 이미지로 병합됩니다. 이를 통해 그리드 형태의 아티팩트가 크게 억제되고 다운스트림 파인튜닝 중 견고성이 향상됩니다.
지침 수행에서 시각적 보존으로
U1.5는 이미지 편집 코퍼스를 광범위하게 정리, 필터링, 합성하여 중국어-영어 균형을 개선하고 단일 이미지 및 다중 이미지 참조 설정 모두의 적용 범위를 확장합니다. 인코더 없는 아키텍처는 단일 참조 이미지 토큰 시퀀스만으로 피사체 정체성과 구조 보존을 함께 유지하면서 강력한 지침 수행을 달성합니다.
형식 노출에서 교차 작업 일반화로
생성 및 편집 코퍼스에는 단순한 JSON 형식의 프롬프트만 포함되어 있지만, U1.5는 길고 구조화된 지침에도 잘 일반화됩니다. 이는 네이티브 통합 멀티모달 모델링이 전용 프롬프트 템플릿 학습 없이도 작업 간 이해 및 시각적 계획 능력을 전이할 수 있음을 보여줍니다.
쇼케이스: 텍스트 기반 이미지 생성
SenseNova-U1.5가 생성한 상세한 레트로 광고 포스터로, 조밀한 텍스트 렌더링과 복잡한 레이아웃 제어를 보여줍니다
정교한 텍스처와 조명 디테일을 갖춘 포토리얼리스틱 수중 장면
쇼케이스: 이미지 편집
스타일 전이, 피사체 정체성 보존, 영역 제어 가능한 변경을 다루는 편집 예시
벤치마크 주요 결과
Qwen-Image Bench에서 U1.5-Preview는 모든 카테고리에서 원본 U1보다 개선되었으며, 특히 미적 품질과 정렬에서 가장 큰 향상을 보였습니다. Prompt Enhance(PE)를 활성화하면 미리보기 버전은 전체 55.17(EN) / 55.22(ZH)를 기록하여 동일한 평가에서 Qwen Image 2에 근접합니다.
이미지 편집에서 U1.5-Preview는 ImgEdit-Bench 전체 4.37점(U1의 3.90점에서 상승)과 WeEdit 평균 6.852점을 기록하며, 보고된 비교에서 Qwen-Image-2, FireRed-Image-Edit, LongCat-Image-Edit를 능가합니다.
ComfyUI 지원
커뮤니티 개발자 smthemex가 ComfyUI_SenseNova_U1 커스텀 노드 팩에 U1.5 지원을 추가했습니다. GGUF, INT8, FP8 가중치 형식을 포함합니다(smthem/SenseNova-U1-8B-MoT-Merger-gguf 참조). 이 노드 팩은 A3B-MoT MoE 변형, 8단계 LoRA, Infographic-V3 체크포인트도 지원합니다.
클릭하면 확대됩니다. 이 커스텀 노드 팩에는 텍스트 기반 이미지 생성과 이미지 기반 이미지 생성을 위한 실행 가능한 예제 워크플로가 포함되어 있습니다.
로컬에서 실행하려면 커스텀 노드를 설치하고 양자화된 가중치를 ComfyUI/models/gguf/ 또는 ComfyUI/models/diffusion_models/에 넣으세요:
cd ComfyUI/custom_nodes
git clone https://github.com/smthemex/ComfyUI_SenseNova_U1
pip install -r ComfyUI_SenseNova_U1/requirements.txt제공 정보
- 모델 가중치: Hugging Face의 sensenova/SenseNova-U1.5-8B-MoT-Preview 및 ModelScope의 SenseNova-U1.5-8B-MoT-Preview
- 코드: OpenSenseNova/SenseNova-U1 (추론, 학습, PE 도구)
- 논문: arXiv 2605.12500
- ComfyUI 노드: smthemex/ComfyUI_SenseNova_U1
공식 Python 추론의 경우 참조 구현에서 cfg_scale=4.0, timestep_shift=3.0, num_steps=50을 사용하세요. SenseNova는 생성 품질을 더욱 높이기 위해 선택적 Prompt Enhance(PE) 및 참조 이미지 검색 도구도 제공합니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.