ComfyUI v0.37.0: Qwen-Image 2.1 및 MoGe 3 지원
ComfyUI v0.37.0은 세 가지 공식 템플릿과 함께 네이티브 Qwen-Image 2.1 지원을 추가하고, MoGe 3 기하 추정, 더 빨라진 Qwen3.8 텍스트 인코더, 자동 빠른 디스크 로딩을 제공합니다.
MoGe 3는 희소 복셀 셸에서 거친 포인트 맵을 정제하여, 이미지 공간 디코더가 흐릿하게 만드는 얇은 구조를 유지합니다(Comfy-Org/ComfyUI#16381의 비교 이미지).
코어에 포함된 Qwen-Image 2.1
Qwen-Image 2.1이 Comfy-Org/ComfyUI#16400(CORE-423)을 통해 코어에 포함되었으며 네이티브 구현으로 제공됩니다. 7B 단일 스트림 diffusion transformer는 comfy/ldm/qwen_image21에 있고, Qwen3-VL-8B 텍스트 인코더는 마지막 hidden state에서 읽으며 참조 이미지 슬롯은 DiT 자체가 이어 붙입니다.
모델의 편집 기능을 담당하는 두 개의 새 노드가 있습니다.
- Qwen 이미지 2.1 텍스트 인코드(
TextEncodeQwenImage21, 카테고리model/conditioning/qwen image)는 고정 입력 대신 참조 이미지의 동적 목록을 받아resolution위젯(기본 1024, 32의 배수,0은 각 참조를 원래 크기로 유지)으로 크기를 조정하고, 이를 VAE 잠재로 시퀀스에 이어 붙입니다. 포지티브 및 네거티브 조건화와 함께 첫 번째 참조 이미지 크기의 빈 잠재를 출력하는데, 이것이 편집 결과를 정렬된 상태로 유지합니다. - Qwen 이미지 2.1 캐시(
QwenImage21Cache)는 prefix KV 캐시가 어디에 있고 어떻게 저장되는지 설정합니다.device는auto,gpu,cpu,off중 하나이고dtype은default,int8,int4입니다.cpu는 연산 뒤에서 RAM으로부터 캐시를 미리 가져오고,off는 매 스텝마다 prefix를 다시 계산하므로 느리지만 디버깅할 때 캐시를 배제할 수 있습니다.
이번 릴리스에는 텍스트에서 이미지로, 이미지 편집, 배경 제거의 세 가지 공식 템플릿이 함께 제공됩니다. 세 가지 모두 v0.37.0 이상이 필요합니다.
공식 Qwen Image 2.1 이미지 편집 템플릿의 출력입니다. workflow_templates 저장소에서 가져왔습니다.
재패키징된 가중치는 Comfy-Org/Qwen-Image-2.1에 공개되어 있습니다.
MoGe 3: 정밀 디테일 기하 추정
MoGe 3는 Microsoft Research의 단안(monocular) 기하 모델 3세대로, 논문 MoGe-3: Fine-Detail Monocular Geometry Estimation with Self-Guided Sparse Volumetric Refinement와 함께 공개되었습니다. 이미지 공간에서 포인트 맵을 직접 디코딩하는 대신, 거친 예측을 희소 복셀 셸에 올리고 그 위에서 희소 3D UNet을 실행하여 얇은 구조와 깊이 불연속을 선명하게 유지합니다.
코어 지원은 Comfy-Org/ComfyUI#16381(CORE-443)을 통해 ViT-L과 ViT-G 두 체크포인트 모두에 추가되었습니다. ComfyUI 포팅은 프로젝트가 이미 Trellis 2용으로 제공하는 FlexGEMM 희소 커널(comfy/ldm/trellis2/flexgemm.py) 위에 리파이너를 구축하므로, 일반적인 CUDA 환경에서는 별도로 설치할 것이 없습니다.
MoGe 3 프로젝트 페이지의 티저.
공식 템플릿 utility_moge3_geometry_estimation은 이미지 한 장을 입력받아 깊이 맵과 표면 노멀 맵을 출력합니다. 기본적으로 moge_3_vitg_fp16.safetensors를 로드하며, 같은 드롭다운에서 ViT-L 파일도 선택할 수 있습니다. MoGe 추론 및 MoGe 파노라마 추론의 새 refine_steps 위젯은 MoGe-3 리파이너를 직접 제어합니다. 기본값은 3, 최대 8이며 0은 비활성화입니다. 이 설정은 MoGe 1 또는 MoGe 2 체크포인트에는 영향을 주지 않지만, 노드는 여전히 해당 체크포인트들을 로드합니다.
템플릿은 이미지 한 장으로 실행됩니다(입력 자산은 workflow_templates 저장소에서 가져왔습니다).
템플릿은 Comfy-Org/MoGe의 재패키징된 가중치를 필요로 합니다.
📂 ComfyUI/
└── 📂 models/
└── 📂 geometry_estimation/
├── moge_1_vitl_fp16.safetensors
├── moge_2_vitl_normal_fp16.safetensors
├── moge_3_vitg_fp16.safetensors
└── moge_3_vitl_fp16.safetensors같은 노드 제품군은 이전 도구들도 그대로 유지합니다. 등장방형(equirectangular) 이미지를 열두 개의 원근 뷰로 나누고 깊이를 다시 병합하는 파노라마 추론, 포인트 맵을 메시로 변환하는 기능, 카메라 매칭을 위한 FoV 판독값 등입니다.
더 빨라진 Qwen 텍스트 인코더
Comfy-Org/ComfyUI#15623(CORE-390)은 Qwen-Image 프롬프트 재작성과 텍스트 생성 노드에 중요한 Qwen3.5 및 Qwen3.8 텍스트 인코더의 디코드 속도 개선입니다.
- 투기적 디코딩(Speculative decoding): 체크포인트의 멀티 토큰 예측 헤드가 2~5개의 토큰을 초안으로 만들고, 하나의 배치 검증 패스가 이를 승인합니다. 초안 헤드는 캡처된 CUDA 그래프로 실행되고 검증 패스는 메모리 컴파일러 아래에서 실행됩니다.
- FixedKVBias: 디바이스 측 쓰기 위치를 가진 전체 용량 어텐션 캐시로,
llama.py와qwen35.py전반에서 디코드 스텝이 그래프 재생 가능하게 유지됩니다. - comfy-kitchen의 융합된 DeltaNet 디코드 커널과 즉시 실행(eager) 폴백, 그리고 스텝마다 할당하는 대신 고정 크기 vocab 마스크를 통해 적용되는 반복 및 존재 페널티.
텍스트 생성 노드는 auto, off, 2~5 옵션을 가진 새 mtp 위젯으로 이를 노출합니다. auto는 초안 깊이를 적응적으로 조정하고, 고정된 값은 이를 고정합니다. MTP 가중치가 없는 체크포인트에는 영향을 주지 않으며, 툴팁에는 샘플링된 출력이 올바른 분포를 유지하지만 같은 시드에 대해 비 MTP 출력과는 다르다는 점이 적혀 있습니다. 같은 릴리스는 이 인코더들에 대한 W4A8 GEMV 지원도 추가하며, 이는 Comfy-Org가 게시하는 int8 및 W4A8 리팩과 짝을 이룹니다.
빠른 디스크와 메모리
v0.37.0은 comfy-aimdo 0.5.5로 업그레이드되며, 여기에는 Windows 빠른 디스크 감지의 네이티브 C 구현이 포함됩니다. ComfyUI는 이제 스스로 빠른 디스크를 감지하고, 드라이브가 PCIe 4 NVMe 이상일 때 모델별로 디스크 기반 동적 로딩과 오프로드를 자동으로 활성화합니다. 가중치는 RAM 버퍼와 핀 등록 프라이밍 단계를 건너뜁니다. 혼합 구성에서는 느린 드라이브에 RAM 우선순위가 주어지므로, NVMe와 회전식 디스크에 나뉘어 있는 모델 라이브러리도 도움이 되는 곳에서는 캐시를 계속 사용합니다. --fast-disk는 여전히 이 동작을 강제하고, 새 --disable-fast-disk는 이를 끄며 --fast-disk를 재정의합니다.
같은 릴리스에 두 가지 메모리 변경 사항이 더 있습니다. 텍스트 인코더는 동적 VRAM이 활성화된 경우 앞뒤로 옮겨지지 않고 이제 GPU에 유지되며, comfy-kitchen 어텐션을 사용할 때 Wan 모델의 최대 VRAM이 감소합니다.
기타 변경 사항
- 빈 잠재 이미지가 이제 512 x 512 대신 1024 x 1024를 기본값으로 사용하므로, 새로 만든 노드가 최신 모델 학습 해상도와 일치합니다.
- MiniMax Music 3는 ComfyUI 컴파일러 그래프가 활성화된 상태에서 더 이상 노이즈를 렌더링하지 않습니다. 오토리그레시브 텍스트 인코더가 이제 YuE2 및 일반 생성 경로처럼 고정된 디코드 버퍼를 사용합니다.
- ACE-Step VAE 디코드가 bf16을 실행하지 않는 GPU에서 더 이상 충돌하지 않습니다.
- YuE2 음악 생성 노드에 CFG 컨트롤이 추가되었고, SheetSage2 위치 임베딩 정밀도가 업스트림과 일치하도록 맞춰졌습니다.
- 그래프 전반에서 노드 이름과 카테고리가 정리되었습니다.
- 파트너 노드: Meshy 7.1, GPT Image 2의 투명 배경, 연결된 GLB 또는 FBX 출력이 비어 있을 때 Tripo P2 실행을 거부하는 가드, 그리고 재시도가 두 번 청구되지 않도록 파트너 프록시 호출에 Idempotency-Key가 추가되었습니다.
- comfyui-frontend-package가 1.53.6으로, 워크플로 템플릿이 v0.11.66으로, 내장 문서가 0.5.12로, comfy-kitchen이 0.2.35로 올라갔습니다.
v0.37.0 업데이트하기
매니저나 선호하는 런처를 통해 ComfyUI를 업데이트하세요. Qwen-Image 2.1과 MoGe 3 노드 및 해당 템플릿은 v0.37.0 이상이 필요하며, Desktop과 Cloud 빌드는 안정 릴리스를 따릅니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.