ComfyUI v0.37.0: Qwen-Image 2.1 및 MoGe 3 지원

ComfyUI Wikinews

ComfyUI v0.37.0은 세 가지 공식 템플릿과 함께 네이티브 Qwen-Image 2.1 지원을 추가하고, MoGe 3 기하 추정, 더 빨라진 Qwen3.8 텍스트 인코더, 자동 빠른 디스크 로딩을 제공합니다.

ComfyUI v0.37.0이 출시되었습니다. Qwen-Image 2.1을 세 가지 공식 템플릿과 함께 코어에 포함하고, MoGe 3 정밀 디테일 기하 추정을 추가하며, 투기적 디코딩(speculative decoding)으로 Qwen3.5와 Qwen3.8 텍스트 인코더 속도를 높이고, 빠른 NVMe 드라이브에서 빠른 디스크 로딩을 자동으로 활성화하며, 빈 잠재 이미지 노드의 기본 크기를 1024로 올립니다.
MoGe 3 포인트 맵 정제

MoGe 3는 희소 복셀 셸에서 거친 포인트 맵을 정제하여, 이미지 공간 디코더가 흐릿하게 만드는 얇은 구조를 유지합니다(Comfy-Org/ComfyUI#16381의 비교 이미지).

코어에 포함된 Qwen-Image 2.1

Qwen-Image 2.1Comfy-Org/ComfyUI#16400(CORE-423)을 통해 코어에 포함되었으며 네이티브 구현으로 제공됩니다. 7B 단일 스트림 diffusion transformer는 comfy/ldm/qwen_image21에 있고, Qwen3-VL-8B 텍스트 인코더는 마지막 hidden state에서 읽으며 참조 이미지 슬롯은 DiT 자체가 이어 붙입니다.

모델의 편집 기능을 담당하는 두 개의 새 노드가 있습니다.

  • Qwen 이미지 2.1 텍스트 인코드(TextEncodeQwenImage21, 카테고리 model/conditioning/qwen image)는 고정 입력 대신 참조 이미지의 동적 목록을 받아 resolution 위젯(기본 1024, 32의 배수, 0은 각 참조를 원래 크기로 유지)으로 크기를 조정하고, 이를 VAE 잠재로 시퀀스에 이어 붙입니다. 포지티브 및 네거티브 조건화와 함께 첫 번째 참조 이미지 크기의 빈 잠재를 출력하는데, 이것이 편집 결과를 정렬된 상태로 유지합니다.
  • Qwen 이미지 2.1 캐시(QwenImage21Cache)는 prefix KV 캐시가 어디에 있고 어떻게 저장되는지 설정합니다. deviceauto, gpu, cpu, off 중 하나이고 dtypedefault, int8, int4입니다. cpu는 연산 뒤에서 RAM으로부터 캐시를 미리 가져오고, off는 매 스텝마다 prefix를 다시 계산하므로 느리지만 디버깅할 때 캐시를 배제할 수 있습니다.

이번 릴리스에는 텍스트에서 이미지로, 이미지 편집, 배경 제거의 세 가지 공식 템플릿이 함께 제공됩니다. 세 가지 모두 v0.37.0 이상이 필요합니다.

Qwen Image 2.1 이미지 편집 출력

공식 Qwen Image 2.1 이미지 편집 템플릿의 출력입니다. workflow_templates 저장소에서 가져왔습니다.

재패키징된 가중치는 Comfy-Org/Qwen-Image-2.1에 공개되어 있습니다.

MoGe 3: 정밀 디테일 기하 추정

MoGe 3는 Microsoft Research의 단안(monocular) 기하 모델 3세대로, 논문 MoGe-3: Fine-Detail Monocular Geometry Estimation with Self-Guided Sparse Volumetric Refinement와 함께 공개되었습니다. 이미지 공간에서 포인트 맵을 직접 디코딩하는 대신, 거친 예측을 희소 복셀 셸에 올리고 그 위에서 희소 3D UNet을 실행하여 얇은 구조와 깊이 불연속을 선명하게 유지합니다.

코어 지원은 Comfy-Org/ComfyUI#16381(CORE-443)을 통해 ViT-L과 ViT-G 두 체크포인트 모두에 추가되었습니다. ComfyUI 포팅은 프로젝트가 이미 Trellis 2용으로 제공하는 FlexGEMM 희소 커널(comfy/ldm/trellis2/flexgemm.py) 위에 리파이너를 구축하므로, 일반적인 CUDA 환경에서는 별도로 설치할 것이 없습니다.

MoGe 3 프로젝트 페이지의 티저.

공식 템플릿 utility_moge3_geometry_estimation은 이미지 한 장을 입력받아 깊이 맵과 표면 노멀 맵을 출력합니다. 기본적으로 moge_3_vitg_fp16.safetensors를 로드하며, 같은 드롭다운에서 ViT-L 파일도 선택할 수 있습니다. MoGe 추론MoGe 파노라마 추론의 새 refine_steps 위젯은 MoGe-3 리파이너를 직접 제어합니다. 기본값은 3, 최대 8이며 0은 비활성화입니다. 이 설정은 MoGe 1 또는 MoGe 2 체크포인트에는 영향을 주지 않지만, 노드는 여전히 해당 체크포인트들을 로드합니다.

MoGe 3 템플릿 입력

템플릿은 이미지 한 장으로 실행됩니다(입력 자산은 workflow_templates 저장소에서 가져왔습니다).

템플릿은 Comfy-Org/MoGe의 재패키징된 가중치를 필요로 합니다.

📂 ComfyUI/
└── 📂 models/
    └── 📂 geometry_estimation/
        ├── moge_1_vitl_fp16.safetensors
        ├── moge_2_vitl_normal_fp16.safetensors
        ├── moge_3_vitg_fp16.safetensors
        └── moge_3_vitl_fp16.safetensors

같은 노드 제품군은 이전 도구들도 그대로 유지합니다. 등장방형(equirectangular) 이미지를 열두 개의 원근 뷰로 나누고 깊이를 다시 병합하는 파노라마 추론, 포인트 맵을 메시로 변환하는 기능, 카메라 매칭을 위한 FoV 판독값 등입니다.

더 빨라진 Qwen 텍스트 인코더

Comfy-Org/ComfyUI#15623(CORE-390)은 Qwen-Image 프롬프트 재작성과 텍스트 생성 노드에 중요한 Qwen3.5 및 Qwen3.8 텍스트 인코더의 디코드 속도 개선입니다.

  • 투기적 디코딩(Speculative decoding): 체크포인트의 멀티 토큰 예측 헤드가 2~5개의 토큰을 초안으로 만들고, 하나의 배치 검증 패스가 이를 승인합니다. 초안 헤드는 캡처된 CUDA 그래프로 실행되고 검증 패스는 메모리 컴파일러 아래에서 실행됩니다.
  • FixedKVBias: 디바이스 측 쓰기 위치를 가진 전체 용량 어텐션 캐시로, llama.pyqwen35.py 전반에서 디코드 스텝이 그래프 재생 가능하게 유지됩니다.
  • comfy-kitchen의 융합된 DeltaNet 디코드 커널과 즉시 실행(eager) 폴백, 그리고 스텝마다 할당하는 대신 고정 크기 vocab 마스크를 통해 적용되는 반복 및 존재 페널티.

텍스트 생성 노드는 auto, off, 2~5 옵션을 가진 새 mtp 위젯으로 이를 노출합니다. auto는 초안 깊이를 적응적으로 조정하고, 고정된 값은 이를 고정합니다. MTP 가중치가 없는 체크포인트에는 영향을 주지 않으며, 툴팁에는 샘플링된 출력이 올바른 분포를 유지하지만 같은 시드에 대해 비 MTP 출력과는 다르다는 점이 적혀 있습니다. 같은 릴리스는 이 인코더들에 대한 W4A8 GEMV 지원도 추가하며, 이는 Comfy-Org가 게시하는 int8 및 W4A8 리팩과 짝을 이룹니다.

빠른 디스크와 메모리

v0.37.0은 comfy-aimdo 0.5.5로 업그레이드되며, 여기에는 Windows 빠른 디스크 감지의 네이티브 C 구현이 포함됩니다. ComfyUI는 이제 스스로 빠른 디스크를 감지하고, 드라이브가 PCIe 4 NVMe 이상일 때 모델별로 디스크 기반 동적 로딩과 오프로드를 자동으로 활성화합니다. 가중치는 RAM 버퍼와 핀 등록 프라이밍 단계를 건너뜁니다. 혼합 구성에서는 느린 드라이브에 RAM 우선순위가 주어지므로, NVMe와 회전식 디스크에 나뉘어 있는 모델 라이브러리도 도움이 되는 곳에서는 캐시를 계속 사용합니다. --fast-disk는 여전히 이 동작을 강제하고, 새 --disable-fast-disk는 이를 끄며 --fast-disk를 재정의합니다.

같은 릴리스에 두 가지 메모리 변경 사항이 더 있습니다. 텍스트 인코더는 동적 VRAM이 활성화된 경우 앞뒤로 옮겨지지 않고 이제 GPU에 유지되며, comfy-kitchen 어텐션을 사용할 때 Wan 모델의 최대 VRAM이 감소합니다.

기타 변경 사항

  • 빈 잠재 이미지가 이제 512 x 512 대신 1024 x 1024를 기본값으로 사용하므로, 새로 만든 노드가 최신 모델 학습 해상도와 일치합니다.
  • MiniMax Music 3는 ComfyUI 컴파일러 그래프가 활성화된 상태에서 더 이상 노이즈를 렌더링하지 않습니다. 오토리그레시브 텍스트 인코더가 이제 YuE2 및 일반 생성 경로처럼 고정된 디코드 버퍼를 사용합니다.
  • ACE-Step VAE 디코드가 bf16을 실행하지 않는 GPU에서 더 이상 충돌하지 않습니다.
  • YuE2 음악 생성 노드에 CFG 컨트롤이 추가되었고, SheetSage2 위치 임베딩 정밀도가 업스트림과 일치하도록 맞춰졌습니다.
  • 그래프 전반에서 노드 이름과 카테고리가 정리되었습니다.
  • 파트너 노드: Meshy 7.1, GPT Image 2의 투명 배경, 연결된 GLB 또는 FBX 출력이 비어 있을 때 Tripo P2 실행을 거부하는 가드, 그리고 재시도가 두 번 청구되지 않도록 파트너 프록시 호출에 Idempotency-Key가 추가되었습니다.
  • comfyui-frontend-package가 1.53.6으로, 워크플로 템플릿이 v0.11.66으로, 내장 문서가 0.5.12로, comfy-kitchen이 0.2.35로 올라갔습니다.

v0.37.0 업데이트하기

매니저나 선호하는 런처를 통해 ComfyUI를 업데이트하세요. Qwen-Image 2.1과 MoGe 3 노드 및 해당 템플릿은 v0.37.0 이상이 필요하며, Desktop과 Cloud 빌드는 안정 릴리스를 따릅니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
ComfyUI v0.37.0: Qwen-Image 2.1 및 MoGe 3 지원 | ComfyUI Wiki