ComfyUI 뉴스 & 오픈소스 AI 릴리스

ComfyUI 생태계 소식 — 오픈소스 모델 릴리스, 커스텀 노드, 워크플로, 이미지·비디오·오디오 생성 도구 업데이트.

멀티모달
베이스 모델
NVIDIA, LocateAnything-3B 출시 – 병렬 박스 디코딩을 탑재한 오픈소스 비전-언어 그라운딩 모델

NVIDIA가 LocateAnything-3B를 오픈소스로 공개했습니다. 이 비전-언어 그라운딩 모델은 Parallel Box Decoding(PBD)을 통해 빠르고 정밀한 객체 위치 파악을 지원하며, 객체 감지, GUI 요소 그라운딩, OCR 위치 파악, 포인트 기반 그라운딩 등 다양한 도메인에서 활용 가능합니다.

Open-Weights

이미지→비디오
파인튜닝
DomainShuttle: HKUST, Wan2.2 기반 14B 규모의 오픈 도메인 주제 기반 텍스트 비디오 생성 모델을 오픈소스로 공개

HKUST C4G 연구실이 Wan2.2-T2V-14B를 기반으로 한 Apache-2.0 라이선스의 오픈 도메인 주제 기반 비디오 생성 모델 DomainShuttle을 공개했습니다. Domain-MoT, Video-Reference DualRoPE, Cross-Pair Consistent Loss를 도입하여 도메인 내 충실도와 도메인 간 스타일 전환을 유연하게 지원합니다.

Apache-2.0