ComfyUI 뉴스 & 오픈소스 AI 릴리스

ComfyUI 생태계 소식 — 오픈소스 모델 릴리스, 커스텀 노드, 워크플로, 이미지·비디오·오디오 생성 도구 업데이트.

멀티모달
베이스 모델
NVIDIA, LocateAnything-3B 출시 – 병렬 박스 디코딩을 탑재한 오픈소스 비전-언어 그라운딩 모델

NVIDIA가 LocateAnything-3B를 오픈소스로 공개했습니다. 이 비전-언어 그라운딩 모델은 Parallel Box Decoding(PBD)을 통해 빠르고 정밀한 객체 위치 파악을 지원하며, 객체 감지, GUI 요소 그라운딩, OCR 위치 파악, 포인트 기반 그라운딩 등 다양한 도메인에서 활용 가능합니다.

Open-Weights

이미지→비디오
파인튜닝
DomainShuttle: HKUST, Wan2.2 기반 14B 규모의 오픈 도메인 주제 기반 텍스트 비디오 생성 모델을 오픈소스로 공개

HKUST C4G 연구실이 Wan2.2-T2V-14B를 기반으로 한 Apache-2.0 라이선스의 오픈 도메인 주제 기반 비디오 생성 모델 DomainShuttle을 공개했습니다. Domain-MoT, Video-Reference DualRoPE, Cross-Pair Consistent Loss를 도입하여 도메인 내 충실도와 도메인 간 스타일 전환을 유연하게 지원합니다.

Apache-2.0

텍스트→비디오
파인튜닝
Sulphur 2: LTX 2.3 기반 9B 비디오 생성 모델

Sulphur 2는 LTX 2.3의 커뮤니티 파인튜닝 모델로, 텍스트 기반 비디오 생성 및 이미지 기반 비디오 생성을 제공하며, 내장 프롬프트 인핸서와 증류 LoRA를 갖추고 125K+ 개의 선별된 클립으로 학습되었습니다.

Open-Weights

멀티모달

OpenMOSS, MOVA 출시 - 오픈소스 동영상·오디오 동기화 생성 모델

멀티모달
베이스 모델
OpenMOSS, MOVA 출시 - 오픈소스 동영상·오디오 동기화 생성 모델

OpenMOSS 팀이 MOVA (MOSS Video and Audio)를 출시했습니다. 단일 추론 패스로 비디오와 오디오를 생성하는 엔드투엔드 동영상·오디오 동기화 생성 기반 모델로, 정확한 립싱크와 환경 인식 사운드 효과를 실현하며 모델 가중치, 훈련 및 추론 코드를 완전히 오픈소스화했습니다

Open-Weights