ComfyUI 뉴스 & 오픈소스 AI 릴리스

ComfyUI 생태계 소식 — 오픈소스 모델 릴리스, 커스텀 노드, 워크플로, 이미지·비디오·오디오 생성 도구 업데이트.

텍스트→비디오
파인튜닝
Sulphur 2: LTX 2.3 기반 9B 비디오 생성 모델

Sulphur 2는 LTX 2.3의 커뮤니티 파인튜닝 모델로, 텍스트 기반 비디오 생성 및 이미지 기반 비디오 생성을 제공하며, 내장 프롬프트 인핸서와 증류 LoRA를 갖추고 125K+ 개의 선별된 클립으로 학습되었습니다.

Open-Weights

멀티모달

OpenMOSS, MOVA 출시 - 오픈소스 동영상·오디오 동기화 생성 모델

멀티모달
베이스 모델
OpenMOSS, MOVA 출시 - 오픈소스 동영상·오디오 동기화 생성 모델

OpenMOSS 팀이 MOVA (MOSS Video and Audio)를 출시했습니다. 단일 추론 패스로 비디오와 오디오를 생성하는 엔드투엔드 동영상·오디오 동기화 생성 기반 모델로, 정확한 립싱크와 환경 인식 사운드 효과를 실현하며 모델 가중치, 훈련 및 추론 코드를 완전히 오픈소스화했습니다

Open-Weights

텍스트→이미지

알리바바 통이 연구소, Z-Image-Base 출시 - 비증류 고품질 이미지 생성 모델

텍스트→이미지
베이스 모델
알리바바 통이 연구소, Z-Image-Base 출시 - 비증류 고품질 이미지 생성 모델

알리바바 통이 연구소가 Z-Image-Base를 출시했습니다. 이는 Z-Image 시리즈의 비증류 기반 모델로, 완전한 생성 잠재력을 보존하며 커뮤니티 파인튜닝과 맞춤 개발을 위한 이상적인 기반을 제공합니다

Open-Weights

멀티모달

Moonshot AI, Kimi K2.5 출시 - 1T 파라미터 네이티브 멀티모달 에이전트 모델

멀티모달
베이스 모델
Moonshot AI, Kimi K2.5 출시 - 1T 파라미터 네이티브 멀티모달 에이전트 모델

Moonshot AI가 Kimi K2.5를 정식 출시. 15조 개의 혼합 비주얼·텍스트 토큰으로 지속적으로 사전 학습된 1T 파라미터 네이티브 멀티모달 에이전트 모델로, 이미지·동영상 이해를 지원하며 Agent Swarm 자율 협업 메커니즘 탑재

Open-Weights

음성 인식

Microsoft, VibeVoice-ASR 출시 - 60분 장시간 오디오 싱글 패스 처리 지원 음성 인식 모델

음성 인식
베이스 모델
Microsoft, VibeVoice-ASR 출시 - 60분 장시간 오디오 싱글 패스 처리 지원 음성 인식 모델

Microsoft가 9B 파라미터의 통합 음성 인식 모델 VibeVoice-ASR을 오픈소스화. 최대 60분의 오디오를 한 번에 처리 가능하며, 단일 추론 프로세스에서 인식, 화자 분리, 타임스탬프 생성을 공동 완료

Open-Weights

텍스트→이미지

알리바바 통이 랩, Z-Image-Turbo 출시 - 6B 파라미터의 효율적인 이미지 생성 모델

텍스트→이미지
Turbo
알리바바 통이 랩, Z-Image-Turbo 출시 - 6B 파라미터의 효율적인 이미지 생성 모델

알리바바 통이 랩이 Z-Image-Turbo를 출시했습니다. 6B 파라미터의 효율적인 이미지 생성 모델로, 단 8단계 샘플링으로 고품질 이미지를 생성하며 16GB VRAM의 일반 소비자용 GPU에서 원활하게 작동합니다

Open-Weights

텍스트→이미지

텐센트, 훈위안 이미지 3.0 오픈소스 공개 - 세계 최대의 오픈소스 텍스트-이미지 생성 모델

텍스트→이미지
베이스 모델
텐센트, 훈위안 이미지 3.0 오픈소스 공개 - 세계 최대의 오픈소스 텍스트-이미지 생성 모델

텐센트가 총 80B 파라미터를 보유한 최초의 상용 수준 오픈소스 네이티브 멀티모달 이미지 생성 모델 훈위안 이미지 3.0을 출시하며, 세계 지식 추론 기능을 갖추고 수천 단어의 복잡한 의미 이해를 지원합니다.

Open-Weights

캐릭터 애니메이션

알리바바, Wan-Animate 모델 출시 - 통합 캐릭터 애니메이션 및 교체 기술

캐릭터 애니메이션
도구
알리바바, Wan-Animate 모델 출시 - 통합 캐릭터 애니메이션 및 교체 기술

알리바바 통의 실험이 Wan-Animate를 출시했는데, 이는 Wan2.2 기반의 통합 캐릭터 애니메이션 프레임워크로, 캐릭터 애니메이션 생성 및 비디오 캐릭터 교체를 지원하며 모델 가중치와 추론 코드를 오픈소스화했습니다

Open-Weights