음성 합성Higgs TTS 3는 4B 파라미터 텍스트-음성 변환 모델로, 100개 이상의 언어를 지원하며 제로샷 음성 복제, 감정 표현 제어, 인라인 운율 및 음향 효과를 음성 에이전트 애플리케이션에 제공합니다.
Open-Weights
ComfyUI 생태계 소식 — 오픈소스 모델 릴리스, 커스텀 노드, 워크플로, 이미지·비디오·오디오 생성 도구 업데이트.
음성 합성Higgs TTS 3는 4B 파라미터 텍스트-음성 변환 모델로, 100개 이상의 언어를 지원하며 제로샷 음성 복제, 감정 표현 제어, 인라인 운율 및 음향 효과를 음성 에이전트 애플리케이션에 제공합니다.
Open-Weights
텍스트→비디오Sulphur 2는 LTX 2.3의 커뮤니티 파인튜닝 모델로, 텍스트 기반 비디오 생성 및 이미지 기반 비디오 생성을 제공하며, 내장 프롬프트 인핸서와 증류 LoRA를 갖추고 125K+ 개의 선별된 클립으로 학습되었습니다.
Open-Weights
OpenMOSS 팀이 MOVA (MOSS Video and Audio)를 출시했습니다. 단일 추론 패스로 비디오와 오디오를 생성하는 엔드투엔드 동영상·오디오 동기화 생성 기반 모델로, 정확한 립싱크와 환경 인식 사운드 효과를 실현하며 모델 가중치, 훈련 및 추론 코드를 완전히 오픈소스화했습니다
Open-Weights
알리바바 통이 연구소가 Z-Image-Base를 출시했습니다. 이는 Z-Image 시리즈의 비증류 기반 모델로, 완전한 생성 잠재력을 보존하며 커뮤니티 파인튜닝과 맞춤 개발을 위한 이상적인 기반을 제공합니다
Open-Weights
DeepSeek이 DeepSeek-OCR-2를 오픈소스화. 새로운 DeepEncoder V2 비전 인코더를 도입하여 비주얼 인과 흐름 메커니즘을 통해 인간의 읽기 논리를 모방하며, OmniDocBench v1.5에서 91.09% 정확도 달성
Open-Weights
Moonshot AI가 Kimi K2.5를 정식 출시. 15조 개의 혼합 비주얼·텍스트 토큰으로 지속적으로 사전 학습된 1T 파라미터 네이티브 멀티모달 에이전트 모델로, 이미지·동영상 이해를 지원하며 Agent Swarm 자율 협업 메커니즘 탑재
Open-Weights
알리바바 Qwen이 Qwen3-TTS 음성 생성 모델 시리즈를 오픈소스화. Dual-Track 모델링으로 97ms 초저지연을 실현하고, 3초 음성 클로닝과 자연어 음성 디자인을 지원하며, 10개 주요 언어 커버
Open-Weights
Microsoft가 9B 파라미터의 통합 음성 인식 모델 VibeVoice-ASR을 오픈소스화. 최대 60분의 오디오를 한 번에 처리 가능하며, 단일 추론 프로세스에서 인식, 화자 분리, 타임스탬프 생성을 공동 완료
Open-Weights
NVIDIA가 Moshi 아키텍처 기반 70억 파라미터 전이중 음성 대화 모델 PersonaPlex-7B-v1을 오픈소스화. 동시 청취·발화, 자연스러운 중단, 역할 커스터마이징을 지원하며, 중단 응답 지연은 240밀리초까지 감소
Open-Weights
텍스트→비디오Stable Video Infinity 2.0 Pro가 공식 출시되어 Wan 2.2 기본 모델 지원을 추가하고, ComfyUI에서 무한 길이 비디오 콘텐츠를 생성하기 위한 HIGH 및 LOW 버전의 LoRA 모델을 제공
이미지 편집Qwen-Image-Layered는 이미지를 여러 RGBA 레이어로 분해할 수 있으며, 각 레이어는 다른 콘텐츠에 영향을 주지 않고 독립적으로 편집 가능합니다. 색상 변경, 교체, 삭제, 크기 조정, 위치 이동 등의 작업을 지원합니다
Open-Weights
이미지→3DMicrosoft가 40억 파라미터의 대규모 3D 생성 모델 TRELLIS.2를 발표. 몇 초 만에 이미지를 고품질 3D 자산으로 변환하며, 완전한 PBR 재질과 복잡한 토폴로지를 지원
Open-Weights
칭화대학교 팀이 TurboDiffusion을 오픈소스로 공개. RTX 5090 한 장으로 100-205배의 엔드투엔드 확산 생성 가속을 달성하면서 비디오 품질을 유지하는 비디오 생성 가속 프레임워크
Alibaba Cloud PAI 팀이 Z-Image-Turbo-Fun-Controlnet-Union을 출시. Canny, HED, Depth, Pose, MLSD를 포함한 여러 제어 조건을 지원하는 ControlNet 모델로 1328 해상도에서 훈련됨
Open-Weights
텍스트→이미지Alibaba AIDC-AI 팀이 고품질 텍스트 렌더링에 특화된 7B 파라미터 텍스트-이미지 모델 Ovis-Image를 출시. 여러 텍스트 렌더링 벤치마크에서 우수한 결과를 달성하며 단일 고성능 GPU에서 효율적으로 실행
Open-Weights
알리바바 통이 랩이 Z-Image-Turbo를 출시했습니다. 6B 파라미터의 효율적인 이미지 생성 모델로, 단 8단계 샘플링으로 고품질 이미지를 생성하며 16GB VRAM의 일반 소비자용 GPU에서 원활하게 작동합니다
Open-Weights
멀티모달바이트댄스는 SAM2와 LLaVA 기술을 결합하여 이미지와 동영상의 밀집 분할 및 시각적 질문 응답을 구현하는 Sa2VA 멀티모달 모델을 도입하여 여러 벤치마크에서 최고 성능을 달성함
Open-Weights
텐센트가 총 80B 파라미터를 보유한 최초의 상용 수준 오픈소스 네이티브 멀티모달 이미지 생성 모델 훈위안 이미지 3.0을 출시하며, 세계 지식 추론 기능을 갖추고 수천 단어의 복잡한 의미 이해를 지원합니다.
Open-Weights
Nunchaku 팀은 4-Bit Lightning Qwen-Image-Edit-2509 모델의 최적화 버전을 출시하여, 4/8단계 고속 추론을 지원하고 8GB VRAM 환경에서도 원활하게 작동합니다.
알리바바 통의 실험이 Wan-Animate를 출시했는데, 이는 Wan2.2 기반의 통합 캐릭터 애니메이션 프레임워크로, 캐릭터 애니메이션 생성 및 비디오 캐릭터 교체를 지원하며 모델 가중치와 추론 코드를 오픈소스화했습니다
Open-Weights