NUS 팀이 OmniConsistency 프로젝트를 발표, 단 2,600개 이미지 쌍과 500시간의 GPU 훈련만으로 GPT-4o 수준의 이미지 스타일화 일관성을 달성, ComfyUI 노드 지원
Open-Weights
ComfyUI 생태계 소식 — 오픈소스 모델 릴리스, 커스텀 노드, 워크플로, 이미지·비디오·오디오 생성 도구 업데이트.
NUS 팀이 OmniConsistency 프로젝트를 발표, 단 2,600개 이미지 쌍과 500시간의 GPU 훈련만으로 GPT-4o 수준의 이미지 스타일화 일관성을 달성, ComfyUI 노드 지원
Open-Weights
Black Forest Labs가 FLUX.1 Kontext 시리즈 모델을 출시하여 텍스트와 이미지 입력 기반의 컨텍스트 인식 편집을 최초로 구현하고, 캐릭터 일관성 보존 및 로컬라이즈된 편집 기능을 지원
Open-Weights
텍스트→이미지바이트댄스와 미시간 주립대학교가 공동으로 제안한 ID-Patch 방법으로, 다중 신원 개인화 이미지 생성이 가능하며 신원 유지와 생성 효율성이 향상되어 그룹 사진, 광고 등 다중 인물 장면에 적합합니다.
Open-Weights
캐릭터 애니메이션텐센트가 HunyuanVideo-Avatar를 공개했습니다. 이미지를 오디오와 결합해 고품질, 감정 제어가 가능한 디지털 휴먼 영상을 생성할 수 있어, 숏폼 영상, 이커머스 광고 등 다양한 분야에 활용할 수 있습니다.
Open-Weights
Pixel-Reasoner는 Qwen2 기반으로, 전역 및 국부 픽셀 수준의 시각 이해와 추론 능력을 제공하며, 세부 확대 분석을 지원하여 시각 언어 모델의 발전을 이끕니다.
MIT
IndexTTS가 버전 1.5를 출시하여 모델 안정성과 영어 성능을 크게 향상시켰으며, 병음 발음 교정과 구두점 제어 일시정지를 지원하여 여러 테스트에서 주류 TTS 시스템을 능가하는 성능을 달성
Open-Weights
이미지→3DStepFun이 단일 이미지에서 고품질 3D 기하학과 텍스처를 생성하는 오픈소스 프레임워크 Step1X-3D를 출시. 200만개 고품질 데이터셋, 완전한 훈련 코드 및 모델 가중치 포함
Open-Weights
멀티모달ByteDance가 7B 활성 파라미터를 갖춘 오픈소스 멀티모달 기반 모델 BAGEL을 공개했습니다. 텍스트, 이미지, 비디오 등 다양한 데이터의 이해와 생성을 지원하며, 여러 공개 벤치마크에서 우수한 성능을 보입니다.
Open-Weights
텍스트→이미지최근 ComfyUI 업데이트 이후, 일부 커스텀 노드가 프론트엔드 문제를 일으킬 수 있습니다. 이 글에서는 영향을 받는 플러그인과 해결 방법을 정리하고, 적시에 업데이트하거나 관련 플러그인을 제거할 것을 권장합니다.
Open-Weights
Step1X-3D 팀이 고정밀 3D 에셋 생성 솔루션을 공개하고, 모델·데이터셋·코드를 오픈소스로 제공. 다양한 3D 에셋 생성과 텍스처 합성 지원.
Open-Weights
멀티모달텐센트가 텍스트, 이미지, 오디오 및 비디오 조건을 지원하는 멀티모달 비디오 맞춤화 프레임워크 HunyuanCustom을 발표하여 다양한 시나리오에서 높은 일관성의 비디오 생성 가능
Open-Weights
이미지 편집Insert Anything은 참조 이미지에서 사람, 물체, 의류와 같은 요소를 대상 장면에 원활하게 삽입할 수 있는 오픈소스 통합 프레임워크로, 다양한 응용 시나리오를 지원합니다
Open-Weights
텍스트→비디오칭화대학교와 텐센트 ARC 연구소가 공동으로 개발한 FlexiAct 기술은 참조 비디오의 동작을 모든 대상 이미지로 전송하면서 신원 일관성을 유지할 수 있습니다
Open-Weights
멀티모달Step1X-Edit은 자연어 지시를 통한 이미지 편집을 지원하는 강력한 오픈소스 이미지 편집 프레임워크로, GPT-4o와 Gemini2 Flash와 유사한 편집 기능을 제공합니다。
Open-Weights
인페인팅Flex.2-preview는 범용 제어 및 내장 인페인팅 기능을 갖춘 오픈소스 텍스트-이미지 확산 모델로, 창작자에게 더 강력한 이미지 생성 도구를 제공합니다
Open-Weights
이미지→비디오Sand AI가 MAGI-1을 오픈소스로 공개했습니다. 이 자기회귀 모델은 비디오를 청크별로 생성하며, 24B 및 4.5B 매개변수 버전을 제공하고 다양한 비디오 생성 모드를 지원합니다
Open-Weights
이미지→비디오SkyworkAI가 무한 길이 비디오 생성을 지원하고 텍스트-투-비디오 및 이미지-투-비디오 기능을 모두 갖춘 새로운 오픈소스 비디오 생성 모델 SkyReels-V2를 출시
Open-Weights
음성 합성나리 랩스에서 오픈소스 텍스트 음성 변환 모델 Dia 1.6B를 발표했으며, 텍스트에서 직접 다중 캐릭터 대화를 생성하고 감정 표현과 비언어적 의사소통을 지원
Open-Weights
멀티모달쿤룬완웨이의 SkyReels 팀이 Diffusion Forcing 프레임워크를 사용하여 세계 최초의 무한 길이 영화 생성 모델인 SkyReels-V2를 출시하고 오픈 소스화했습니다. 이 모델은 고품질의 긴 동영상 콘텐츠를 생성할 수 있습니다.
Open-Weights
텍스트→이미지Shakker Labs가 제어 효과가 최적화되고, 다양한 제어 모드를 지원하며, 모델 크기가 더 작아진 새로운 FLUX.1-dev-ControlNet-Union-Pro-2.0 모델을 출시했습니다
Open-Weights