XGEN-JING: MiniMax H3 기반 1인칭 인터랙티브 모델

ComfyUI Wikinews

XGEN Labs의 JING-Flash-v1은 MiniMax H3 기반으로 1인칭 비디오와 오디오를 생성합니다: 키보드 카메라 제어, 텍스트 기반 상호작용, 대화, 4단계 추론.

XGEN LabsMiniMax H3를 기반으로 구축된 1인칭 인터랙티브 경험 모델 XGEN-JING을 공개했습니다. 일반 비디오 모델이 고정된 클립을 생성하는 것과 달리, JING은 작업, 참조 이미지, 관찰 기록을 입력받아 1인칭 비디오와 오디오를 생성합니다: 직접 움직이고, 사물과 상호작용하고, 대화를 나눌 수 있습니다.

XGEN-JING 커버

모델 저장소의 공식 XGEN-JING 커버.

무엇을 하는가

이 모델은 세 가지 동작을 위해 학습되었으며, 모두 비디오와 오디오로 동시에 생성됩니다:

  • 카메라 제어. 키보드 입력으로 일상적인 장소와 상상 속 세계를 이동하며, 동일한 시작 지점을 다른 방식으로 걸어 탐험합니다.
  • 상호작용과 대화. 모션 프롬프트 대신 텍스트로 사물 상호작용과 캐릭터 대화를 지시합니다.
  • 참조 조건화. 이야기에서 가져온 캐릭터, 사물, 장면 이미지로 경험을 구성하여, 동일한 참조 세트를 서로 다른 작업 아래에서 탐험할 수 있습니다.

JING Flash는 MiniMax H3의 Ref2VA 경로와 4단계 H3 LoRA인 FlashGen을 기반으로 하며, 이것이 4단계 양방향 추론을 가능하게 합니다. 텍스트 인코더, tokenizer, 프로세서, 비디오 및 오디오 VAE와 스케줄러는 모두 릴리스의 일부가 아니라 diffusers 형식의 MiniMax H3에서 가져온 것이므로, 새로 추가된 것은 jing_flash_v1 transformer뿐입니다.

릴리스 상태

이것은 미리보기 등급의 릴리스이며, 릴리스 계획에서 이를 명확히 밝히고 있습니다:

항목상태
JING-Flash-v1 4단계 양방향 모델공개됨
추론 코드 및 예제공개됨
프롬프트 스킬공개됨
인과 모델곧 출시 예정
기술 보고서곧 출시 예정

이 구분은 여기서 말하는 "인터랙티브"의 의미에 중요합니다. 4단계 양방향 모델은 작업 시퀀스를 미리 알고 전체 클립을 생성합니다. 키를 누르는 대로 단계별로 반응하는 인과 모델은 아직 공개되지 않았습니다. XGEN Labs는 가중치와 함께 갤러리와 데모 영상을 공개했습니다.

저장소에는 프롬프트 스킬 문서도 포함되어 있으며, 이는 이야기와 참조 이미지로부터 검증된 추론 사례를 생성합니다.

XGEN Labs 로고

사용 가능 여부

공식 XGEN-JING 데모 영상.

ComfyUI 지원은 없습니다: 추론 경로는 diffusers와 특정 diffusion 리비전에 고정된 SGLang 런타임으로 구성되며, 검증된 데모 구성은 스택을 6개의 H100 GPU에 분산합니다(텍스트 인코더용 1개, 비디오 및 오디오 VAE용 1개, 시퀀스 병렬 처리를 사용하는 DiT용 4개). 기본 어텐션 백엔드는 FlashAttention-4입니다. 인과 모델과 더 가벼운 추론 경로가 나오기 전까지, 이는 로컬 ComfyUI 환경에서 실행할 수 있는 무언가라기보다 H3 기반 인터랙티브 모델이 향하는 방향을 보여주는 사례입니다.

동일한 기반을 사용한 이전 인터랙티브 월드 모델은 H3-World를 참고하세요.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
XGEN-JING: MiniMax H3 기반 1인칭 인터랙티브 모델 | ComfyUI Wiki