EVOKE 14B: 알라야랩(Alaya Lab)의 오픈 3단계 인터랙티브 월드 모델
Alaya Lab이 EVOKE를 공개했습니다. 14B 오픈 가중치 월드 모델로, 3단계로 384x640 비디오를 생성하며 외부 월드 상태 메모리와 실행 중 프롬프트 전환을 지원합니다.
개요
EVOKE("Endless Interactive World with Bounded State and Long-Horizon Supervision")는 Alaya Lab의 AlayaWorld의 후속 모델입니다. 논문은 WBench 인터랙티브 벤치마크에서 최첨단 결과를 보고하면서 VBench-Long과 VBench-2.0에서도 경쟁력을 유지하는 3단계, CFG 없는 월드 모델을 설명합니다.
증류 모델은 384 x 640 @ 24fps를 생성하며 30초 롤아웃 동안 일관성을 유지합니다. 단일 H200에서 2.11초마다 1.5초 분량의 비디오를 생성합니다. 가중치는 Hugging Face에 공개되어 있으며, 추론 및 학습 런처는 GitHub 저장소에서 제공됩니다.
EVOKE 공식 개요 비디오
3단계 생성, CFG 제로
대부분의 few-step 모델은 증류에 사용되는 티처(teacher)로부터 성능 상한선을 물려받습니다. EVOKE는 티처를 고정된 생성기로 취급하는 대신 장기 지평(long-horizon) 인터랙티브 생성을 위해 재설계합니다. 청크 단위 그룹화, 원거리 프레임 검색, 선형 어텐션 글로벌 상태를 통해 티처의 메모리와 연산이 세션 길이에 따라 선형적으로 증가하도록 유지하며, 이 덕분에 30초 자기 강제(self-forced) 지도 학습이 가능해집니다.
자기 강제 롤아웃에 적용되는 분포 정합(distribution-matching) 목적 함수는 이러한 능력을 3단계 학습자(student)에게 전달합니다. 이 학습자는 classifier-free guidance를 사용하지 않으며, 단계당 두 번이 아닌 한 번의 순전파만 수행합니다.
EVOKE 추론 파이프라인: 지속형 월드 상태 뱅크가 오토리그레시브 few-step 디노이저에 입력을 공급합니다
무한, 창 기반이 아닌
인터랙티브 월드 모델은 다음의 충돌에 직면합니다. 디노이저 컨텍스트나 키-값 캐시에 기록을 유지하면 세션 길이에 따라 비용이 증가하는 반면, 저지연 인터랙션은 few-step 생성을 요구합니다. EVOKE는 지속형 월드 상태를 외부화하여 이 문제를 해결합니다.
- Write: 단안(monocular) 깊이 모델이 알려진 카메라 포즈 하에서 각 생성 청크의 깊이를 추정하고 이를 역투영(unproject)하여 지속형 포인트 클라우드로 변환합니다.
- Read: 현재 카메라 포즈가 뱅크를 직접 지정합니다. 상호 가시성(co-visibility)으로 순위가 매겨진 최대 8개 소스가 배치 처리된 z-버퍼 스캐터로 융합되고, 워프된 이미지와 픽셀별 가시성 마스크를 반환합니다.
- Evict: 옵션인 보존 창(retention window)으로, 시간 단위 실행을 위해 명시적으로 활성화합니다.
뷰와 관련된 정보만 검색되므로 세션이 아무리 길어도 디노이저 컨텍스트는 제한된 상태를 유지합니다. 세션 길이와 메모리를 맞바꿀 필요가 없습니다.
생성 도중 세계 변경
청크 단위 조건화를 통해 롤아웃이 실행되는 동안 프롬프트를 변경할 수 있습니다. 컷 없이, 재시작 없이 말이죠. 아래 각 일정은 6개 청크 중 3번째 청크(213프레임, 8.9초)에서 전환됩니다.
| 장면 | 전환되는 프롬프트 | |
|---|---|---|
![]() | 얼어붙은 툰드라, 극지의 낮 | 하늘 전체에 오로라가 피어오릅니다 |
![]() | 지속형 월드 내비게이션 | 세계가 공간 상태를 유지하는 동안 카메라가 이동하고 회전합니다 |
조건화 모드
| 모드 | 입력 | 카메라 제어 |
|---|---|---|
v2v | 참조 비디오 + 포즈 트랙 | 가능, 참조 창 이후에도 계속됩니다 |
i2v | 단일 첫 프레임 + 포즈 트랙 | 가능 |
t2v | 프롬프트만 | 불가 (엔진이 warp + t2v를 금지함) |
기능 데모: 게임처럼 생성된 세계를 탐색하는 모습 (공식 프로젝트 페이지에서 발췌)
릴리스 구성
이번 릴리스는 기본 구성 요소와 함께 4개의 모델을 제공합니다.
| 디렉터리 | 모델 | 단계 |
|---|---|---|
stage3_post_distillation | 배포 모델 | 3, CFG 프리 |
stage1_camera_control | 다단계 카메라 제어 가능 모델 | 50, CFG 5.0 |
stage2_few_step_training | few-step 증류 (3단계 피라미드) | 학습 전용 |
evoke_teacher | 듀얼 전문가 DMD 티처 | 50, CFG 5.0 |
모든 EVOKE 디렉터리는 transformer/의 상위 디렉터리이며 from_pretrained(path, subfolder="transformer")로 로드됩니다. 증류 모델은 v2v 조건화만으로 학습되었으므로 이 모델에서 i2v와 t2v는 **제로샷(zero-shot)**입니다. 분포 내(in-distribution)에서 세 가지 모드를 모두 갖는 것은 stage1_camera_control뿐입니다. evoke-base의 VAE, 텍스트 인코더, 토크나이저, 스케줄러는 공개된 Helios 베이스에서 가져온 것으로, 결국 Wan에서 파생되었습니다.
사용 가능 여부
EVOKE는 출시 시점에 네이티브 ComfyUI 지원이 없습니다. 공식 릴리스는 텍스트 기반 비디오 생성, 이미지 기반 비디오 생성, 비디오 기반 비디오 생성, 롤아웃 중간 세그먼트 모드를 위한 Python 추론 런처(scripts/inference/infer_post_distill.sh)와 각 단계별 학습 런처를 제공합니다. 월드 상태 뱅크에는 ViGeo 깊이 백엔드가 필수입니다. Depth-Anything-3는 선택 사항입니다. 가중치는 Hugging Face의 AlayaLab/Evoke에서 확인할 수 있습니다.


댓글
GitHub로 로그인하고 토론에 참여하세요.