MiniMax H3 시맨틱 브릿지: 11MB 어댑터로 개선된 프롬프트 준수
SenseNova U1.5 의 의미 정보를 MiniMax H3 의 조건화 공간으로 전달하는 독립적인 지식 증류 프로젝트입니다. ComfyUI 노드 및 예시 워크플로와 함께 11MB 단일 어댑터를 제공합니다.
제공된 예시 워크플로는 표준 H3 FL2VA 파이프라인에서 시맨틱 브릿지 노드가 텍스트 조건화 이후, 샘플링 이전에 위치함을 보여줍니다.
왜 단순히 가중치를 이식하지 않나요?
작성자는 먼저 가장 직관적인 접근 방식을 테스트했습니다: SenseNova U1.5 의 트랜스포머 가중치를 MiniMax H3 로 직접 이식하는 것입니다. 이는 완전히 실패했습니다. 관련 2D 가중치를 비교했을 때, H3 는 264 개의 tensor 를 가지고 있는 반면 SenseNova 는 593 개이며, 정확한 모양 일치, 전치 행렬 일치, 입력 또는 출력 크기 매칭은 모두 없습니다.
작동 가능한 인터페이스는 조건화 표현임이 밝혀졌습니다. H3 는 내부 5376 차원 트랜스포머 공간으로 투영하기 전에 5120 차원의 텍스트 조건화를 소비하며, SenseNova 의 언어 표현은 4096 차원입니다. 가중치를 복사하는 대신, 이 프로젝트는 두 아키텍처가 같은 프롬프트를 어떻게 표현하는지 정렬한 후, 그 매핑을 소형 H3 측 어댑터로 지식 증류했습니다.
저널에 완전히 문서화된 연구 경로: 숨김 표현 정렬은 원본 분포에서 홀드아웃 프롬프트에 대해 약 0.904 의 검증 코사인 값을 달성했고, 160 개의 엄격한 분포 외 프롬프트에서는 0.749 를 기록했습니다. 완전한 교사 브릿지 (추론 시간 동안 SenseNova 실행) 는 작동했지만 비현실적이었으므로, H3 의 자체 조건화에서 교사 유도 표현을 직접 예측하는 학생 어댑터로 지식을 증류했습니다. 최종 학생은 0.996 의 교사 표현 코사인과 0.984 의 보정 코사인을 달성했으며, 분포 외 보정은 0.990 입니다.
ComfyUI 에서 어댑터의 역할
어댑터는 LoRA, 체크포인트 병합 또는 파라미터 이식이 아닙니다. 추론 시간에는 H3 조건화에서만 작동합니다: 노드는 네이티브 H3 텍스트 조건화를 학습된 의미 표현으로 변환하고 크기를 맞추며 잔여값으로 다시 결합합니다 (C = H + alpha * (S - H)), 확산 트랜스포머 가중치는 그대로 둡니다. 추론 시 SenseNova 는 필요하지 않습니다.
노드 팩 (HF 에 있는 zip) 은 세 개의 노드를 제공합니다:
- MiniMax H3 이미지 → 비디오 + 시맨틱 브릿지: 표준 H3 이미지 기반 비디오 생성 경로의 드롭인 래퍼
- MiniMax H3 시맨틱 브릿지: 조건화 변환 자체로,
alpha(기본값 0.10, A/B 예시는 0.15 사용) 및magnitude_match(토큰별 권장) 제어 기능이 있습니다 - MiniMax H3 시맨틱 브릿지 캐시 지우기
설치: zip 파일을 ComfyUI/custom_nodes/ 로 추출하고, MiniMaxH3_SemanticBridge_v1.safetensors 를 ComfyUI/models/semantic_bridge/ 에 넣은 후 재시작합니다. 전체 어댑터는 약 11MB 입니다.
목표: 새로운 스타일이 아닌 프롬프트 준수
이 프로젝트는 시각적 개념 추가보다는 의미 구조에 중점을 둡니다: 복잡한 구성, 공간 관계, 해부학, 객체 카운팅, 텍스트 제약, 소재 및 조명, 반사 또는 오클루전 동작 등입니다. 주요 A/B 예시는 유리 테이블 위에 손이 평평하게 놓여 있고 "모든 다섯 손가락이 자연스럽게 분리되어 명확히 보인다"고 요청하는 프롬프트를 강조하며, 기타 많은 동시 제약 사항들 중에서 선택되었습니다.
![]() | ![]() |
|---|---|
| 네이티브 H3: 오른손이 테이블 위를 떠다닙니다 | 시맨틱 브릿지 (alpha 0.15): 손이 프롬프트대로 안정적으로 유지됩니다 |
브릿지를 활성화한 유리 테이블 A/B 쌍의 후반부 (alpha 0.15).
작성자는 이것이 통제된 쌍에서의 정성적 관찰이지 벤치마크가 아니라고 명시합니다: 어댑터는 일부 프롬프트에는 도움이 될 수 있지만, 다른 것에는 거의 효과가 없거나 때로는 결과를 악화시킬 수도 있습니다. 표현 공간 지표는 지각적 품질 향상으로 직접 전환되지 않습니다.
범위: FL2VA 전용 및 24GB 개발 환경
두 가지 실용적인 참고 사항입니다. 첫째, v1 은 표준 FL2VA / 텍스트 조건화 경로에서만 작동합니다. Ref2VA 호환 변형체가 테스트되었으나 참조 오디오 노래 및 입술 동기화가 저하되었으므로, README 는 참조 조건화 생성에 사용하지 않도록 명시적으로 경고합니다.
둘째, 전체 프로젝트 (표현 추출, 브릿지 실험, 지식 증류, 평가) 는 멀티 GPU 클러스터 없이 24GB 단 하나의 RTX 3090 Ti 에서 실행되었습니다. 호환되지 않는 아키텍처 간 학습된 행동 전달에 관한 실험으로서, 이는 릴리스의 가장 흥미로운 부분이라 할 수 있습니다.
사용 가능성
- 어댑터, 노드, 워크플로, 연구 자료: speach1sdef178/MiniMax-H3-Semantic-Bridge on Hugging Face
- 라이선스: 모델 유래 아티팩트는 MiniMax H3 커뮤니티 라이선스를 따릅니다 (NOTICE 포함); SenseNova U1.5 교사는 Apache-2.0 이며 재배포되지 않습니다
- 전체 연구 보고서: RESEARCH_ARTICLE.md


댓글
GitHub로 로그인하고 토론에 참여하세요.