MiniMax-H3 × Z-Image: прививка пространственных деталей для видео H3
Прививка переносит внимание Z-Image на MiniMax-H3 через пересчёт q_norm: богаче декорации и текстуры, ровная детализация между склейками, чекпоинты для ComfyUI.
Что это
Z-Image (Lumina2, 6B-модель изображений, известная исключительной прорисовкой текстур) и MiniMax-H3 используют поперечную нормализацию Q в attention. Прививка пересчитывает веса q_norm поздних блоков H3, чтобы они уделяли внимание мелкой текстуре так же, как Z-Image, без дообучения, новых знаний или изменений архитектуры. Ранние блоки не трогаются (их прививка даёт решётчатый артефакт на регулярных текстурах — это измерено, а не предположено), а нормализация K и feed-forward слои не изменяются никогда.
Это второй «брак» в линейке автора: Joy-LTX 2.5 перенёс производительность JoyAI-Echo на LTX-2.5 через трансплантацию дельты весов. Здесь донор — совершенно другая архитектура, поэтому переносятся статистики внимания, а не веса; механизм блокируется по блокам и дозируется, проверен против базовых линий с одинаковым сидом.
Как это выглядит
Демо-видео — непрерывные трёхкадровые планы, отрендеренные файлами с этой страницы:
На цепочках сцен дополнительные детали остаются ровными между склейками: соотношение высоких частот 0,99 на 3 склейках против 1,11 у оригинала, то есть без нарастания резкости от кадра к кадру.
Использование в ComfyUI
Положите файл туда, где лежат ваши чекпоинты H3, и выберите его в лоадере. Все рабочие процессы H3 работают без изменений, включая бесшовные цепочки MiniMax-H3 Multishot. Версии для ComfyUI (bf16 / fp8 / int8 / w4a8 / nvfp4) загружаются стандартным узлом Load Diffusion Model в ComfyUI 0.32+; в GGUF-репозитории есть curve-сборки для карт поменьше:
| файл | для |
|---|---|
*-curve-zs05-Q8_0.gguf | 32 ГБ |
*-curve-zs05-Q5_1.gguf | 24-32 ГБ |
*-curve-zs05-Q4_0.gguf | 16-24 ГБ |
fl2va vs ref2va: выбор как у стандартного H3 — ref2va, когда нужно сохранить идентичность и голос (референсные изображения, голосовое якорение, банк идентичности), fl2va, когда кадр должен лечь на заданное изображение. Обе версии поддерживают цепочки. На RTX 30/40 автор сообщает, что GGUF-сборки в 4-8 раз быстрее любых 4-битных версий для ComfyUI на Ampere.
Проверка
Автор сообщает об эквивалентности с одинаковым сидом по сравнению с runtime-patch реализацией, сохранении идентичности лиц между вариантами (текстура лица улучшается по сравнению с оригиналом), цепочках из 4 кадров, отрабатывающих сценарные события без артефактов, и проверке математики прививки на уровне тензоров после сборки для каждого файла.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.