MiniMax-H3 × Z-Image: прививка пространственных деталей для видео H3

ComfyUI Wikinews

Прививка переносит внимание Z-Image на MiniMax-H3 через пересчёт q_norm: богаче декорации и текстуры, ровная детализация между склейками, чекпоинты для ComfyUI.

MiniMax-H3 × Z-Image (репозиторий для ComfyUI | GGUF-репозиторий) — это сообщественная прививка пространственных деталей от joeygambino, которая переносит профиль внимания Z-Image, специализирующийся на текстурах, на поздние блоки MiniMax-H3. Результат — прямая замена стандартных чекпоинтов H3: та же идентичность, голоса, скорость и VRAM, но заметно более богатые декорации и поверхности.

Что это

Z-Image (Lumina2, 6B-модель изображений, известная исключительной прорисовкой текстур) и MiniMax-H3 используют поперечную нормализацию Q в attention. Прививка пересчитывает веса q_norm поздних блоков H3, чтобы они уделяли внимание мелкой текстуре так же, как Z-Image, без дообучения, новых знаний или изменений архитектуры. Ранние блоки не трогаются (их прививка даёт решётчатый артефакт на регулярных текстурах — это измерено, а не предположено), а нормализация K и feed-forward слои не изменяются никогда.

Это второй «брак» в линейке автора: Joy-LTX 2.5 перенёс производительность JoyAI-Echo на LTX-2.5 через трансплантацию дельты весов. Здесь донор — совершенно другая архитектура, поэтому переносятся статистики внимания, а не веса; механизм блокируется по блокам и дозируется, проверен против базовых линий с одинаковым сидом.

Как это выглядит

Демо-видео — непрерывные трёхкадровые планы, отрендеренные файлами с этой страницы:

На цепочках сцен дополнительные детали остаются ровными между склейками: соотношение высоких частот 0,99 на 3 склейках против 1,11 у оригинала, то есть без нарастания резкости от кадра к кадру.

Использование в ComfyUI

Положите файл туда, где лежат ваши чекпоинты H3, и выберите его в лоадере. Все рабочие процессы H3 работают без изменений, включая бесшовные цепочки MiniMax-H3 Multishot. Версии для ComfyUI (bf16 / fp8 / int8 / w4a8 / nvfp4) загружаются стандартным узлом Load Diffusion Model в ComfyUI 0.32+; в GGUF-репозитории есть curve-сборки для карт поменьше:

файлдля
*-curve-zs05-Q8_0.gguf32 ГБ
*-curve-zs05-Q5_1.gguf24-32 ГБ
*-curve-zs05-Q4_0.gguf16-24 ГБ

fl2va vs ref2va: выбор как у стандартного H3 — ref2va, когда нужно сохранить идентичность и голос (референсные изображения, голосовое якорение, банк идентичности), fl2va, когда кадр должен лечь на заданное изображение. Обе версии поддерживают цепочки. На RTX 30/40 автор сообщает, что GGUF-сборки в 4-8 раз быстрее любых 4-битных версий для ComfyUI на Ampere.

Проверка

Автор сообщает об эквивалентности с одинаковым сидом по сравнению с runtime-patch реализацией, сохранении идентичности лиц между вариантами (текстура лица улучшается по сравнению с оригиналом), цепочках из 4 кадров, отрабатывающих сценарные события без артефактов, и проверке математики прививки на уровне тензоров после сборки для каждого файла.

Ссылки

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
MiniMax-H3 × Z-Image: прививка пространственных деталей для видео H3 | ComfyUI Wiki