MiniMax H3 TRT VAE: декодирование H3 в ComfyUI в 1.7 раза быстрее

ComfyUI Wikinews

Пакет узлов ComfyUI компилирует видео VAE MiniMax H3 в движки TensorRT, сокращая время кодирования и декодирования VAE до 1.7x, с декодером w4a16 для малого объёма VRAM.

ComfyUI-H3VAE_TRT запускает видео VAE MiniMax H3 через TensorRT. Скомпилируйте VAE один раз, а затем переиспользуйте движок: узел сообщает об ускорении кодирования и декодирования VAE в ComfyUI до 1.7x.
ПРЕДПРОСМОТР узла и рабочего процесса из README проекта

ПРЕДПРОСМОТР из README проекта: узлы компиляции и загрузки TRT VAE внутри графа ComfyUI.

Декодирование VAE: это фиксированная стоимость при каждом запуске H3. Встроенные ядра ComfyUI уже сократили эту стоимость на стороне PyTorch; этот узел идёт другим путём и передаёт VAE скомпилированному движку TensorRT.

Что делает узел

Пакет содержит два узла и маршрут через ONNX к движку:

  • MiniMax-H3 TRT VAE Compiler принимает ONNX-энкодер и декодер и собирает движки TensorRT. Это одноразовый шаг, а скомпилированные движки затем переиспользуются.
  • MiniMax-H3 TRT VAE Loader загружает скомпилированные движки, чтобы их можно было использовать вместо обычного VAE.

Веса опубликованы в виде ONNX-файлов на Hugging Face и размещаются в ComfyUI/models/vae. Пакет также включает отдельный compile.py для сборки движков вне ComfyUI, что полезно, когда шаг компиляции не должен блокировать интерфейс.

Установка

ШагДействие
1git clone https://github.com/lihaoyun6/ComfyUI-H3VAE_TRT в ComfyUI/custom_nodes и установите requirements.txt
2Скачайте ONNX-энкодер и декодер в ComfyUI/models/vae
3Запустите MiniMax-H3 TRT VAE Compiler один раз, чтобы собрать движки
4Переключите VAE рабочего процесса на MiniMax-H3 TRT VAE Loader

В ONNX-репозитории также есть вариант декодера w4a16_awq, который README рекомендует, когда у GPU меньше 12 ГБ VRAM.

Заметки из трекера проблем

Проблемы репозитория стоит прочитать до компиляции, потому что сборки TensorRT чувствительны к установленному стеку:

  • Компиляция движка идёт медленно. В одном сообщении зафиксировано более пяти часов на одну сборку, поэтому первую компиляцию лучше делать заранее, а не посреди сессии.
  • Версии TensorRT и CUDA должны совпадать. Есть открытые сообщения о TensorRT 11.2 с CUDA 13.0, а также ошибка использования API IBuilder::buildSerializedNetwork на другой конфигурации.
  • Сетка, которую скомпилированный энкодер оставлял на первом, последнем и референсных кадрах, была описана и исправлена в начале сентября, поэтому сборка из текущей ветки main её избегает.

Доступность

Пакет узлов и ONNX-веса общедоступны:

Пакет узлов: lihaoyun6/ComfyUI-H3VAE_TRT
ONNX-веса: lihaoyun6/MiniMax-H3-VAE-ONNX
Базовая модель: MiniMaxAI/MiniMax-H3

В пакет не входит пример рабочего процесса: компилятор и загрузчик встраиваются в существующий граф H3 вместо стандартного узла VAE.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
MiniMax H3 TRT VAE: декодирование H3 в ComfyUI в 1.7 раза быстрее | ComfyUI Wiki