FreeVideo: запуск MiniMax H3 на 8 ГБ видеопамяти
FreeVideo от FlashML запускает MiniMax H3 всего на 8 ГБ видеопамяти: это плагин для ComfyUI и лаунчер для Windows на базе 8-шаговой модели VDN-H3 с выполнением в FP8.
Рабочее пространство FreeVideo внутри ComfyUI. Для LoRA и правки рабочего процесса доступен вид узлов.
На базе VDN-H3
FreeVideo не запускает плотный трансформер H3. Он работает с чекпоинтом 8-шаговой VDN-H3 от OpenVDN: это переработка гибридного внимания Video DeltaNet, которая заменяет квадратичное дальнодействующее внимание H3 на линейную ветвь (см. материал о VDN-H3). FreeVideo упаковывает эту модель как подготовленный FP8-релиз vdn-minimax-h3-edge, около 22,9 ГБ на формат, и надстраивает сверху планировщик, который решает, где будет находиться каждый из 50 трансформерных блоков H3 во время выполнения.
Адаптивное к оборудованию выполнение
Для каждого запроса Adaptive Execution Planner измеряет свободную видеопамять, доступную память хоста и результаты проверки ядер внимания, а затем определяет:
- Размещение блоков: сколько из 50 трансформерных блоков остаются в видеопамяти, сколько живут в закреплённой памяти хоста (до 22 ГБ) и сколько считываются с диска на каждом шаге.
- Путь FP8 GEMM: масштабы по тензорам на Blackwell (SM120), масштабы по каналам на Ada и Hopper, а также веса FP8 с вычислениями BF16 на Ampere.
- Бэкенд внимания: первый из SageAttention 2, PyTorch flash attention, cuDNN, FlashAttention 2 и FlashAttention 4, который проходит проверку на устройстве.
- Размещение декодера VAE: при бюджете ниже 20 ГБ часть из 36 блоков декодера остаётся резидентной, а остальные передаются потоком, при этом клипы декодируются последовательно.
Бюджеты пересчитываются перед каждым запросом, а завершённые запуски сохраняют своё время и пики памяти в resource-history.sqlite3; движок использует эти данные, чтобы переключиться на более быстрое размещение, когда оно прогнозируется как минимум на 2% быстрее.
| Где находятся 50 трансформерных блоков при каждом бюджете видеопамяти | Пропускная способность, которую планировщик ожидает при каждом бюджете видеопамяти |
Что он запускает
- Текстовые промпты в видео с аудио
- Условие по первому и последнему кадру
- Ссылки на изображения, видео и аудио
- LoRA MiniMax H3 от сообщества в том же рабочем процессе
- Двухпроходная выборка и пакетная генерация из рабочего пространства ComfyUI с историей прошлых генераций
Начало работы
В Windows скачайте FreeVideo.exe из релиза windows-preview и запустите его. Лаунчер устанавливает ComfyUI, среду выполнения и пакет моделей, соответствующий вашей видеокарте, переиспользует существующие папки с моделями и поддерживает офлайн-установку из скачанных пакетов.
Чтобы добавить FreeVideo в существующую установку ComfyUI:
cd ComfyUI/custom_nodes
git clone https://github.com/FlashML-org/FreeVideo.gitПерезапустите ComfyUI, откройте Workflow -> Просмотреть шаблоны -> FreeVideo -> FreeVideo-All-in-One и завершите настройку в Настройках FreeVideo. В Linux репозиторий также предлагает CLI:
git clone https://github.com/FlashML-org/FreeVideo.git && cd FreeVideo
./setup.sh
./freevideo generate --prompt-file prompt.txt --out video.mp4Прилагаемый пример рабочего процесса совпадает с тем, что показан в браузере шаблонов:
Доступность
FreeVideo доступен по адресу github.com/FlashML-org/FreeVideo, а подготовленные веса FP8 берутся из OpenVDN/vdn-minimax-h3-edge; лаунчер автоматически скачивает их для обнаруженной архитектуры.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.