TaoMate-H3: потоковая LoRA от Alibaba для MiniMax H3

ComfyUI Wikinews

Alibaba TaoLive AIGC выпустила TaoMate-H3: 3-шаговый LoRA, потоково выдающий синхронизированное аудио и видео блоками для длинной генерации MiniMax H3 на 35 FPS.

Команда TaoLive AIGC из группы Taobao и Tmall Group компании Alibaba выпустила TaoMate-H3: низколатентный потоковый рантайм на базе MiniMax H3, который генерирует синхронизированное аудио и видео небольшими блоками. Фреймворк достигает 35 FPS при stage-parallel выводе, поддерживает непрерывную генерацию дольше 30 минут и поставляется с 3-шаговым LoRA-адаптером ранга 128 вместе с кодом рантайма на GitHub (150+ звёзд).

Обзор

TaoMate: это фреймворк с постоянной памятью и наведением по якорю (anchor) для совместной генерации аудио и видео за несколько шагов, описанный в статье и на странице проекта. Вместо расширения кэша активного контекста он сохраняет неизменяемый визуальный якорь, сжимает завершённые видео- и аудиоблоки в динамические состояния фиксированной ёмкости и извлекает эти состояния через модально-специфичное residual attention. Метод модуляции с учётом референса обуславливает видео-признаки статистикой внешнего вида якоря, а дистилляция причинно-следственного контекста с сохранением якоря не даёт якорю искажаться во время обучения.

МетрикаЗначение
Потоковый выход35 FPS
Задержка на одном устройстве130.3 с / 1441 кадр
Базовая модель22.1B (MiniMax H3)
Долгосрочная согласованность0.9520
Рассинхронизация аудио0.000

Выпущенный рантайм генерирует речь, звуковые эффекты и видео на одной синхронизированной временной шкале с чистой передачей KV-кэша, которая сохраняет визуальную идентичность, голос и движение на границах промптов. Каждый пятисекундный блок может нести собственный промпт через файл --prompt-json, а генерация выполняется в 480p, 768p и выровненном 1080p. Проверенная конфигурация оборудования: 8 x H20 96 GB с тензорным и последовательным параллелизмом.

Кадр TaoMate-H3 из официального демо-ролика: репортёр в гавани

Кадр из официального демо-ролика: один персонаж-рассказчик, сохраняемый между потоковыми блоками.

Что было выпущено

Официальное демо: 10-секундный клип с глиняным роботом, сгенерированный с синхронизированным аудио.

Реакция сообщества

Релиз быстро привлёк внимание сообщества MiniMax H3. За неделю он собрал 150+ звёзд на GitHub, а участники сообщества нашли практичный рабочий процесс с двумя сэмплерами для использования на одной GPU: сначала построить сцену сэмплером с высоким качеством по шагам, а затем завершить последние три шага с помощью LoRA TaoMate. Тестировщики сообщают о высоком визуальном качестве без «пережаренного» вида, характерного для других turbo LoRA, и при этом отмечают, что статичные или медленные сцены работают значительно лучше быстрого движения. Также доступна конвертация LoRA в safetensors, совместимую с ComfyUI, от участника сообщества.

Доступность

TaoMate-H3 требует базовую модель MiniMax H3 и рассчитан на Linux с GPU SM90 (Hopper) в рамках лицензии сообщества MiniMax H3. Код рантайма, руководство по установке и формат файла промптов находятся в репозитории GitHub, а LoRA-адаптер на Hugging Face. Нативной ноды ComfyUI для самого потокового рантайма нет; пользователи с одной GPU получают доступ к LoRA через рабочие процессы сообщества.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
TaoMate-H3: потоковая LoRA от Alibaba для MiniMax H3 | ComfyUI Wiki