TaoMate-H3: потоковая LoRA от Alibaba для MiniMax H3
Alibaba TaoLive AIGC выпустила TaoMate-H3: 3-шаговый LoRA, потоково выдающий синхронизированное аудио и видео блоками для длинной генерации MiniMax H3 на 35 FPS.
Обзор
TaoMate: это фреймворк с постоянной памятью и наведением по якорю (anchor) для совместной генерации аудио и видео за несколько шагов, описанный в статье и на странице проекта. Вместо расширения кэша активного контекста он сохраняет неизменяемый визуальный якорь, сжимает завершённые видео- и аудиоблоки в динамические состояния фиксированной ёмкости и извлекает эти состояния через модально-специфичное residual attention. Метод модуляции с учётом референса обуславливает видео-признаки статистикой внешнего вида якоря, а дистилляция причинно-следственного контекста с сохранением якоря не даёт якорю искажаться во время обучения.
| Метрика | Значение |
|---|---|
| Потоковый выход | 35 FPS |
| Задержка на одном устройстве | 130.3 с / 1441 кадр |
| Базовая модель | 22.1B (MiniMax H3) |
| Долгосрочная согласованность | 0.9520 |
| Рассинхронизация аудио | 0.000 |
Выпущенный рантайм генерирует речь, звуковые эффекты и видео на одной синхронизированной временной шкале с чистой передачей KV-кэша, которая сохраняет визуальную идентичность, голос и движение на границах промптов. Каждый пятисекундный блок может нести собственный промпт через файл --prompt-json, а генерация выполняется в 480p, 768p и выровненном 1080p. Проверенная конфигурация оборудования: 8 x H20 96 GB с тензорным и последовательным параллелизмом.
Кадр из официального демо-ролика: один персонаж-рассказчик, сохраняемый между потоковыми блоками.
Что было выпущено
- Код рантайма: полный стек потокового вывода в TaoLiveAIGC/TaoMate-H3, включая блочную генерацию, планирование промпта для каждого блока и stage-parallel выполнение
- 3-шаговый LoRA-адаптер: EMA-чекпоинт генератора на шаге 3000 (ранг 128, alpha 128, тензоры FP32) в TaoLiveAIGC/TaoMate-H3 на Hugging Face, используемый с базовой моделью MiniMax H3 FL2VA
- Демо-галерея: примеры роликов, включая непрерывный 30-минутный рассказчик документального фильма на странице проекта
Официальное демо: 10-секундный клип с глиняным роботом, сгенерированный с синхронизированным аудио.
Реакция сообщества
Релиз быстро привлёк внимание сообщества MiniMax H3. За неделю он собрал 150+ звёзд на GitHub, а участники сообщества нашли практичный рабочий процесс с двумя сэмплерами для использования на одной GPU: сначала построить сцену сэмплером с высоким качеством по шагам, а затем завершить последние три шага с помощью LoRA TaoMate. Тестировщики сообщают о высоком визуальном качестве без «пережаренного» вида, характерного для других turbo LoRA, и при этом отмечают, что статичные или медленные сцены работают значительно лучше быстрого движения. Также доступна конвертация LoRA в safetensors, совместимую с ComfyUI, от участника сообщества.
Доступность
TaoMate-H3 требует базовую модель MiniMax H3 и рассчитан на Linux с GPU SM90 (Hopper) в рамках лицензии сообщества MiniMax H3. Код рантайма, руководство по установке и формат файла промптов находятся в репозитории GitHub, а LoRA-адаптер на Hugging Face. Нативной ноды ComfyUI для самого потокового рантайма нет; пользователи с одной GPU получают доступ к LoRA через рабочие процессы сообщества.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.