NVIDIA Cosmos3-Edge: открытая мировая модель 4B для видео

ComfyUI Wikinews

NVIDIA выпускает Cosmos3-Edge, мировую модель 4B на архитектуре MoT, генерирующую видео, изображения и аудио из текста и изображений, с нодами ComfyUI.

NVIDIA Cosmos3-Edge — новейший представитель семейства Cosmos 3 открытых омнимодальных мировых моделей. Модель 4B на архитектуре Mixture-of-Transformers (MoT) принимает на вход текст, изображения, видео и траектории действий и генерирует согласованные текст, изображения, видео и действия, покрывая симуляцию мира, предсказание будущего и рассуждение о действиях для Physical AI.

Что такое Cosmos 3

Cosmos 3 объединяет понимание, генерацию, симуляцию и действия в одном трансформере: авторегрессионная башня обрабатывает дискретные текстовые токены, а диффузионный трансформер синтезирует изображения, видео, аудио и действия итеративным денойзингом. Отдельного текстового энкодера нет — языковые и диффузионные токены проходят через один общий трансформер, который сам считывает свою архитектуру из чекпоинта.

МодельРазмерКлючевые особенности
Cosmos3-Edge4BТекст-в-видео, изображение-в-видео, генерация с управлением действиями (backbone Nemotron-dense)
Cosmos3-Nano16BОмнимодальная: текст, изображение, видео, аудио + действия
Cosmos3-Super64BКрупнейшая омнимодальная модель
Cosmos3-Super-Image2Video-4Step64BДистилляция DMD2, изображение-в-видео за 4 шага
Cosmos3-Super-Text2Image-4Step64BДистилляция DMD2, текст-в-изображение за 4 шага

Cosmos3-Edge принимает текстовые и графические входы в разрешениях 256p и 480p с соотношениями 16:9, 4:3, 1:1, 3:4 и 9:16, а управление действиями работает с различными робототехническими embodiment: руки Franka Panda, автономные транспортные средства, дроны и траектории камер. Ниже — выходы генерации аудио-видео с управлением действиями из карточки модели:

Выход аудио-видео Cosmos3-Edge с управлением действиями Выход аудио-видео Cosmos3-Edge с управлением действиями

Поддержка ComfyUI

Cosmos3 не входит в ядро ComfyUI, но пакет кастомных нод ComfyUI-Cosmos3 поддерживает всё семейство Cosmos3 — включая Cosmos3-Edge для текст-в-видео и изображение-в-видео — через встроенный стек KSampler / SamplerCustomAdvanced:

  1. Клонируйте ComfyUI-Cosmos3 в ComfyUI/custom_nodes/ и установите его requirements.txt
  2. Скачайте чекпоинт (например, nvidia/Cosmos3-Edge) в ComfyUI/models/cosmos3/<name>/; загрузчик считывает архитектуру из transformer/config.json, ручная настройка не требуется
  3. Сэмплируйте с flow-matching расписанием uni_pc_bh2; текстовая башня префиллится один раз на промпт, а её K/V переиспользуются между шагами денойзинга

В пакете есть примеры workflow для текст-в-видео, изображение-в-видео, совместного аудио-видео и дистиллированных 4-шаговых чекпоинтов Super:

Доступность

Веса открыты на Hugging Face, коллекция моделей — на huggingface.co/collections/nvidia/cosmos3. Официальный код инференса и обучения находится в репозитории NVIDIA Cosmos и Cosmos Framework, технический отчёт — на странице исследований Cosmos 3.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
NVIDIA Cosmos3-Edge: открытая мировая модель 4B для видео | ComfyUI Wiki