NVIDIA Cosmos3-Edge: открытая мировая модель 4B для видео
NVIDIA выпускает Cosmos3-Edge, мировую модель 4B на архитектуре MoT, генерирующую видео, изображения и аудио из текста и изображений, с нодами ComfyUI.
NVIDIA Cosmos3-Edge — новейший представитель семейства Cosmos 3 открытых омнимодальных мировых моделей. Модель 4B на архитектуре Mixture-of-Transformers (MoT) принимает на вход текст, изображения, видео и траектории действий и генерирует согласованные текст, изображения, видео и действия, покрывая симуляцию мира, предсказание будущего и рассуждение о действиях для Physical AI.
Что такое Cosmos 3
Cosmos 3 объединяет понимание, генерацию, симуляцию и действия в одном трансформере: авторегрессионная башня обрабатывает дискретные текстовые токены, а диффузионный трансформер синтезирует изображения, видео, аудио и действия итеративным денойзингом. Отдельного текстового энкодера нет — языковые и диффузионные токены проходят через один общий трансформер, который сам считывает свою архитектуру из чекпоинта.
| Модель | Размер | Ключевые особенности |
|---|---|---|
| Cosmos3-Edge | 4B | Текст-в-видео, изображение-в-видео, генерация с управлением действиями (backbone Nemotron-dense) |
| Cosmos3-Nano | 16B | Омнимодальная: текст, изображение, видео, аудио + действия |
| Cosmos3-Super | 64B | Крупнейшая омнимодальная модель |
| Cosmos3-Super-Image2Video-4Step | 64B | Дистилляция DMD2, изображение-в-видео за 4 шага |
| Cosmos3-Super-Text2Image-4Step | 64B | Дистилляция DMD2, текст-в-изображение за 4 шага |
Cosmos3-Edge принимает текстовые и графические входы в разрешениях 256p и 480p с соотношениями 16:9, 4:3, 1:1, 3:4 и 9:16, а управление действиями работает с различными робототехническими embodiment: руки Franka Panda, автономные транспортные средства, дроны и траектории камер. Ниже — выходы генерации аудио-видео с управлением действиями из карточки модели:
Поддержка ComfyUI
Cosmos3 не входит в ядро ComfyUI, но пакет кастомных нод ComfyUI-Cosmos3 поддерживает всё семейство Cosmos3 — включая Cosmos3-Edge для текст-в-видео и изображение-в-видео — через встроенный стек KSampler / SamplerCustomAdvanced:
- Клонируйте
ComfyUI-Cosmos3вComfyUI/custom_nodes/и установите егоrequirements.txt - Скачайте чекпоинт (например,
nvidia/Cosmos3-Edge) вComfyUI/models/cosmos3/<name>/; загрузчик считывает архитектуру изtransformer/config.json, ручная настройка не требуется - Сэмплируйте с flow-matching расписанием
uni_pc_bh2; текстовая башня префиллится один раз на промпт, а её K/V переиспользуются между шагами денойзинга
В пакете есть примеры workflow для текст-в-видео, изображение-в-видео, совместного аудио-видео и дистиллированных 4-шаговых чекпоинтов Super:
Доступность
Веса открыты на Hugging Face, коллекция моделей — на huggingface.co/collections/nvidia/cosmos3. Официальный код инференса и обучения находится в репозитории NVIDIA Cosmos и Cosmos Framework, технический отчёт — на странице исследований Cosmos 3.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.