NVIDIA Cosmos3-Edge: Modelo Mundial Omnimodal Abierto de 4B para Vídeo

ComfyUI Wikinews

NVIDIA lanza Cosmos3-Edge, un modelo de mundo MoT de 4B que genera vídeo, imágenes y audio desde texto e imágenes, con nodos ComfyUI.

NVIDIA Cosmos3-Edge es el miembro más reciente de la familia Cosmos 3 de modelos mundiales omnimodales abiertos. El modelo Mixture-of-Transformers (MoT) de 4B toma texto, imágenes, vídeo y trayectorias de acción como entrada y genera salidas coherentes de texto, imágenes, vídeo y acciones, lo que cubre la simulación del mundo, la predicción del futuro y el razonamiento de acciones para aplicaciones de IA Física.

¿Qué es Cosmos 3?

Cosmos 3 unifica la comprensión, la generación, la simulación y la acción en un único transformer: una torre autoregresiva maneja tokens de texto discretos mientras que un transformer de difusión sintetiza imágenes, vídeo, audio y acciones mediante denoising iterativo. No existe un codificador de texto separado: los tokens de idioma y difusión pasan por un único transformer compartido, por lo que el modelo lee su propia arquitectura desde el checkpoint.

ModeloTamañoDestacados
Cosmos3-Edge4BTexto-a-vídeo, imagen-a-vídeo, generación condicionada por acciones (backbone denso Nemotron)
Cosmos3-Nano16BOmnimodal: texto, imagen, vídeo, audio + acciones
Cosmos3-Super64BModelo omnimodal más grande
Cosmos3-Super-Image2Video-4Step64BDestilado con DMD2, imagen-a-vídeo en 4 pasos
Cosmos3-Super-Text2Image-4Step64BDestilado con DMD2, texto-a-imagen en 4 pasos

Cosmos3-Edge admite entradas de texto e imagen a 256p y 480p con relaciones de aspecto 16:9, 4:3, 1:1, 3:4 y 9:16, y su acondicionamiento por acciones funciona en distintas plataformas robóticas, como brazos Franka Panda, vehículos autónomos, drones y trayectorias de cámara. Las salidas que se muestran a continuación presentan la generación de audio-vídeo condicionada por acciones de la tarjeta del modelo:

Salida de audio-vídeo condicionada por acciones de Cosmos3-Edge Salida de audio-vídeo condicionada por acciones de Cosmos3-Edge

Soporte de ComfyUI

Cosmos3 no forma parte del núcleo de ComfyUI, pero el paquete de nodos de la comunidad ComfyUI-Cosmos3 ofrece soporte para toda la familia Cosmos3, incluido Cosmos3-Edge para texto-a-vídeo e imagen-a-vídeo, a través de la pila integrada KSampler / SamplerCustomAdvanced:

  1. Clona ComfyUI-Cosmos3 en ComfyUI/custom_nodes/ e instala su requirements.txt
  2. Descarga un checkpoint (p. ej. nvidia/Cosmos3-Edge) en ComfyUI/models/cosmos3/<name>/; el cargador lee la arquitectura desde transformer/config.json, por lo que no se necesita configuración manual
  3. Muestrea con el programa de flow-matching uni_pc_bh2; la torre de texto se rellena previamente una vez por prompt y su K/V se reutiliza en todos los pasos de denoising

El paquete incluye flujos de trabajo de ejemplo para texto-a-vídeo, imagen-a-vídeo, audio-vídeo conjunto y los checkpoints destilados Super de 4 pasos:

Disponibilidad

Los pesos están abiertos en Hugging Face, con la colección de modelos en huggingface.co/collections/nvidia/cosmos3. El código oficial de inferencia y entrenamiento se encuentra en el Repositorio de NVIDIA Cosmos y en el Cosmos Framework, y el informe técnico está en la página de investigación de Cosmos 3.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
NVIDIA Cosmos3-Edge: Modelo Mundial Omnimodal Abierto de 4B para Vídeo | ComfyUI Wiki