Noticias de ComfyUI y lanzamientos de IA de código abierto

Novedades del ecosistema ComfyUI: lanzamientos de modelos de código abierto, nodos personalizados, flujos de trabajo y herramientas de generación de imagen, video y audio.

Multimodal

OpenMOSS lanza MOVA - modelo de generación sincronizada de video y audio de código abierto

Multimodal
Modelo base
OpenMOSS lanza MOVA - modelo de generación sincronizada de video y audio de código abierto

El equipo de OpenMOSS lanza MOVA (MOSS Video and Audio), un modelo fundacional de generación sincronizada de video y audio de extremo a extremo que genera video y audio en una sola inferencia, logrando sincronización labial precisa y efectos de sonido conscientes del entorno, con código de modelo, entrenamiento e inferencia completamente de código abierto

Open-Weights

Texto a imagen

Alibaba Tongyi Lab Lanza Z-Image-Base - Modelo de Generación de Imágenes de Alta Calidad No Destilado

Texto a imagen
Modelo base
Alibaba Tongyi Lab Lanza Z-Image-Base - Modelo de Generación de Imágenes de Alta Calidad No Destilado

Alibaba Tongyi Lab lanza Z-Image-Base, el modelo fundacional no destilado de la serie Z-Image, preservando el potencial generativo completo y proporcionando una base ideal para el ajuste fino de la comunidad y el desarrollo personalizado

Open-Weights

Multimodal

Moonshot AI lanza Kimi K2.5 - Modelo de agente multimodal nativo de 1T parámetros

Multimodal
Modelo base
Moonshot AI lanza Kimi K2.5 - Modelo de agente multimodal nativo de 1T parámetros

Moonshot AI lanza oficialmente Kimi K2.5, un modelo de agente multimodal nativo de 1T parámetros, pre-entrenado continuamente en aproximadamente 15 billones de tokens mixtos visuales y de texto, compatible con comprensión de imágenes y videos con mecanismo de colaboración autónoma Agent Swarm

Open-Weights

Texto a voz

Alibaba Qwen lanza Qwen3-TTS - Modelo de síntesis de voz con latencia ultra baja de 97ms

Texto a voz
Modelo base
Alibaba Qwen lanza Qwen3-TTS - Modelo de síntesis de voz con latencia ultra baja de 97ms

Alibaba Qwen publica como código abierto la serie de modelos de generación de voz Qwen3-TTS, logrando latencia ultra baja de 97ms mediante modelado Dual-Track, compatible con clonación de voz de 3 segundos y diseño de voz en lenguaje natural, cubriendo 10 idiomas principales

Open-Weights

Reconocimiento de voz

Microsoft lanza VibeVoice-ASR - Modelo de reconocimiento de voz compatible con procesamiento de audio largo de 60 minutos en un solo paso

Reconocimiento de voz
Modelo base
Microsoft lanza VibeVoice-ASR - Modelo de reconocimiento de voz compatible con procesamiento de audio largo de 60 minutos en un solo paso

Microsoft publica como código abierto VibeVoice-ASR, un modelo unificado de reconocimiento de voz de 9B parámetros capaz de procesar hasta 60 minutos de audio en un solo paso, completando conjuntamente reconocimiento, diarización de hablantes y generación de marcas de tiempo en un solo proceso de inferencia

Open-Weights

Multimodal

NVIDIA lanza PersonaPlex-7B-v1 - Modelo de diálogo de voz full-duplex

Multimodal
Modelo base
NVIDIA lanza PersonaPlex-7B-v1 - Modelo de diálogo de voz full-duplex

NVIDIA publica como código abierto PersonaPlex-7B-v1, un modelo de diálogo de voz full-duplex de 7 mil millones de parámetros basado en arquitectura Moshi, compatible con escucha y habla simultáneas, interrupciones naturales y personalización de roles con latencia de respuesta a interrupciones tan baja como 240 milisegundos

Open-Weights