Noticias de ComfyUI y lanzamientos de IA de código abierto

Novedades del ecosistema ComfyUI: lanzamientos de modelos de código abierto, nodos personalizados, flujos de trabajo y herramientas de generación de imagen, video y audio.

Multimodal

OpenMOSS lanza MOVA - modelo de generación sincronizada de video y audio de código abierto

Multimodal
Modelo base
OpenMOSS lanza MOVA - modelo de generación sincronizada de video y audio de código abierto

El equipo de OpenMOSS lanza MOVA (MOSS Video and Audio), un modelo fundacional de generación sincronizada de video y audio de extremo a extremo que genera video y audio en una sola inferencia, logrando sincronización labial precisa y efectos de sonido conscientes del entorno, con código de modelo, entrenamiento e inferencia completamente de código abierto

Open-Weights

Texto a imagen

Alibaba Tongyi Lab Lanza Z-Image-Base - Modelo de Generación de Imágenes de Alta Calidad No Destilado

Texto a imagen
Modelo base
Alibaba Tongyi Lab Lanza Z-Image-Base - Modelo de Generación de Imágenes de Alta Calidad No Destilado

Alibaba Tongyi Lab lanza Z-Image-Base, el modelo fundacional no destilado de la serie Z-Image, preservando el potencial generativo completo y proporcionando una base ideal para el ajuste fino de la comunidad y el desarrollo personalizado

Open-Weights

Multimodal

Moonshot AI lanza Kimi K2.5 - Modelo de agente multimodal nativo de 1T parámetros

Multimodal
Modelo base
Moonshot AI lanza Kimi K2.5 - Modelo de agente multimodal nativo de 1T parámetros

Moonshot AI lanza oficialmente Kimi K2.5, un modelo de agente multimodal nativo de 1T parámetros, pre-entrenado continuamente en aproximadamente 15 billones de tokens mixtos visuales y de texto, compatible con comprensión de imágenes y videos con mecanismo de colaboración autónoma Agent Swarm

Open-Weights

Texto a voz

Alibaba Qwen lanza Qwen3-TTS - Modelo de síntesis de voz con latencia ultra baja de 97ms

Texto a voz
Modelo base
Alibaba Qwen lanza Qwen3-TTS - Modelo de síntesis de voz con latencia ultra baja de 97ms

Alibaba Qwen publica como código abierto la serie de modelos de generación de voz Qwen3-TTS, logrando latencia ultra baja de 97ms mediante modelado Dual-Track, compatible con clonación de voz de 3 segundos y diseño de voz en lenguaje natural, cubriendo 10 idiomas principales

Open-Weights

Reconocimiento de voz

Microsoft lanza VibeVoice-ASR - Modelo de reconocimiento de voz compatible con procesamiento de audio largo de 60 minutos en un solo paso

Reconocimiento de voz
Modelo base
Microsoft lanza VibeVoice-ASR - Modelo de reconocimiento de voz compatible con procesamiento de audio largo de 60 minutos en un solo paso

Microsoft publica como código abierto VibeVoice-ASR, un modelo unificado de reconocimiento de voz de 9B parámetros capaz de procesar hasta 60 minutos de audio en un solo paso, completando conjuntamente reconocimiento, diarización de hablantes y generación de marcas de tiempo en un solo proceso de inferencia

Open-Weights

Multimodal

NVIDIA lanza PersonaPlex-7B-v1 - Modelo de diálogo de voz full-duplex

Multimodal
Modelo base
NVIDIA lanza PersonaPlex-7B-v1 - Modelo de diálogo de voz full-duplex

NVIDIA publica como código abierto PersonaPlex-7B-v1, un modelo de diálogo de voz full-duplex de 7 mil millones de parámetros basado en arquitectura Moshi, compatible con escucha y habla simultáneas, interrupciones naturales y personalización de roles con latencia de respuesta a interrupciones tan baja como 240 milisegundos

Open-Weights

Texto a imagen

Tencent publica Hunyuan Image 3.0 como código abierto - Modelo de generación de imágenes a partir de texto más grande del mundo

Texto a imagen
Modelo base
Tencent publica Hunyuan Image 3.0 como código abierto - Modelo de generación de imágenes a partir de texto más grande del mundo

Tencent lanza Hunyuan Image 3.0, el primer modelo nativo de generación de imágenes multimodal comercial de código abierto con un total de 80 mil millones de parámetros, que cuenta con capacidades de razonamiento basadas en conocimientos del mundo y admite comprensión semántica compleja de miles de caracteres

Open-Weights