JoyAI Image Edit de JD Open Source ahora se ejecuta de forma nativa en ComfyUI. Edición de imágenes única y múltiple guiada por instrucciones con control espacial, formatos BF16 e INT8.
Apache-2.0
Novedades del ecosistema ComfyUI: lanzamientos de modelos de código abierto, nodos personalizados, flujos de trabajo y herramientas de generación de imagen, video y audio.
JoyAI Image Edit de JD Open Source ahora se ejecuta de forma nativa en ComfyUI. Edición de imágenes única y múltiple guiada por instrucciones con control espacial, formatos BF16 e INT8.
Apache-2.0
Texto a vozHiggs TTS 3 es un modelo de texto a voz de 4 mil millones de parámetros que admite más de 100 idiomas con clonación de voz zero-shot, control emocional expresivo y efectos de sonido/prosodia en línea para aplicaciones de agentes de voz.
Open-Weights
Texto a vídeoSulphur 2 es un ajuste fino comunitario de LTX 2.3 que ofrece generación de video de texto a video y de imagen a video, con un mejorador de prompts integrado y un LoRA destilado, entrenado en más de 125K clips seleccionados.
Open-Weights
El equipo de OpenMOSS lanza MOVA (MOSS Video and Audio), un modelo fundacional de generación sincronizada de video y audio de extremo a extremo que genera video y audio en una sola inferencia, logrando sincronización labial precisa y efectos de sonido conscientes del entorno, con código de modelo, entrenamiento e inferencia completamente de código abierto
Open-Weights
Alibaba Tongyi Lab lanza Z-Image-Base, el modelo fundacional no destilado de la serie Z-Image, preservando el potencial generativo completo y proporcionando una base ideal para el ajuste fino de la comunidad y el desarrollo personalizado
Open-Weights
DeepSeek publica como código abierto DeepSeek-OCR-2, introduciendo el nuevo codificador de visión DeepEncoder V2 que imita la lógica de lectura humana a través del mecanismo de flujo causal visual, logrando 91.09% de precisión en OmniDocBench v1.5
Open-Weights
Moonshot AI lanza oficialmente Kimi K2.5, un modelo de agente multimodal nativo de 1T parámetros, pre-entrenado continuamente en aproximadamente 15 billones de tokens mixtos visuales y de texto, compatible con comprensión de imágenes y videos con mecanismo de colaboración autónoma Agent Swarm
Open-Weights
Alibaba Qwen publica como código abierto la serie de modelos de generación de voz Qwen3-TTS, logrando latencia ultra baja de 97ms mediante modelado Dual-Track, compatible con clonación de voz de 3 segundos y diseño de voz en lenguaje natural, cubriendo 10 idiomas principales
Open-Weights
Microsoft publica como código abierto VibeVoice-ASR, un modelo unificado de reconocimiento de voz de 9B parámetros capaz de procesar hasta 60 minutos de audio en un solo paso, completando conjuntamente reconocimiento, diarización de hablantes y generación de marcas de tiempo en un solo proceso de inferencia
Open-Weights
NVIDIA publica como código abierto PersonaPlex-7B-v1, un modelo de diálogo de voz full-duplex de 7 mil millones de parámetros basado en arquitectura Moshi, compatible con escucha y habla simultáneas, interrupciones naturales y personalización de roles con latencia de respuesta a interrupciones tan baja como 240 milisegundos
Open-Weights
Texto a vídeoStable Video Infinity 2.0 Pro ha sido lanzado oficialmente, agregando soporte para el modelo base Wan 2.2, proporcionando versiones HIGH y LOW de modelos LoRA para generar contenido de video de longitud infinita en ComfyUI
Edición de imagenQwen-Image-Layered puede descomponer imágenes en múltiples capas RGBA, donde cada capa se puede editar independientemente sin afectar otro contenido, soportando operaciones como recolorización, reemplazo, eliminación, redimensionamiento y reposicionamiento
Open-Weights
Imagen a 3DMicrosoft presenta TRELLIS.2, un gran modelo generativo 3D de 4 mil millones de parámetros que convierte imágenes en activos 3D de alta calidad en segundos, con materiales PBR completos y soporte para topologías complejas
Open-Weights
El equipo de la Universidad Tsinghua publica como código abierto TurboDiffusion, un marco de aceleración para generación de video que logra 100-205x de aceleración en la generación de difusión de extremo a extremo en una sola RTX 5090 mientras mantiene la calidad del video
El equipo de Alibaba Cloud PAI lanza Z-Image-Turbo-Fun-Controlnet-Union, un modelo ControlNet que soporta múltiples condiciones de control incluyendo Canny, HED, Depth, Pose y MLSD, entrenado en resolución 1328
Open-Weights
Texto a imagenEl equipo AIDC-AI de Alibaba lanza Ovis-Image, un modelo de texto a imagen de 7B parámetros enfocado en el renderizado de texto de alta calidad, logrando excelentes resultados en múltiples benchmarks
Open-Weights
Alibaba Tongyi Lab lanza Z-Image-Turbo, un modelo eficiente de generación de imágenes con 6B parámetros que produce imágenes de alta calidad en solo 8 pasos de muestreo y funciona fluidamente en GPUs de consumo con 16GB de VRAM
Open-Weights
MultimodalByteDance presenta el modelo multimodal Sa2VA, combinando las tecnologías SAM2 y LLaVA para lograr segmentación densa y respuesta a preguntas visuales tanto para imágenes como para videos, alcanzando un rendimiento líder en múltiples puntos de referencia
Open-Weights
Tencent lanza Hunyuan Image 3.0, el primer modelo nativo de generación de imágenes multimodal comercial de código abierto con un total de 80 mil millones de parámetros, que cuenta con capacidades de razonamiento basadas en conocimientos del mundo y admite comprensión semántica compleja de miles de caracteres
Open-Weights
El equipo de Nunchaku lanza la versión optimizada del modelo Qwen-Image-Edit-2509 Lightning de 4-Bit, compatible con inferencia rápida de 4/8 pasos, ejecutándose sin problemas en entornos con 8 GB de VRAM