JoyAI Image Edit de JD Open Source ahora se ejecuta de forma nativa en ComfyUI. Edición de imágenes única y múltiple guiada por instrucciones con control espacial, formatos BF16 e INT8.
Apache-2.0
Novedades del ecosistema ComfyUI: lanzamientos de modelos de código abierto, nodos personalizados, flujos de trabajo y herramientas de generación de imagen, video y audio.
JoyAI Image Edit de JD Open Source ahora se ejecuta de forma nativa en ComfyUI. Edición de imágenes única y múltiple guiada por instrucciones con control espacial, formatos BF16 e INT8.
Apache-2.0
Texto a vozHiggs TTS 3 es un modelo de texto a voz de 4 mil millones de parámetros que admite más de 100 idiomas con clonación de voz zero-shot, control emocional expresivo y efectos de sonido/prosodia en línea para aplicaciones de agentes de voz.
Open-Weights
Meituan actualiza LongCat-Video-Avatar a 1.5 con lip-sync Whisper-Large, destilación DMD2 en 8 pasos y nodos ComfyUI para avatares de audio a vídeo.
MIT
Texto a vídeoSulphur 2 es un ajuste fino comunitario de LTX 2.3 que ofrece generación de video de texto a video y de imagen a video, con un mejorador de prompts integrado y un LoRA destilado, entrenado en más de 125K clips seleccionados.
Open-Weights
El equipo de OpenMOSS lanza MOVA (MOSS Video and Audio), un modelo fundacional de generación sincronizada de video y audio de extremo a extremo que genera video y audio en una sola inferencia, logrando sincronización labial precisa y efectos de sonido conscientes del entorno, con código de modelo, entrenamiento e inferencia completamente de código abierto
Open-Weights
Alibaba Tongyi Lab lanza Z-Image-Base, el modelo fundacional no destilado de la serie Z-Image, preservando el potencial generativo completo y proporcionando una base ideal para el ajuste fino de la comunidad y el desarrollo personalizado
Open-Weights
DeepSeek publica como código abierto DeepSeek-OCR-2, introduciendo el nuevo codificador de visión DeepEncoder V2 que imita la lógica de lectura humana a través del mecanismo de flujo causal visual, logrando 91.09% de precisión en OmniDocBench v1.5
Open-Weights
Moonshot AI lanza oficialmente Kimi K2.5, un modelo de agente multimodal nativo de 1T parámetros, pre-entrenado continuamente en aproximadamente 15 billones de tokens mixtos visuales y de texto, compatible con comprensión de imágenes y videos con mecanismo de colaboración autónoma Agent Swarm
Open-Weights
ACE Studio y StepFun lanzan ACE-Step 1.5, un modelo de música abierto que genera canciones completas en segundos, con soporte oficial de Comfy-Org.
Apache-2.0
Alibaba Qwen publica como código abierto la serie de modelos de generación de voz Qwen3-TTS, logrando latencia ultra baja de 97ms mediante modelado Dual-Track, compatible con clonación de voz de 3 segundos y diseño de voz en lenguaje natural, cubriendo 10 idiomas principales
Open-Weights
Microsoft publica como código abierto VibeVoice-ASR, un modelo unificado de reconocimiento de voz de 9B parámetros capaz de procesar hasta 60 minutos de audio en un solo paso, completando conjuntamente reconocimiento, diarización de hablantes y generación de marcas de tiempo en un solo proceso de inferencia
Open-Weights
NVIDIA publica como código abierto PersonaPlex-7B-v1, un modelo de diálogo de voz full-duplex de 7 mil millones de parámetros basado en arquitectura Moshi, compatible con escucha y habla simultáneas, interrupciones naturales y personalización de roles con latencia de respuesta a interrupciones tan baja como 240 milisegundos
Open-Weights
Texto a vídeoGenera videos de longitud infinita en ComfyUI con SVI 2.0 Pro y Wan 2.2. Incluye modelos LoRA HIGH y LOW para video AI de larga duracion. Descarga el workflow.
Edición de imagenQwen-Image-Layered puede descomponer imágenes en múltiples capas RGBA, donde cada capa se puede editar independientemente sin afectar otro contenido, soportando operaciones como recolorización, reemplazo, eliminación, redimensionamiento y reposicionamiento
Open-Weights
Imagen a 3DMicrosoft presenta TRELLIS.2, un gran modelo generativo 3D de 4 mil millones de parámetros que convierte imágenes en activos 3D de alta calidad en segundos, con materiales PBR completos y soporte para topologías complejas
Open-Weights
El equipo de la Universidad Tsinghua publica como código abierto TurboDiffusion, un marco de aceleración para generación de video que logra 100-205x de aceleración en la generación de difusión de extremo a extremo en una sola RTX 5090 mientras mantiene la calidad del video
El equipo de Alibaba Cloud PAI lanza Z-Image-Turbo-Fun-Controlnet-Union, un modelo ControlNet que soporta múltiples condiciones de control incluyendo Canny, HED, Depth, Pose y MLSD, entrenado en resolución 1328
Open-Weights
Texto a imagenEl equipo AIDC-AI de Alibaba lanza Ovis-Image, un modelo de texto a imagen de 7B parámetros enfocado en el renderizado de texto de alta calidad, logrando excelentes resultados en múltiples benchmarks
Open-Weights
Alibaba Tongyi Lab lanza Z-Image-Turbo, un modelo eficiente de generación de imágenes con 6B parámetros que produce imágenes de alta calidad en solo 8 pasos de muestreo y funciona fluidamente en GPUs de consumo con 16GB de VRAM
Open-Weights
MultimodalByteDance presenta el modelo multimodal Sa2VA, combinando las tecnologías SAM2 y LLaVA para lograr segmentación densa y respuesta a preguntas visuales tanto para imágenes como para videos, alcanzando un rendimiento líder en múltiples puntos de referencia
Open-Weights