Actualités ComfyUI et sorties IA open source

Nouveautés de l'écosystème ComfyUI : sorties de modèles open source, nœuds personnalisés, workflows et outils de génération d'images, de vidéos et d'audio.

Multimodal

OpenMOSS publie MOVA - modèle de génération synchronisée vidéo et audio open source

Multimodal
Modèle de base
OpenMOSS publie MOVA - modèle de génération synchronisée vidéo et audio open source

L'équipe OpenMOSS publie MOVA (MOSS Video and Audio), un modèle fondamental de génération synchronisée vidéo et audio de bout en bout qui génère vidéo et audio en une seule inférence, réalisant une synchronisation labiale précise et des effets sonores conscients de l'environnement, avec poids du modèle, entraînement et code d'inférence entièrement open source

Open-Weights

Texte vers image

Alibaba Tongyi Lab Lance Z-Image-Base - Modèle de Génération d'Images Haute Qualité Non Distillé

Texte vers image
Modèle de base
Alibaba Tongyi Lab Lance Z-Image-Base - Modèle de Génération d'Images Haute Qualité Non Distillé

Alibaba Tongyi Lab lance Z-Image-Base, le modèle fondamental non distillé de la série Z-Image, préservant le plein potentiel génératif et fournissant une base idéale pour le fine-tuning communautaire et le développement personnalisé

Open-Weights

Multimodal

Moonshot AI lance Kimi K2.5 - Modèle d'agent multimodal natif de 1T paramètres

Multimodal
Modèle de base
Moonshot AI lance Kimi K2.5 - Modèle d'agent multimodal natif de 1T paramètres

Moonshot AI lance officiellement Kimi K2.5, un modèle d'agent multimodal natif de 1T paramètres, pré-entraîné en continu sur environ 15 billions de tokens visuels et textuels mixtes, prenant en charge la compréhension d'images et de vidéos avec mécanisme de collaboration autonome Agent Swarm

Open-Weights

Synthèse vocale

Alibaba Qwen lance Qwen3-TTS - Modèle de synthèse vocale à latence ultra-faible de 97ms

Synthèse vocale
Modèle de base
Alibaba Qwen lance Qwen3-TTS - Modèle de synthèse vocale à latence ultra-faible de 97ms

Alibaba Qwen publie en open source la série de modèles de génération vocale Qwen3-TTS, atteignant une latence ultra-faible de 97ms grâce à la modélisation Dual-Track, prenant en charge le clonage vocal de 3 secondes et la conception vocale en langage naturel, couvrant 10 langues principales

Open-Weights

Reconnaissance vocale

Microsoft lance VibeVoice-ASR - Modèle de reconnaissance vocale compatible avec le traitement audio long de 60 minutes en un seul passage

Reconnaissance vocale
Modèle de base
Microsoft lance VibeVoice-ASR - Modèle de reconnaissance vocale compatible avec le traitement audio long de 60 minutes en un seul passage

Microsoft publie en open source VibeVoice-ASR, un modèle unifié de reconnaissance vocale de 9B paramètres capable de traiter jusqu'à 60 minutes d'audio en un seul passage, complétant conjointement la reconnaissance, la diarisation des locuteurs et la génération d'horodatages en un seul processus d'inférence

Open-Weights

Multimodal

NVIDIA lance PersonaPlex-7B-v1 - Modèle de dialogue vocal full-duplex

Multimodal
Modèle de base
NVIDIA lance PersonaPlex-7B-v1 - Modèle de dialogue vocal full-duplex

NVIDIA publie en open source PersonaPlex-7B-v1, un modèle de dialogue vocal full-duplex de 7 milliards de paramètres basé sur l'architecture Moshi, compatible avec l'écoute et la parole simultanées, les interruptions naturelles et la personnalisation des rôles avec une latence de réponse aux interruptions aussi faible que 240 millisecondes

Open-Weights

Texte vers image

Alibaba Tongyi Lab lance Z-Image-Turbo - Un modèle efficace de génération d'images à 6B paramètres

Texte vers image
Turbo
Alibaba Tongyi Lab lance Z-Image-Turbo - Un modèle efficace de génération d'images à 6B paramètres

Alibaba Tongyi Lab lance Z-Image-Turbo, un modèle efficace de génération d'images à 6B paramètres qui produit des images de haute qualité en seulement 8 étapes d'échantillonnage et fonctionne fluidement sur les GPU grand public avec 16 Go de VRAM

Open-Weights

Texte vers image

Tencent publie Hunyuan Image 3.0 en open source - Le plus grand modèle de génération d'images à partir de texte au monde

Texte vers image
Modèle de base
Tencent publie Hunyuan Image 3.0 en open source - Le plus grand modèle de génération d'images à partir de texte au monde

Tencent lance Hunyuan Image 3.0, le premier modèle natif de génération d'images multimodal de niveau commercial open source avec un total de 80 milliards de paramètres, doté de capacités de raisonnement sur la connaissance du monde et prenant en charge la compréhension sémantique complexe de milliers de caractères

Open-Weights

Animation de personnage

Alibaba publie le modèle Wan-Animate - Technologie unifiée d'animation et de remplacement de personnages

Animation de personnage
Outil
Alibaba publie le modèle Wan-Animate - Technologie unifiée d'animation et de remplacement de personnages

Le laboratoire Tongyi d'Alibaba lance Wan-Animate, un cadre unifié d'animation de personnages basé sur Wan2.2, prenant en charge la génération d'animation de personnages et le remplacement de personnages dans les vidéos, avec des poids de modèle et du code d'inférence open-source

Open-Weights