L'équipe NUS présente le projet OmniConsistency, atteignant une cohérence de stylisation d'images au niveau de GPT-4o avec seulement 2 600 paires d'images et 500 heures d'entraînement GPU, maintenant compatible avec les nœuds ComfyUI
Open-Weights
Nouveautés de l'écosystème ComfyUI : sorties de modèles open source, nœuds personnalisés, workflows et outils de génération d'images, de vidéos et d'audio.
L'équipe NUS présente le projet OmniConsistency, atteignant une cohérence de stylisation d'images au niveau de GPT-4o avec seulement 2 600 paires d'images et 500 heures d'entraînement GPU, maintenant compatible avec les nœuds ComfyUI
Open-Weights
Black Forest Labs présente les modèles de la série FLUX.1 Kontext, les premiers à réaliser une édition consciente du contexte basée sur les entrées texte et image, supportant la préservation de la cohérence des personnages et les fonctionnalités d'édition localisée
Open-Weights
Texte vers imageByteDance et l'Université d'État du Michigan proposent conjointement la méthode ID-Patch, permettant la génération d'images personnalisées multi-identité avec une meilleure préservation de l'identité et une efficacité de génération accrue, adaptée aux photos de groupe, publicités et autres scénarios multi-personnages.
Open-Weights
Animation de personnageTencent lance HunyuanVideo-Avatar, permettant de générer des vidéos numériques haute fidélité et contrôlables en émotion à partir d'images et d'audio, adapté aux vidéos courtes, publicités e-commerce, etc.
Open-Weights
Pixel-Reasoner, basé sur Qwen2, offre des capacités de compréhension et de raisonnement visuel au niveau du pixel, à la fois globales et locales, prend en charge l'analyse détaillée par zoom et fait progresser les modèles de langage visuel.
MIT
IndexTTS lance la version 1.5 avec des améliorations significatives de la stabilité du modèle et des performances en anglais, supportant la correction de prononciation pinyin et les pauses contrôlées par ponctuation, surpassant les systèmes TTS traditionnels dans plusieurs tests
Open-Weights
Image vers 3DStepFun lance le framework open source Step1X-3D qui génère une géométrie 3D et des textures de haute qualité à partir d'images uniques, incluant un dataset de 2M de haute qualité, du code d'entraînement complet et des poids de modèle
Open-Weights
MultimodalByteDance lance BAGEL, un modèle fondation multimodal open source avec 7 milliards de paramètres actifs, capable de comprendre et de générer du texte, des images et des vidéos, avec d'excellents résultats sur les benchmarks publics.
Open-Weights
Texte vers imageAprès les récentes mises à jour de ComfyUI, certains nœuds personnalisés peuvent causer des problèmes d'interface. Cet article résume les plugins affectés et les solutions, recommandant des mises à jour rapides ou la désinstallation des plugins concernés.
Open-Weights
L'équipe Step1X-3D a publié une solution de génération d'actifs 3D haute fidélité, en ouvrant les modèles, les jeux de données et le code, prenant en charge diverses tâches de génération et de texturisation d'actifs 3D.
Open-Weights
MultimodalTencent présente HunyuanCustom, un cadre de personnalisation vidéo multimodal qui prend en charge les conditions de texte, d'image, d'audio et de vidéo, permettant une génération vidéo hautement cohérente dans de multiples scénarios
Open-Weights
Édition d'imageInsert Anything est un cadre unifié open-source qui peut insérer de manière transparente des éléments tels que des personnes, des objets et des vêtements à partir d'images de référence dans des scènes cibles, prenant en charge divers scénarios d'application
Open-Weights
Texte vers vidéoFlexiAct, développé conjointement par l'Université Tsinghua et le Laboratoire ARC de Tencent, peut transférer des actions d'une vidéo de référence à n'importe quelle image cible tout en maintenant la cohérence d'identité
Open-Weights
MultimodalStep1X-Edit est un puissant cadre d'édition d'images open source qui prend en charge l'édition d'images via des instructions en langage naturel, offrant des capacités similaires à GPT-4o et Gemini2 Flash。
Open-Weights
InpaintingFlex.2-preview est un modèle de diffusion texte-image open source avec contrôle universel et capacités d'inpainting intégrées, offrant aux créateurs des outils de génération d'images plus puissants
Open-Weights
Image vers vidéoSand AI a rendu open-source MAGI-1, un modèle autorégressif qui génère des vidéos par segments, proposant des versions à 24B et 4,5B de paramètres et prenant en charge plusieurs modes de génération vidéo
Open-Weights
Image vers vidéoSkyworkAI lance un nouveau modèle de génération vidéo open-source SkyReels-V2, permettant la création de vidéos de longueur infinie avec des capacités de texte vers vidéo et d'image vers vidéo
Open-Weights
Synthèse vocaleNari Labs présente Dia 1.6B, un modèle open-source de texte vers parole capable de générer des dialogues multi-personnages directement à partir de texte, avec expressions émotionnelles et communications non-verbales
Open-Weights
MultimodalL'équipe SkyReels de Kunlun Wanwei lance et open-source SkyReels-V2, le premier modèle génératif de films de longueur infinie au monde utilisant le cadre de Forçage de Diffusion, capable de produire du contenu vidéo de haute qualité et de longue durée
Open-Weights
Texte vers imageShakker Labs lance le nouveau modèle FLUX.1-dev-ControlNet-Union-Pro-2.0 avec des effets de contrôle optimisés, le support de plusieurs modes de contrôle et une taille de modèle réduite
Open-Weights