Qwen-Image-2.1 Next-Scene LoRA : storyboards enchaînés

ComfyUI Wikinews

Le LoRA Next-Scene d'akhaliq apprend à Qwen-Image 2.1 à générer le plan suivant à partir d'une seule image et à enchaîner les storyboards via un nœud LoRA ComfyUI.

Qwen-Image-2.1-Next-Scene-LoRA est un adaptateur de rang 64 qui enseigne à Qwen-Image 2.1 une modification bien précise : à partir de l'image en cours et d'une instruction de type réalisateur, générer le plan suivant au lieu de modifier celui que vous avez. Les mouvements de caméra, les révélations et les changements d'éclairage sont appliqués tandis que le décor, les personnages et le style restent inchangés, et la sortie peut être réinjectée comme entrée suivante pour construire un storyboard.
Quatre sauts à partir d'une seule photographie, chaque image étant générée à partir de la précédente

Quatre plans dirigés à partir d'une seule photographie. Chaque image correspond à la sortie précédente réinjectée avec une nouvelle instruction, au checkpoint step-2,500 recommandé et à une strength de 0,7.

Ce qu'il apporte à Qwen-Image 2.1

Le format next-scene provient de lovis93/next-scene-qwen-image-lora-2509, qui a dépassé les 313 000 téléchargements sur le modèle d'édition Qwen-Image 2509. Il s'agit ici du portage vers la base en cours : réentraîné nativement sur Qwen-Image 2.1, où cette capacité n'existe pas encore. Il se combine avec le LoRA Multiple-Angles antérieur d'akhaliq, qui contrôle où se trouve la caméra, tandis que Next-Scene contrôle où l'histoire se dirige ensuite.

Les prompts commencent par Next Scene: et placent en tête l'indication de caméra, par exemple « Next Scene: The camera pulls back to a sweeping aerial view, revealing the fleet behind the cliffs » :

Next Scene: The camera tracks forward and tilts down as rain begins to streak the lens.
Next Scene: Cut to a low-angle shot; sunlight breaks through the clouds behind her.
Next Scene: The camera pans right, revealing the fleet massing behind the ridge.

L'enchaînement, avec une recette mesurée

Réinjecter chaque sortie comme entrée suivante est ce qui transforme l'adaptateur en outil de storyboard, mais l'auteur a mesuré un mode de défaillance au lieu de le deviner : un enchaînement naïf à une strength de 0,9 accumule du grain jusqu'à ce qu'il devienne un bruit de couleur visible dès le 3e ou 4e saut. La recette vérifiée pour des chaînes propres est une strength de 0,7 ou moins, plus un flou gaussien de 0,5 pixel sur chaque entrée enchaînée, ce qui rompt la boucle de rétroaction d'amplification du grain. L'exemple à quatre sauts ci-dessus a été rendu exactement de cette manière.

Premier sautDeuxième saut
Saut 1 : la caméra recule vers un plan largeSaut 2 : panoramique vers la droite, l'astronaute bondit sur le régolithe
Troisième sautQuatrième saut
Saut 3 : coupe sur un plan en contre-plongée tandis que l'astronaute salueSaut 4 : zoom avant sur la visière dorée, le module lunaire s'y reflétant

Quel checkpoint utiliser

Le référentiel fournit trois checkpoints convertis ainsi que les sorties d'entraînement brutes :

CheckpointVerdict
next_scene_step2500.safetensorsRecommandé. Étape finale, converti vers la disposition de clés diffusers. Transformation de scène la plus marquée tout en conservant la composition et l'identité.
next_scene_step1500.safetensorsAlternative plus douce, plus respectueuse de l'identité. À utiliser si 2 500 pousse trop fort.
next_scene_step1000.safetensorsTransformation la plus faible, surtout utile pour étudier la courbe d'entraînement.
checkpoints/qwen21_next_scene_v1_*.safetensorsFormat ai-toolkit brut. Les clés MLP utilisent la nomenclature fusionnée d'ai-toolkit, que diffusers ignore silencieusement. Utilisables uniquement via ai-toolkit ou son propre loader.

L'auteur a également publié un balayage de checkpoints sur un même prompt de tempête aux étapes 1 000, 1 500 et 2 500, avec un témoin sans LoRA. Le modèle de base tente déjà la tempête, car Qwen-Image 2.1 édite bien de lui-même, mais l'étape 2 500 est la cellule qui déploie un front orageux complet sur la vallée tout en conservant l'explorateur, les ruines et la palette intacts.

Balayage de checkpoints au fil des étapes d'entraînement avec un témoin sans LoRA

Une même image de départ cinématographique, la même instruction de tempête à chaque checkpoint, plus un témoin sans LoRA.

Comment il a été entraîné

  • Base : Qwen-Image 2.1, arch: qwen_image_2.
  • Données : 1 144 paires de progression de scène, images consécutives issues des films libres Blender Sintel et Tears of Steel (CC-BY), légendées sous forme d'instructions de type réalisateur « Next Scene: ... » par Qwen3-VL-4B sur chaque paire image suivante. Les paires brutes et l'ensemble légendé sont publiés.
  • Entraînement : ostris/ai-toolkit, rang 64 / alpha 64, adamw8bit, taux d'apprentissage 1e-4, timesteps pondérés, caption dropout 0,05, 512 pixels, 2 500 étapes, sur une base quantifiée uint3 en bf16.

Portée et limites

L'adaptateur a été entraîné sur des images de films cinématographiques, un animé et un en prises de vue réelles. Il généralise aux photographies, mais il est plus performant sur les scènes filmiques, les paysages et les plans d'ensemble, et les portraits statiques sont hors périmètre par conception. L'entraînement a été effectué à 512 pixels ; les toiles plus grandes héritent du comportement mais n'ont pas servi à l'entraînement. Les grilles d'échantillons toutes les 250 étapes sont conservées dans checkpoints/samples/, et un tableau de bord Trackio ainsi qu'un Space de démo sont liés depuis la carte du modèle.

Disponibilité dans ComfyUI

Le checkpoint recommandé est déjà converti, il se charge donc dans n'importe quel flux de travail Qwen-Image 2.1 via un nœud LoRA à une strength de 0,7 à 0,9, avec l'image transmise comme entrée d'édition ou de référence. Il n'existe pas de fichier de flux de travail distinct pour l'adaptateur, et ce sont les fichiers next_scene_step*.safetensors à la racine qu'il faut utiliser dans ComfyUI ; les copies dans checkpoints/ sont au format ai-toolkit.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Qwen-Image-2.1 Next-Scene LoRA : storyboards enchaînés | ComfyUI Wiki