Description
Le nœud Composants d'encodage vidéo extrait les images d'une vidéo, les redimensionne à une résolution spécifiée, puis les encode directement via un VAE en une représentation latente. Il traite les images une par une, évitant ainsi le coût mémoire lié au stockage du tenseur d'image complet pour l'ensemble de la vidéo en une seule fois. Le nœud transmet également la piste audio de la vidéo d'entrée et produit des métadonnées telles que la fréquence d'images et le nombre total d'images.
Entrées
- video (
VIDEO, requis) — Le fichier vidéo ou la séquence à traiter. Doit être une entrée vidéo valide telle qu'acceptée par ComfyUI-KJNodes. - vae (
VAE, requis) — Le modèle VAE utilisé pour encoder les images redimensionnées dans l'espace latent. - width (
INT, défaut :768, plage :0–16384, pas :2) — Largeur cible pour chaque image avant encodage. Mettez0pour conserver la largeur d'origine de la vidéo. - height (
INT, défaut :512, plage :0–16384, pas :2) — Hauteur cible pour chaque image avant encodage. Mettez0pour conserver la hauteur d'origine de la vidéo. - max_frames (
INT, défaut :0, plage :0–999999, pas :1) — Nombre maximum d'images à traiter.0signifie aucune limite et toute la vidéo est traitée. - upscale_method (
COMBO, défaut :"lanczos") — Algorithme d'interpolation utilisé lors du redimensionnement des images. Options :nearest-exact— Rapide, interpolation au plus proche voisin ; peut produire des résultats pixelisés.bilinear— Lisse, bon pour une mise à l'échelle générale.area— Redimensionnement basé sur l'aire ; efficace lors de la réduction d'échelle.bicubic— Qualité supérieure au bilinéaire, légèrement plus lent.lanczos— Rééchantillonnage net, souvent préféré pour une réduction d'échelle de haute qualité.
- keep_proportion (
DYNAMICCOMBO, requis) — Contrôle la gestion du décalage de rapport hauteur/largeur lorsque la largeur/hauteur cible diffère du rapport d'origine de l'image. Il s'agit d'un menu déroulant dynamique qui adapte les options disponibles en fonction des autres entrées ; les modes courants incluent"crop","pad","stretch"ou"fit". Voir les notes d'utilisation pour plus de détails.
Sorties
- LATENT — La représentation latente encodée par le VAE de toutes les images traitées, empilées en un lot. La forme correspond aux dimensions latentes attendues par le VAE.
- AUDIO — La piste audio extraite de la vidéo d'entrée, si présente. Cette sortie peut être vide ou
Nonesi la vidéo n'a pas d'audio. - FLOAT — La fréquence d'images (FPS) de la vidéo d'origine, sous forme de nombre à virgule flottante.
- INT — Le nombre total d'images effectivement traitées (en respectant la limite
max_frames).
Notes d'utilisation
- Le nœud traite les images séquentiellement et alimente chaque image redimensionnée immédiatement dans le VAE, réduisant considérablement l'utilisation de la mémoire maximale par rapport au chargement d'une vidéo entière dans un lot d'images au préalable.
- Définissez
widthet/ouheightà0pour conserver la dimension d'origine. Si les deux sont non nuls, ils définissent la résolution cible. Le paramètrekeep_proportiondétermine comment les décalages de rapport hauteur/largeur sont résolus. - Le combo
keep_proportionest intitulé « Comment gérer le décalage de rapport hauteur/largeur lors du redimensionnement » dans l'infobulle. Ses options exactes dépendent de l'implémentation du nœud (par exemple,"crop to fit","pad","ignore"ou"fit"). Testez le nœud dans votre flux de travail pour voir les choix disponibles. upscale_methodn'affecte que les images qui sont effectivement redimensionnées (c'est-à-dire lorsque la largeur ou la hauteur diffère de l'originale). Si les deux dimensions correspondent à l'originale, aucun redimensionnement n'a lieu et ce paramètre est ignoré.- Utilisez
max_framespour limiter le traitement des longues vidéos ou pour déboguer avec un sous-ensemble d'images. La valeur0(par défaut) traite toute la vidéo. - La sortie
LATENTpeut être directement injectée dans des nœuds d'échantillonnage (par exemple, KSampler) qui acceptent des lots d'échantillons latents. La taille du lot latent correspond au nombre d'images. - Si la vidéo d'entrée n'a pas de piste audio, la sortie
AUDIOsera un espace réservé vide ; les nœuds en aval qui attendent de l'audio doivent gérer cela correctement. - La sortie
FLOAT(fréquence d'images) et la sortieINT(nombre d'images) peuvent être utiles pour synchroniser les étapes suivantes qui dépendent du timing ou pour des rapports.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.