AKUSPACE : LoRA Acoustic Space pour LTX-2.5 Audio avec ComfyUI

ComfyUI Wikinews

KoshiMazaki publie AKUSPACE v0.5, un LoRA audio spatial pour LTX-2.5 qui place les voix et musiques générées dans des pièces, clubs, cathédrales ou en extérieur, avec des nœuds ComfyUI inclus.

KoshiMazaki a publié AKUSPACE v0.5, un LoRA audio conscient de l'espace pour LTX-2.5 qui donne à l'audio généré ou de référence le caractère acoustique d'un espace physique : une petite pièce, un club vide, une cathédrale ou un environnement extérieur. Le LoRA, le site de démonstration et un pack de nœuds ComfyUI compagnon sont tous ouverts : Hugging Face | démonstration interactive | ComfyUI-Koshi-Nodes.

Surface de contrôle AKUSPACE

La surface de contrôle AKUSPACE : source, auditeur et l'espace acoustique sélectionné, avec le temps de décroissance entraîné affiché en dessous.

Fonctionnement

AKUSPACE est entraîné comme un adaptateur audio-vers-audio : il transforme l'audio qu'il reçoit, façonnant les voix, les rythmes et les instruments avec la réverbération de salle, l'ambiance extérieure et les effets sonores spatiaux. La surface de contrôle est pilotée par des prompts, avec le mot déclencheur AKUSPACE et un mot de niveau entre l'espace et son caractère :

AKUSPACE female spoken voice through synthetic cathedral reverb, moderate wide diffuse reflections and a long decaying tail, no background ambience
ModeOptionsNiveaux
Espace : pièces où se trouve un sonpetite pièce, pièce moyenne, club vide, cathédraledoux / modéré / lourd
Lieu : environnements où se trouve un sonextérieur jour, extérieur nuitdoux / lourd
Effets sonores : traitement que subit un sondouble délaidoux / lourd

Les « lieux » extérieurs ne font que réduire l'échelle, pas l'augmenter : un lit d'ambiance est un enregistrement séparé plutôt qu'une queue de réverbération. Les légendes de salle comportent un temps de décroissance ; la cathédrale, l'effet granulaire et les deux lieux extérieurs n'ont pas de décroissance numérique.

Flux de travail pris en charge

EntréeSortie
AudioTraitement audio-vers-audio pour un enregistrement existant
Texte + audioVidéo texte-vers-vidéo avec audio synchronisé traité par AKUSPACE
Image + audioVidéo image-vers-vidéo avec audio synchronisé traité par AKUSPACE

Le chemin éprouvé pour la vidéo est une voix sèche, puis un passage d'espace audio-vers-audio, puis image+audio-vers-vidéo avec l'audio traité maintenu fixe pendant que l'image conditionne la première frame. L'adaptateur cible les branches audio ; la génération vidéo est gérée par le modèle de base LTX-2.5. Il peut également fonctionner comme un passage de doublage, où sa référence alignée sur le temps ancre le traitement à la performance source.

Désactivez l'amélioration du prompt. Le réécrivain paraphrase le mot déclencheur et le mot de niveau, qui sont exactement les jetons sur lesquels dépend la surface de contrôle. Notez également qu'avec le LoRA chargé et sans audio de référence présent, le texte-vers-audio produit presque du silence : il n'y a rien à transformer.

Paramètres et utilisation

Les paramètres suggérés sont 24 étapes, CFG 1-2, ajustés vers CFG 4 pour un volume et des détails plus élevés. Les légendes partielles fonctionnent moins bien que les complètes, car les clauses finales étaient présentes dans chaque légende d'entraînement. Le pack de nœuds ComfyUI embarque un visualiseur three.js pour manipuler le prompt depuis une vue de scène : source, auditeur et espace.

Disponibilité

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
AKUSPACE : LoRA Acoustic Space pour LTX-2.5 Audio avec ComfyUI | ComfyUI Wiki