AKUSPACE : LoRA Acoustic Space pour LTX-2.5 Audio avec ComfyUI
KoshiMazaki publie AKUSPACE v0.5, un LoRA audio spatial pour LTX-2.5 qui place les voix et musiques générées dans des pièces, clubs, cathédrales ou en extérieur, avec des nœuds ComfyUI inclus.
KoshiMazaki a publié AKUSPACE v0.5, un LoRA audio conscient de l'espace pour LTX-2.5 qui donne à l'audio généré ou de référence le caractère acoustique d'un espace physique : une petite pièce, un club vide, une cathédrale ou un environnement extérieur. Le LoRA, le site de démonstration et un pack de nœuds ComfyUI compagnon sont tous ouverts : Hugging Face | démonstration interactive | ComfyUI-Koshi-Nodes.
La surface de contrôle AKUSPACE : source, auditeur et l'espace acoustique sélectionné, avec le temps de décroissance entraîné affiché en dessous.
Fonctionnement
AKUSPACE est entraîné comme un adaptateur audio-vers-audio : il transforme l'audio qu'il reçoit, façonnant les voix, les rythmes et les instruments avec la réverbération de salle, l'ambiance extérieure et les effets sonores spatiaux. La surface de contrôle est pilotée par des prompts, avec le mot déclencheur AKUSPACE et un mot de niveau entre l'espace et son caractère :
AKUSPACE female spoken voice through synthetic cathedral reverb, moderate wide diffuse reflections and a long decaying tail, no background ambience| Mode | Options | Niveaux |
|---|---|---|
| Espace : pièces où se trouve un son | petite pièce, pièce moyenne, club vide, cathédrale | doux / modéré / lourd |
| Lieu : environnements où se trouve un son | extérieur jour, extérieur nuit | doux / lourd |
| Effets sonores : traitement que subit un son | double délai | doux / lourd |
Les « lieux » extérieurs ne font que réduire l'échelle, pas l'augmenter : un lit d'ambiance est un enregistrement séparé plutôt qu'une queue de réverbération. Les légendes de salle comportent un temps de décroissance ; la cathédrale, l'effet granulaire et les deux lieux extérieurs n'ont pas de décroissance numérique.
Flux de travail pris en charge
| Entrée | Sortie |
|---|---|
| Audio | Traitement audio-vers-audio pour un enregistrement existant |
| Texte + audio | Vidéo texte-vers-vidéo avec audio synchronisé traité par AKUSPACE |
| Image + audio | Vidéo image-vers-vidéo avec audio synchronisé traité par AKUSPACE |
Le chemin éprouvé pour la vidéo est une voix sèche, puis un passage d'espace audio-vers-audio, puis image+audio-vers-vidéo avec l'audio traité maintenu fixe pendant que l'image conditionne la première frame. L'adaptateur cible les branches audio ; la génération vidéo est gérée par le modèle de base LTX-2.5. Il peut également fonctionner comme un passage de doublage, où sa référence alignée sur le temps ancre le traitement à la performance source.
Paramètres et utilisation
Les paramètres suggérés sont 24 étapes, CFG 1-2, ajustés vers CFG 4 pour un volume et des détails plus élevés. Les légendes partielles fonctionnent moins bien que les complètes, car les clauses finales étaient présentes dans chaque légende d'entraînement. Le pack de nœuds ComfyUI embarque un visualiseur three.js pour manipuler le prompt depuis une vue de scène : source, auditeur et espace.
Disponibilité
- Poids du LoRA : KoshiMazaki/akuspace-ltx25 sous la licence communautaire LTX-2
- Nœuds ComfyUI : koshimazaki/ComfyUI-Koshi-Nodes
- Étude audiovisuelle interactive : akuspace.pages.dev
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.