AKUSPACE: LoRA de Espacio Acústico para Audio LTX-2.5

ComfyUI Wikinews

KoshiMazaki lanza AKUSPACE v0.5, un LoRA de audio espacial para LTX-2.5 que sitúa voces y música generadas en habitaciones, clubes, catedrales o exteriores, con nodos de ComfyUI incluidos.

KoshiMazaki lanzó AKUSPACE v0.5, un LoRA de audio consciente del espacio para LTX-2.5 que otorga al audio generado o de referencia el carácter acústico de un espacio físico: una habitación pequeña, un club vacío, una catedral o un entorno exterior. El LoRA, el sitio de demostración y un paquete de nodos de ComfyUI complementario están disponibles: Hugging Face | demo interactiva | ComfyUI-Koshi-Nodes.

AKUSPACE control surface

La superficie de control de AKUSPACE: fuente, oyente y el espacio acústico seleccionado, con el tiempo de decaimiento entrenado mostrado debajo.

Qué hace

AKUSPACE está entrenado como un adaptador de audio a audio: transforma el audio que recibe, dando forma a voces, ritmos e instrumentos con reverberación de sala, ambiente exterior y efectos de sonido espacial. La superficie de control es impulsada por prompts, con la palabra clave AKUSPACE y una palabra de nivel entre el espacio y su carácter:

AKUSPACE female spoken voice through synthetic cathedral reverb, moderate wide diffuse reflections and a long decaying tail, no background ambience
ModoOpcionesNiveles
Espacio: habitaciones donde reside un sonidohabitación pequeña, habitación mediana, club vacío, catedralsuave / moderado / intenso
Lugar: entornos donde reside un sonidodía exterior, noche exteriorsuave / intenso
Efectos de sonido: procesamiento por el que pasa un sonidodoble retardosuave / intenso

Los 'lugares' exteriores solo escalan hacia abajo, no hacia arriba: una cama de ambiente es una grabación separada en lugar de una cola de reverberación. Las descripciones de las salas llevan un tiempo de decaimiento; la catedral, el efecto granular y ambos lugares exteriores no tienen decaimiento numérico.

Flujos de trabajo compatibles

EntradaSalida
AudioTratamiento de audio a audio para una grabación existente
Texto + audioVídeo de texto a audio con audio sincronizado tratado con AKUSPACE
Imagen + audioVídeo de imagen a audio con audio sincronizado tratado con AKUSPACE

La ruta probada para el vídeo es voz seca, luego un paso de espacio de audio a audio, luego imagen+audio a vídeo con el audio tratado mantenido fijo mientras la imagen condiciona el primer cuadro. El adaptador apunta a las ramas de audio; la generación de vídeo es manejada por el modelo base LTX-2.5. También puede ejecutarse como un paso de doblaje, donde su referencia alineada en tiempo mantiene el tratamiento anclado al rendimiento de la fuente.

Desactive la mejora de prompts. El reescritor parafrasea la palabra clave y la palabra de nivel, que son exactamente los tokens en los que depende la superficie de control. También tenga en cuenta que con el LoRA cargado y sin audio de referencia presente, el texto a audio produce casi silencio: no hay nada que transformar.

Configuraciones y uso

Las configuraciones sugeridas son 24 pasos, CFG 1-2, ajustando a CFG 4 para mayor volumen y detalle. Las descripciones parciales funcionan menos bien que las completas, ya que las cláusulas finales estaban presentes en cada descripción de entrenamiento. El paquete de nodos de ComfyUI incluye un visor three.js para manipular el prompt desde una vista de escena: fuente, oyente y espacio.

Disponibilidad

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
AKUSPACE: LoRA de Espacio Acústico para Audio LTX-2.5 | ComfyUI Wiki